中企动力 > 商学院 > 数据分析实操
  • ?

    通过基础数据进行数据分析的实例

    甄笑翠

    展开

    国产〇〇柒

    前几天朋友给了一组行业同行表现数据,让帮忙分析一下自己的店铺问题所在和表现如何。今天我通过这个小示例来跟大家简单分享一下一些基础的分析方法。

    (开始之前先跟小伙伴们说明一下,本案例是一个简单的基于一组数据而进行的分析,并通过这个给大家一个相对比较概括的方法介绍,实际分析操作中会遇到更复杂的情况,而且实际分析中的挖掘深度要比本案例要深)

    下边是朋友提供的一组数据:

    图片:基础数据表01.png

    为了保护隐私避免侵权,公司名称这里就以字母替代

    通过上图我们可以看到这是几组非常简单的数据,这些数据我们都可以在自己的店铺采集到,但是我们也可以看到这组数据有一个问题,多数数据缺乏一个时间参数,从表格中我们只能看到最后两项有一个准确的时间界定,其他项数据均没有这个界定。不过这里我们采用对比模糊分析的方法,不用考虑数据是否精确,只需要进行对比即可,所以缺乏时间参数问题也不太大。接下来我们通过以下几个步骤进行分析。

    一,做筛选

    首先我们要对这些数据进行筛选,只留可对比的数据组,剔除无用的数据。方法很简单,这里我们通过公司名称进行检测,进行主营产品类目检查(这里我是以朋友公司产品类目对基础的),通过分析发现C、G、M三个公司的产品与其他不符,这里我们就直接剔除这三家的数据不做参考。

    整理后的数据如图:

    图片:整理后的数据02.png

    (再更复杂的分析中,剔除噪音数据并非这么简单,这里是用这个简单的方式说明一下这个操作步骤,大家在操作中要根据自己实际情况进行数据甄别,甄别的过程是非常复杂和繁琐的,如果这一步出错,做出的分析结果的准确性就很难得到保障)

    二,做归类

    无用的数据剔除之后,接下来我们就是要对现有的数据进行归类处理。

    通过图表数据的阅读,我们可以把里面的数据简单的归为三类:交易数据、回复率、行为数据。交易数据这里主要就是包含前三项,一达通和信保;回复率就是询盘回复率的表现数据;行为数据这里主要是指人的行为,访客和季度、月询盘数。归类后如图:

    图片:归类后的数据03.png

    这三类数据是有区别的,交易数据和回复率我们可以统一称之为“操作数据”或“加权数据”,因为这些数据的控制权基本掌握在我们手里,我们在这部分数据的积累上有较大的主动权。行为数据可以称之为“结果数据”,这部分数据的直接控制权来自于客户行为,我们无法直接去干预,我们只能通过提升“操作数据”的方法去影响这个“结果数据”。我们之前的操作都是为了这个“结果数据”有较好的表现。

    数据归类之后,我们开始分析

    三,做分析

    由于上面拿到的三类数据有两类属于“操作数据”,这两类对“结果数据”只能产生部分影响,这里我们就不关注这两项数据了(在全局分析中,这些局部数据都可以作为一个参数加入到分析的行列)。这里我们只关注结果数据。这里的结果数据中虽然有三组数据,由于其中一项数据缺少时间参数,所以我们可以把三项数据当作两项去分析,季度和月询盘量可以当作一个有效参数,这个时候我们就把数据优化成两类:访客和询盘。当看到这两个数据的时候我们很简单的就会联想到由他们而衍生出来的一个数据:“转化率”,这个数据能够比较真实的反馈平台效果。接下来我们计算出每一组的“转化率”数据如图(按照月度参数计算):

    图片:转化率04.png

    从上图可以看出“转化率”排名如下:

    H > K > P > A = F > B > D = E > I = O > J > L >N

    当然,转化率高并不代表代表一个店铺的表现就是第一名,这个数据只能判断该店铺引流的精准程度(当然如果需要更深入的分析精准度是需要深入到询盘质量和成交转化中去的,这里不做过多介绍)。我们可以观察一下N店铺的转化率,0.43%的数据与其他店铺相比较差距较大,该店铺的访客流量占据第一位,但是反馈数据在该表中与其他几家并列最后一名,该店铺就需要认真的分析访客来源和未转化的原因(这里就牵扯到了其他数据的数据分析,这里不多介绍)。

    当然,从数据组中我们一共可以看到这些数据条件,也可以计算出一个数据进行比较。但是这并不太说明什么太多的问题。接下来我们用加入条件的方法来进一步深入分析。这里我加入的数据是店铺的产品”上架产品数量“这个参数。加入数据到图标(实际操作中我们可以加入更多的可参考数据进行数据分析),如图:

    图片:加入产品数量条件05.png

    从表格中可以看出产品数量过万的有A B J N ,产品数量5000以上的有D I K L O P,产品数量低于5000的有E F H。从阿里规则上来说,店铺产品数量过多,店铺过于臃肿并不太好,但是这并不代表不用去发布产品了,其实我们真正要做到的是产品数量适中,做到全覆盖即可。从以上店铺的产品数量数据表现可以看出来,该行业的产品数量需要大于5000以上,如果低于5000,应该做不到全覆盖,可能会浪费很多流量(这里是从数据表大致得出结论,如要深入分析具体多少产品数量合适,还需要从其他方面进行综合分析)。我们也可以看到低于5000的几个店铺的访客量分别为:4000,7000,9000(里面有P4P引流数据,所以该数据仅作参考,不可作为实际数据参考),这个数据量并不算高,特别是H,访客是最少,产品数量也是最少,但是我们可以发现H的转化率是最高的,我们这里假设,H拥有A的产品数量(覆盖面),保持转化率不变,其他条件随覆盖面递增,这个时候我们可以看到H的数据应该是这样的,如图:

    图片:修改数据后转化询盘06.png

    当然这是一个理想的假设状态,覆盖,访客,转化这些数据都是的动态的,越是大的数据体量对转化率的控制难度越大,但是不可否认的是,如果产品覆盖能够达到一定程度的话,对访客和询盘转化肯定是有益处的,示例中虽然达不到492条的完美状态,但是询盘数量增加2倍应该还是有保障的。从这些数据的表现我们也可以看到覆盖的重要性(其实覆盖是一个很复杂的事情,并不是咱们想象的那种把产品和关键词上传上去就完事儿的事情,有时间可以跟大家深入交流关于覆盖的问题)。其实这些数据中还有很多可以对比解读的地方,我们今天先这里,以覆盖落幕。

  • ?

    一起聊聊数据分析师的那些技能(硬功夫)

    窦难敌

    展开

    在前面写了《聊聊我的R语言学习路径和感受》一文,很多朋友在公众号后台给我留言,问如何学习数据分析、如何转行数据分析、如何快速的掌握数据分析技能等等类似的问题。为了回答这些问题,就在这里跟大家聊聊我个人从事数据分析行业后的一些感受和建议。也欢迎各位看官提出你自己的想法和经验,帮助到其他同行的朋友。

    感受1:SQL很重要

    SQL很重要!SQL很重要!SQL很重要!重要的事说三遍,数据库查询对于一个数据分析师来说真的是必备技能。没有它,你的工作真的非常难找,往往在面试的时候,对方都会出一些数据库相关的问题。数据库之所以重要,那是因为你工作中所需要分析的数据基本都是来自于数据库,如果你不会从数据库查询,就等同于“巧妇难为无米之炊”。

    学习建议

    数据库目前在市面是有很多种,如Oracal、SQL Server、MySQL、Hive等,并不是都要一一学个遍,因为它是结构化的查询语言,各种数据库的语法都非常相似,可以说是一通百通。如果你想从事数据分析岗,但又没有接触过数据库(学生或准备换行的朋友),建议你下载一个MySQL的社区版本(https://dev.mysql/downloads/mysql/),然后买一本相对实战且基础的书籍(《SQL必知必会》)进行学习。这本书一共介绍了30个章节的内容,你只需重点吸收数据库的查询、修改、删除、插入、存储过程等知识点,我认为通过这些知识点的吸收和应用,基本上可以满足数据分析岗的面试要求了。当然对于老手来说,这本书里面也有很多其他值得学习和实战的例子(如存储过程、游标、事件、性能等)。

    感受2:可视化显水平

    数据可视化的技能,也是数据分析师的必备要求,因为枯燥的数据表肯定不如一张张图更吸引眼球,更何况这些报表更多的是给那些业务繁忙的Boss看。那报表的展现方式总不能每次发一个PPT给对方吧,如何让对方随时随地的查看到你的报表呢?Tableau!

    它有两个强大的版本,一个是DeskTop版,即分析人员的可视化设计版本;另一个是Server版,即通过DeskTop将设计好的可视化报表上传至服务器,实现随时查阅报表的功能,而这两个版本的结合就能恰到好处的满足随时随地查报表。最大的好处是你无需编程即可完成高质量的可视化任务,只需通过简单的托拉拽,就让数据可视化想怎么玩就怎么玩。目前越来越多的企业,在招聘时,都会要求或注明有Tableau的使用经验。

    学习建议

    这里推荐《Tableau数据可视化从入门到精通》一书,这也是我看的众多Tableau书籍中比较好的一本,而且该书籍在售书平台上的评价也非常棒。该书一共16个章节,从基础的工具简介、数据读取、字段操作、函数使用到可视化实操,讲到了很多细节方面的内容,最后还以两个案例作为压轴戏,分别是“网上超市运营分析”和“网站流量统计分析”。这两个主题抓的非常贴切,一个从电商运营角度来思考常见的可视化问题;另一个则从网站运营角度来分析有哪些核心指标可供选择和及对应的展现方式。这两个角度都顺应了互联网时代下的需求,我相信当你读完并操作完数里面的案例,会对你的可视化能力有一个质的提升,也是进入数据分析行业的加分项。

    感受3:Excel很普及

    作为一个数据分析师或BI,其实很多工作内容都可以通过SQL提数和Excel的加工就可以任务完成,困难的是如何梳理好SQL的提数逻辑和灵活的应用Excel减轻你的工作量。之所以说它应用很普及,是因为它不仅仅是个装数据的容器,更多的是会借助于强大函数、可视化等帮你完成工作。

    各式各样的字符串函数(LEFT、RIGHT、MID、LEN、REPLACE、TRIM、FIND、SEARCH、CONCATENATE、REPT等)、数值函数(ABS、EXP、LOG、POWER、SQRT、CEILING、FLOOR、MOD、ROUND、SIGN等)、日期函数(DATE、YEAR、MONTH、DAY、WEEKDAY、WORKDAY、TODAY等)、统计函数(MIN、MAX、AVERAGE、MEDIAN、VAR.S、SUM、SUMIFS、COUNT、SKEW、NORM.DIST等)、匹配函数(ROWS、COLUMNS、MATCH INDEX、VLOOKUP)等可以让你在数据处理过程中变的非常简单而轻松;强大的可视化功能(如饼图、条形图、柱状图、折线图、面积图、散点图、气泡图、雷达图等)也会为你的数据分析助一臂之力,但面对大数据量时就显得非常捉急,这也是无法跟Tableau媲美的;灵活的宏功能,可以避免我们不断的做重复性工作,从而节约时间,提高我们的工作效率,宏语句是由一系列的命令和函数组织起来的,尽管它在工作中用的并不是那么的频繁,但一有机会,你去用它来开发报表或表计算的话,会大大提高你的成就感,当然,我希望你能够会一些宏语句,这样你身边的朋友或同事都会觉得你很了不起呢!

    学习建议

    这里向大家推荐《Excel函数与公式速查手册》和《Excel2016宝典》两本书。第一本书涵盖了近600个函数的讲解,而且这些函数都是借助于一个个实例来完成的,有助于读者的操作和理解,可以说,读完这本关于函数的书就可以在工作中使用函数时显得游刃有余;第二本光从书名就知道是一本知识点比较全面的书籍,该书涉及Excel的公式和函数、图表可视化以及Excel的各种设置。个人建议可以把这两本书当作工具来使用,没必要系统的过一遍,当你需要某个知识点时,从目录去查找相关关键词,然后操作几遍就记得如何使用了。

    数据挖掘秀肌肉

    我相信,当你找数据分析相关的工作岗位时,基本上都会看见对方要求你会数据挖掘或数据建模方面的能力,同时也会附上一条熟练使用Python、R等工具。此时你会掂量掂量自己,这方面的技能我会吗?工具使用的熟悉程度能够达到对方的预期吗?我有哪些相关的建模经验?

    在面试或工作中比较常见的数据挖掘算法有四类,分别是预测、分类、聚类和关联,个人觉得前两类的使用频率会更高一些。这里提几个重要的挖掘算法:线性回归、Logistic回归、决策树、贝叶斯、SVM、随机森林、K均值和关联规则。希望不熟或不会数据挖掘的朋友可以先从这几个着手学习,而且学习的时候先通过代码完成落地,然后再去慢慢研究其理论知识。

    学习建议

    如果你是统计学或经济学等类似专业的朋友,建议你去学习R语言,而如果你是计算机专业或理工科的朋友,则建议你去学习Python。因为这两个工具的思维有一点点差异,毕竟R语言是由统计学家创建的(偏向于函数概念),而Python是由计算机学家创建的(偏向于类概念)。而且又有一些相似性,同时学习的话会比较容易混淆。如果你选择R语言的话,这里推荐《R语言实战》和《机器学习与R语言》这两本书,前一本书偏向于语法编程,同时也会含有案例来说明统计学方面的知识点,后一本则通过实战的方式来介绍常用的数据挖掘技术,能够助你快速的进入R语言的挖掘状态;如果你选择Pythond的话,同样介绍两本书,即《利用Python进行数据分析》和《Python数据分析与挖掘实战》,第一本更多的是介绍数据分析方面的Python库,如numpy、pandas和matplotlib,这也是一本基础书,第二本则是教你如何按部就班地完成每一个实战案例,具有代入感,让读者学习起来很顺畅;如果你还想补一补数据挖掘的理论知识,则推荐《数据挖掘概念与技术》,个人看了好几遍,不是很难,有比较好的操作性。

    OK,如上就是我从事数据分析岗位的一些学习经验和感悟,希望对各位读者有一点点的帮助。学习是一种投资,需要耐得下性子,坐得住板凳,敲得住键盘,同时,还要不断的坚持。只有这样,我相信一定会成为数据分析或挖掘的强者。

    End.

    作者:刘顺祥(中国统计网特邀认证作者)

    点击下面链接 查看历史文章

    一文综述数据科学家必备的10大统计技术:线性回归、分类、无监督学习...

    【漫画版】12星座程序员写代码

    怎样成为知乎大V?爬取张佳玮138w+知乎关注者:数据可视化

    一步一步教你分析消费者大数据

  • ?

    五个大数据分析成功案例分享

    春江畔

    展开

    首席信息官正在利用数据分析来提高效率和促进增长,但并不是每一次努力都会产生结果。以下讲述了优秀的首席信息官是如何成功地利用数据分析和机器学习技术来增加收益或降低成本的。

    如果把数据比作新的石油,那么掌握如何将其提炼为可使用的情报就是发挥其潜力的关键。为此,首席信息官正在使用预测分析工具,设计机器学习算法和对其他解决方案进行测试,以追求企业的效率和以新的方式为客户服务。

    胡椒博士集团(Dr.PepperSnappleGroup)将机器学习技术用于语境相关性工作中

    多年来,胡椒博士集团的销售路线员工一直是抓着一本厚厚的活页夹,里面装满了客户数据、销售和促销说明,然后去吸引一些零售客户,如沃尔玛和塔吉特百货公司(Target)等。今天,销售人员不再使用这种活页夹,而是配备了能告诉他们需要拜访哪家商店的iPad,而且还会告诉销售人员该为这些零售商提供何种优惠,以及其他关键指标。胡椒博士集团的首席信息官汤姆·法拉(TomFarrah)表示:“他们都是接订单的销售人员,为此他们感到很骄傲。现在他们配备了信息资料来帮助其实现目标,使他们成为智能的销售人员。”

    该MyDPS平台配有机器学习和其他分析工具,可在工作人员加载应用程序时向其提供建议和日常操作记分卡。这些算法向员工显示他们是如何按照预期计划进行工作的,包括他们是否按照自己的计划工作,或是落后于计划,以及给他们提供见解,让他们清楚如何纠正他们的工作。法拉说:“如果我要让某人获得成功,我必须确保他们拥有哪些信息是与工作内容相关的。”

    经验教训:为了测试验证MyDPS平台的概念,法拉将该软件分给了一个分公司的四个人,并让业务总裁去拜访他们。他们透露,自从上个月使用MyDPS之后,执行销售额已经提高了50%,这一表现让他批准了该项目。法拉说:“他获得了结果,这就是销售所需要的,这不仅仅是为了项目的商业赞助,而且这也是他们希望得到的结果,这一点非常重要。”

    凭借机器学习技术,RRD公司走上新业务之路

    营销传播公司R.H.Donnelley公司为RRD公司的前身,几年前,RRD公司设立了物流部门,向消费者和企业配送它的印刷材料。为了支持这项业务,公司自己管理运营,并代表其合作伙伴配送各种物品,包括洗衣机、狗粮等等,最终成长为价值10亿美元的一个企业。这是一个挑战吗?在联邦快递和UPS成为无可争议的霸主的天下,找到一个最优的运费。

    诸如天气、地域、司机和政治局面等因素都是业务上的成本。RRD公司的首席信息官肯奥布莱恩(KenO'Brien)表示,随着迫切需要对费率变量进行预测,RRD公司转向了机器学习和数据分析。公司聘请员工和与大学合作来帮助编写算法,在700条路线上测试数千个场景,直到能够以99%的准确率提前7天实时预计运费。奥布莱恩说:“该项目在不到一年的时间就完成了,我们现在仍然看到业务的增长与运费有关。”该公司预计,在2017年,其卡车货运代理业务将从400万美元增长到1600万美元,营收将增长1200万美元,业务规模达6亿美元。

    经验教训:新企业需要高水平的全心投入,尽管奥布莱恩承认,他的一些业务同行已准备好在业务的不同环节上认输。该业务并不相信那些通常以感觉和猜测来完成一个流程的技术。RRD公司建立了一个协作环境,业务和IT共同合作来推进结果。“你会遇到困难,你会遇到挑战,但要耐心,”奥布莱恩说。

    孟山都公司(Monsanto)利用机器学习技术,实现最佳种植计划

    农民永远为要种植何种作物,种植面积,在哪里种植及何时种植而苦恼。种子行业巨人孟山都公司正在研究这项工作,利用数据科学为农业种植提供规范性建议。数学和统计学模型会绘制出雄性作物和雌性作物的最佳种植时间,以及在何处种植,在理想状态下,这就最大限度地提高产量并减少土地使用。孟山都公司全球IT分析主管艾德里安·卡地亚(AdrianCartier)表示,其机器学习算法在数天内完成了超过900亿的数据点,而不是几周或几个月。这是商业利益吗?在2016年,孟山都公司节省了600万美元,其供应链足迹减少了4%。卡地亚说:“北美地区的土地利用率下降了4%,相当于不去使用大面积的土地,这节省了大量资金。”

    经验教训:孟山都公司成功的关键是在信息技术与供应链业务之间建立了一个“自始至终”的合作。卡地亚说:“他们具有农业和供应链角度的专业知识,而我们具有数学和统计领域的专业知识,两者结合起来,就创造了我们能够提供的价值。”卡地亚说道,他还寻求在供应链业务中“改变领导者和倡导者”,以形成对反对者一种健康的平衡。

    柏克德公司(Bechtel)以卓越的大数据中心来颠覆自己

    一个鲜为人知的事实:柏克德公司首席信息官CarolZierhoffer说,与建筑有关的支出占GDP的13%,但整个行业在过去二十年中只有1%的生产率增长。专家表示,通过重新制定合同、提高工人技能以及改进现场执行工作等方式,该行业可以提高50%至60%的生产率。柏克德公司建造了胡佛水坝、英吉利海峡隧道和其他大型设施,已经开始在业务各个环节的数据中挖掘洞察力。

    Zierhoffer在沃尔玛、波音和洛克希德马丁公司会见了业内同行,以获得有关如何向前发展的见解。柏克德公司建立了一个先进的大型数据中心,其中包含5千万亿字节数据的数据湖,并开始了概念验证。该数据中心使用照片识别技术,并代表客户来检查和标记各个地点的照片,这节省了200万美元。自然语言处理(NLP)工具可解析索赔、提案请求(RFP)和合同。过去需要几天和几周的评估和计划工作现在只需要数小时。柏克德公司还扩大了分析工作范围,以了解员工的流失率情况,包括试图预测员工将何时离职。Zierhoffer说:“我们相信我们正在敲开解决生产率难题的大门。”

    经验教训:数据仓库和质量是支柱。尽管柏克德公司可以分析大量的数据,但在整个业务各环节的数据质量必须提高。“我们不得不颠覆自己,了解我们是如何工作的,并且将数据仓库进行连接。”

    数据分析帮助辛辛那提动物园提高客户满意度

    辛辛那提动植物园成立于1873年,是世界上著名的动植物园之一,以其物种保护和保存以及高成活率繁殖饲养计划享有极高声誉。它占地面积71英亩,园内有500种动物和3000多种植物,是国内游客人数最多的动植物园之一,曾荣获Zagat十佳动物园,并被《父母》(Parent)杂志评为最受儿童喜欢的动物园,每年接待游客130多万人。

    辛辛那提动植物园是一个非营利性组织,是俄亥州同时也是美国国内享受公共补贴最低的动植物园,除去政府补贴,2600万美元年度预算中,自筹资金部分达到三分之二以上。为此,需要不断地寻求增加收入。而要做到这一点,最好办法是为工作人员和游客提供更好的服务,提高游览率。从而实现动植物园与客户和纳税人的双赢。

    借助于该方案强大的收集和处理能力、互联能力、分析能力以及随之带来的洞察力,在部署后,企业实现了以下各方面的受益:

    -帮助动植物园了解每个客户浏览、使用和消费模式,根据时间和地理分布情况采取相应的措施改善游客体验,同时实现营业收入最大化。

  • ?

    EXCEL数据分析师常用操作技巧

    占樱

    展开

    快捷键

    Excel的快捷键很多,以下主要是能提高效率。

    Ctrl+方向键,对单元格光标快速移动,移动到数据边缘(空格位置)。

    Ctrl+Shift+方向键,对单元格快读框选,选择到数据边缘(空格位置)。

    Ctrl+空格键,选定整列。

    Shift+空格键,选定整行。

    Ctrl+A,选择整张表。

    Alt+Enter,换行。

    Ctrl+Enter,以当前单元格为始,往下填充数据和函数。

    Ctrl+S,快读保存。

    Ctrl+Z,撤回当前操作。

    如果是效率达人,可以学习更多快捷键。Mac用户的Ctrl一般需要用command替换。

    格式转换

    Excel的格式及转换很容易忽略,但格式会如影随形伴随数据分析者的一切场景。

    通常我们将Excel格式分为数值、文本、时间。

    数值常见整数型 Int和小数/浮点型 Float。两者的界限很模糊。

    文本分为中文和英文,存储字节,字符长度不同。

    时间格式在Excel中可以和数值直接互换,也能用加减法进行天数换算。

    时间格式有不同表达。例如2016年11月11日,2016/11/11,2016-11-11等。当数据源多就会变得混乱。我们可以用自定义格式规范时间。

    数组

    数组很多人都不会用到,甚至不知道有这个功能。。

    数组由多个元素组成。普通函数的计算结果是一个值,数组类函数的计算结果返回多个值。

    数组用大括号表示,当函数中使用到数组,应该用Ctrl+Shift+Enter输入,不然会报错。

    先看数组的最基础使用。选择A1

    1区域,输入={1,2,3,4}。记住是大括号。然后Ctrl+Shift+Enter。我们发现数组里的四个值被分别传到四个单元格中,这是数组的独有用法。

    我们再来看一下数组和函数的应用。利用{},我们能做到1匹配a,2匹配b,3匹配c。也就是一一对应。专业说法是Mapping。

    =lookup(查找值,{1,2,3},{"a","b","c"})

    分列

    Excel可以将多个单元格的内容合并,但是不擅长拆分。分列功能可以将某一列按照特定规则拆分。常常用来进行数据清洗。

    上文我有一列地区的数据,我想要将市和区分成两列。我们可以用mid和find函数查找市截取字符。但最快的做法就是用“市”分列。

    合并单元个格

    单元格作为报表整理使用,除非是最终输出格式,例如打印。否则不要随意合并单元格。

    一旦使用合并单元格,绝大多数函数都不能正常使用,影响批量的数据处理和格式转换。合并单元格也会造成Python和SQL的读取错误。

    数据透视表

    数据透视表的主要功能是将数据聚合,按照各子段进行sum( ),count( )的运算。

    下图我选择想要计算的数据,然后点击创建透视表。

    此时会新建一个Sheet,这是数据透视表的优点,将原始数据和汇总计算数据分离。

    数据透视表的核心思想是聚合运算,将字段名相同的数据聚合起来,所谓数以类分。

    列和行的设置,则是按不同轴向展现数据。简单说,你想要什么结构的报表,就用什么样的拖拽方式。

    删除重复项

    一种数据清洗和检验的快速方式。想要验证某一列有多少个唯一值,或者数据清洗,都可以使用。

    条件格式

    条件格式可以当作数据可视化的应用。如果我们要使用函数在大量数据中找出前三的值,可能会用到rank( )函数,排序,然后过滤出1,2,3。

    用条件格式则是另外一种快速方法,直接用颜色标出,非常直观。

    冻结首行首列

    Excel的首行一般是各字段名Header,俗称表头,当行数和列数过多的时候,观察数据比较麻烦。我们可以通过固定住首行,方便浏览和操作。

    Header是一个较为重要的概念。在Python和R中,read_csv函数,会有一个专门的参数header=true,来判断是否读取表头作为columns的名字。

    自定义下拉菜单(数据有效性)

    数据有效性是一种约束,针对单元格限制其输入,也就是让其只能固定几个值。下拉菜单是一种高阶应用,通过允许下拉箭头即可。

    自定义名称

    自定义名称是一个很好用的技巧,我们可以为一个区域,变量、或者数组定义一个名称。后续要经常使用的话,直接引用即可,无需再次定位。这是复用的概念。

    我们将A1:A3区域命名为NUM

    直接使用=sum(NUM) ,等价于sum(A1:A3)。

    查找公式错误

    公式报错也不知道错在哪里的时候可以使用,尤其是各类IF嵌套或者多表关联,逻辑复杂时。查找公式错误是逐步运算的,方便定位。

    分组和分级显示

    分组和分级显示,常用在报表中,在报表行数多到一定程度时,通过分组达到快速切换和隐藏的目的。越是专业度的报表(咨询、财务等),越可以学习这块。在数据菜单下。

    分析工具库

    分析工具库是高阶分析的利器,包含很多统计计算,检验功能等工具。Excel是默认不安装的,要安装需要加载项,在工具菜单下(不同版本安装方式会有一点小差异)。

    分析工具库是统计包,规划求解是计算最优解,类似决策树。

    内容来源:网络整理

    百家号-【袁帅数据分析运营】运营者:袁帅,互联网数据分析运营实践者。会展业信息化、数字化领域专家。认证数据分析师、网络营销师、SEM搜索引擎营销师、SEO工程师、电子商务职业经理人。

  • ?

    Python 爬虫实操,顺便做了个数据分析

    高老四

    展开

      【IT168 资讯】本文作者是一名地地道道的程序员,最大的乐趣就是爬各种网站。特别是在过去的一年里,为了娱乐和利润而爬掉了无数网站。从小众到主流电子商店再到新闻媒体和文学博客,通过使用简单的工具(如BeautifulSoup)获得了很多有趣且干净的数据—我也很喜欢Chrome 的Headless模式。

      本文,作者将分析从Greek wine e-shop商店(一个希腊葡萄酒网站)中获得的数据,来看看哪种葡萄酒最受欢迎。

      scraper本身相当简单,可以在GitHub页面(https://github/Florents-Tselai/greek-wines-analysis)找到。作者将着重于通过使用标准的Python包对得到的数据(1125个独特的标签)做一些快速的探索性分析。

      scraper本身暴露了一个相当简单的API。首先,请求葡萄酒页面的数据,并将数据返回给nicedict,如下所示:

      In [2]:

      In [3]:

      Out[3]:

      然后,定义一些matplotlib。

      In [4]:

      加载由houseofwine_gr.dump模块生成的数据转储,开发者也可以在GitHub页面找到.json,.csv和.xlsx的数据集。

      In [5]:

      以下是所拥有数据的视图:

      In [6]:

      Out[6]:

      用np.nan替换空的字符串,使它们更容易处理 Pandas。

      In [7]:

      重命名一些包含特殊字符的列名,以便将它们用作本机DataFrame存储器。

      In [8]:

      我们还将适当的类型分配给列:

      In [9]:

      让我们将color列值从希腊语翻译成英语。

      In [10]:

      以下是数据集的颜色直方图。

      In [11]:

      以下是每种葡萄酒的简单指标分布情况:

      In [12]:

      如图所示,Average Rating列几乎为正态分布,μ值高达85以上。 Reddit上的Kroutoner解释了为什么会发生这种情况(并纠正了作者以前的错误):

      典型的葡萄酒评级是50-100,而不是0-100。所以看起来似乎只有一半分布,实际上是一个几乎完全的分布。此外,90分以上的葡萄酒一般被认为效果更好,销售也更好。这个事实改变了对数据的解释,也就是说大多数葡萄酒被评为好,只有一小部分被评为非常好。

      为了进一步推进,来看一下tags 列。

      似乎每个标签列表可以给出有关葡萄酒的各种属性(品种,甜味等)的信息。接下来,作者将这些属性分开,将tags列元素从list 转换为set列表元素,因为这样会使操作更简单。也就是说,不是在一个if x in -else-try-except-IndexError中,我们将使用set操作。

      现在,做一些简单操作来提取关于甜度,温和性等信息,以下信息同样从希腊语翻译到了英语。

      以下是4个属性中每一个属性的直方图:

      在这一点上,开发者可以(几乎)安全地假设所有剩下的标签显示每种葡萄酒的品种信息,所以定义一个新的列来存储它们。

      由于解析错误,列中出现了一些整数,我们将其过滤掉。

      我们也可以添加一个布尔变量varietal。酒中的混合物只有一种的称为varietal,至少有两种混合物的称作blends。

      对于varietal葡萄酒,我们设定了一个single_variety - 对于其他非varietal的葡萄酒来说,这个数值将是NaN。

      让我们来看看Varietal / Blend的分布是怎样的。

      这是一些指示性的情节。

      In [27]:

    看起来Chardonnay是最流行的品种,而Vidal和Sangiovese是最昂贵的品种。评分最高的是Malvasia,但所有品种都非常接近。

      把注意力转移到blends上,我们做了一些Numpy和Scikit-Learn来产生blends的矩阵。

      上面的代码简单地从这里得到:

      对此:

      这些是blends中出现频率最高的品种。

      In [30]:

      这里是一个热图,显示哪些品种通常混合在一起。

      In [31]:

      In [32]:

      如果你有兴趣,欢迎来Github页面与作者交流。

  • ?

    极简数据分析实操指南(上)

    雁菱

    展开

    “用数据做事情的能力,将在你的工作和生活的方方面面发挥意想不到的作用。”

    在工作中,我们会遇到各种各样的问题。如:

    如果你是一家 SaaS 公司的营销经理,产品副总裁看到注册数量突然下降,需要你汇报原因;

    也许你是一个电商运营主管,当天的首要任务是弄清楚为什么购物车的转化率正在降低;

    或者你是一个产品经理 ,所负责的 App 激活率已降低,你有责任找出原因。

    ……

    如果你意识到数据分析解决问题的价值,但没有时间来进行大规模复杂的数据调查。下面为你介绍的极简数据分析指南,将帮助你!

    本文将为你重点介绍:

    如何评估和定位问题?

    如何确定潜在原因?

    如何分析数据?

    预告:在下篇,我将继续详细介绍,数据分析的示例和如何避免数据谬误,最终解决问题,做出明确的决定。

    正文

    评估和定位问题

    在深入研究任何类型的数据之前,应该快速找到你需要解决的真正问题,并用最简单的话定义它。

    如果您无法用简单的语言解释您要解决的业务问题,那么任何数据分析都无法解决问题。

    —— DezBlanchfield,投资者,数据科学家

    我们可以通过思考以下三个方面来快速评估,这实际上是一个问题吗?如果是的话,这里的核心问题是什么?

    快速评估和定位问题的三问:

    这是否是系统异常导致的问题?例如,你注意到下载量下跌,但激活量没有,也许是下载没有被正确捕获?

    这是更大问题的预兆吗?例如,注册号码的下降是网站故障的指示吗?

    你是在看一个重要的度量指标吗?例如,如果你注意到网站的转化率下降,但原始注册量没有下降,那么这就从一个紧急事件变成一个谜团待揭开。

    确定潜在原因

    现在你已经定位了问题,下面将开始解决问题,首先我们先要确定潜在原因,下面将介绍几个方法。

    1.经验检索,快速寻找原因

    根据经验,寻找任何明显的可能原因或问题的答案。如当你检查了显示问题的来源或报告后,是否有任何异常原因立即浮现在脑海中?

    例如,你的电子商务网站的 SSL 认证(一种保护客户数据的加密)可能已过期,导致浏览器弹出窗口警告数据不安全,从而显著降低购物车转化率。

    2.询问相关人员原因

    这个问题会影响或涉及其他团队吗?如果是这样,他们是否对可能的原因有任何了解?

    即使问题与其他团队之间没有明显的联系,也有必要咨询一下。例如,营销经理可能会问客户支持,“我注意到注册数量下降了,你能否想一想在过去几周内你发现过什么相关的变化吗?”

    在进入第三步时,请使用你在此处收集的任何见解。

    3.创建假设

    一个假设只是一个尚未得到证实的有根据的猜测。

    在分析数据之前,清楚地说明问题的几个可能原因非常重要,这有助于防止常见的数据分析误区。

    假设示例:

    回到开头提到的场景,导致注册数量突然下降的假设如下:

    o 某些地区的公众假期

    o 最近对营销网站的更改

    o 星期一早上网站中断导致注册过程中出现错误

    o 转换率下降减少了注册量

    o 有机搜索排名(针对我们的产品页面)下降到搜索结果的第二页

    如果你想采用更科学的方法来制定你的假设,下面是一个偏技术思维的方法:

    科学的假设需具备的条件

    o 它涉及一个自变量和一个因变量

    o 它是可测试的

    o 它是可以证伪的

    自变量是原因(可以改变或控制),因变量是效果(可测试结果)。

    需要注意的是,有时查看数据可能会产生一个新的假设,您需要再次测试。最终,我们的假设会在下一步通过数据分析得到证实或反驳。

    如何分析数据?

    下面是一个简单的数据分析流程来测试您的假设和寻找解决方案。

    1.分割并确定相关数据指标

    根据你的假设,你需要查看哪些数据?哪些指标可以帮助你证明或反驳假设?

    例如,你可以按国家/地区,渠道和网络会话持续时间细分注册次数,以测试你的假设(解决前面提到的 App 注册问题)。

    2.注意你的数据

    基于你已知的业务正常指标,你可以判断数据是否出现异常?也许你看到澳大利亚的 App 注册有明显的 20% 下降。

    如果尚未为“正常”建立基线,请使用历史数据作为起点。例如,你可以将本月的注册与去年同月的注册进行比较。

    3.评估异常或趋势的影响

    经过步骤 2 后,你需要查看发现的趋势/异常是否足以解释问题。

    在寻找数据中的异常或趋势时,要注意这些异常或趋势不仅要具有统计意义,而且要具有实际意义。简单来说,就是我们需要弄清楚是什么会对我们发现的问题产生实际影响。

    统计意义小贴士

    统计显著性(或统计显著性检验)是用于确定你注意到的异常是由于抽样误差还是适用于所有对象。

    例如,继续前面 App 注册的示例,如果后来发现澳大利亚只占所有注册人数的 5%,不可能导致注册人数总体下降 10%,因此澳大利亚注册率的下降并不是主要原因,这就是抽样误差导致的。

    为了更好地理解数据分析实操指南,下篇文章我将继续详细介绍,做数据分析的示例和如何避免数据谬误,最终达到解决问题,做出明确的决定。

    本文由策小编编译

    来源:Geckoboard 网站

  • ?

    零一《从0开始,教你做数据分析》—10篇

    mm123

    展开

    大家好,我是零一。这一篇给大家介绍聚类/分类。

    我们先讲一讲聚类。

    上一篇的探索关系,很多朋友反映说非常有趣,这一篇,聚类分析也是相当有趣的。

    聚类分析简称聚类,俗话说物以类聚,人以群分,聚类就是划分子类的过程。算法上面多用k-means和k-medoids,当然,大家可以跳过这些算法的过程,用程序来完成即可。

    说简单一点,通过聚类,可以将我们的数据进行分类,并且描述每个类的特征。

    聚类应用非常广泛,包括在电商领域的应用也是多不胜数。比如

    (1)对客户数据进行聚类分析得到多个客户群组,并且得到各个群组的特征,这可以帮助我们发现客户的共性和差异性;

    (2)竞争对手数据进行聚类分析得到多个对手群组和各自的特征,这一样可以让我们找到对手们的共性和差异性;

    (3)对行业数据进行聚类分析得到多个行业群组和各自的特征,这个可以来发现不同行业之间的共性和差异性

    (4)对销售数据进行聚类分析(比如以其中的地域聚类),可以告诉我们那些地域之间的共性和差异性

    不难发现,我举的4个例子都是在发现共性和差异性。对的!我们了解了这些信息,可以指导我们的运营决策,对不同群组制定不同的策略。

    下图是对地域数据做的聚类分析,得到的一个谱系图,我们从上往下看,首先是分成两大类

    广东,天津,浙江,北京和上海这五个省市为一类,其余的多省为一类。

    再往下看又分成了四大类,西藏作为单独一个分类,广东也作为单独的一个分类,天津和浙江为一类,北京和上海为一类。

    从上往下,越分越细。红色的边框把多个省市划分成5个分类。一般没必要分得太细,这个数据目测是分成了20个细分的分类,除非是确实是需要细分到很细的时候,才需要看最低层的分类。

    当我们知道天津和浙江聚为一类的时候,他们必然存在共性,才会聚在一起。当我们知道天津-浙江类和北京-上海类,作为两个不同的群组聚集,它们之间肯定是存在某种差异。

    =======================================

    下面,我们用上篇共享的数据,跟大家一起探讨聚类,和寻找他们的共性和差异性。

    先处理下缺失值,选择清除数据里面的离群值

    中间要选择需要处理的字段,选择好后,进入以下界面,也一样下一步即可

    选择删除包含离群点的行(因为这里数据量不少,可以删了)

    一般情况下,我们都避免直接修改源数据,需要新建一个变量或者空间或者工作表来存放处理过后的数据。这里选择复制到新的工作表就可以了。

    数据处理好后,就可以进行聚类分析了。在数据挖掘套件里面直接选择聚类分析即可。

    选择需要的数据进入模型里面

    点击参数,然后就会看到下图这个对话框,可以手动输入数字来更改聚类算法,可以看到微软提供的聚类算法有4种,分别是可变的EM,固定的EM,可变的K-means跟固定K-means(EM是最大期望算法,K-means是K平均值算法,可变的是可以伸缩调整的,固定的就是固定不可调整的)

    这里我输入4,选择固定的K-means算法

    下图是选择测试集的比例,默认是30%。【测试集】是数据挖掘特有的名词,数据挖掘里头将数据集一分为二,大头的部分用来训练建立模型,称之为【训练集】,小的部分就用来测试模型,称之为【测试集】。这是数据挖掘和统计学最大的差异之一。统计学是通过统计方法来验证模型是否可靠,而数据挖掘技术是利用测试集来验证模型的可靠性。一般用于预测模型,聚类分析其实可以不用测试集,可以把数值改为0。但我就不改了。就用随机抽取出来的70%的数据来建立模型。

    完成后,就会进入模型浏览界面,我们看到共有划分了7个,这有点儿多,我们可以在选择输入列的时候指定分类的数量,刚才我们是选了自动检测来着。

    线粗代表两个分类之间的关系的强度,越粗关系越强。分类的颜色代表密度,颜色越是深蓝代表这个分类的数据个数越多。那非常明显,系统把大部分的数据归入分类1里头了。

    下面是分类的剖面图,每个分类对应的指标范围在这里一览无遗。

    简单解读一下上面这个分类情况

    【分类1】包含2768个数据,最鲜明的是30天成交量偏大,价格偏低的这一个群组,是中低端爆款类

    【分类2】只有246个数据,这个群组比较失败,发货分丶服务分丶好评率都偏低,销量偏低,价格偏高一点,典型就是卖货不卖服务类

    【分类3】只有187个,集中在广东深圳,DSR很好,评价很好,价格很高,但退款率也很高,应该是高端市场的卖家,标准的价格高,服务好,但不知为何退款率也高,可能是买家收到了,觉得不划算吧,这一类是高端类,但产品或品牌的价值感可能没有做好。

    【分类4】只有65个,也是DSR超好,价格中档,产品的价值完美体现,退款率不错,同样集中在广东深圳,是中档性价比类。

    【分类5】只有61个,这个群组很惨,集中在浙江金华(估计是义乌),价格超低,DSR超烂,好评率很惨,是低端烂货类

    【分类6】和【分类7】规模很小,就不解读了。以上解读仅供参考。一般分个4-5个群组就差不多了,如果数据量确实大,可以考虑分细一些。

    每一个分类都可以单独提取出这个分类下的数据的。

    下图是分类的一些特征,每个特征的概率情况

    下图是分类间的差异性,通过对比可以发现,分类1多是天猫,非分类1的多是C店。

    下面我着重看下分类3和分类4的区别,因为分类3败在退款率上面,而分类四就解决了这个问题。

    我大致上看出来了,分类3的服务(DSR,退款速度)没有分类4的做得好,但分类4的价格又要比分类3低,并且包邮。那作为消费者,肯定选个价格中肯,服务又好的店家。而且分类4的销量还不低,有少部分是心店,我对心店的印象就是心店的服务一般要比大店的要好。

    以上就是对这儿聚类分析结果的简单解读,具体的,亲们实操一下吧。

    =============================================

    下面说说分类。

    聚类和分类,从语义来讲,看似很像,但有一点重要的差异。分类是指定了我们要分析的列(维度),然后通过决策树算法(默认方法是用贝叶斯分类器),来告诉我们,影响这个目标的维度有哪些。下面我们看下过程。

    选择要分析的列,我这里选择的是30天销量,看下会影响销量的是什么因子。

    下图是结果,告诉我们,收藏很重要!收藏跟销量有很强的关系。同样第一张图是决策树,一样有分组的作用。

    决策树一般用来分析影响客户下单或者流失的因子有哪些。有兴趣的朋友可以自己倒腾一下。试下会有哪些意外的收获。

    ===========================================

    下面,告诉大家测试集的使用方法。

    选择准确性图表

    选择模型,一般用于预测模型,刚才的决策树是属于预测模型,而聚类就不属于,因此聚类的模型不可用于准确性图表。

    选择要预测的区间,我选择的是30天成交大于122的情况

    我们之前保留的测试集,就在这里出现了,默认会选择测试集来验证准确性。

    在上图点了完成后,就会得到这样的一个结果(部分截图),会有一个指标, “分类 30天成交”模型提升144.11%,这个数值越大代表模型的准确性越高。但我一般看下面的ROC图。

    蓝色代表没有模型的结果,红色代表理想的结果。而绿色代表我们测试得到的结果。

    绿色的线越接近红色的就代表越好,一般情况下,只要不要太接近蓝色的线(或者低于蓝色的线),就好了。如果接近蓝色的线或者在蓝色线下面,那就不如不用模型了,此时这个模型就没什么存在的意义,如果硬要用那就只是为了做模型玩玩而已了。

  • ?

    竞价营销流程数据分析实操(二)持续更新中……

    惠思远

    展开

    这篇文章是接上一篇“SEM公开课:竞价营销流程数据分析实操(一)”有感兴趣的可以找小编要之前讲的视频或是文章。

    上篇讲了看账户数据汇总阶段的部分,咱们讲这个数据分析实操的目的就是让大家可以透过数据本身看到本质问题,是数据分析的基础部分,这些技巧会在后续的公开课中一一给大家讲解,下面继续上一篇未说完的部分。

    5月份汇总数据

    直接进入到干货部分,账户汇总部分带大家分析完了,接下来看下面两个图片,第一张先不说了,上一节课讲过了,再放到上面是为了稍后计算数据的时候,大家可以看得清楚。主要下面那张内含弹出、对话、信息量和信息成本等等。下面看下从这组数据我们发现了什么问题。

    6月份汇总数据

    一、弹出率问题

    先计算下弹出率,弹出/总点击=5923/14605=0.4,这个就是弹出率,这个40%是非常低的,一般的弹出率起码达到85%以上,这种情况可能跟竞价人员设置的弹出时间较长有关,这里提醒下大家,正常我们设置抵达就可以了,不要设置弹出,具体为什么?上节课说过了,就是设置弹出其实不精准,PC和移动端的弹出时间有可能不一样,不一样的话数据就不具有参考性可能存在一定的误差并且误差会比较大。他这个弹出的设置可能是根据公司的情况进行设置的,所以设置弹出不具有参考意义。(弹出是在53/商务通后台统计,我们的追踪参数都是带“问号”后面带参数,可以直接在53的后台搜索带“问号”的代码就可以,所以我们的关键词应该在设置的时候就添加追踪参数,便于后期统计,具体怎么操作,在后期的公开课中会为大家讲解,这里不做介绍,可私密小编要视频资料)

    二、对话率问题

    计算对话率,对话/总点击=320/14605=0.02,点击到对话只有2.19%,这个数据是非常非常低的,正常点击到对话起码要达到4%—6%,这个2.19%可能是他的自身竞价水平问题,但是也有可能是品牌问题,那这个这么低,最有可能的就是投放策略有一定的问题,可能账户更注重第一阶段的投放,也就是需求阶段(具体阶段内容参考上一篇竞价数据分析(1)),导致对话率太低。

    三、转信息率

    下面我们再看下对话到信息量这块,通过下面图我们可以看到对话转信息量,一般行业要求是要在65%以上就还不错。

    5月6月7月8月

    从上面的数据可以看出来,他的网咨团队还是很厉害的,一个新手网络咨询大概可以达到30%,它这个网咨团队平均也可以达到这么高,说明它的网络咨询团队平均水平还是很高的,而且6月达到81%,这个可以说是很顶尖的团队了,转化率相当高,但是转化率从这四个月上看是呈下降趋势,人员可能有变动或者推广有些问题。

    综合上面的弹出率问题、对话率、信息率,看完这些数据我们发现它的弱点其实是在前期投放上,可能投放策略不是特别的精准,可能投放的都是第一阶段的,页面承接方面做的也不好,点击到对话只有2.19%,,即使后期的网咨团队很强,对话到信息转化率比较高,但是转化成本还是很高,在五百多一个信息量,如果前期做好的话,预计可以达到三百以下,这么强的网咨团队150都是有可能的。

    通过这个数据我们可以看到,即使出现了这么差的转化,信息量价格这么高,他们的数据一直没有太大的波动,他们的营销团队工作肯定是没有做好的,这是我们通过营销流程来看这几组数据,我们就可以分析出到底是哪些环节出现问题。

    这篇文章是根据狼训竞价视频公开课第二讲第二小部分进行整理的,有需要视频的朋友可以私聊小编,每周公开课不错过。

    作者:狼训竞价培训刘强森

  • ?

    竞价营销流程数据分析实操(一)持续更新中……

    悄然

    展开

    很多竞价人员在账户分析的时候,不明确分析的思路及分析方向,一味的盲目调整账户,竞价专员是否具备竞价推广的能力,第一评测的标准也是数据分析,学好数据分析可以大大的降低转化成本,而竞价人员调整账户的目的就是用最少的钱带来最精准的流量,所以这里就不跟大家一一说明数据分析对竞价人员的重要性了,想必大家都懂,下面咱们进入干货部分。

    这里给大家说下具体哪四种:随缘分析法、目标反推法、维度分析法、营销流程分析法。今天为大家讲解的是四种竞价思维分析法中的一种实操——数据营销流程分析法,要是对四种方法不了解可以关注之前讲的关于数据分析法的视频或是文章,到咱们群里下载一下。

    大家后期在搭建账户的时候最好也是按照维度进行搭建,便于后期的数据分析,日常数据处理的不够好,或者前期搭建账户没有考虑要按照数据分析方法去搭建的话,可能你的数据就不能很好的进行利用,参考价值就不是特别大。

    首先大家先看下下面的数据,先看数据汇总阶段,后面再说转化数据,这里说下,这组数据中有对对话框弹出的统计,现在一般都是统计抵达,因为对话框弹出不具有普遍的参考意义。

    账户数据汇总图

    大家可以看下这个数据,可能截图较小,我这里就给大家大概说下,咱们首先先看账户汇总部分的总体账户消费为160000,点击量11539,展现量167000万,点击率0.7%,点击价格9块左右,

    首先大家应该从这组账户总体数据能看出来,他们的点击率是非常低的,有可能他的投放策略为第一阶段。

    DFEAS理论阶段

    {引入知识:关键词阶段知识普及}根据上图,这张行消费者行为心理学导图来看下。第一阶段——需求阶段,需求阶段包含什么样的词呢,例如生病了,得了妇科病,那这个需求词是什么呢“妇科病有哪些症状”。(症状词)第二阶段——找到、评估阶段,“例如治疗妇科病的方法、治疗费用”。(治疗词)第三阶段——行动、分享阶段,“例如某某医院怎么样、某某医院在哪 ”。(医院词、口碑)

    上面给大家引入了一个课程外的知识点(详细的消费心理学具体怎么跟现有的账户关键词一一对应,后期会在公开课中再详细讲),下面我们继续进行讲解,回到咱们的数据上来,数据中的点击率很低,均点击价格不低。

    五月份六月份七月份八月份

    大家先看下整体的对比,经过对比我们能看出来,后期账户是经过调整的,而且我们看下五月份同六月份对比,展现总量明显减少应该是删减了部分的关键词,点击率和点击价格有提升,说明往上调整了关键词排名,七月份同六月份差别不是很大,消费是在提升,再看八月份也是有一定调整,但是整体来看数据呢,从展现和消费上看,展现和消费都不低,点击率调整后达到1.9%这个还是比较低的,点击价格偏高,那点击率低这说明一个什么问题,说明他账户关键词是比较多的,大多数排名都不高,可能投放策略为第一阶段,关键词大多数放在了需求阶段,前期的需求阶段它的点击成本就会比较低,要是放在第三阶段,它的点击成本高。

    这里提醒大家,具体什么样的投放策略还要看自己团队,可能有的团队它的转化团队就特别好,那调整账户的策略可能会着重投放第一、二阶段,转化团队能力不好的话可以重点投放第三阶段、所以要看自己的整体情况再定投放策略,不要盲目投放。

    这个账户规模是中上等账户左右,关键词大概在十万左右,长尾关键词投放的排名应该都不高,另一方面猜测它的人力资源应该也不够,账户大人力不够就会导致账户优化不及时。

    未完待续……

    下一篇文章,我们继续看面后面的弹出等转化数据进行对比分析。

    作者:狼训竞价培训刘强森

  • ?

    极简数据分析实操指南(下)

    Zhai

    展开

    科学方法必须包括:问题陈述、产生假设、收集数据、分析数据,然后获取结果并采取行动.......当你使用科学方法做事情时,你会更快取得成功。—— Bob Hayes 博士,百老汇商业总裁

    前面我们已经介绍了评估和定位问题、确定潜在原因和分析数据的必要性和方法,详情请戳极简数据分析实操指南(上)

    下面将为你重点介绍:

    数据分析实操指南实例解读如何避免数据分析中的坑?解决问题,做出明智的决定

    数据分析实操指南实例解读

    下面我们将按照极简数据分析实操指南(上)中提到的方法,对文章中提到的几个场景进行详细解读。

    SaaS 公司的营销实例

    SaaS 公司的营销经理 Jody ,需要向产品副总裁汇报注册量下降的原因。

    ◆核心问题:最近我们产品的注册量下降,是什么原因导致?

    ◆假设:由于......注册量下降

    o 最近对营销网站的更改

    o 某些地区的公众假期

    o 广告投放转化率下降减少了注册量

    o 有机搜索排名(针对我们的产品页面)下降到搜索结果的第二页

    ◆数据分析:

    Jody 第一步思考数据有多少变化?是否是真的异常?

    她开始分别按照天和小时查看数据的变化,发现更改网站(网站注册会出现中断)时注册量确实有下降,但网站更改完成后注册量仍然在下跌,且进一步分析发现对注册表单样式的更改,使转化率略有上升,因此不是对营销网站的更改导致。

    Jody 通过进一步查看数据,发现在总体注册量下降期间,到达注册页面的人数减少了大约 10%,因此,可能是上游问题导致的。

    接下来,Jody 考虑假期假设(下跌开始时间是某些地区的公众假期)。但随着时间的推移,各国的注册量都有所下跌,所以该假设排除。

    此时,她整理了一下思绪,决定分析点击付费广告投放更改后的数据。发现其中一个广告系列转化率下降了 50%,但这个只占注册量的 1%,所以不是主要原因。

    Jody 又通过渠道查看注册率,发现有机搜索(占注册量的 70%)下降了 20%,推测是几周前页面更改引起的页面排名的变化。于是,她开始检查 SEO 数据,发现主要关键字已降低排名,现在位于第二页,这样一来,除了注册量其他方面也会受影响。

    最终,Jody 除了解释注册量下降之外,还创建了一个策略来恢复注册,并将分析报告呈现给了产品副总裁和首席执行官。

    电子商务示例

    电商运营主管 Tyler 想弄清楚为什么购物车到下单的转化率正在降低?

    ◆核心问题:许多潜在客户在购物车结算这一步流失,我们该如何降低其流失率?

    ◆假设:由于......转化率下降

    o 放入购物车的人绝对数量增加

    o 最近对付费流程的更改

    o 季节性(即假期,学校休息等)

    o 促销结束导致更多人放弃下单

    o 某些商品出现问题,影响下单

    Tyler 第一步思考加入购物车的人绝对数量是否增加?如果有大量人开始向购物车添加商品但完成购买的人数保持不变,那么可以判断有一批购物者的转化率降低,他注意到加入购物车的人数略有增加。

    然后他开始询问相关团队的人,如有没有促销活动?有没有推出新产品?会不会有季节性影响?付费过程有什么变化吗?价格是否经过调整?(注意:根据业务和产品范围的不同,这可能会有很大差异。)

    Tyler 最终得知付费流程发生了一些小变化。现在,他们不仅仅列出购物车中的商品,而是展示每件商品的图片。

    为了进一步分析这种变化的影响,他将付费流程分成了不同的步骤,发现用户的浏览数据正常,事实上,更多的人正在进行下一步,所以这似乎不太可能是罪魁祸首。

    接下来,Tyler 通过将本周的购物车转化率与前几年的同一周进行比较来寻找任何季节性影响,他还通过快速浏览日历,了解任何可能的线索,但由于会话和电子邮件开放率等相关指标未受影响,季节性因素假设也排除。

    Tyler 之前咨询到最近的促销结束了,按照常识,当人们意识到促销已经结束时,他们更有可能放弃下单。Tyler 在购物车转化率下降之前使用促销代码查看付费比例,发现只占 5%,但放弃率的变化是三倍,所以这只能算一个促成因素。

    Tyler 又开始思考这是商品库存的原因吗?但所有商品的性能相当一致,这个假设也不成立。

    在考虑其他可能的原因时,Tyler 再次审查付费流程。发现商品价格页面中对运费的描述部分大大减少,他回忆起之前对产品页面进行一些外观修改的时间与流失率增加时间完美吻合。

    回顾这些变化后,他的新假设是潜在客户放弃下单,是因为他们期望下单时购买的价格是产品页面设定的较低价格,一旦他们看到全价(包括运费),就会放弃下单。

    发现这一点后,Tyler 非常有自信的准备使用 A / B 测试来检验假设,如将产品更改恢复到以前的设计,或者尝试使用包含运费的版本。最终,他验证了假设,并调整了页面。

    移动应用示例

    产品经理 Sofia 想找出所负责的 App 激活率降低的原因。

    ◆核心问题:初始下载后,打开和使用 App 的人数减少了,怎样才能提高激活率?

    ◆假设:由于......激活率下降

    o App 的更改使人们不太愿意激活。

    o 一群新的(或不同的)人开始尝试这种产品

    她注意到在过去 3 个月中激活(打开并开始使用 App)的比例一直在稳步下降(与下载总数相比)。

    Sofia 先查看一些数据来获得更多背景资料。最终她发现下载的绝对数量明显增加,而激活人数仅略有增加。不过两个指标的绝对数字都在增加,让她松了一口气。(注意:根据不同的企业,这可能是也可能不是问题。最终,这取决于是否浪费了额外的注册资金。)

    Sofia 后续很快确定应用程序中与激活下降相关的初始体验没有任何变化。

    现在,她更密切地关注哪些人正在下载应用程序以及人口统计数据是否发生了变化。因此,她按地区对下载人群进行了分层,发现来自较低激活区域的下载量略有增加,但这远远不足以解释激活率的下降。

    接下来,Sofia 分析不同渠道(例如,应用商店搜索,社交广告,推荐等)的下载情况,发现推荐下载渠道的下载量大幅增加,且似乎与她之前提到的增加的下载次数大致相同。深入分析后,她发现通过推荐下载的激活率明显低于其他渠道。

    Sofia 通过咨询营销团队,了解到基本是一个高流量文章引起的推荐渠道的下载量增加,而且它没有任何成本,具有很大的潜力待开发。Sofia 和营销经理下一步准备采取行动增加该渠道的激活量。

    Sofia 最终通过一些快速的数据分析,使最初的问题变成了一个机会。

    看完上面的例子,下一步该你分析了,在分析数据时,请记住要考虑差异的真实性(统计显著性)以及差异的实际意义。

    随着业务中的运用数据分析的地方比以往任何时候都多,领导者需要培养一种数据驱动的文化,而不是相信他们的直觉。

    —— Ronald van Loon,数据科学家,演讲人,作家和创始人

    如何避免数据分析中的坑?

    在数据分析的过程中,即使是最有经验的数据分析人员也必须提防数据谬误(Data Fallacies)。以下提示,将帮助你避免一些最常见的数据谬误。

    避免数据偏见

    在分析数据时受个人偏见和动机的影响,即仅选择支持你声明的数据,同时丢弃不支持声明的部分。“数据偏见”将让数据的客观性荡然无存。

    避免这种谬误的方法是在分析数据时,尽可能收集相关数据,并询问他人意见。

    一个人应该保持中立并且不要爱上你的假设是绝对必要的。

    ——David Douglass,美国物理学家

    避免数据疏浚

    数据疏浚(Data Dredging)是指未能确认相关性,实际上是偶然的结果。

    在寻找问题的原因时,很容易被数据蒙蔽。乍一看,这些数据可能具有统计学意义,但进一步测试(例如,检查趋势是否持续,查看相关指标等)可能会发现只是偶然结果。

    避免这种谬误的方法是在分析数据时,从假设开始检查相关指标和观察数据变化趋势。

    一个常见的谬误是假设数据集是值得信赖的——直到后来在分析中发现数据是错误的。所以,在开始分析之前,请确保您的数据值得信赖。

    —— Tamara Dull ,SAS 研究所新兴技术总监

    区分因果关系和相关性

    在数据分析时很容易将两个事件同时发生(相关),判断为因果关系。

    避免这种谬误的方法是,收集更多数据并查看可能的第三方原因,有时会发现他们的相关关系可能与第三个独立因子相关,而不是彼此相关。

    例如,我们发现放弃其在线购物车的潜在客户往往具有较低的总购物车价值(放弃时购物车中物品的总成本)。此时,我们没有足够的数据来确定这是一致的相关性,是偶然结果,还是由其他因素引起的。深入挖掘我们可能会发现运输成本导致购物车到下单的流失率上升,因为免费送货仅适用于超过特定最低购物车价值的订单。

    如果你对数据进行足够长时间的折磨,它就会承认任何事情。

    —— Ronald Coase 诺贝尔经济学奖

    解决问题,做出明智的决定

    这个极简数据分析实操指南可以帮助你快速解决问题并做出明智的决策。无论你是领导团队还是向执行官报告,你都可以对有数据支持的观点充满信心。

    在任何竞争中,获胜者都将是那些有效利用数据做出明智商业决策的人。

    —— Kirk D. Borne,博士,天体物理学家,博思艾伦首席数据科学家

    在找到数据支持的结论后,你需要记下一个简短的摘要(包括问题,数据显示的内容以及由此产生的决策 / 行动),这样做有两个目的:

    1.将你所分析的数据和结论告知可能涉及或受影响的任何其他团队,为其他人提供有价值的背景信息。

    2.这个记录也将使你在将来出现类似情况时更容易参考和以防其他人想要查看数据本身。

    最终,问题解决了,也总结了有价值的经验。

    下面我们回顾一下整个《极简数据分析实操指南》,当你遇到问题时,你可以随时查看:

    评估和定位问题确定潜在原因如何分析数据?数据分析实操指南实例解读如何避免数据分析中的坑?解决问题,做出明智的决定

    本文由策小编编译

    来源:Geckoboard 网站

    更多精彩

    神策数据2018数据驱动大会10月16日举行,报名正式开启!

    数据之“星”冉冉升起,“星斗奖”申报正式启动!

    三大方面优势解析 小米与神策数据展开合作

数据分析实操

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP