中企动力 > 商学院 > 数据深度分析
  • ?

    数据分析图的十大错误,你占了几个?

    京文

    展开

    "数据可视化是个好帮手,可以帮助用户理解数据。但是,你真的会用它吗?看看这里,数据可视化的十大错误你占了几个?

    优秀的数据可视化依赖优异的设计,并非仅仅选择正确的图表模板那么简单。全在于以一种更加有助于理解和引导的方式去表达信息,尽可能减轻用户获取信息的成本。当然并非所有的图表制作者都精于此道。所以我们看到的图表表达中,各种让人啼笑皆非的错误都有,下面就是这些错误当容易纠正的例子:

    1 、饼图顺序不当

    饼图是一种非常简单的可视化工具,但他们却常常过于复杂。份额应该直观排序,而且不要超过5个细分。有两种排序方法都可以让你的读者迅速抓取最多的重要信息。

    方法一:将份额最大的那部分放在12点方向,逆时针放置第二大份额的部分,以此类推。

    方法二:最大部分放在点,然后顺时针放置。

    2 、在线状图中使用虚线

    虚线会让人分心,而是用实线搭配合适的颜色更容易彼此区分。

    3 、数据摆放不直观

    你的内容应该符合逻辑并于直观的方式引导读者阅读数据。对类目进行按字母,次数或数值大小进行排序。

    4 、数据模糊化

    确保数据不会因为设计而丢失或被覆盖。例如在面积图中使用透明效果来确保用户可以看到全部数据。

    5 、耗费读者更多的精力

    要通过辅助的图形元素来使数据更易于理解,比如在散点图中增加趋势线。

    6 、错误呈现数据

    确保任何呈现都是准确的,比如,气泡图的大小应该跟数值一样,不要随便标注。

    7 、在热图中使用不同颜色

    一些颜色比其他颜色突出,赋予了数据不必要的重元素。反而你应该使用单一颜色,然后通过颜色的深浅来表达。

    8 、柱状过宽或过窄

    柱子与柱子之间的间隔最好调整为宽的1/2。

    9 、数据对比困难

    对比是呈现差异的有效方式,但如果你的读者不易对比时,效果就大打折扣了。确保数据的呈现方式一致,可以让你的读者对比。

    10 、使用三维图

    尽管这些图看来让人振奋,但3D图也容易分散预期和扰乱数据,坚持2D是王道。

    怎么样?看过10个数据可视化的错误之后,是否意识到领导对你的数据分析图表摇头的原因了,快行动起来吧~

  • ?

    五个大数据分析成功案例分享

    Dundee

    展开

    首席信息官正在利用数据分析来提高效率和促进增长,但并不是每一次努力都会产生结果。以下讲述了优秀的首席信息官是如何成功地利用数据分析和机器学习技术来增加收益或降低成本的。

    如果把数据比作新的石油,那么掌握如何将其提炼为可使用的情报就是发挥其潜力的关键。为此,首席信息官正在使用预测分析工具,设计机器学习算法和对其他解决方案进行测试,以追求企业的效率和以新的方式为客户服务。

    胡椒博士集团(Dr.PepperSnappleGroup)将机器学习技术用于语境相关性工作中

    多年来,胡椒博士集团的销售路线员工一直是抓着一本厚厚的活页夹,里面装满了客户数据、销售和促销说明,然后去吸引一些零售客户,如沃尔玛和塔吉特百货公司(Target)等。今天,销售人员不再使用这种活页夹,而是配备了能告诉他们需要拜访哪家商店的iPad,而且还会告诉销售人员该为这些零售商提供何种优惠,以及其他关键指标。胡椒博士集团的首席信息官汤姆·法拉(TomFarrah)表示:“他们都是接订单的销售人员,为此他们感到很骄傲。现在他们配备了信息资料来帮助其实现目标,使他们成为智能的销售人员。”

    该MyDPS平台配有机器学习和其他分析工具,可在工作人员加载应用程序时向其提供建议和日常操作记分卡。这些算法向员工显示他们是如何按照预期计划进行工作的,包括他们是否按照自己的计划工作,或是落后于计划,以及给他们提供见解,让他们清楚如何纠正他们的工作。法拉说:“如果我要让某人获得成功,我必须确保他们拥有哪些信息是与工作内容相关的。”

    经验教训:为了测试验证MyDPS平台的概念,法拉将该软件分给了一个分公司的四个人,并让业务总裁去拜访他们。他们透露,自从上个月使用MyDPS之后,执行销售额已经提高了50%,这一表现让他批准了该项目。法拉说:“他获得了结果,这就是销售所需要的,这不仅仅是为了项目的商业赞助,而且这也是他们希望得到的结果,这一点非常重要。”

    凭借机器学习技术,RRD公司走上新业务之路

    营销传播公司R.H.Donnelley公司为RRD公司的前身,几年前,RRD公司设立了物流部门,向消费者和企业配送它的印刷材料。为了支持这项业务,公司自己管理运营,并代表其合作伙伴配送各种物品,包括洗衣机、狗粮等等,最终成长为价值10亿美元的一个企业。这是一个挑战吗?在联邦快递和UPS成为无可争议的霸主的天下,找到一个最优的运费。

    诸如天气、地域、司机和政治局面等因素都是业务上的成本。RRD公司的首席信息官肯奥布莱恩(KenO'Brien)表示,随着迫切需要对费率变量进行预测,RRD公司转向了机器学习和数据分析。公司聘请员工和与大学合作来帮助编写算法,在700条路线上测试数千个场景,直到能够以99%的准确率提前7天实时预计运费。奥布莱恩说:“该项目在不到一年的时间就完成了,我们现在仍然看到业务的增长与运费有关。”该公司预计,在2017年,其卡车货运代理业务将从400万美元增长到1600万美元,营收将增长1200万美元,业务规模达6亿美元。

    经验教训:新企业需要高水平的全心投入,尽管奥布莱恩承认,他的一些业务同行已准备好在业务的不同环节上认输。该业务并不相信那些通常以感觉和猜测来完成一个流程的技术。RRD公司建立了一个协作环境,业务和IT共同合作来推进结果。“你会遇到困难,你会遇到挑战,但要耐心,”奥布莱恩说。

    孟山都公司(Monsanto)利用机器学习技术,实现最佳种植计划

    农民永远为要种植何种作物,种植面积,在哪里种植及何时种植而苦恼。种子行业巨人孟山都公司正在研究这项工作,利用数据科学为农业种植提供规范性建议。数学和统计学模型会绘制出雄性作物和雌性作物的最佳种植时间,以及在何处种植,在理想状态下,这就最大限度地提高产量并减少土地使用。孟山都公司全球IT分析主管艾德里安·卡地亚(AdrianCartier)表示,其机器学习算法在数天内完成了超过900亿的数据点,而不是几周或几个月。这是商业利益吗?在2016年,孟山都公司节省了600万美元,其供应链足迹减少了4%。卡地亚说:“北美地区的土地利用率下降了4%,相当于不去使用大面积的土地,这节省了大量资金。”

    经验教训:孟山都公司成功的关键是在信息技术与供应链业务之间建立了一个“自始至终”的合作。卡地亚说:“他们具有农业和供应链角度的专业知识,而我们具有数学和统计领域的专业知识,两者结合起来,就创造了我们能够提供的价值。”卡地亚说道,他还寻求在供应链业务中“改变领导者和倡导者”,以形成对反对者一种健康的平衡。

    柏克德公司(Bechtel)以卓越的大数据中心来颠覆自己

    一个鲜为人知的事实:柏克德公司首席信息官CarolZierhoffer说,与建筑有关的支出占GDP的13%,但整个行业在过去二十年中只有1%的生产率增长。专家表示,通过重新制定合同、提高工人技能以及改进现场执行工作等方式,该行业可以提高50%至60%的生产率。柏克德公司建造了胡佛水坝、英吉利海峡隧道和其他大型设施,已经开始在业务各个环节的数据中挖掘洞察力。

    Zierhoffer在沃尔玛、波音和洛克希德马丁公司会见了业内同行,以获得有关如何向前发展的见解。柏克德公司建立了一个先进的大型数据中心,其中包含5千万亿字节数据的数据湖,并开始了概念验证。该数据中心使用照片识别技术,并代表客户来检查和标记各个地点的照片,这节省了200万美元。自然语言处理(NLP)工具可解析索赔、提案请求(RFP)和合同。过去需要几天和几周的评估和计划工作现在只需要数小时。柏克德公司还扩大了分析工作范围,以了解员工的流失率情况,包括试图预测员工将何时离职。Zierhoffer说:“我们相信我们正在敲开解决生产率难题的大门。”

    经验教训:数据仓库和质量是支柱。尽管柏克德公司可以分析大量的数据,但在整个业务各环节的数据质量必须提高。“我们不得不颠覆自己,了解我们是如何工作的,并且将数据仓库进行连接。”

    数据分析帮助辛辛那提动物园提高客户满意度

    辛辛那提动植物园成立于1873年,是世界上著名的动植物园之一,以其物种保护和保存以及高成活率繁殖饲养计划享有极高声誉。它占地面积71英亩,园内有500种动物和3000多种植物,是国内游客人数最多的动植物园之一,曾荣获Zagat十佳动物园,并被《父母》(Parent)杂志评为最受儿童喜欢的动物园,每年接待游客130多万人。

    辛辛那提动植物园是一个非营利性组织,是俄亥州同时也是美国国内享受公共补贴最低的动植物园,除去政府补贴,2600万美元年度预算中,自筹资金部分达到三分之二以上。为此,需要不断地寻求增加收入。而要做到这一点,最好办法是为工作人员和游客提供更好的服务,提高游览率。从而实现动植物园与客户和纳税人的双赢。

    借助于该方案强大的收集和处理能力、互联能力、分析能力以及随之带来的洞察力,在部署后,企业实现了以下各方面的受益:

    -帮助动植物园了解每个客户浏览、使用和消费模式,根据时间和地理分布情况采取相应的措施改善游客体验,同时实现营业收入最大化。

  • ?

    数据深度解析!詹姆斯无球能力到底如何?

    渺茫

    展开

    随着湖人和詹姆斯达成口头协议,他们连续签下了隆多和史蒂芬森两名持球进攻类型的球员,新的进攻体系即将搭建完成。

    在这个进攻体系中,詹姆斯将更多的打无球,以延续他的职业生涯。

    不少球迷对于詹姆斯转型打无球不太看好,甚至认为詹姆斯在无球进攻的时候不是掐腰,就是看热闹。

    而实际上,詹姆斯的无球能力到底如何呢?我们来看几组数据就知道了。

    1、空切

    整个17-18赛季季后赛,詹姆斯总领球权,空切次数不算很多,场均0.8回合位列联盟中游,但空切出手的命中率为73%!

    但这个情况在16-17赛季季后赛是截然不同的!

    当骑士有欧文这样出色的持球人的时候,詹姆斯场均的空切次数场均1.8回合(位列联盟前20),这些空切的出手中有9.1%的概率会打成2+1(排名联盟前20),命中率更是高达89%,在空切超过1.8回合的所有球员中命中率第一!

    毫无疑问,当球队中有更好的进攻组织者的时候,詹姆斯的空切频率很高,也很无解!

    2、补篮

    17-18赛季季后赛,詹姆斯场均补篮1次,频率为3%,由此能得到1.1分,这个数据可能看起来很干涩,并不见得多牛。

    但再看看——以补篮著称的雷霆悍将亚当斯也才场均补篮0.8次,由此得到0.5分,你就对詹姆斯的补篮水平有多高有一个大致的印象了。

    3、挡拆之后

    詹姆斯为队友挡拆的频率并不算太高,但他在为队友挡拆之后接球的效率简直就是恐怖。

    在17-18赛季季后赛,他在挡拆之后接到球总共5次出手全部命中,能得到17分(造犯规),命中率100%!

    这也和我们的印象一致,当詹姆斯挡拆顺下,想到想得到会发生什么。

    4、三分球投射

    当今这个时代,无球能力最重要的一环就是三分球投射。

    詹姆斯在17-18赛季的季后赛,接球就投的三分球场均能命中0.6个,命中率40.6%(也有版本是45%,反正很高),甚至比库里接球就投的三分命中率还高!(差距就在库里场均能进2个接球就投的三分)

    不仅如此,詹姆斯在接球运一次球三分球命中率也高达42.9%,也是相当高效的表现!

    尽管詹姆斯的接球就投三分频率不高,但他一旦接到球出手就非常稳。

    当然,无球进攻还有不少招式,就不一一列举了。

    就这几项数据来看,詹姆斯的无球能力绝对是相当强的,只不过此前并没有高频率使用罢了。

    相信在湖人和朗多这样的顶尖传球手并肩作战,詹姆斯能够完全解放自己的持球压力。

    要知道,詹姆斯是历史级别的篮球天才——他很快就会发现,也许一个轻轻的加速就能接到隆多完美的助攻扣篮得分(就像国家队和基德保罗一起打球那样)。

  • ?

    干货|关于大数据分析方法的深度思考

    以丹

    展开

    本文作者:郭朝晖@蝈蝈创新随笔

    本文是我关于大数据分析方法的几点思考。当初的目的是系统化地看待数据分析。为了这点东西,我花了一个礼拜的时间,思考的结果却是碎片化的。看来,想清楚并不容易。由于时间关系,只能中止。文字描述很不严格、肯定经不起推敲,读者找不毛病是正常的、看不明白更是正常的。不感兴趣的可以当做胡扯。我希望将来有时间时能把问题思考下去。

    从数据中发现信息和知识,是人们多年来的梦想。随着大数据理论的兴起,这个话题变得非常热门。在有些人看来,大数据非常神秘,似乎无所不能。当然,现实不会是这样。我想,研究大数据,首先要破除迷信:大数据需要什么条件、什么问题是大数据无法做到的。

    1、知识和信息,只能从关联关系中得到

    对象(包括过程,如生产过程、购物过程)及其属性、同一对象的属性之间具备关联关系。例如,“张三身高1.8米”就是对象(张三)与属性(身高)的关联;再如,如果我们知道张三体重75公斤,则“1.8米”和“75公斤”之间就因“张三”建立了关联。

    关联的对象可能并不确定:我们看到一张履历表,即便隐去名字、不知道这个人是谁,也知道其中的各种信息是与某人关联的。

    在数字化的世界里,不和其他的符号(数字)关联的符号(数字)是不包含任何信息的。从不包含信息的素材,得不到包含信息的结论。

    有人可能反对这个观点:谷歌曾经用“感冒”的搜索量预报流感啊,这里哪有关联呢?其实,只有搜索“感冒”的数量是根本无法预测流感的。谷歌的做法,是把“感冒”的搜索与搜索的地点、时间联系起来。

    这个观点告诉我们:收集数据的时候,要尽可能地把关联关系建立起来;没有关联关系,数据很容易成为垃圾。这种情况并不少见:有些实验室,把针对同一试样的各项实验结果分别保存起来,而没有建立统一的ID、关联关系丢失。这样的数据,再多也没有用处。

    2、人们要挖掘的知识和信息,就是找映射关系

    知识(或信息)的发现与挖掘,其本质是寻找映射关系:通过已知的、对象的一部分属性,把对象的另外一部分属性或对象本身找出来(或缩小范围)。产生这类问题的原因是:只有一部分属性已知、容易得到、容易识别、容易表述,而另外一部分未知、不容易得到、不容易识别、不容易描述。

    例如,我们可以说:张三就是那个穿红衣服的——这里“穿红衣服”比其他特征容易识别。从衣服识别出张三,就是从张三的衣着特征(属性)找到关联对象(张三)的信息;从一个人的身高预估他的体重,就是从一个根据一类属性估计另外一类属性。

    我习惯于把信息挖掘和知识发现分开。

    在本文中,信息挖掘指的是预测某个特定对象的属性,如上海市的人口是多少;知识发现是确定一类对象的属性之间的关系,如一类人群中身高和体重的关系。当然,这种区分不是绝对的。

    3、映射关系的差别

    正确的识别,最好的办法是找到好的素材(数据)。素材与结果之间的关联强度是不一样的:有的比较强,是因果关系、必然联系;有的比较弱,是相关关系、偶然联系。

    例如,我们可以根据DNA、相貌、衣服来识别一个人。但三者相比,DNA的联系是强的必然性联系、衣服是弱的偶然性联系,相貌是介于两者之间的联系。大数据的一个著名案例,是网站根据客户买的药判断她已怀孕、并推送有关产品:因为这种药只有孕妇才吃,是很强的关联。

    从数据得到的知识和信息,往往不是绝对正确。一般来说,可靠的结论基于可靠的数据和可靠的分析方法。数据量大了以后,滤除干扰的可能性增大,从而可以从原来可靠度低的数据中,得到可靠性相对较高的数据。

    所以,尽量找到好的素材,是做好分析的第一步。

    在很多情况下,我们找不到好的素材。这时,首先要做的尽量提高数据质量。数据质量不仅是精度问题,还包括数据来源的可靠性:为此,需要把数据来源的相关过程要搞清楚,否则很可能会误导人的分析。

    4、相关与因果

    有些相关性的背后,一般会有因果关系存在。两个要素由因果产生关联的机制大概可以分成两类:1、两个要素具有因果的关系:比如刚做父亲的青年人常会买尿布;2、共同原因导致的两个结果之间的关系:比如孩子的父亲会常买啤酒,也常买尿布;于是,啤酒和尿布就可能关联起来。

    有些相关性,看似没有因果,但背后往往有某些特殊的规律或因素其作用(上述第二种情况)。比如,女孩子往往喜欢花衣服,与基因和文化的共性有关。但这种因果关系可能相隔太远,以至于难以考证了。

    当人们需要根据关系作出决策时,需要研究因果的逻辑关系:到底是谁影响了谁。否则,根据分析结构的盲目行为可能适得其反。 “到底谁影响了谁”为什么会成为问题?大概有两类原因:

    第一类原因是:忽视了时间因素。如“统计结果表明,练太极拳的身体差”。现实却是:很多人身体变差(包括衰老)以后,才练太极拳。一般来说,具有因果关系的两个要素之间,时间上有前后关系:原因早前,结果在后。

    第二类原因是:忽视了前导因素。“公鸡一叫,天就亮了”。现实却是,天量之前的迹象被公鸡察觉到了。两者是第二种因果关系,只是看似“原因在后、结果在前”了。

    一般来说,工业大数据分析更重视因果,而商务大数据分析对因果性的要求较弱。

    5、数据分析的先导因素

    从某种意义上说,数据分析的过程,就是寻找强的相关关系(必然性、因果性),或对弱的相关关系进行综合、得到强的相关关系。

    用数据发现信息,需要用到各种知识。例如,把“云南白药是用于治疗外伤的”放入计算机,当某人购买白药的行为判断他或家人可能受伤,从而可以推荐相关产品。但注意到:这种类型的知识很可能是被人事先装入计算机的,而不是靠计算机自动学习得到的。

    所有的学习过程,本质上都是基于这样一种假设:A和B的一部分属性类似,则推测另一部分属性也应该类似。例如,A和B的身高相似,则体重也可能相似。现实中,两个属性确实具有强烈的相关性,但身高相同而体重不同的也大有人在。这时,如果我们还知道他的体型,是瘦弱、偏瘦、正常、偏胖、肥胖型,对体重的估计就可以准确一些。由此可见,用数据发现知识的过程,本质上就是提高相关性、可靠性的过程。

    一般来说,人们在做数据分析之前,一定会有一定的知识积淀, 但认识不清却是一种常态;人们希望通过对数据的分析,来改变这种常态。而改变认识的过程依赖于数据的质量和分析数据的方法。所以,刨除分析方法外,分析过程依赖于两个先导性因素:1、数据质量(包含多方面的含义)如何;人们已有的认识如何。

    注意,这段说法有个潜台词:强调了人类可认识的知识,而不是机器用复杂函数关系表述的、人类难以用逻辑关系认知的知识(如神经元)。的确如此,笔者一直认为:这类方法的作用被学术界有意识地夸大了。

    6、数据分析的过程

    与商业大数据相比,工业大数据更重视可靠性和精确性。在很多情况下,猜出一个结论并不难,难的是论证一个结论。一般来说,凡是可靠的知识,都应该能够被机理和数据双重认证。

    大数据分析的一个重要特征是:传统概率理论的假设往往不成立。例如:大数定理的条件往往不成立、模型的结构往往未知、因果关系不是天然清晰、自变量的误差往往不能忽略、数据分布往往是没有规律的。所以,为了得到可靠的结果,人们工作的重点很可能是验证这些条件、构造这些条件。从某种意义上说,数据分析的过程,主要是排除干扰的过程、特别是排除系统干扰的过程。而且,如果完全依照逻辑、用纯粹数学的办法加以论证,则数据需求量会遭遇“组合爆炸”,永远是不够的。这时,已有的领域知识就是降低数据需求量的一种手段。要记住:求得可靠性是一个过程而不是结果、可能永远没有终点;分析的过程只是不断增加证据而已。这个过程,是修正人的认识的过程;所以,错误或不恰当的认识常常是分析过程中最大的干扰——这个干扰一旦去除,我们可能就发现了真正的知识。

    数据量大的直接好处,是排除随机性干扰。但排除系统性干扰却不那么容易,数据量大是必要条件但不充分,需要深入的方法研究才能解决问题。

    系统性的干扰往往体现在:对主体进行分组,所体现的规律是不同的。比如,身高和体重的统计关系,男女是不同的、不同民族是有差异的、可能与年龄有关。如果不进行分类研究,统计的结果就会与样本的选取有很大关系。但分类研究也会遇到一个困难:遭遇组合爆炸,数据再多都不够用。这时,“领域知识”就会发生作用:

    认定一个结论成立的办法,是确认它的“可重复性”。在许多情况下,“可重复性”指的是在各种分组下都成立的结论:最好能在不同时间分组中也能成立。分组越多、分组的维度越多、结论的可靠性越高。

    但具有“可重复性”的结论,往往只在一定的范围内成立。在很多情况下,“明确结论成立的范围”也是数据分析的重要内容。

    如何分组、如何确定范围、如何构筑逻辑链条、数据结果的解读、数据结果与领域知识的融合,都是重要的能力。事实上,根据领域知识,常常用于构造证据链、进行有效的数据选取和分组。

    在精密论证时,我们就会发现:基础数据的质量很重要。因为许多干扰就来源于数据本身。从某种意义上说,数据的采集方法和环境不同,就是不同的数据。

    在构建数据分析体系的过程中,也会发现,企业经营的数据分析也确实需要一个可展示的平台,实时展示业务,有问题就优化更新。

    FineReport 数据决策系统

    7、关于预测数字

    许多问题分析的目的得到一个数字:如钢的强度、用电量、人口数量、钢产量。这类问题的特点之一是:最终的结果是各种影响因素相加得到的。

    对于这种问题,我的观点是:要想得到可靠的结果,一定要拆成若干子问题来分析。其中,各个子问题要尽可能利用规律性的结果来分析。我认为:把人的认识和数据用到极致的时候,才能得到最好的结果。随便地建立回归模型是不懂数据的表现。

  • ?

    深度解读:大数据与洞察

    宫如彤

    展开

    洞察与大数据之间是什么关系?大数据解决不了的问题可以用洞察来解决吗?

    大数据与洞察之间不是相互替代关系。前者是后者的原材料,后者是用前者生产出的产品,二者之间并不矛盾。

    大约从2012起,中国兴起了一股大数据热潮。在各方的炒作下,大数据被包装得无所不能,成为解决各种问题的万能良药。于是乎,人们都在谈论大数据,仿佛不懂大数据就会被时代抛弃了一样。很多企业盲目上了大数据系统,有的甚至斥巨资来追赶这股热潮,还有的大幅削减在传统洞察方面的投资,转投到大数据上。2016年以来,热潮迅速退去,人们才发现,号称搞大数据的,大部分是在裸泳,不少甚至在以“黑数据”冒充“大数据”在骗钱。于是,交了学费、尝了苦头的企业,产生了另一种认识,即大数据否定不能解决问题,开始对各种大数据持怀疑和态度了。

    其实这里存在一个认识误区,就是把知识的各个层次混淆了,把数据与洞察混为一谈。严谨一点说,知识有四个层次,即:数据,即产生洞察的原材料;信息,即经过加工和处理,形成的对事物属性的描述;知识,即经过人类大脑的加工,融入人类的价值判断,对事物的优劣、是非的认识;洞察,则是对知识的升华,具有指向性,可以告诉人们如何选择,或者怎样的选择会导致怎样的结果。由于人们在现实生活中通常并不做这种区分,把大数据与大数据应用、大数据洞察,也就不足为怪了。

    无论大数据热潮中炒作者把大数据说得多么神,他们所能做的,基本是停留在数据和信息层的,特别强调数量的大,是对数据的获取、结构化、清洗、描述而已。这样的所谓“大数据”,当然没有多少实际用处,解决不了什么实际决策问题。我们眼里的大数据,则是数量(Volume)、多样性(Variety)、激增性(Velocity)、价值性(Value)的统一,是把各种来源、各种形式的大量且在不断快速增长的数据,经过数据技术的分析挖掘,融入知识、理论模型,从而形成知识和洞察的过程和应用。

    不得不说,现存的大数据产品和服务,尽管在实用价值上有了很大进步,但输出结果普遍存在机械性、内部一致性问题或曰逻辑自洽问题。背后的原因,主要是过度依赖数据可供性和技术,缺少了对数据背后商业意义与商业逻辑的理解,机械地把现象间的共发当作因果,甚至不考虑时间先后。这就是我们强调数据、技术、知识三位一体结合的原因,其中的知识,就是指对数据背后商业意义和商业逻辑的理解,包括决策的理论与模型。

    张文双参加”第四届‘一带一路’园区建设国际合作峰会暨第十五届中国企业发展论坛营商环境峰会”同向与会代表介绍了动因大数据与传统大数据的本质区别,他说:“我们把消费者通过社交媒体、自媒体平台表达意见、态度、价值取向产生大数据的称作表达大数据,其特点是芜杂、不聚焦;把他们在电商、服务平台通过交易、出行、搜索、浏览等操作形成的大数据称作痕迹大数据,这种大数据具有事后性和碎片性;而动因大数据的价值在探究表达、痕迹背后的态度、心理及场景因素,具有强烈的主动性、目的性、预示性,更好地诠释现象背后的深层关系,解读原因,预测未知。他相信,动因大数据将在表达大数据和痕迹大数据基础上,形成大数据的第三极。这三种大数据相互支撑,相互补充,才是大数据的完整图景。(作者:张文双)

    作者简介:

    张文双,云图元睿(上海)科技有限公司董事长,主要创始人。经济学专家,营销管理专家,曾任WPP集团旗下国际研究集团中国区副总裁、董事 ,全球研发机构产品评审委员会(PET)成员、营销科学集团(MSG)中国区负责人,战略管理委员会核心成员。美国营销协会(AMA)会员。2017年与合伙人联合创建云图起势(上海)科技有限公司 及云图元睿(上海)科技有限公司。现任云图元睿(上海)科技有限公司董事长、CEO 。

    主要研究咨询领域:市场细分战略,新产品研发战略,品类管理战略,品牌资产评估与管理,顾客资产评估与管理,人才资产评估与管理,多源数据整合与挖掘,高级统计分析与建模。(源自:百度百科)

  • ?

    我也就看了八遍,深度剖析互联网大数据

    武芷蝶

    展开

    大数据是什么?从哪里来?有什么用?这些问题是自大数据诞生以来就一直存在的问题。但这些问题也没有影响到大数据的发展,对个人来说,对企业来说,大数据是可以控制、可以利用、可以取舍的技术现象,大数据只是一种工具。

    但是仅仅把大数据看做一种技术手段是不够的。从个人层面来说,轻视大数据也只是在生活选择中不知所措,在上学、就业、家居、社交、教育等问题上有可能陷入困境。从企业层面来说,看不到大数据的趋势,轻视各行各业走向数据化的趋势,以为随便做做就是互联网+了,都可能是首先被淘汰被取代的企业。从国家层面来说,如果抓不住大数据的机遇,消极抵抗大数据浪潮,就会像许多处于农业社会的国家面对工业革命的冲击却错失良机,再想赶超就需要数百年的努力。

    大数据是一种世界观,大数据是一种历史观,大数据是一种价值观,大数据是一种方法论。面对这种变革,每个人都很难不去面对,不去思考,不去选择。计算机解决的是数据计算问题,互联网解决的是数据传输问题,大数据则是在此基础上直奔主题,用数据化的方式解决各种问题。

    所以,无论你现在处在什么行业,什么地位,都应该认识大数据,思考大数据。

    大数据,在百度百科上的解释是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。当然了在如何定义大数据的概念问题上,在学术界和也没有共识。

    从实际出发,制造业在大数据方面的创新进展也很显著。第一类是以3D打印技术为代表的数据化制作方式正在以日新月异的速度发展,数据化制作很快会成为制造业创新的主流。第二类是制造业产品的数据终端化,越来越多的工业产品具备了互联互通、数据生成的功能。第三类是传统制造技术与流程的数据化,主要表现为自动控制和智能化生产。

    但是像制造业这样历史悠久的传统产业发展大数据难度也比较大,第一是惯性思维制约了创造性思维的产生,例如像苹果手机这样的智能手机居然不是在手机制造业产生,反倒是要毫无手机制造能力的苹果公司先走一步;第二是数据终端的产品需要漫长的试错过程;第三是大数据制造需要新人、新设备,这意味着企业重组。

    大数据的出现既为网络业带来了机遇也带来了挑战。从潜在的机会看,数据量的增加为网络公司提供了精确把握用户群体和个体网络行为模式的基础,如果能够充分利用,就可以创立比现有广告和产品推广形式性价比高数倍的全新商业模式。但是需要重建公司架构,进行商业模式的创新,需要升级公司的技术开发、数据处理和组织运营能力。

    互联网的战争说到底就是人才的战争,创新的战争。新的人才带来新的技术手段,新的技术手段带来新的公司架构。创新者生,要敞开胸怀迎接新的思想,新的事物。

  • ?

    “简”析世界杯:冠军之路的大数据深度分析

    鄂从云

    展开

    今夜凌晨,伴随着一场淋漓尽致的进球大战,法兰西雄鸡以4:2战胜了格子军团克罗地亚,封冠俄罗斯世界杯,而克罗地亚也以胜利者的姿态向世界展现了自己的风采。60年来的决赛最多进球、继球王贝利又一位决赛进球的20岁小将……伴随着一项项新纪录、新数据的产生,本届世界杯也圆满落幕。

    赛前并不被外界所看好的法国队因何可以走到最后,笑傲群雄,简极运动数据研究院将一同和大家用数据回顾并剖析一下这一支二度封王的法国队。

    高卢雄鸡的身价与成绩

    2018俄罗斯世界杯最高身价非华丽的高卢雄鸡莫属,23人大名单总身价达到了14.1亿欧元位居榜首,高于位于第二的英格兰(13.9亿欧元)和排名第三的巴西(12.7亿欧元),立下了历史世界杯上的最高纪录标杆。更有年轻活力的豪华配置,出生于巴黎东北部小镇邦迪的19岁小将姆巴佩不仅速度达到了惊人的39.2km/h,更是以1.87亿欧元的身价力压梅西身价,并与格列兹曼各为法国打进4球,并列居于本届射手榜第三位。

    如此顶配的幸福烦恼自然是被这位1998年法国首次夺得第一次世界杯冠军的球队队长德尚承担,虽说不能把身价等同于实力,也不能把实力和成绩画上等号,但是在今日凌晨能够时隔20年再夺世界杯,相信大部分参赛球队的主教练都愿意替德尚去承担这种幸福的烦恼。

    如果非得用一句话来形容这支位置均衡、平均年龄合理、一手好牌的法国队,我能想到只能是:一分钱一分货。

    法国23人大名单与决赛首发

    德尚幸福的烦恼-阵型选择

    世界杯的舞台上也是有着太多超豪华阵容却折戟沉沙的案例,因此德尚带领着这样一支顶配的球队,排兵布阵的选择也是不可能让所有人满意的,当成绩开始出现与身价不匹配的时候立刻会招来舆论的口诛笔伐。从本届世界杯的历程来看,德尚对于4-2-3-1可谓是执着偏爱了,在7场的比赛中,仅在首战对阵澳大利亚中摆出了一次433阵型,其余6场不出意外的将4231执行到底。

    小组赛:试水三叉戟

    法国队在世界杯上首先尝试的阵型是4-3-3,在金斯利-科曼和奥斯曼-登贝莱都遭受了重大伤病后,德尚优先选择了更早复出的后者与格列兹曼、姆巴佩搭档三叉戟,首战103km的跑动距离,484次的传球次数和52次的反抢创造了12次的射门机会并有5次射正,最后凭借着格列兹曼的进球和对手的乌龙球以2-1拿下了澳大利亚。

    1/8、1/4、1/2淘汰赛:433到4231的转变

    德尚还拥有着一个纯粹的中锋——吉鲁的烦恼,身披9号战袍的吉鲁是现阶段法国最高的信任支点了,虽然在首战对阵澳大利亚中未首发上场,在次回合直至决赛吉鲁确立了中锋支点的威信,擅长传威胁球的勒马尔,追风少年姆巴佩,全能的格列兹曼让德尚的433完成了不断换位的组合拳,换阵成的4231和吉鲁简直是绝配,在淘汰赛阶段创造出了11个进球,并且拥有场均99km的跑动距离、场均372次的传球次数、场均45%的控球率转换成场均12次射门次数和4次射正次数的数据,相比于传控的完美数据,高卢雄鸡的进攻可谓是犀利高效了,华丽丽的高卢雄鸡与德尚怎能说不是顶配了呢!

    决赛:放弃球权诱敌深入

    决赛对阵克罗地亚,德尚没有“烦恼”,德尚是赢的。39%的控球率与淘汰赛场均45%的控球率相比,可以看出法国人是果断放弃了球权诱敌深入,全民皆后卫的特点在很大程度上克制了克罗地亚的速度,吉鲁和格列茨曼回撤,姆巴佩的伺机跑位,坚决打起了反击并将4231进行到底。事实证明,效果显著,法国的8次射门就有6次射正,其中将4个进球收入囊中。

    法国全场各个时间段平均站位图

    坎特全程盯防莫德里奇,集中活动在中后场,在吃到黄牌后毅然的被德尚换下,德尚换人也赢了,黄牌让坎特开始无法全力盯防担心红牌的出现,且耗到了莫德里奇在下半场的体能大量消耗后,让其不足以有强大的爆发力,落后的克罗地亚起了高球,而这也正是坎特的弱项,德尚的换人是明智的。

    吉鲁回防到禁区,格列兹曼回撤,姆巴佩追防佩里西奇在右边路上伺机跑位,法国人的右边路集中了50%的进攻比例,姆巴佩98分钟的全场比赛中跑了8712m,在对手控球时跑了3526m,本队控球时跑了2588m,身为边前卫,在对方半场仅占了总时间的53%,并且有着28次的冲刺次数,达到了31.28km/h的极值速度,上一次看到法国人退的这么后面这么迅速应该要追溯到郭刻尔克那会儿了。在反击上姆巴佩禁区弧顶接球的原地摆腿射门,真的是诠释了什么是年轻有天赋真的是可以为所欲为。

    法国进攻比例

    法国vs克罗地亚(4-2)

    2018年俄罗斯世界杯真正结束了,4年一届的大舞台上从来不缺少精彩的故事,多年后球赛里的某一事件依然会是人们讨论的话题,从1998年到2018年,高卢雄鸡再次华丽的登顶,克罗地亚也让人肃然起敬,引用网友的一句话:或许足球只是生活的一部分,但有时又超越了简单的生活。世界杯,我们再见!

    版权声明:如涉及版权问题,请作者持权属证明与本网联系

    来源:人民网-体育频道

  • ?

    资深数据大牛深度解析:大数据底层架构!

    绫罗缎

    展开

    随着公司业务的增长,大量和业务、流程、规则相关的半结构化数据也爆发式增长。但数据分散在公司的各个系统中,如何将它们汇总并形成统一的企业级数据仓库,使企业灵活,高效的运用成了难题。

    如需将分散的各个底层数据汇总则需建立完整的体系,支撑风控的大数据框架则是重中之重。

    拥有5000万+注册用户;13亿+设备标签;100亿+行为数据;1500万+行业关注名单等海量多维数据的拍拍信则是从这几个方面落实:

    1. 数据采集

    面对来源各异、以结构化/半结构化为主的数据,我们使用linkedin开源的camus来采集消息类数据,使用kettle来采集RMDB的数据。

    2. 数据储存

    将采集到的原始数据存储到hadoop集群的分布式文件系统中。此外,基于hdfs文件系统对小文件并不是很友好的前提下,定期对历史文件进行合并、压缩、归档的操作也很有必要。

    3. 离线处理

    数据的离线处理则是一个非常大的话题,相当多的工作量都在这里,但它的价值却往往不会马上得到体现,从而被企业忽视。不仅仅包含以下这些内容:

    l 构建并不停地丰富数据仓库

    参照传统的ODS,DW,DM将数仓分层,对数据进行加密、去重后分门别类,持续不断的坚持做这件事。

    l 管理元数据

    建立数据字典,统一数据编码,描绘数据血缘等。

    l 检测数据质量

    从众数、少数、中位数、平均值等多维度来检测和把握数据的质量。

    4. 流式处理

    我们使用spark streaming将特征工程、模型结果计算与流式处理相结合,提供秒级的输出。甚至成功的将类似RNN(循环神经网络)这样的深度学习计算添加到整个流式处理的过程中。

    5. 数据可视化

    使用不同的工具以满足不同场景、不同职责的人员对数据的使用。不仅仅包含以下这些内容:

    l 数据的即席查询

    懂SQL、随意组合查询条件,进行自助查询,可以忍受分钟级的耗时。

    l 多维分析

    不懂SQL的情况下,在给定的维度和指标下,随意组合,并在秒级得到查询结果。

    l 静态报表

    只关注关键性指标。

    l 数据分析挖掘

    会使用像python、R这样的语言,结合集群的Spark、hive这样的分布式处理工具,对数据进行更深层次的利用。

    经过处理的底层大数据相对于以往,在实际业务中使源数据种类更丰富,数据量更多, 借助集群的助力,处理速度更快,回溯时间更久远。

    实际运用:

    模型训练:风控模型是互联网金融,传统金融等行业在风控流程中不可或缺的环节。

    模型应用:将模型与流式计算相结合,提供秒级的风控决策。

    数据产品:对数据加工处理,产生像多头、风险名单一类的数据产品。

    常用业务:企业在日常工作中各个环节都涉及到数据如:处理数据,更新数据,数据调用,查询日志等。

    运用大数据架构前后比对:

    在进行大数据框架搭建时还需注意以下几点:

    现在即使在同一细分领域,也有很多开源技术可供选择,请尽量选用相对成熟,社区活跃的;能选用开源的,尽量避免自研;另外代码如果要维护自己分支,请特别要谨慎,避免与社区越走越远;hadoop最初并没有太多的考虑数据安全方面,这点要自己加强;高稳定性和高性能往往一个是鱼,一个是熊掌,请考虑好取舍。

    本期对大数据底层架构的分享就到这里,欢迎大家联系探讨。

    本文为拍拍信原创,未经许可,禁止转载,侵权必究。申请授权,请联系我们。

    感谢您对拍拍信的认可与支持

    我们一直在路上

  • ?

    深度解析数据分析、大数据工程师和数据科学家的区别

    Humphrey

    展开

    数据越来越多的影响并塑造着那些我们每天都要交互的系统。不管是你使用Siri,google搜索,还是浏览facebook的好友动态,你都在消费者数据分析的结果。我们赋予了数据如此大的转变的能力,也难怪近几年越来越多的数据相关的角色被创造出来。

    这些角色的职责范围,从预测未来,到发现你周围世界的模式,到建设操作着数百万记录的系统。在这篇文章中。我们将讨论不同的数据相关的角色,他们如何组合在一起,并且帮你找出那些角色是适合你自己的。

    什么是数据分析师?

    数据分析通过谈论数据来像他们的公司传递价值,用数据来回答问题,交流结果来帮助做商业决策。数据分析师的一般工作包括数据清洗,执行分析和数据可视化。

    取决于行业,数据分析师可能有不同的头衔(比如:商业分析师,商业智能分析师,业务/运营分析师,数据分析师)不管头衔是什么,数据分析师是一个能适应不同角色和团队的多面手以帮助别人做出更好的数据驱动的决策。

    深度解析数据分析师

    数据分析师拥有把传统的商业方式转换成数据驱动的商业方式的潜质。虽然数据分析师是数据广泛领域的入门水平,但不是说所有的分析师都是低水平的。数据分析师不仅仅精通技术工具,还是高效的交流者,他们对于那些把技术团队和商业团队隔离的公司是至关重要的。

    他们的核心职责是帮助其他人追踪进展,和优化目标。市场人员如何使用分析的数据取帮助他们安排下一次活动?销售人员如何衡量哪种类型人群能更好的争取?CEO如何更好的理解最最近公司发展背后潜在原因?这些问题就需要数据分析师通过数据分析和呈现结果来给答案。他们从事的这些和数据打交道的复杂工作能够为他们所在的组织贡献价值。

    一个高效的数据分析师能够在商业决策的时候摒弃臆想和猜测,并且帮助整个组织快速成长。数据分析师必须是一个横跨在不同团队中的有效桥梁。通过分析新的数据,综合不同的报告,翻译整体的产出。反过来,这也能帮助组织对于自身的发展时刻保持警觉。

    公司的不同需求决定了数据分析师的技能要求,但是下面这些应该是通用的:

    清洗和组织未加工的数据

    使用描述性统计来得到数据的全局视图

    分析在数据中发现的有趣趋势

    创建数据可视化和仪表盘来帮助公司解读说明和使用数据做决策

    呈现针对商业客户或者内部团队的科学分析的结果

    数据分析师对公司科技和分科技的两面都带来了重大的价值。不管是进行探索性的分析还是解读经营状况的仪表盘。分析师都促进了团队之间更紧密的连接。

    什么是数据科学家?

    数据科学家是使用他们在统计学和建设机器学习模型方面的专业技术去进行关键商业问题预测的专家。

    数据科学家也需要像数据分析师一样去清洗、分析、可视化数据。然而一个数据科学家需要在这些技能上更深入也更专业,他们还可以去训练和优化机器学习的模型。

    深度解析数据科学家

    数据科学家能产生巨大的价值,他们处理更多开放式的问题并且利用他们专业的统计学和算法知识发挥更大杠杆的作用。如果说数据分析师专注于从过去和现在数据层面来理解数据的话,那么数据科学家就是专注于做出对未来更可信的预测。

    数据科学家通过有监督学习(分类、回归)和无监督学习(聚类,神经网络,异常监测?)机器学习模型来揭开隐藏着的规律。本质上来说他们是训练那些能让他们更好的识别模型和产出精确预测效果的数学模型的人。

    下面是数据科学家完成的一些例子:

    评估统计学模型来决定分析有效性

    使用机器学习来建设更好的预测算法

    测试和持续提升模型精确度

    进行数据可视化来概括分析的结论

    数据科学家为预测和理解数据带来了一种完全崭新的方式。虽然数据分析师可能也可以去描述趋势和为商业团队传递这些结果。但是数据科学家能剔除新的问题并且可以去建模来做出对新数据的预测。

    什么是数据工程师?

    数据工程师建设和优化系统。这些系统帮助数据科学家和数据分析师开展他们的工作。每一个公司里面和数据打交道的人都需要依赖于这些数据是准确的和可获取的。数据工程师保证任何数据都是正常可接收的,可转换的,可存储的并且对于使用者来说是可获取的。

    深度解析数据工程师

    数据工程师建立了数据分析师和数据科学家依赖的基础。数据工程师对构造数据管道并且经常需要去使用复杂的工具和技术来管理数据负责。不想前面说的两个事业的路径,数据工程师更多的是朝着软件开发能力上学习和提升。

    在比较大的组织中,数据工程师需要关注不同的方面:比如使用数据的工具,维护数据库,创建和管理数据管道。不管侧重于什么,一个好的数据工程师能够保证数据科学家和数据分析师专注于解决分析方面的问题,而不是一个数据源一个数据源的去移动、操作数据。

    数据工程师往往更加注重建设和优化。下面的任务的示例是数据工程师通常的工作:

    为数据消费开发API

    在现存的数据管道中整合数据集

    在新数据上运用特征转换提供给机器学习模型

    持续不断的监控和测试系统保证性能优化

    你的数据驱动的事业路径:

    现在你已经了解了这三种数据驱动的工作了,但是问题还在,你适合哪一种呢?虽然都是和数据相关,但是这三种工作是截然不同的。

    数据工程师主要工作在后端。持续的提升数据管道来保证数据的精确和可获取。他们一般利用不同的工具来保证数据被正确的处理了,并且当用户要使用数据的时候保证数据是可用的。一个好的的数据工程师会为组织节省很多的时间和精力。

    数据分析师一般用数据工程师提供的现成的接口来抽取新的数据,然后取发现数据中的趋势。同时也要分析异常情况。数据分析师以一种清晰的方式来概括和提出他们的结果来让非技术的团队更好的理解他们现在在做的东西。

    最后,数据科学家更倾向于基于分析的发现和在更多可能性上的调查来获得方向。不管是训练模型还是进行统计分析,数据科学家试图去对未来要发生的可能性提出一个更好的预测。

    不管你的特殊的路径是什么,好奇心都是这三个职业最本质的要求。使用数据来更好的提问和进行精确的实验是数据驱动事业的全部目标。此外,数据科学家领域是不断的进化的,你必须要有强大的能力去持续不断的学习。

    有一句话叫做三人行必有我师,其实做为一个开发者,有一个学习的氛围跟一个交流圈子特别重要这是一个我的大数据交流学习群531629188不管你是小白还是大牛欢迎入驻,正在求职的也可以加入,大家一起交流学习,话糙理不糙,互相学习,共同进步,一起加油吧。

  • ?

    十种常用的数据分析方法

    紫萱

    展开

    道家强调四个字,叫“道、法、术、器”。

    层次区别:

    “器”是指物品或工具,在数据分析领域指的就是数据分析的产品或工具,“工欲善其事,必先利其器”;

    “术”是指操作技术,是技能的高低、效率的高下,如对分析工具使用的技术(比如用Excel进行数据分析的水平);

    “法”是指选择的方法,有句话说“选择比努力重要”;

    “道”是指方向,是指导思想,是战略。

    在数据分析和产品、运营优化方面,数据分析方法是其核心,属于“法”和“术”的层次。

    那么如何做好数据分析呢,今天我们来讲讲互联网运营中的十大数据分析方法。

    01 细分分析

    细分分析是分析的基础,单一维度下的指标数据的信息价值很低。

    细分方法可以分为两类, 一类逐步分析, 比如:来北京市的访客可分为朝阳,海淀等区; 另一类是维度交叉, 如:来自付费SEM的新访客。

    细分用于解决所有问题。

    比如漏斗转化,实际上就是把转化过程按照步骤进行细分,流量渠道的分析和评估也需要大量用到细分的方法。

    02 对比分析

    对比分析主要是指将两个相互联系的指标数据进行比较,从数量上展示和说明研究对象的规模大小,水平高低,速度快慢等相对数值, 通过相同维度下的指标对比,可以发现,找出业务在不同阶段的问题。

    常见的对比方法包括: 时间对比,空间对比,标准对比。

    时间对比有三种: 同比,环比,定基比。

    例如: 本周和上周进行对比就是环比;本月第一周和上月第一周对比就是同比;所有数据同今年的第一周对比则为定基比。通过三种方式,可以分析业务增长水平,速度等信息。

    03 漏斗分析

    转化漏斗分析是业务分析的基本模型, 最常见的是把最终的转化设置为某种目的的实现,最典型的就是完成交易。但也可以是其他任何目的的实现,比如一次使用app的时间超过10分钟。

    漏斗帮助我们解决两方面的问题:

    在一个过程中是否发生泄漏,如果有泄漏,我们能在漏斗中看到,并且能够通过进一步的分析堵住这个泄漏点。

    在一个过程中是否出现了其他不应该出现的过程,造成转化主进程收到损害。

    04 同期群分析

    同期群(cohort)分析在数据运营领域十分重要,互联网运营特别需要仔细洞察留存情况。 通过对性质完全一样的可对比群体的留存情况的比较,来分析哪些因素影响用户的留存。

    同期群分析深受欢迎的重要原因是十分简单,但却十分直观。 同期群只用简单的一个图表,直接描述了用户在一段时间周期(甚至是整个LTV)的留存或流失变化情况。

    以前留存分析只要用户有回访即定义为留存,这会导致留存指标虚高。

    05 聚类分析

    聚类分析具有简单,直观的特征, 网站分析中的聚类主要分为:用户,页面或内容,来源。

    用户聚类主要体现为用户分群,用户标签法;页面聚类则主要是相似,相关页面分组法;来源聚类主要包括渠道,关键词等。

    例如: 在页面分析中,经常存在带?参数的页面。 比如: 资讯详情页面,商品页面等,都属于同一类页面。简单的分析容易造成跳出率,退出率等指标不准确的问题,通过聚类分析可以获取同类页面的准确数据用于分析场景。

    06 AB测试

    增长黑客的一个主要思想之一,是不要做一个大而全的东西,而是不断做出能够快速验证的小而精的东西。 快速验证,那如何验证呢?主要方法就是AB测试。

    比如: 你发现漏斗转化中中间有漏洞,假设一定是商品价格问题导致了流失,你看到了问题-漏斗,也想出了主意-改变定价。但主意是否正确,要看真实的用户反应,于是采用AB测试,一部分用户还是看到老价格,一部分用户看到新价格,若你的主意真的管用,新价格就应该有更好的转化,若真如此,新价格就应该确定下来,如此反复优化。

    07 埋点分析

    只有采集了足够的基础数据,才能通过各种分析方法得到需要的分析结果。

    通过分析用户行为,并细分为:浏览行为,轻度交互,重度交互,交易行为,对于浏览行为和轻度交互行为的点击按钮等事件,因其使用频繁,数据简单,采用无埋点技术实现自助埋点,即可以提高数据分析的实效性,需要的数据可立即提取,又大量减少技术人员的工作量,需要采集更丰富信息的行为。

    如: 重度交互(注册,邀请好友等)和交易事件(加购物车,下订单等)则通过SDK批量埋点的方式来实施。

    08 来源分析

    流量红利消失,我们对获客来源的重视度极高,如何有效的标注用户来源,至关重要。

    传统分析工具,渠道分析仅有单一维度,要深入分析不同渠道不同阶段效果,SEM付费搜索等来源渠道和用户所在地区进行交叉分析,得出不同区域的获客详细信息,维度越细,分析结果也越有价值。

    09 用户分析

    用户分析是互联网运营的核心, 常用的分析方法包括:活跃分析,留存分析,用户分群,用户画像,用户细查等。

    可将用户活跃细分为浏览活跃,互动活跃,交易活跃等,通过活跃行为的细分,掌握关键行为指标;通过用户行为事件序列,用户属性进行分群,观察分群用户的访问,浏览,注册,互动,交易等行为,从而真正把握不同用户类型的特点,提供有针对性的产品和服务。

    用户画像基于自动标签系统将用户完整的画像描绘清晰,更有力的支撑运营决策。

    10 表单分析

    填写表单是每个平台与用户交互的必备环节,优秀的表单设计,对转化率的提升起到重要作用。

    用户从进入表单页面之时起,就产生了微漏斗,从进入总人数到最终完成并成功提交表单人数,这个过程之中,有多少人开始填写表单,填写表单时,遇到了什么困难导致无法完成表单,都影响最终的转化效果。

    以上是常见的数据分析方法,更多应用方法需要根据业务场景灵活应用。

数据深度分析

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP