中企动力 > 商学院 > 对数据分析
  • ?

    关于数据分析的4点心得:维度、指标、KPI

    羊芷波

    展开

    1、看数据看维度

    在对某一项业务或者业务的某个模块进行分析时,可以从大小两个角度去切入分析。

    首先站在广阔的视角去看待一些数据。比如对某个产品(消费品),就要分析在大环境下是一个什么样的数据,如市场排名,市场占有率。还要记录市场整体波动情况,竞品的数据。这些一般可以通过第三方调研机构或者行业报告获得。

    FineReport数据报表看板

    然后需要分析针对这个产品你内部关心的数据是什么。比如每月每周的销售量,各渠道的销售量,广告、促销活动、线下活动、联合活动等带来的销售的提升和品牌知名度的提升。

    当了解完以上的数据,就应该对这个产品方方面面的情况有个宏观的了解,对需要提升哪些数据指标有一个清晰的认识。之后就是细化到某个模块维度进一步分析,比如电商渠道需要关注的多一些,DAU、WAU、客单价、复购、用户流失等等,每个模块都可建立漏斗信息。实际分析时还要关注数据异常,做针对性分析。

    2、什么是好的数据指标?

    并不是所有的数据字段都可以当做指标。在选择监测的数据指标前可以先问自己几个问题:

    一对于这个产品你核心关注的是什么?比如销售增长率、市场占有率?

    二这些指标能够反映这个产品的走向趋势么?如果这些指标变好了能否说明公司是在往好的方向上发展?

    三这个指标是否可控,能否操作?如果有些指标你目前的技术根本无法统计到,那也是无济于事。

    四指标系设立是否严谨不存在漏洞。描述一个产品的一定是有系列指标,这些会标是否能完全的说明情况,在验证你的假设结论时,是否能完全支撑。

    再来说说指标的数据和分析。

    有时候数据本身也存在欺骗性,比如这个月的销售额是600W,另外两家最大竞品分别是300W和250W,似乎加起来也没有我们大。但是事实上,我们上个月的销售是800W,竞品分别是200W和180W。数据看上去很漂亮,但是按对比和比率来讲我们远下降了。

    所以,好的数据最好一定是以比率的形式存在,要有对比性质的相对数据。

    单纯一个或几个数据情况是没有意义的,点连成线,线构成面去展示,用图表展示一段时间的整体趋势,才能客观评价产品的健康程度。通常我们用BI或者报表搭建数据看板(dashboard)监测重要的数据指标。

    FineReport数据报表看板

    数据分析要有目的性,不要被数据迷惑。上面的数据就是只关注了销售额情况,但忽略了整体分析而导致的表面欺骗。

    3、发现数据异常,该从哪几个维度去分析?

    有时候总量的角度是无法看出问题的,比如销售额、UV下降了,我们需要进一步细化去分析。看销售额总量的时候明显是下降了,先确定大的市场有没有波动,竞争对手有没有动作,需要查看市场总额以及竞争对手每个品类的数据。然后分析自身,每个渠道的销售额情况监测,每个区域的销售额情况,每个时间段的销售情况,把活动时间比如五一的数据扣除拟合,将有问题的标记出来。如果是渠道问题优化渠道,如果是市场波动,需要全局考虑战略和市场对策。

    所以如果是销售额的分析,需要从渠道、活动时间点、地域等情况去深入分析。比如,是不是因为十一的活动导致销量有个明显的上升趋势?是不是因为上周搞了促销活动,导致本周一线业务员有个消极缓冲的时段,整体销售额低迷。

    另外,数据一场也不是什么坏事,如果再数据分析过程中发现某数据表现极好,比如某渠道的销售增长率很高,是不是可以思考为什么会这样,有什么好的经验借鉴,甚至是不是要考虑调整渠道的投放比率。

    4、不同阶段的关键性指标应该是随着业务的变化而变化的

    在做数据分析前,我们会确定分析的目标,每个阶段不同。以电商渠道为例,有时候是分析各类活动效果以进一步优化方案或者挑选最合适的方案,留下分析模型以便后续活动对比预测;有时候是研究广告投放,在预算内让营收最大化;有时候是增强用户粘性,提高用户活跃度。

    所以不同阶段无论是关键性指标还是KPI都要做相应调整。比如产品投放初期,关注用户数、订单数,后续考虑用户活跃度,回购率,客单价等等。

  • ?

    数据分析方法(一):对比与对标

    呼呼

    展开

    对比是数据分析最基本的方法,通过对比识别数据差异。但是对比有得失。在分析过程中,对比得当可获得精准结论,但对比分析也存在陷阱,比如某产品近期销售数据在下滑,想当然得会得出结论此产品受欢迎度在下降,但是查看销售比(销售数/DAU)却在上升,所以只是因为DAU下降了。

    所以如何去有效对比?

    1、 横向、纵向多维度对比

    对比的前提是两个事物或统一个事物的两个状态,其次必须要有一个对比的指标或标准(这里可称为对比的度量)。对比的两事物一个是主体,另一个是客体。也就是明确对比的三要素:主体、客体和度量。比如小明比小王高5cm,就是一个最简单的对比,这里小明是主体,小王是客体,度量身高,且人们对于身高这个度量存有共识。但如果去大排档吃一碗炒饭50元,可能觉得很贵。那如果是取希尔顿吃一碗炒饭128元可能就不觉得贵,这里我们选择了常识作为比较的基准,客体也没有问题,问题在于我们所谓的“常识”并非所有人的“共识”,如果不是共识,就要非常谨慎地得出结论,否则就容易从自我出发做出判断,影响结论的中肯性。

    2、建立标准化的对比客体和度量

    就是因为标准可以是认为确定的,所以存在质疑和不确定性。

    建立标准化的对比可以是时间标准、空间标准、特定标准、计划标准。

    3、 比率的对比

    常见的对比是大小的对比、数量的对比,比如销售额的对比,人数的对比,使用不同的对比指标会得到不同的结论,我们把对比标准的选择叫做视角,视角不同,结论不同。比如上述对比小明小王俩同学,身高是视角事宜,除此之外还有年龄、学习成绩、颜值等等。在对比各种变化的原因时,我们也有各种模型,我们所要做的就是找到合适的对比视角。

    直接描述事物的变量:长度、数量、高度、宽度等

    加工后可得到:增速、效率、效益等指标,这才是数据分析时常用的。

    如下图的AB公司销售额对比,虽然A公司销售额总体上涨且高于B公司,但是B公司的增速迅猛,高于A公司,即使后期增速下降了,最后的销售额还是赶超。(数据都是笔者瞎编的,工具用的是FineBI)

    3、 指标的逻辑与管理指标

    数据分析师有一个关键的职能就是要设计“指标”来对比,设计指标和应用指标有着天壤之别。比如某保健品公司,他们的产品是各类补品及奶粉,他们的业务与市场中人口的出生率、老龄化速度、市场整体购买力、对保健品的消费观念有着直接关系,还与政府对这个市场的管控力度有关。分析这么多之后,有没有一个指标来反映这些综合的因素,它的正反代表着好坏。

    考虑到以上因素需要构建一个综合性的指标,这需要各种数据的加权计算。在不考虑市场规模的情况才,可以先构建一个指标指数模型:

    Y=aX1 + bX2 + cX3 + dX4+……

    Y 可定为市场吸引力指标值

    X1 可定为老龄化程度

    X2 可定为市场整体购买力

    X3 可定为市场对保健品的品牌的看法

    X4 可定为政府对这个市场的管控力度

    abcd是系数,分别代表影响力程度

    当然以上只是简单的罗列,实际情况比如X2还能分解出多个影响指标,甚至整体可以换成乘法模型,指数模型。。。

    4、 对标的层次和维度

    设定了各项管理指标后,剩下的就是比较工作了。从变化到追踪事物变化的诡计,找到问题的根源,从而找到书屋发展规律,这个过程叫对标。对标可以和自己比,也要和别人和竞品比。

    对标的维度有规模指标、速度指标、效率指标、效益指标。

    规模指标比如营业额、销售额,电商平台的UV、日活,医院的一天接诊数量,年营业收入额;

    速度指标往往代表着活力,也是看未来趋势和潜能的重要指标类,包括各种运营管理指标的速度指标。

    效率指标即投入和产出比,如果投入的是时间,月度产值、季度产值;如果投入的是净资产、则净资产周转率;如果投入的是人,人均产值,人均销售额。

  • ?

    最常用的四种大数据分析方法

    Rasine

    展开

    本文主要讲述数据挖掘分析领域中,最常用的四种数据分析方法:描述型分析、诊断型分析、预测型分析和指令型分析。

    当刚涉足数据挖掘分析领域的分析师被问及,数据挖掘分析人员最重要的能力是什么时,他们给出了五花八门的答案。

    其实我想告诉他们的是,数据挖掘分析领域最重要的能力是:能够将数据转化为非专业人士也能够清楚理解的有意义的见解。

    使用一些工具来帮助大家更好的理解数据分析在挖掘数据价值方面的重要性,是十分有必要的。其中的一个工具,叫做四维分析法。

    简单地来说,分析可被划分为4种关键方法。

    下面会详细介绍这四种方法。

    1. 描述型分析:发生了什么?

    这是最常见的分析方法。在业务中,这种方法向数据分析师提供了重要指标和业务的衡量方法。

    例如,每月的营收和损失账单。数据分析师可以通过这些账单,获取大量的客户数据。了解客户的地理信息,就是“描述型分析”方法之一。利用可视化工具,能够有效的增强描述型分析所提供的信息。

    2. 诊断型分析:为什么会发生?

    描述性数据分析的下一步就是诊断型数据分析。通过评估描述型数据,诊断分析工具能够让数据分析师深入地分析数据,钻取到数据的核心。

    良好设计的BI dashboard能够整合:按照时间序列进行数据读入、特征过滤和钻取数据等功能,以便更好的分析数据。

    3. 预测型分析:可能发生什么?

    预测型分析主要用于进行预测。事件未来发生的可能性、预测一个可量化的值,或者是预估事情发生的时间点,这些都可以通过预测模型来完成。

    预测模型通常会使用各种可变数据来实现预测。数据成员的多样化与预测结果密切相关。

    在充满不确定性的环境下,预测能够帮助做出更好的决定。预测模型也是很多领域正在使用的重要方法。

    4. 指令型分析:需要做什么?

    数据价值和复杂度分析的下一步就是指令型分析。指令模型基于对“发生了什么”、“为什么会发生”和“可能发生什么”的分析,来帮助用户决定应该采取什么措施。通常情况下,指令型分析不是单独使用的方法,而是前面的所有方法都完成之后,最后需要完成的分析方法。

    例如,交通规划分析考量了每条路线的距离、每条线路的行驶速度、以及目前的交通管制等方面因素,来帮助选择最好的回家路线。

    结论

    最后需要说明,每一种分析方法都对业务分析具有很大的帮助,同时也应用在数据分析的各个方面。

    原文链接:http://kdnuggets/2017/07/4-types-data-analytics.html

    转载请注明出自:葡萄城控件

    关于葡萄城

    葡萄城是全球控件行业领导者,世界领先的企业应用定制工具、企业报表和商业智能解决方案提供商,为超过75%的全球财富500强企业提供服务。

  • ?

    数据分析的8种方法详解

    邬嵩

    展开

    对于具体的业务场景问题,我们该怎么办呢?我们以一个电子商务网站为例,用数据分析产品 GrowingIO 对该网站进行快速地数据采集、清晰和可视化展示,然后给大家分享这 8 种常见的数据分析方法。

    1 数字和趋势

    看数字、看趋势是最基础展示数据信息的方式。

    在数据分析中,我们可以通过直观的数字或趋势图表,迅速了解例如市场的走势、订单的数量、业绩完成的情况等等,从而直观的吸收数据信息,有助于决策的准确性和实时性。

    对于电子商务网站,流量是非常重要的指标。

    上图中,我们将网站的访问用户量(UV)和页面浏览量(PV)等指标汇汇聚到统一的数据看板(Dashboard),并且实时更新。

    这样的一个数据看板,核心数字和趋势一目了然,对于首席增长官来说一目了然。

    2 维度分解

    当单一的数字或趋势过于宏观时,我们需要通过不同的维度对于数据进行分解,以获取更加精细的数据洞察。

    在选择维度时,需要仔细思考其对于分析结果的影响。

    举个例子,当监测到网站流量异常时,可以通过拆分地区、访问来源、设备、浏览器等等维度,发现问题所在。

    3 用户分群

    针对符合某种特定行为或背景信息的用户,进行归类处理,是我们常常讲到的用户分群(segmentation )的手段。

    我们也可以通过提炼某一群用户的特定信息,创建该群体用户的画像。 例如访问购物网站、寄送地址在北京的用户,可以被归类为“北京”用户群体。

    而针对“北京”用户群体,我们可以进一步观察他们购买产品的频度、类别、时间,这样我们就创建出该用户群体的画像。

    在数据分析中,我们往往针对特定行为、特定背景的用户进行有针对性的用户运营和产品优化,效果会更加明显。

    上图中,我们通过 GrowingIO 的用户分群功能将一次促销活动中支付失败的用户挑选出来,然后推送相应的优惠券。

    这样精准的营销推广,可以大幅度提高用户支付的意愿和销售金额。

    4 转化漏斗

    绝大部分商业变现的流程,都可以归纳为漏斗。

    漏斗分析是我们最常见的数据分析手段之一,无论是注册转化漏斗,还是电商下单的漏斗。

    通过漏斗分析可以从先到后还原用户转化的路径,分析每一个转化节点的效率。  其中,我们往往关注三个要点: 第一,从开始到结尾,整体的转化效率是多少?  第二,每一步的转化率是多少?  第三,哪一步流失最多,原因在什么地方?流失的用户符合哪些特征?

    上图中注册流程分为 3 个步骤,总体转化率为45.5%;

    也就是说有 1000 个用户来到注册页面,其中 455 个成功完成了注册。

    但是我们不难发现第二步的转化率是 56.8% ,显着低于第一步 89.3% 和第三步转化率 89.7%,可以推测第二步注册流程存在问题。

    显而易见第二步的提升空间是最大的,投入回报比肯定不低;如果要提高注册转化率,我们应该优先解决第二步。

    5 行为轨迹

    关注行为轨迹,是为了真实了解用户行为。

    数据指标本身往往只是真实情况的抽象,例如,网站分析如果只看访问用户量(UV)和页面访问量(PV)这类指标,断然是无法全面理解用户如何使用你的产品。通过大数据手段,还原用户的行为轨迹,有助于增长团队关注用户的实际体验、发现具体问题,根据用户使用习惯设计产品、投放内容。

    上图中展示了一位用户在某电商网站上的详细行为轨迹,从官网到落地页,再到商品详情页,最后又回到官网首页。

    网站购买转化率低,以往的业务数据无法告诉你具体的原因;通过分析上面的用户行为轨迹,可以发现一些产品和运营的问题(比如是不是商品不匹配等等),从而为决策提供依据。

    6 留存分析

    在人口红利逐渐消褪的时代,留住一个老用户的成本要远远低于获取一个新用户。

    每一款产品,每一项服务,都应该核心关注用户的留存,确保做实每一个客户。

    我们可以通过数据分析理解留存情况,也可以通过分析用户行为或行为组与回访之间的关联,找到提升留存的方法。

    在 LinkedIn,增长团队通过数据发现,如果新用户进来后添加 5 个以上的联系人(上图红色线条),那么他/她在 LinkedIn 上留存要远远高于那些没有添加联系人(上图绿色和紫色的线条)的留存。

    这样,添加联系人称为 LinkedIn 留存新用户的最核心手段之一。除了需要关注整体用户的留存情况之外,市场团队可以关注各个渠道获取用户的留存度,或各类内容吸引来的注册用户回访率,产品团队关注每一个新功能对于用户的回访的影响等等,这些都是常见的留存分析场景。

    7 A/B 测试

    A/B 测试用来对比不同产品设计/算法对结果的影响。

    产品在上线过程中经常会使用 A/B 测试来测试不同产品或者功能设计的效果,市场和运营可以通过 A/B 测试来完成不同渠道、内容、广告创意的效果评估。

    举个例子,我们设计了两种不同的产品交互形式,通过比较实验组(A 组)和对照组(B 组)的访问时长和页面浏览量两个衡量指标,来评估哪一种交互形式更佳。要进行 A/B 测试有两个必备因素:

    第一,有足够的时间进行测试;

    第二,数据量和数据密度较高。

    因为当产品流量不够大的时候,做 A/B 测试得到统计结果是很难的。而像 LinkedIn 这样大体量的公司,每天可以同时进行上千个 A/B 测试。所以 A/B 测试往往在公司数据规模较大时使用会更加精准,更快得到统计的结果。

    8 数学建模

    当一个商业目标与多种行为、画像等信息有关联性时,我们通常会使用数学建模、数据挖掘的手段进行建模,预测该商业结果的产生。

    作为一家 SaaS 企业,当我们需要预测判断客户的流失时,可以通过用户的行为数据、公司信息、用户画像等数据建立流失模型。

    利用统计学的方式进行一些组合和权重计算,从而得知用户满足哪些行为之后流失的可能性会更高。

    我们常常说,不能度量,就无法增长,数据分析对于企业商业价值的提升有着至关重要的作用。

    当然,仅仅掌握单纯的理论还远远不够,实践出真知。数据分析的方法大家不妨在自己日常工作中,有分析相关项目里尝试使用,相信可以事半功倍,创造更多商业价值。

  • ?

    数据分析:浅谈大数据对统计学的挑战和机遇,看完长见识了!

    支凡桃

    展开

    浅谈大数据对统计学的挑战和机遇

    引言  国际数据公司的相关研究指出,2011年全球数据生产量达1.8ZB,且全球信息总量每隔两年增长一倍[1]。在大数据时代下,对于统计学发展而言,挑战与机遇并存,挑战指的是现阶段传统统计学相关方法难以适用大数据,机遇指的是基于统计学,大数据展开数据处理、分析,促使大数据具备可视化特性。由此可见,研究大数据对统计学的挑战和机遇有着十分重要的现实意义。  1.大数据及其目的  现阶段,关于大数据仍旧没有一个十分明确的界定,大数据起初是源自于技术领域。在信息量不断扩大的情况下,使得常规电脑原有存储空间已不能对新处理数据进行承载,新兴数据处理技术得以产生,好比雅虎的Hadoop平台、谷歌的MapReduce等。此类技术能够对僵化层次结构、一致性予以消除,促进数据无需通过常规数据库表格进行排列,极大程度地提升了人们可处理的数据量[1]。 

     2.大数据与统计学的对比  2.1样本统计与全样本统计的区别  样本统计属于统计学不可或缺的依赖,样本指的是结合相应的概率自总体中随机筛选并视作总体代表的集合内容,值得一提的是随机抽样是需要成本的,包括社会关系、资金成本或者时间成本等。基于样本数量提升有限前提下,样本估计误差会随着总体数量增多而增大,这亦是样本统计无法避免的不足。大数据时代下,收集整理庞大的数据信息应运而生,数据信息发展表现出总体即是样本的态势,该属性很好的消除了样本统计这一不足。大数据时代下的全样本统计,通常情况下可对完全总体进行覆盖,然而受大部分数据属于半结构、半结构数据影响,使得概率论应用遭受一定的制约[2]。鉴于此,将全样本统计应用到统计学中,应当就总体数据展开相应的归纳、筛选,即好比在样本统计中展开数据预处理。  2.2预测分析与非预测分析的区别  统计学的创立,是为了对变量相互相关关系展开分析,因此获取数据是发生于变量确定之后的,数据分析价值是能够被预测的。相较于统计学的预测分析,庞大数据将互联网、传感器作为载体,存在于分析需求之前,因此构建于大数据上的分析多为非预测性分析。在统计学中,出现大数据无法有效应用局面,这是由于不具备非预测分析所需的庞大数据,庞大数据产生与数据中心、存储系统存在紧密的联系,并非短期产生。也就是说,统计学中大数据的应用发展,说明了非预测分析正逐步取代传统统计学预测分析,数据多次利用正逐步取代传统数据一次性利用的。  3.大数据对统计学的挑战与机遇  3.1数据生产、处理与应用的转变 

     相关统计部门经开展严格的统计设计工作,获得相关的统计数据,数据的预处理分别有数据清洗、非全面数据填补以及数据矫正等。大数据时代下的统计手段尚不十分明确,自大数据流环境而言,要不断探索新型抽样方法,并确保抽样方法的实时、连贯及可行性。除去传统的统计分析方法,还应当开发大数据动态分析、数据流算法等[3]。  3.2大数据时代对市场营销的机遇  3.2.1大数据营销的特点与价值  大数据营销的特点:I.数据采集多平台化特点,即大数据时代下,大数据的数据大多来源于不同的领域、不同的渠道。II.时效性特点,随着信息技术的急速发展,互联网用户消费、购物行为方式往往会瞬间出现转变。国际先进大数据营销企业AdTime基于此大数据营销特点,采取了时间营销措施,即采取相应的技术方式全面获悉用户所需,于第一时间对用户当下的需求进行回应,以使用户在下决心购买的最佳时间及时看到对应的产品广告。III.个性化特点,在大数据时代下,广告商传统媒体导向的营销理念逐步由受众导向取代,现如今,广告商可应用大数据了解用户的地理方位,需求内容等信息,达到对用户个性化营销的目的。  大数据营销的价值:I.升级营销与用户的匹配度,大数据营销不仅可提供给企业了解用户有效的途径,还能够与网络环境下,选取相关技术方法达到对用户精确定位的目的,从而开展好营销工作,升级营销与用户的匹配度。II.改善用户体验,大数据营销促使企业真正意义上认识到用户及其所使用企业产品情况,以给予用户最人性化的提醒。  3.2.2大数据营销的应用  (1)与消费者建立紧密关系  现如今,我国一些企业营销行为仍旧处于个性化定位信息、创意设计阶段,而无法对不同消费者展开个性化的营销活动。大数据时代下,经采用相关数据分析技术方法,基于对消费群体喜好、传媒接触习惯等展开有效的分析,达到特定营销活动明确开展的目的,实现企业精心开展的营销活动精准的辐射至目标消费群体处,与消费者建立紧密关系,极大的改善营销效率、质量[4]。  (2)掌握竞争对手数据  企业通过对竞争对手数据的有效掌握,获悉竞争对手发展状况,基于此帮助企业制定科学合理的产品价格,提升企业产品市场竞争优势。与此同时,企业务必要全面实施以事实为前提的决策手段,广泛地应用数据分析方式对企业每一个发展运营步骤进行优化,经对企业一系列数据的充分优化、对接,促使业务环节中潜在的价值得以被有效挖掘,降低生产成本,知己知彼,促使企业在日趋白热化的市场竞争中占据有利位置。  (3)挖掘企业内部数据  “市场未动,数据先行”俨然转变为国际上企业有效运营发展的一致认识,为了提升企业管理效率,要求企业要充分挖掘企业内部数据,并展开有效的整合、分析,以为企业相关人员做决策提供有利的参考依据,提升决策准确性,促进企业可持续发展。

    3.2.4 企业的应用案例——以亚马逊为例  在应用大数据开展市场营销方面,美国亚马逊公司一直处于领先地位。亚马逊研发出“用户未下单,先发货”功能,即结合用户的购物需求数据信息,分析用户想要购买的产品,达到用户未下单,提前发货的目的。此外,亚马逊通过对用户检索信息的分析,评估流感的传播,但这仅仅为海量检索数据中的一项用途,相同的数据能够应用于预测大选结果、预测某类产品市场行情等等,极大地降低了统计成本[5]。  3.3大数据时代对市场营销的挑战  3.3.1信息收集  大数据并非就是对数据信息展开盲目的收集,即便收集了再多的数据,倘若这些数据并非是市场营销所需要的,如此便会导致前期收集来的数据信息,变成一堆“数据垃圾”。鉴于此,为了避免这一情况发生,务必要充分分析业务需求,再对自身存在价值的数据展开收集、归纳,如此方可实现大数据的有效收集应用。  3.3.2经验与数据  数据采集完毕后,面对参差不齐的数据,还应当做好数据评估工作,评估对何种目标受众开展市场营销工作。鉴于此,要求采取科学合理的手段,将这些参差不齐的数据整合成可被市场营销实践应用的,经结合过去的经验,与采集数据进行有机融合,实现对目标受众的有效分析确定。  3.3.3分析与优化  数据分析,一方面是实现数据优化,一方面是进行决策层面上的调整、转变。此环节对于专业人才的需求提出了严苛的挑战。数据分析、数据优化对于专业人才的知识框架要求大不相同,这要求相关企业不仅要培养专业的数据分析人才,还要打造数据优化人才队伍。 

     3.4大数据营销的未来发展趋势  信息技术不断发展,单一媒体导向的“消费者碎片化”俨然无法达到企业对于数据多样性的需求。大数据时代下,媒体的跨界融合实现对“碎片化”受众的充分聚合。在科学技术技术不断进步的背景下,跨媒介、跨平台、跨终端的多途径将不断被开拓,将使庞大的数据信息获取多维度的整合,并且在多样化网络环境下,消费者主观信息与客观数据有机融合,构筑全面用户数据库环节,将成为未来大数据营销发展的必然趋势[6]。  4.结束语  总而言之,大数据为传统统计学带来了严峻的考验,也为传统统计学有效发展创造了良好的契机。在大数据时代发展潮流中,我们应当充分的认识到大数据对于传统统计学而言,是补充而不是更替,构建于样本统计、预测分析内容上的传统统计学,仍旧于社会统计、经济分析中占据着主导位置。大数据时代下,为了实现企业市场营销的有效开展,相关人员务必要不断专研研究、总结经验,全面分析大数据与统计学的对比,充分认识大数据对统计学的挑战和机遇,“与消费者建立紧密关系”、“掌握竞争对手数据”、“挖掘企业内部数据”等,积极促进企业市场营销的科学合理化。

  • ?

    菜鸟数据分析师对数据可视化的理解—完整篇

    Dock

    展开

    本人新人一枚,是个菜鸟数据分析师,统计学专业,接触数据分析大概有半年,在这里稍微写一下自己对可视化的拙见,大牛们看了不对地方还望指正;刚刚工作不久就谈对可视化的理解确实是有些过了,个人因为也看不了不少可视化的手册或者书,例如:数据可视化之美,R语言可视化手册,数据可视化设计指南等,因为工作本来没什么机会写博客总结,借着天善这个社区写写总结,让自己进步,废话不多说;

    什么是数据可视化?在我看来,数据可视化就是用图表的形式展示数据的信息;让展示的东西有视觉冲突,让人能出图表中一目了然看出你想要表达的信息;这里很关键一点就是,你想要展示数据的什么信息,很多人为了盲目的追求可视化的一些酷炫效果,得到的东西却不知道表达的是什么,那么这个可视化是失败的;当然可视化也要简洁,简单明了才是可视化的目标所在,毕竟做数据可视化是帮助人们去理解数据,认识数据,从多个侧面去观察数据,并告知告知别人你想表达的数据中的信息;

    这工作半年下来,我用了不少可视化的一些软件或者编程语言,一开始我最早接触的是大家基本都能听过的EXCEL,功能特别强大,用它都可以做数据分析,然而原谅我没有把它学好,EXCEL它其实可以做很多的事情,简单方便的生成各种你需要的图表,虽然颜色上不是那么让人喜欢,要是有耐心可以慢慢的调,加一下后期制作或者渲染;然后就是TABLEAU,这个软件确实是强大,能够连接多种数据,拖拽式的操作,可以自动的帮你生成图表,界面简洁易操作,要全放开版的收费,作为刚刚工作的小白只能用它的免费版的,不过限制挺多的;接下来就是R语言了,这是一个开源的统计语言,在数据分析方面和可视化方面都无比强大,第一次用上了GGPLOT2这个包我便开始喜欢上了这个编程语言,这个包的构图思想是图层思想,一个图层一个图层去操作,特别的灵活,我正在学习R语言,希望在今年能稍微精通一下;下面说一下自己对各种图形或者可视化的理解

    柱状图

    柱状图确实是一个很强大的图形,为什么说它强大呢?因为个人看,柱状图在展示的数据类型上可以选择非连续的数据数据类型和连续的数据类型,又有常用的柱状图和侧面柱状图,还可以用来折叠去展示数据;当我们的去展示非连续的数据类型的时候我们大部分都是用柱状图去展示这类的数据分布,大概能看出这个数据分布情况,又可以用来比较不同数据的整体与部分的关系;在展示连续的数据类型的大部分是用来展示这类数据的时间趋势。或者数据的分布。在设计上我个人认为柱状在设计的时候底层的便签最好不要太长和斜着或者90度垂直于坐标轴,因为这样为方便别人去阅读你的图表,毕竟可视化是方便别人去解读你的数据,能简单易懂就是最好不过了,在各个的柱形下的柱子的间距多少为妙呢?其实个人人为不宜过宽也不宜近,长度大概在柱状的宽度的一半左右为佳,在颜色上的设计,我比较偏向于柱形图用一种颜色,如果要想展示数据突出的部分,我们只需要将颜色加深,这也是为了阅读的简洁性,如果一张柱形图的颜色五花八门,那么所表达的效果是特别糟糕的。对于数据的排序,如果没有某种特殊的要求,我们最好给数据排下序,当然,如果展示的时间趋势的话就没法排序了。

    饼图

    饼图大部分得的时候是展示部分和总体的关系,不过饼图有个缺点就是,当部分特别繁多的时候就不能用来展示了,因为界面效果会特别差;常用的两种方式是饼状和环状两种。饼状的直接展示各个部分于总体的关系,而环状的保留饼状的样式,中间部分可以展示突出的数据。饼图在一般的展示情况大多数人为了展示一个百分比这个数不管有多少个部分都是去用饼图,然而饼图一般用情况下部分五六个为佳,当多个部分的时候,很多数据没法展示出来,也就是掩盖了部分的信息,有时候我们需要对比两个总体的结构,大部分人都会选择去用两个饼图去比较,然后这个效果不太好,所以一般要比较结构的差异的话最好不要使用多个饼图去展示,最好使用堆叠柱状图去比较两个总体的差异,还有展示的时候部分最好经过大到小的排序。

    折线图

    折现图大部分情况下都是去展示连续的数据类型,常用是时间趋势,它可以很好的展示趋势,累积,减少以及变化;在设计上,纵坐标最好是能从0开始,因为这样避免有些地方让人误读,展示线条上我们最好能够选择实心的线条,不要用虚线或者点去表示线,这样情况下看着看着容易分析,一张折现图的线三四条为佳,过多的线只会让观察某条线的时候看错了,如果要展示多条,可以在下一张图上去展示,如果你要展示的数据是多个部分的话,这些部分的数据最好能有一个共同趋势,不然有升又降趋势让人看不知所措。还有一个细节的地方,就是加图例的时候最好折线末尾那时候加,对应的折线加对应的图例,方便人读懂你的折线。

    散点图

    散点图做研究的时候用的比较多,因为散点图大部分情况是用来探究两个部分的关系的时候用的,就先做相关分析的时候要用散点图观察一下是否有相关关系;设计上改注意的和上面的图一样,纵坐标最好能从0开始,当想要展示多种关系的话的,我们可以利用点的大小和颜色去探究,在有某种趋势关系下我们最好加个辅助的线,方便别人看出相关性;

    气泡图

    气泡图有点类似于加了大小的散点图,气泡图还可以在展示地域数据的可视化,在设计上我们需要注意的是,气泡的尺寸我们需要去注意,例如我们在展示数据的大小比例最好面积的比例一样,不要用半径,如果用半径的话就是1:4了,大小差异就过大了,气泡的形状上最好使用老老实实的圆最好,不要用一些奇怪的图像。

    热点地图

    怎么说呢,我觉得热点地图的展示是很考验人的技能,第一个热点地图要展示的数据与地域关系差异较大类型的数据才能体现出它的价值,也就是说有背景故事或者价值去让我们发现的数据,热点地图主要是通过强烈的色彩对比去体现数据的差异,有个缺点就是没法很具体的表达数据之间差距而不是差异。在设计上,我推荐色彩最好是一种色调,通过颜色的深浅去反映数据的强度,如果色彩过于繁多,对于读者来说读这张图是个负担,也无法体现出数据之间的差异,轮廓最好简单即可,毕竟简约美嘛,上色的时候会有一个叫色阶的东西,这时候什么数据范围位于哪个色阶最好分清楚,最好能体现出差异,不要全部都是一个色阶,不然热点地图就是去了它的意义了。

    上面说的是对于图表的理解,下面说下对常用的展示方式的一些理解;

    尺寸:就是用柱形的长短,饼图的大小这类去展示,这可能是我们大家最为常用的一种方式去展示数据,当展示两个对象的数据的时候,我们可以通过尺寸马上的发现了两个对象之间的差异,在展示的精准读上也有些不同,个人人为点的精度大于线条大于面的精度。

    色彩:色彩是用来展示大数据的非常好的方式,因为大数据之间会有不少的差异,颜色恰恰是展示这些差异最好的方式,毕竟我们人天生对色差明感,在色阶的选取上我觉得最好能够有明显的差异。

    位置:差不多就是我们所说的地图了,这是基于位置的可视化方式,一般我们都用于展示于位置较强关系的数据类型

    网络:这个展示数据点之间的关系,例如就像社交网络,就是用这样的展示去表达人与人之间的相关关系。

    时间:展示趋势用的最多,主要是想了解对象的发展和变化规律,让我们了解对象整个发展脉络。

    那么成功的可视化是怎么样子的呢?

    借用《数据可视化之美》的话来说,成功的可视化总共有四点,第一点是新颖,大家都知道,数据可视化就是了简单明了的了解数据,不过你用一个全新的角度去诠释你的数据,让读者读懂了你的信息又能从更高的角度去解读这些信息;第二点信息要充实,充实不代表越多越好,因为一个图表展示的信息过多,会让读者成为一种累赘,很难读懂你的想法,充实的信息就表明你的图表能够能到他们想要的信息又不造成信息过多的情况,所以我们就要考虑业务应用场景了,什么样的场景需要用那些信息结合那些是多余的需要去判断,第三点高效,也就是我们所说的简单明了,一眼就能知道数据中的信息,所以我们在可视化过程中一定要把一些也主题不相关的因素排除掉,过多不相关的因素存在只会增加读者的阅读时间和难度;第四点美感,图片的布局,色彩,形状等一系列的组成部分都是相当和谐的。

    那么我们如何设计成功的可视化图表呢?

    首先学习这个步骤肯定是少不了的,怎么去学习,当然是去学习一些经典的可视化图片,学习它是如何去构造这张图的,色彩为何要这样的去运用等,还要学习一些可视化的语言或者软件,例如像R语言,它的有强大的包,ggplot2,newwordk,ggmaps(地图)等之类强大的包可以去学习,不然你会设计也不会操作那也是空有一身力气,然后理解数据意义和你想要表达的信息,然后遵从图表的一些设计规范,在规范的基础在进行一些自己的想法。

    参考文献:

    《数据可视化之美》

    《数据可视化设计指南:图表设计》

    本文作者:天善智能社区 夏尔康,通晓各种统计学习方法,熟练使用R语言建模,结合帅气与才智的不明吃瓜群众。

  • ?

    谈谈对数据分析师岗位的感想!

    胡来

    展开

    在对数据分析岗位进行整理与研究时,通过对于这些岗位的企业性质、从事数据分析岗位职责、岗位要求及薪资待遇进行研究。我们对于未来的数据分析这个职业充满了希望,但是也对于这个职业二极分化充满了担忧。

    一、数据分析职业概述

    越来越多的企业将选择拥有项目数据分析师资质的专业人士为他们的项目做出科学、合理的分析,以便正确决策项目;越来越多的风险投资机构把项目数据分析师所出具的项目数据分析报告作为其判断项目是否可行及是否值得投资的重要依据;越来越多的企业把项目数据分析师课程作为其中高管理层及决策层培训计划的重要内容;越来越多的有志之士把项目数据分析师培训内容作为其职业生涯发展中必备的知识体系,数据分析这个职业应运而生,毫不夸张的说,数据分析师带给企业的不仅仅是一个个数据报告,更是一桶桶黄金,一片片亟待探索的蓝海。

    二、数据分析职业现状分析

    这个职位目前呈现是二八原则,好的数据分析师的收入是非常高,差不多平均水平在13k左右,但是处境不好的数据分析人员只能拿到跟内勤同等收入的水平。比如数据分析招聘中,185号岗位,这是一家公司需要大量招聘初级的数据分析师进行长期的培养广告公司;高级数据分析师在全国的范围内来说还是很少一个群体,主要承担对于某个数据分析项目进行建模与分析及算法研究等,这批人员一般的薪资待遇在16K以上,大多数在互联网与金融行业等利润率比较高的行业,数据分析招聘中,199号岗位,该岗位是杭州大型电商公司为其呼叫中心招聘数据分析师,待遇在P7左右,也就20-22K/月,还有盛大招聘数据分析师岗位也其实有很有代表性;最高端是一些互联网数据分析部门的管理层与数据科学家,一般是大型公司对于某个项目进行数据挖掘研究,全国也只有微软与阿里及一些从事数据挖掘公司里有这些数据科学家,一般的待遇差不多在50万以上年薪,这个大家可以关注一些互联网公司的招聘信息。

    三、数据分析师的能力标准

    格局是决定一个数据分析师的能力标准,一个好的数据分析师应该从行业的层面来分析公司现在所处的位置以及整个行业的分析,而且通过内外的数据得出富有逻辑性的结论,然后从这些结论中提供公司战略层面思考的策略,当然我也明白现在我们很多的分析师朋友都在沉浸在业务或者项目分析中,但是我认为格局观是决定一个数据分析师的能力标准。

    数据分析师要做到基于内部与外部的数据结合通过严密的完整商业思考及严密逻辑推理,得出针对业务好坏的结论,并得出业务改进的策略。

    什么内部与外部的数据的结合,我们即要看内部的数据还要结合行业的数据,而商业思考是做数据分析师通用的技能,那么结论是基本产出物,策略是分析师高级产出物。

    四、数据分析师的三类素质

    第一类是基本素质,第二类是通用技能,第三类是专业技能。

    基本素质包括:1、聪明与好奇心;2、愿意学习并愿意能沉下心来付出;3、耐心与专注。

    通用技能是核心思考能与展现自己的能力,第一点,结构化的思考能力与逻辑推理能力即智商不能差,如果是这样你看到的越多就做的越好,怎么来判断呢?第二点,良好商业感觉与商业判断能力;第三点,要有宏观思考能力,你要看到的格局要到;第四点,要有良好沟通能力。

    专业能力从专业上要有基本统计学知识,从能力上要包括扎实数据分析能力与数据处理能力包括SAS\R\SPSS及tableau、FineBI等可视化表达的能力。那么高级数据分析师,我们应该更看中基本素质与通用能力,如果专业操作类分析师那么我们需要基本素质与专业技能。

    五、企业要求及需备的知识点

    大多数的互联网行业特别是电商行业对于数据分析师这块还是比较看重,主要的原因其主要的资产除了产品、人员就是长期积累的数据而这些海量的数据已经不能用人工经验来还原业务,这就需要数据分析师对于数据进行归纳与还原商业规则与逻辑,一般主要涉及商业分析、用户分析、产品分析、运唯支撑等这几块;从各家公司招聘信息来看,要求几乎雷同,同时也说明这个职业的互通性很强,说白了就是换个行业都可以在职场上存活下来;一般需要以下几个要求:

    1、数据分析经验;

    2、商业数据敏感度;

    3、基本工具(SAS、SPSS、SQL、EXECEL等);

    4、建模;

    5、知识点(统计学、会编程);

    六、如何获得数据分析知识点?

    1、数据分析经验,大家可以每天浏览我们西线学院官网的文章,我们每天都会发布一些最新的分析实战文章;

    2、基本工具类,我们西线学院帮助学员从零基础学会数据分析工具编程,丰富的知识扩展,实用性强,不掺杂无用讲解,只为给学员最极致的教学体验!

  • ?

    干货 | 这是一份完整的大数据处理技术总结与分析

    沈飞莲

    展开

    一 数据分析处理需求分类

    1 事务型处理

    在我们实际生活中,事务型数据处理需求非常常见,例如:淘宝网站交易系统、12306网站火车票交易系统、超市POS系统等都属于事务型数据处理系统。

    这类系统数据处理特点包括以下几点:

    一是事务处理型操作都是细粒度操作,每次事务处理涉及数据量都很小。

    二是计算相对简单,一般只有少数几步操作组成,比如修改某行的某列;

    三是事务型处理操作涉及数据的增、删、改、查,对事务完整性和数据一致性要求非常高。

    四是事务性操作都是实时交互式操作,至少能在几秒内执行完成;

    五是基于以上特点,索引是支撑事务型处理一个非常重要的技术。

    在数据量和并发交易量不大情况下,一般依托单机版关系型数据库,例如ORACLE、MYSQL、SQLSERVER,再加数据复制(DataGurad、 RMAN、MySQL数据复制等)等高可用措施即可满足业务需求。

    在数据量和并发交易量增加情况下,一般可以采用ORALCE RAC集群方式或者是通过硬件升级(采用小型机、大型机等,如银行系统、运营商计费系统、证卷系统)来支撑。

    事务型操作在淘宝、12306等互联网企业中,由于数据量大、访问并发量高,必然采用分布式技术来应对,这样就带来了分布式事务处理问题,而分布式事务处理很难做到高效,因此一般采用根据业务应用特点来开发专用的系统来解决本问题。

    2 数据统计分析

    数据统计主要是被各类企业通过分析自己的销售记录等企业日常的运营数据,以辅助企业管理层来进行运营决策。典型的使用场景有:周报表、月报表等固定时间提供给领导的各类统计报表;市场营销部门,通过各种维度组合进行统计分析,以制定相应的营销策略等。

    数据统计分析特点包括以下几点:

    一是数据统计一般涉及大量数据的聚合运算,每次统计涉及数据量会比较大。

    二是数据统计分析计算相对复杂,例如会涉及大量goupby、 子查询、嵌套查询、窗口函数、聚合函数、排序等;有些复杂统计可能需要编写SQL脚本才能实现。

    三是数据统计分析实时性相对没有事务型操作要求高。但除固定报表外,目前越来越多的用户希望能做做到交互式实时统计;

    传统的数据统计分析主要采用基于MPP并行数据库的数据仓库技术。主要采用维度模型,通过预计算等方法,把数据整理成适合统计分析的结构来实现高性能的数据统计分析,以支持可以通过下钻和上卷操作,实现各种维度组合以及各种粒度的统计分析。

    另外目前在数据统计分析领域,为了满足交互式统计分析需求,基于内存计算的数据库仓库系统也成为一个发展趋势,例如SAP的HANA平台。

    3 数据挖掘

    数据挖掘主要是根据商业目标,采用数据挖掘算法自动从海量数据中发现隐含在海量数据中的规律和知识。

    数据挖掘主要过程是:根据分析挖掘目标,从数据库中把数据提取出来,然后经过ETL组织成适合分析挖掘算法使用宽表,然后利用数据挖掘软件进行挖掘。传统的数据挖掘软件,一般只能支持在单机上进行小规模数据处理,受此限制传统数据分析挖掘一般会采用抽样方式来减少数据分析规模。

    数据挖掘的计算复杂度和灵活度远远超过前两类需求。一是由于数据挖掘问题开放性,导致数据挖掘会涉及大量衍生变量计算,衍生变量多变导致数据预处理计算复杂性;二是很多数据挖掘算法本身就比较复杂,计算量就很大,特别是大量机器学习算法,都是迭代计算,需要通过多次迭代来求最优解,例如K-means聚类算法、PageRank算法等。

    因此总体来讲,数据分析挖掘的特点是:

    1、数据挖掘的整个计算更复杂,一般是由多个步骤组成计算流,多个计算步骤之间存在数据交换,也就是会产生大量中间结果,难以用一条sql语句来表达。

    2、计算应该能够非常灵活表达,很多需要利用高级语言编程实现。

    二 大数据背景下事务型处理系统相关技术

    在google、facebook、taobao等大互联网公司出现之后,这些公司注册和在线用户数量都非长大,因此该公司交易系统需要解决“海量数据+高并发+数据一致性+高可用性”的问题。

    为了解决该问题,从目前资料来看,其实没有一个通用的解决方案,各大公司都会根据自己业务特点定制开发相应的系统,但是常用的思路主要包括以下几点:

    (1)数据库分片,结合业务和数据特点将数据分布在多台机器上。

    (2)利用缓存等机制,尽量利用内存,解决高并发时遇到的随机IO效率问题。

    (3)结合数据复制等技术实现读写分离,以及提高系统可用性。

    (4)大量采用异步处理机制,对应高并发冲击。

    (5)根据实际业务需求,尽量避免分布式事务。

    1相关系统介绍

    1) 阿里CORBAR系统

    阿里COBAR系统是一个基于MYSQL数据库的分布式数据库系统,属于基于分布式数据库中间件的分布式数据库系统。该系统是前身是陈思儒开发的“变形虫”系统(以前调研过),由于陈思儒离开阿里去了盛大,阿里当心“变形虫”稳定性等问题,重新开发该项目。

    该系统主要采用数据库分片思路,实现了:数据拆分、读写分离、复制等功能。由于此系统由于只需要满足事务型操作即可,因此相对真正并行数据库集群(例如TeraData等),此类系统提供操作没有也不需要提供一些复杂跨库处理,因此该系统存在以下限制:

    (1)不支持跨库的join、分页、排序、子查询。

    (2)insert等变更语句必须包括拆分字段等。

    (3)应该不支持跨机事务(以前变形虫不支持)。

    说白了此类系统不具备并行计算能力,基本上相当于数据库路由器!

    另外此类系统的在实际应用的关键问题是,根据什么对数据进行切分,因为切分不好会导致分布式的事务问题。

    2) 阿里OceanBase系统

    该系统也是淘宝为了解决高并发、大数据环境下事务型处理而定制开发的一个系统。该系统主要思路和特点如下:

    (1)他们发现在实际生成环境中,每天更新的数据只占总体数据的1%不到,因此他们把数据分为:基线数据和增量更新数据。

    (2)基线数据是静态数据,采用分布式存储方式进行存储。

    (3)只在一台服务器上存储和处理增量更新数据,并且是在内存中存储和处理更新数据。

    (4)在系统负载轻的时候,把增量更新批量合并到基线数据中。

    (5)数据访问时同时访问基线数据和增量更新数据并合并。

    因此这样好处是:

    (1)读事务和写事务分离

    (2)通过牺牲一点扩展性(写是一个单点),来避免分布式事务处理。

    说明:该系统虽然能处理高并发的事务型处理,号称很牛逼,但其实也只是根据电商的事务处理来定制开发的专用系统,个人认为其技术难度小于oracle等通用型的数据库。该系统无法应用到银行或者12306等,因为其事务处理的逻辑远远比电商商品买卖处理逻辑复杂。

    在目前的大数据时代,一定是基于应用定制才能找到好的解决方案!

    3) 基于Hbase的交易系统

    在hadoop平台下,HBASE数据库是一个分布式KV数据库,属于实时数据库范畴。支付宝目前支付记录就是存储在HBASE数据库中。

    HBASE数据库接口是非SQL接口,而是KV操作接口(基于Key的访问和基于key范围的scan操作),因此HBASE数据库虽然可扩展性非常好,但是由于其接口限制导致该数据库能支持上层应用很窄。基于HBASE应用的设计中,关键点是key的设计,要根据需要支持的应用来设计key的组成。

    可以认为HBASE数据库只支持作为KEY的这一列的索引。虽然目前HBASE有支持二级索引的方案,二级索引维护将会比较麻烦。

    2并发和并行区别

    并发是指同时执行通常不相关的各种任务,例如交易型系统典型属于高并发系统。

    并行是通过将一个很大的计算任务,划分为多个小的计算任务,然后多个小计算任务的并行执行,来缩短该计算任务计算时间。

    两者主要区别在于:

    (1)通讯与协调方面:在并行计算中,由于多个小任务同属一个大的计算任务,因此小任务之间存在依赖关系,小任务之间需要大量通讯和协调;相反,并发中的多个任务之间基本相互独立,任务与任务之间相关性很小。

    (2)容错处理方面:由于并发任务之间相互独立,某个任务执行失败并不会影响其它的任务。但是并行计算中的多个任务属于一个大任务,因此某个子任务的失败,如果不能恢复(粗粒度容错与细粒度容错),则整个任务都会失败。

    3本章总结

    数据量大不一定需要并行计算,虽然数据量大,数据是分布存储,但是如果每次操作基本上还是针对少量数据,因此每次操作基本上都是在一台服务器上完成,不涉及并行计算。只是需要通过数据复制、数据缓存、异步处理等方式来支撑高并发访问量

    三 大数据背景下数据统计分析技术介绍

    随数据量变大,和事务处理不同的是,单个统计分析涉及数据量会非常大,单个统计分析任务涉及数据会分散在多台服务器上,且由于计算量大,采用单台服务器进行计算,会导致计算时间非常长,单个统计分析任务必须采用并行计算方式来加快单个统计分析任务执行速度。

    1并行查询与并行计算技术介绍

    在大数据背景下的数据统计分析技术门类很多,常见的有:

    n MPP并行数据库 : TeraData、GreenPlum、Vertica等。

    n 基于MapReduce并行计算框架的数据仓库:

    HIVE(Hadoop平台) 、Tenzing(Google公司)

    n 基于Hbase的Phoenix系统

    n HadoopDB系统

    n EMC公司的hapt系统

    n MPP分布式查询引擎: Dremel、Impala、Presto、Shard query、Citusdb。

    n 基于SPARK的Shark、基于Dryad的SCOPE、基于Tez的stinger。

    n 基于hadoop+index的JethroData系统

    n 基于内存计算的Druid系统

    这些系统都解决了海量数据下的数据统计分析的问题,并且这些系统另外一个共同特点是都提供了SQL或者类SQL接口。

    为了能够较好研究这些系统,我们需要对并行查询与并行计算的相关技术做一个简要的介绍。

    首先所有的系统都可以分为三个层次: 语义层、并行计算引擎层、分布式存储层。语义层提供一个编程接口让用户表达所需要计算,并负责把该计算翻译成底层并行计算引擎可以执行的执行计划,并由并行计算引擎来执行,最下面一层是分布式存储层。

    对于提供类SQL接口并行计算系统,语义层可以认为是SQL解析层。

    1) 语义层

    SQL语言是一种声名式语言,SQL只是表达了要做什么,而没有表达怎么做。为此,SQL解析层主要作用是:将用户提交的基于SQL的统计分析请求,转化为底层计算引擎层可以执行的执行计划。也就是解决“怎么做”的问题。

    SQL解析层工作主要包括两个大方面:

    (1) 通过语法分析技术来理解要做什么。在关系数据库中,一般会把SQL语言分析后,形成树型结构的执行计划。

    (2) 在语法分析技术上,利用各种优化技术和算法,找出一种最经济物理执行计划。

    优化可以分为两个方面:一是逻辑层面优化、二是物理执行层面优化。

    (1) 逻辑层优化

    逻辑层面个人认为主要是因为同样表达一个分析请求,有的人SQL写的好,有的人SQL写的烂,因此在逻辑层面可以通过一些等价关系代数变换,实现查询重写,将写的比较烂的sql变换为好的写法。

    比较典型优化是:“把投影和过滤下沉,先执行过滤和投影操作”,减少中间结果。

    (2) 物理层优化

    物理层面优化是在逻辑优化后,结合实际物理执行过程,找出最优的物理执行计划。生成物理查询计划的工作包括:

    ü 增加一些操作符: 包括扫描和排序等。

    ü 确定各个操作符实现算法。例如扫描是全表扫描还是利用索引;Join是采用HASH连接、索引连接、合并排序等实现算法中的那一种。

    ü 确定操作符之间的数据流转方法:物化还是流水线方式。

    ü 采用基于代价估算方法确定最优的物理执行计划,目前代价估算主要是以估算该物理计划需要的IO量。另外对于并行数据库,则还要考虑通讯代价,即尽量减少数据在各个机器之间的传递。

    在物理层优化的代价估算过程中,代价估算需要依靠很多统计信息,如表有多大,表中相关列的值分布是什么样子等。传统数据库在数据Load过程中会事先计算好这些统计信息。并行计算中还需要考虑通讯代价。

    需要指出是,由于imapla、Presto、HIVE等系统只是一个查询引擎,它们可以直接查询以普通文件方式存储在HDFS系统上的文件,因此这些系统一般无法使用索引和各种统计信息来进行物理执行计划的优化,这些系统一般只能在逻辑层进行一些基于规则静态优化。根据SHARK论文,SHARK系统支持根据前面一些节点计算获得的信息,来动态优化后面执行计划。

    (3) 物化与流水线执行方法

    一条SQL语句对开发人员而言,感觉只是一次调用,但是实际上在数据库内部,一条SQL语句执行其实是有多个操作符组合而成的的树型结构计算流。如下图:

    针对该计算流有两种执行方式:一是基于物化或者是实体化执行方式,另外一种是基于数据流的执行方式。

    第一种方法的过程是: 把各个操作运算排序,并把每个操作运算的输出的中间结果存储在磁盘上,直到被另外一个操作运算所...

  • ?

    十种常用的数据分析方法

    冰咖啡

    展开

    道家强调四个字,叫“道、法、术、器”。

    层次区别:

    “器”是指物品或工具,在数据分析领域指的就是数据分析的产品或工具,“工欲善其事,必先利其器”;

    “术”是指操作技术,是技能的高低、效率的高下,如对分析工具使用的技术(比如用Excel进行数据分析的水平);

    “法”是指选择的方法,有句话说“选择比努力重要”;

    “道”是指方向,是指导思想,是战略。

    在数据分析和产品、运营优化方面,数据分析方法是其核心,属于“法”和“术”的层次。

    那么如何做好数据分析呢,今天我们来讲讲互联网运营中的十大数据分析方法。

    01 细分分析

    细分分析是分析的基础,单一维度下的指标数据的信息价值很低。

    细分方法可以分为两类, 一类逐步分析, 比如:来北京市的访客可分为朝阳,海淀等区; 另一类是维度交叉, 如:来自付费SEM的新访客。

    细分用于解决所有问题。

    比如漏斗转化,实际上就是把转化过程按照步骤进行细分,流量渠道的分析和评估也需要大量用到细分的方法。

    02 对比分析

    对比分析主要是指将两个相互联系的指标数据进行比较,从数量上展示和说明研究对象的规模大小,水平高低,速度快慢等相对数值, 通过相同维度下的指标对比,可以发现,找出业务在不同阶段的问题。

    常见的对比方法包括: 时间对比,空间对比,标准对比。

    时间对比有三种: 同比,环比,定基比。

    例如: 本周和上周进行对比就是环比;本月第一周和上月第一周对比就是同比;所有数据同今年的第一周对比则为定基比。通过三种方式,可以分析业务增长水平,速度等信息。

    03 漏斗分析

    转化漏斗分析是业务分析的基本模型, 最常见的是把最终的转化设置为某种目的的实现,最典型的就是完成交易。但也可以是其他任何目的的实现,比如一次使用app的时间超过10分钟。

    漏斗帮助我们解决两方面的问题:

    在一个过程中是否发生泄漏,如果有泄漏,我们能在漏斗中看到,并且能够通过进一步的分析堵住这个泄漏点。

    在一个过程中是否出现了其他不应该出现的过程,造成转化主进程收到损害。

    04 同期群分析

    同期群(cohort)分析在数据运营领域十分重要,互联网运营特别需要仔细洞察留存情况。 通过对性质完全一样的可对比群体的留存情况的比较,来分析哪些因素影响用户的留存。

    同期群分析深受欢迎的重要原因是十分简单,但却十分直观。 同期群只用简单的一个图表,直接描述了用户在一段时间周期(甚至是整个LTV)的留存或流失变化情况。

    以前留存分析只要用户有回访即定义为留存,这会导致留存指标虚高。

    05 聚类分析

    聚类分析具有简单,直观的特征, 网站分析中的聚类主要分为:用户,页面或内容,来源。

    用户聚类主要体现为用户分群,用户标签法;页面聚类则主要是相似,相关页面分组法;来源聚类主要包括渠道,关键词等。

    例如: 在页面分析中,经常存在带?参数的页面。 比如: 资讯详情页面,商品页面等,都属于同一类页面。简单的分析容易造成跳出率,退出率等指标不准确的问题,通过聚类分析可以获取同类页面的准确数据用于分析场景。

    06 AB测试

    增长黑客的一个主要思想之一,是不要做一个大而全的东西,而是不断做出能够快速验证的小而精的东西。 快速验证,那如何验证呢?主要方法就是AB测试。

    比如: 你发现漏斗转化中中间有漏洞,假设一定是商品价格问题导致了流失,你看到了问题-漏斗,也想出了主意-改变定价。但主意是否正确,要看真实的用户反应,于是采用AB测试,一部分用户还是看到老价格,一部分用户看到新价格,若你的主意真的管用,新价格就应该有更好的转化,若真如此,新价格就应该确定下来,如此反复优化。

    07 埋点分析

    只有采集了足够的基础数据,才能通过各种分析方法得到需要的分析结果。

    通过分析用户行为,并细分为:浏览行为,轻度交互,重度交互,交易行为,对于浏览行为和轻度交互行为的点击按钮等事件,因其使用频繁,数据简单,采用无埋点技术实现自助埋点,即可以提高数据分析的实效性,需要的数据可立即提取,又大量减少技术人员的工作量,需要采集更丰富信息的行为。

    如: 重度交互(注册,邀请好友等)和交易事件(加购物车,下订单等)则通过SDK批量埋点的方式来实施。

    08 来源分析

    流量红利消失,我们对获客来源的重视度极高,如何有效的标注用户来源,至关重要。

    传统分析工具,渠道分析仅有单一维度,要深入分析不同渠道不同阶段效果,SEM付费搜索等来源渠道和用户所在地区进行交叉分析,得出不同区域的获客详细信息,维度越细,分析结果也越有价值。

    09 用户分析

    用户分析是互联网运营的核心, 常用的分析方法包括:活跃分析,留存分析,用户分群,用户画像,用户细查等。

    可将用户活跃细分为浏览活跃,互动活跃,交易活跃等,通过活跃行为的细分,掌握关键行为指标;通过用户行为事件序列,用户属性进行分群,观察分群用户的访问,浏览,注册,互动,交易等行为,从而真正把握不同用户类型的特点,提供有针对性的产品和服务。

    用户画像基于自动标签系统将用户完整的画像描绘清晰,更有力的支撑运营决策。

    10 表单分析

    填写表单是每个平台与用户交互的必备环节,优秀的表单设计,对转化率的提升起到重要作用。

    用户从进入表单页面之时起,就产生了微漏斗,从进入总人数到最终完成并成功提交表单人数,这个过程之中,有多少人开始填写表单,填写表单时,遇到了什么困难导致无法完成表单,都影响最终的转化效果。

    以上是常见的数据分析方法,更多应用方法需要根据业务场景灵活应用。

  • ?

    什么是数据分析?数据分析的作用是什么?

    Wilma

    展开

    1.什么是数据分析?

    数据分析的目的是把隐藏在一些看似杂乱无章的数据背后的信息提炼出来,总结出所研究对象的内在规律。在实际工作中,数据分析能够帮助管理者进行判断和决策,以便采取适当策略与行动。比如:企业的高管希望通过市场分析和研究,把握当前产品的市场动向,从而制定合理的产品研发和销售计划,这就必须依赖数据分析才能够完成。

    简单的说,就是对数据进行分析,比较专业的说法是,数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,未提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。以求最大化地开发数据的功能,发挥数据的作用。

    数据分析包含“数据”和“分析”两个方面一方面包括加工和整理数据,另一方面也包括分析数据,从中提取有价值的信息并形成对业务有帮助的结论。

    数据分析的成果通常以分析报告的形式呈现。对于数据分析报告,分析就是论点,数据就是论据,两者缺一不可。

    2.数据分析类别

    其中,探索性数据分析侧重于在数据中发现新的特征,而验证性数据分析则侧重于验证已有假设的真伪证明。

    数据分析的划分:描述性数据分析、探索性数据分析、验证性数据分析。

    1)描述性数据分析:属于初级数据分析,常见的分析方法有对比分析法、平均分析法、交叉分析法。

    2)探索性数据分析:侧重于再数据之中发现新的特征

    3)验证性数据分析:侧重于验证已有假设的真伪证明

    其中探索性数据分析和验证性数据分析属于高级数据分析,常见的分析方法有相关分析、因子分析、回归分析等等。

    3.数据分析的作用

    数据分析在日常企业运营中主要有三大作用:

    1.现状分析

    简单的说就是告诉你过去发生了什么。

    具体表现在:

    第一,告诉你企业现阶段的整体运营情况,通过各个经营指标的完成情况来衡量企业的运营状态,以说明企业整体运营是更好了还是坏了,好的程度是如何,坏的程度又到哪里。

    第二,告诉你企业各项业务的构成,让你了解企业各项业务的发展及变动情况,对企业经营状况有更深入的了解。

    现状分析一般通过日常通报来完成,如日报、周报、月报等形式。

    2.原因分析

    简单的说就是告诉你某一现状为什么发生。经过第一阶段的现状分析,我们对企业的运营情况有了一个基本的了解,但是不知道运营情况具体好在哪里,差在哪里,是什么原因引起的。这时候我们就需要开展原因分析,以进一步确定业务变动的具体原因。

    原因分析一般通过专题分析来完成,根据企业运营情况选择针对某一现状进行原因分析。

    3.预测分析

    简单来说就是告诉你将来会发生什么。

    在了解企业运营现状后,有时候还需要对企业未来发展趋势做出预测,为企业制定经营目标以及提供有效的策略参考与决策依据,以确保企业的可持续健康发展。

    预测分析一般通过专题分析来完成,通常在制定企业季度、年度等计划时进行,其开展的频率没有现状分析及原因分析高。

    什么时候开展什么样的数据分析,需要根据自身的需求及目的来确定。

    分享 IT 技术和行业经验,请关注-技术学派。

对数据分析

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP