- ?
浅谈数据分析方法论(上)
曲灵竹
展开
方法论在各种行业都是以各式各样的形式存在着的,他其实就是一个指南针,指导大方向。同样在数据分析中,如果方法论不正确或者不合理,后面的分析结果也就没必要看了,在一个不正确或不合理的方法论的指导下,得到的分析结果是不可能正确的。
数据分析方法论和数据分析法
数据分析方法论主要用来指导数据分析师进行一次完整的数据分析,它更多的是指数据分析思路,比如主要从哪几个方面来开展数据分析?各方面包含什么内容和指标。所以数据分析方法论是从宏观的角度指导如何进行数据分析,它就像是一个数据分析的前期规划,指导着后期数据分析工作的开展。而数据分析法是指具体的分析方法,如:对比分析、交叉分析、相关分析等数据分析方法。数据分析法主要从微观角度指导如何进行数据分析。
作用?
很多人在做数据分析时,经常不知道从哪方面入手进行分析的情况,分析内容和指标也常常被质疑是否合理、完整,而自己也说不出个所以然来。所以方法论这种东西,大部分觉得假大空的东西,其实是非常必要的,只有在营销、管理等方法和理论的指导下,结合实际业务情况,才能确保数据分析维度的完整性,分析结果的有效性和正确性。总结一下:
1、理顺分析思路,确保数据分析结构体系化
2、把问题分解成相关联的部分,并显示他们之间的关系
3、为后续数据分析的开展指引方向
4、确保分析结果的有效性及正确性
常用的数据分析方法论
1、PEST分析法
PEST分析是指宏观环境的分析,P是政治(politics),E是经济(economy),S是社会(society),T是技术(technology)。在分析一个企业所处的背景的时候,通常是通过这四个因素来进行分析企业所面临的状况。
这个分析方法在网上一搜索就有一大堆的讲解,针对互联网行业的分析,我认为就可以采取这个分析法来整理思路。比如:中国网民与中国公民在人口规模、性别比例、年龄结构、人口分布、生活方式、购买习惯、教育状况、城市特征、宗教信仰等方面是否有区别。
2、5W2H分析法
5W2H分析法作为非常容易学习和操作的方法之一,他是以五个W开头的英语单词和2个H开头的单词进行提问,从回答中发现解决问题的线索,即何因(why)、何事(what)、何人(who)、何时(when)、何地(where)、何做(how)、何价(how much),这就构成了5W2H分析法的总体框架。比如O2O的优惠营销信息给用户看,需要搞清楚,用户为什么需要这些优惠,用户的目的是什么?我们提供的优惠是什么?与用户想的是否一致?谁是我们的用户?用户有什么特征?用户喜好在哪个时间段购买?我们的营销活动应该开展在什么时候?用户在线下哪儿去消费?每个地区的线下有什么区别?用户应该怎样去享受优惠?用户去购买花费的成本是多少?我们应该投入多少成本?等等。
- ?
SPSS数据分析方法不知道如何选择
泉水
展开
一提到数学,高等数学,线性代数,概率论与数理统计,数值分析,空间解析几何这些数学课程,头疼呀。作为文科生,遇见这些课程时,通常都是各种寻求帮助,班上有位宅男数学很厉害,各种被女生‘围观’,这数学为什么这么难,学了有啥用呀。
有用的,当做数据分析的时候,使用到SPSS,在线SPSS分析的时候就知道用处了,在写论文的时候会用到SPSS数据分析,工作的时候也会用到SPSS数据分析。此时才知道原来数学很重要。我的数学不好肿么办?听我一 一道来。
1. 数据类型
学过数学的童鞋都知道,数学里面分了两类数据,离散和连续数据,听上去文绉绉的,不懂。那我问男人和女人知道不,知道,对了这种就是离散数据。身高体重知道不,知道,这种就是连续数据。离散数据可以理解为分类,类别,数个数;而连续数据理解为算平均值,度量,比如平均身高,平均年龄,但不能说成是平均性别。离散和连续数据是数学上文绉绉的称呼。如果我们是做数据分析,通常又换成另外一种称呼,定类和定量数据。定类就是离散数据,定量就是连续数据。这点get到后,数据分析方法啥都不在话下,让智能化软件SPSSAU【备注:在线网页版SPSS】这些去解决就好,默认出来智能化文字分析结果。
2. X和Y
除了数据类型外,数学上老是有一些符号,比如X,Y,Z, α, β,γ,还有好多拉丁符号,看着都头疼,而且更糟糕的是发音还那么奇怪。这些都是数学用词,如果是数据分析,只需要知道X和Y就可以。为什么这么简单呢?数据分析通常是用于业务场景,让所有人都会所有人都能懂的。而数学符号是专业性名词,一小部分学习数学专业的人群才懂。
而X,Y基本所有人都懂,平面二维式思维,如果加上Y就变成空间三维思维。这种会变得复杂难懂,而数据分析出来结果是让人理解让人懂的,越简单易懂越有意义越有用的结论越受欢迎。因此从数据分析角度来看,只需要懂X,Y这两个符号就OK。别小看X,Y这两个符号,加上上述的数据类型,它们可以产生非常多的组合,也称作分析方法。
有了X,Y,我们可以研究X和Y之间的关系情况,比如X对于Y的影响关系,X对于Y的差异关系等。下面一一讲述。
3. X和Y的组合方法
再讲组合之前,先单独讲下不区分X和Y的分析方法,如下表格:
当不需要区分不区分X和Y时,比如我只研究性别1个数据,或者只研究身高,体重情况如何等。并不需要研究关联关系,所以并不涉及X和Y的关联关系。这种都可统称为数据基本描述统计,当然数据类型不一样时,方法不同。比如性别为定类数据,这时用频数分析;身高体重是定量数据,这时用描述分析。数据的基本描述统计是最基础的数据分析方法,而且通常都需要做这类分析方法,因为了解了基本情况是非常必要的。
接下来将下X和Y之间的关联关系时,会使用到的数据研究方法;如下表格:
从上表可以看到,通常会涉及到差异关系,相关关系和影响关系共三类。比如不同性别的兴趣爱好是否有差异,性别为定类数据,兴趣爱好也是定类数据;此时就应该使用交叉卡方分析方法。比如研究性别人群体重是否有差异,性别为定类数据,体重为定量数据,此时就需要使用T检验;除此之外,如果想研究不同专业(理科、工科、文科)的体重差异时,此时应该使用方差分析。当X是定类数据,Y是定量数据,研究X对于Y的差异时,可以使用T检验和方差分析;区分在哪里呢?如果X的类别个数(比如男和女)只有2个时,通常使用T检验;如果X的类别个数超过2个(比如理科、工科和文科)时,只能使用方差分析。差异关系就只能有3种,接下来继续相关关系。
相关关系是研究X和Y的关系情况,比如身高和体重之间有没有关系;X和Y均是定量数据;此时应该使用相关关系,再具体一点应该叫Pearson相关关系(相关关系的数学公式是Pearson这人发明的)。
最后一类是影响关系;X对于Y的影响;影响关系的分析方法区分,完全是根据Y的类别而定;比如Y是定量数据,我们则应该使用线性回归分析;如果Y为定类数据,此时我们应该使用Logit回归分析,而具体再细分,Logit回归可以有:二元Logit回归,多分类Logit回归,区分在于Y,举例如下表:
如果X影响Y时,Y只分为两类,购买和不购买,愿意和不愿意,是和否等,这时候就需要使用二元Logit回归分析;如果Y分为n类(n>2)时,则需要使用多分类Logit回归。
数据类型,X和Y;这两点搞明白后,绝大多数的数据研究方法都可以搞定,而这也是当前数学研究的核心思想。也是分析软件的设计理念,网页在线版本的SPSS即SPSSAU软件平台,它的设计核心理念就是这样,只需要会区分数据类型,知道X和Y;就可以自己进行数据分析,其它的全部都可以直接由SPSSAU生成智能化文字结果;当然,分析方法还有很多的,比如因子分析,聚类分析等,这些方法不是研究X和Y的关联性,而是别有用处。
4. 其它研究方法
除开X与Y的关联关系研究,其实还有一些其它的研究方法;比如对于很多个X同时进行分析应该使用什么方法呢?此时可能会结合分析用处而对应不同的方法;常见有因子分析和聚类分析两种,如下表:
如果说了30句话,现在想把30句话概括浓缩成5个关键词,这种就叫浓缩;此时需要使用因子分析;如果有300个人想进行分类,分成3类人群,此时可使用聚类分析(常见是K-means聚类方法)。
除了浓缩和聚类,事实还有非常多其它的研究方法,比如信度研究,多因素方差,非参数检验,正态性检验,配对T检验等等。后续慢慢再谈,更多知识也可使用网页版SPSS即SPSSAU【备注:在线网页版SPSS】进行学习,里面智能化分析结果一目了然,‘拖拽点一下’完成分析得到智能化结果,更多研究方法的详述也可直接查到。
- ?
数据分析:统计学与概率论的教学思考,看完长见识了!
格子
展开
为了在教学方面自我完善,自我提高,更好的服务于教学工作,结合自己的教学实践浅谈一些自己的心得: 一、统计与概率的内涵的进一步认识 数据能够帮助我们认识世界、做出决策和预测,而统计正是与数据打交道的科学,它是在人们对现实生活中数据资料的收集、整理、分析的过程中发展起来的。 (1)紧密联系学生生活实际,创设情境。有了这样的情感学生学起数学知识来当然是事半功倍了。例如:“分苹果”的情境创设,动手操作,激发了学生提出问题,解决问题的欲望,让学生在情境中感受、理解数学问题。再如:圆的周长收集整理的实际测量,也练习了学生的动手操作。 (2)在课堂上让学生充分交流讨论。在民主、和谐的氛围中开拓思维,积极参与,充分合作。教师适时地参与到学生的讨论和交流当中,较好地扮演了组织者、参与者、合作者的角色。 (3)运用丰富多彩的课堂教学手段。随着科技的进步和发展,我们的课堂也要跟上时代的潮流改变传统的一支粉笔进课堂,这两节数学课让我增长了很多见识,随着一个个课件的展示,本来很难理解的数学难题变得形象、具体,一个个教学难点也随之被攻破。课堂也显得生动活泼了很多。如果有条件我们也要丰富我们的课堂,提高课堂的教学效率。
(4)引用《不列颠百科全书》对统计学的一个定义。《不列颠百科全书》对统计学的一个定义:“统计学是关于收集和分析数据的科学和艺术”。我认为定义中有三个比较关键的核心词,第一个是数据。“数据”和“数”的最重要的区别是数据是具有实际背景的,而“数”则并不一定。从这个意义上我们就可以理解了为什么说可以把“统计”从过去我们认为的“数的运算”中单独出来,成为一个相对独立的学习领域,统计主要作用正是通过数据处理来提取信息从而帮助人们进行决策。进一步,“随着信息高速的增长,我们需要进一步扩大对数据的认识。事实上,现在的数据不仅仅是数,其实图像也可以看成是数据、语句也可以看成是数据。只要蕴含着一定信息的,无论是什么表现形式,都可以看作是数据”。 二、教学当中概念的处理方法 在教学中,我们应该首先注重学生统计观念的形成与培养。能从统计的角度思考与数据信息有关的问题;能通过收集数据、描述数据、分析数据的过程,作出合理的决策,认识到统计对决策的作用;能对数据的来源、处理数据的方法以及由此得到的结论进行合理的质疑。收集整理养出来的感觉,统计学习要培养学生能自觉地想到运用统计的方法解决有关的问题。学生没有经历数据的收集过程,随机的数据对他们来说还是确定的,学生也就根本无从体会统计思想方法的价值。因此必须创设原始的随机情境,突出活动性,让学生亲身面对实际问题,亲自调查、收集数据,先体会随机数据的不确定、杂乱无章,然后组织学生经历数据的分类整理,凸现随机数据的特点。在这样的教学情形下,学生才深深地领悟到统计思想确实很有用。
我们还要注重学生在概率实验中的操作体验。教学中应以学生亲身经历和体验统计过程作为主线,即对数据从收集、整理、描述到分析、运用的全过程中突出学生的主体参与,再此过程中引导学生发现并提出问题,用适当的方法收集和整理数据,用合适的图表展示数据,对数据作简单的分析并对自己的分析、思考进行交流和改进。由于处理数据没有唯一的样式,在统计过程中,不同情况下、不同的学生会用不同的方法来记录和表示数据。因此,引导学生经历数据处理过程的教学具有很强的探索性。 三、如何介绍收集和数据的分析和运用 统计处理数据的步骤主要包括:第一是要确定需要解决什么问题;第二是决定收集数据的方法并收集数据;第三是整理并尽可能清晰地描述数据;第四是分析数据,并做出决策和推断。统计学有着它科学的一面,但也有艺术的一面。对于同样的数据,由于背景和目标不同可以有多种分析的方法,需要根据问题的实际背景选择合适的方法。也就是统计的方法没有简单的理论意义上的对和错,只有好和不好。 统计在收集数据和运用数据做出推断等方面吸收了概率的主要成果和主要方法,产生了以抽样为特征的数学与概率论的统计学。数理统计学是运用统计的方法来研究随机现象、从而描述随机现象总体趋势的数学模型,它不会把注意力停留在个别的现象特征上,而是了解大量随机现象的总体的变化趋势,并由此得出随机现象的基本统计规律,进而得到关于社会发展、科学发现的统计预测。
最后,我们再概括地分析一下统计与概率的关系。实际上,众所周知,统计与概率都是研究随机现象的学科。“不论怎么说,机遇(或说偶然性)无所不在,机遇伴随着人的一生(当然随人的情况而有异),这是一个无法回避的现实”。统计与概率正是从不同的角度来研究怎样更好的刻画随机现象,统计主要侧重于从数据来刻画随机,概率则主要侧重于建立理论模型来刻画随机。另一方面,概率为统计提供了理论基础。在运用样本估计总体的过程中,抽样的合理性、样本推断总体的合理性,包括犯错误的风险,都需要概率的知识来提供科学依据(这在下文还要论述)。“‘机遇(机会)的数学’,它包含数学中的两个学科分支——概率论和数理统计学。概括来说就是,前者属于机遇数量化的理论基础。而后者则是其应用。” 四、统计与概率课程的教育价值 由上一段内容我们可以看出,统计的关键是客观地提炼和表述现实世界中广泛存在的随机信息,准确地分析并把握随机信息中的关键因素的规律性,科学地应用数据并做出正确决策是统计与概率的主要任务,而这也构成了大学阶段学习统计与概率的重要原因。具体来说,学习统计与概率的主要目的是让学生适应现代社会的需要;帮助学生形成和运用数据进行推断的思考方式;有助于学生朝着数学思考、解决问题、情感态度等多方面的发展。/
在以信息和技术为基础的现代社会里,生活中充满着大量的数据和随机现象,各种信息量以成倍地速度增长,这时就需要人们面对它们做出合理的决策。事实上,每个人每天都会遇到许多需要判断和推理的事情。总之,生活已先于数学课程将统计与概率推到了学生的面前,统计与概率的思想已渗入人们日常生活和社会生活的方方面面。 许多的例子表明,随着计算机等信息技术的飞速发展,数据日益成为一种重要的信息,21世纪的公民面临着更多的机会和挑战,常常需要在不确定情境中,根据大量无组织的数据,做出合理的决策,这就需要人们能对纷繁复杂的信息做出恰当的选择与判断,具有一定的收集??处理信息、做出决策的能力,并且能够进行有效的表达与交流。而统计与概率正是通过对数据的收集、整理和分析,来为人们更好的制定决策提供依据和建议。因此,要培养学生具有收集并处理数据、做出恰当的选择和判断的能力,以适应现代社会的发展,就必须将统计与概率的基本思想、方法和知识作为义务教育阶段数学课程的重要组成部分。统计与概率的学习必将为数学与学生的日常生活及其他学科联系起来提供一条自然的途径。
- ?
数据分析的8种方法详解
依秋
展开
对于具体的业务场景问题,我们该怎么办呢?我们以一个电子商务网站为例,用数据分析产品 GrowingIO 对该网站进行快速地数据采集、清晰和可视化展示,然后给大家分享这 8 种常见的数据分析方法。
1 数字和趋势
看数字、看趋势是最基础展示数据信息的方式。
在数据分析中,我们可以通过直观的数字或趋势图表,迅速了解例如市场的走势、订单的数量、业绩完成的情况等等,从而直观的吸收数据信息,有助于决策的准确性和实时性。
对于电子商务网站,流量是非常重要的指标。
上图中,我们将网站的访问用户量(UV)和页面浏览量(PV)等指标汇汇聚到统一的数据看板(Dashboard),并且实时更新。
这样的一个数据看板,核心数字和趋势一目了然,对于首席增长官来说一目了然。
2 维度分解
当单一的数字或趋势过于宏观时,我们需要通过不同的维度对于数据进行分解,以获取更加精细的数据洞察。
在选择维度时,需要仔细思考其对于分析结果的影响。
举个例子,当监测到网站流量异常时,可以通过拆分地区、访问来源、设备、浏览器等等维度,发现问题所在。
3 用户分群
针对符合某种特定行为或背景信息的用户,进行归类处理,是我们常常讲到的用户分群(segmentation )的手段。
我们也可以通过提炼某一群用户的特定信息,创建该群体用户的画像。 例如访问购物网站、寄送地址在北京的用户,可以被归类为“北京”用户群体。
而针对“北京”用户群体,我们可以进一步观察他们购买产品的频度、类别、时间,这样我们就创建出该用户群体的画像。
在数据分析中,我们往往针对特定行为、特定背景的用户进行有针对性的用户运营和产品优化,效果会更加明显。
上图中,我们通过 GrowingIO 的用户分群功能将一次促销活动中支付失败的用户挑选出来,然后推送相应的优惠券。
这样精准的营销推广,可以大幅度提高用户支付的意愿和销售金额。
4 转化漏斗
绝大部分商业变现的流程,都可以归纳为漏斗。
漏斗分析是我们最常见的数据分析手段之一,无论是注册转化漏斗,还是电商下单的漏斗。
通过漏斗分析可以从先到后还原用户转化的路径,分析每一个转化节点的效率。 其中,我们往往关注三个要点: 第一,从开始到结尾,整体的转化效率是多少? 第二,每一步的转化率是多少? 第三,哪一步流失最多,原因在什么地方?流失的用户符合哪些特征?
上图中注册流程分为 3 个步骤,总体转化率为45.5%;
也就是说有 1000 个用户来到注册页面,其中 455 个成功完成了注册。
但是我们不难发现第二步的转化率是 56.8% ,显着低于第一步 89.3% 和第三步转化率 89.7%,可以推测第二步注册流程存在问题。
显而易见第二步的提升空间是最大的,投入回报比肯定不低;如果要提高注册转化率,我们应该优先解决第二步。
5 行为轨迹
关注行为轨迹,是为了真实了解用户行为。
数据指标本身往往只是真实情况的抽象,例如,网站分析如果只看访问用户量(UV)和页面访问量(PV)这类指标,断然是无法全面理解用户如何使用你的产品。通过大数据手段,还原用户的行为轨迹,有助于增长团队关注用户的实际体验、发现具体问题,根据用户使用习惯设计产品、投放内容。
上图中展示了一位用户在某电商网站上的详细行为轨迹,从官网到落地页,再到商品详情页,最后又回到官网首页。
网站购买转化率低,以往的业务数据无法告诉你具体的原因;通过分析上面的用户行为轨迹,可以发现一些产品和运营的问题(比如是不是商品不匹配等等),从而为决策提供依据。
6 留存分析
在人口红利逐渐消褪的时代,留住一个老用户的成本要远远低于获取一个新用户。
每一款产品,每一项服务,都应该核心关注用户的留存,确保做实每一个客户。
我们可以通过数据分析理解留存情况,也可以通过分析用户行为或行为组与回访之间的关联,找到提升留存的方法。
在 LinkedIn,增长团队通过数据发现,如果新用户进来后添加 5 个以上的联系人(上图红色线条),那么他/她在 LinkedIn 上留存要远远高于那些没有添加联系人(上图绿色和紫色的线条)的留存。
这样,添加联系人称为 LinkedIn 留存新用户的最核心手段之一。除了需要关注整体用户的留存情况之外,市场团队可以关注各个渠道获取用户的留存度,或各类内容吸引来的注册用户回访率,产品团队关注每一个新功能对于用户的回访的影响等等,这些都是常见的留存分析场景。
7 A/B 测试
A/B 测试用来对比不同产品设计/算法对结果的影响。
产品在上线过程中经常会使用 A/B 测试来测试不同产品或者功能设计的效果,市场和运营可以通过 A/B 测试来完成不同渠道、内容、广告创意的效果评估。
举个例子,我们设计了两种不同的产品交互形式,通过比较实验组(A 组)和对照组(B 组)的访问时长和页面浏览量两个衡量指标,来评估哪一种交互形式更佳。要进行 A/B 测试有两个必备因素:
第一,有足够的时间进行测试;
第二,数据量和数据密度较高。
因为当产品流量不够大的时候,做 A/B 测试得到统计结果是很难的。而像 LinkedIn 这样大体量的公司,每天可以同时进行上千个 A/B 测试。所以 A/B 测试往往在公司数据规模较大时使用会更加精准,更快得到统计的结果。
8 数学建模
当一个商业目标与多种行为、画像等信息有关联性时,我们通常会使用数学建模、数据挖掘的手段进行建模,预测该商业结果的产生。
作为一家 SaaS 企业,当我们需要预测判断客户的流失时,可以通过用户的行为数据、公司信息、用户画像等数据建立流失模型。
利用统计学的方式进行一些组合和权重计算,从而得知用户满足哪些行为之后流失的可能性会更高。
我们常常说,不能度量,就无法增长,数据分析对于企业商业价值的提升有着至关重要的作用。
当然,仅仅掌握单纯的理论还远远不够,实践出真知。数据分析的方法大家不妨在自己日常工作中,有分析相关项目里尝试使用,相信可以事半功倍,创造更多商业价值。
- ?
干货|关于大数据分析方法的深度思考
托马斯
展开
本文作者:郭朝晖@蝈蝈创新随笔
本文是我关于大数据分析方法的几点思考。当初的目的是系统化地看待数据分析。为了这点东西,我花了一个礼拜的时间,思考的结果却是碎片化的。看来,想清楚并不容易。由于时间关系,只能中止。文字描述很不严格、肯定经不起推敲,读者找不毛病是正常的、看不明白更是正常的。不感兴趣的可以当做胡扯。我希望将来有时间时能把问题思考下去。
从数据中发现信息和知识,是人们多年来的梦想。随着大数据理论的兴起,这个话题变得非常热门。在有些人看来,大数据非常神秘,似乎无所不能。当然,现实不会是这样。我想,研究大数据,首先要破除迷信:大数据需要什么条件、什么问题是大数据无法做到的。
1、知识和信息,只能从关联关系中得到
对象(包括过程,如生产过程、购物过程)及其属性、同一对象的属性之间具备关联关系。例如,“张三身高1.8米”就是对象(张三)与属性(身高)的关联;再如,如果我们知道张三体重75公斤,则“1.8米”和“75公斤”之间就因“张三”建立了关联。
关联的对象可能并不确定:我们看到一张履历表,即便隐去名字、不知道这个人是谁,也知道其中的各种信息是与某人关联的。
在数字化的世界里,不和其他的符号(数字)关联的符号(数字)是不包含任何信息的。从不包含信息的素材,得不到包含信息的结论。
有人可能反对这个观点:谷歌曾经用“感冒”的搜索量预报流感啊,这里哪有关联呢?其实,只有搜索“感冒”的数量是根本无法预测流感的。谷歌的做法,是把“感冒”的搜索与搜索的地点、时间联系起来。
这个观点告诉我们:收集数据的时候,要尽可能地把关联关系建立起来;没有关联关系,数据很容易成为垃圾。这种情况并不少见:有些实验室,把针对同一试样的各项实验结果分别保存起来,而没有建立统一的ID、关联关系丢失。这样的数据,再多也没有用处。
2、人们要挖掘的知识和信息,就是找映射关系
知识(或信息)的发现与挖掘,其本质是寻找映射关系:通过已知的、对象的一部分属性,把对象的另外一部分属性或对象本身找出来(或缩小范围)。产生这类问题的原因是:只有一部分属性已知、容易得到、容易识别、容易表述,而另外一部分未知、不容易得到、不容易识别、不容易描述。
例如,我们可以说:张三就是那个穿红衣服的——这里“穿红衣服”比其他特征容易识别。从衣服识别出张三,就是从张三的衣着特征(属性)找到关联对象(张三)的信息;从一个人的身高预估他的体重,就是从一个根据一类属性估计另外一类属性。
我习惯于把信息挖掘和知识发现分开。
在本文中,信息挖掘指的是预测某个特定对象的属性,如上海市的人口是多少;知识发现是确定一类对象的属性之间的关系,如一类人群中身高和体重的关系。当然,这种区分不是绝对的。
3、映射关系的差别
正确的识别,最好的办法是找到好的素材(数据)。素材与结果之间的关联强度是不一样的:有的比较强,是因果关系、必然联系;有的比较弱,是相关关系、偶然联系。
例如,我们可以根据DNA、相貌、衣服来识别一个人。但三者相比,DNA的联系是强的必然性联系、衣服是弱的偶然性联系,相貌是介于两者之间的联系。大数据的一个著名案例,是网站根据客户买的药判断她已怀孕、并推送有关产品:因为这种药只有孕妇才吃,是很强的关联。
从数据得到的知识和信息,往往不是绝对正确。一般来说,可靠的结论基于可靠的数据和可靠的分析方法。数据量大了以后,滤除干扰的可能性增大,从而可以从原来可靠度低的数据中,得到可靠性相对较高的数据。
所以,尽量找到好的素材,是做好分析的第一步。
在很多情况下,我们找不到好的素材。这时,首先要做的尽量提高数据质量。数据质量不仅是精度问题,还包括数据来源的可靠性:为此,需要把数据来源的相关过程要搞清楚,否则很可能会误导人的分析。
4、相关与因果
有些相关性的背后,一般会有因果关系存在。两个要素由因果产生关联的机制大概可以分成两类:1、两个要素具有因果的关系:比如刚做父亲的青年人常会买尿布;2、共同原因导致的两个结果之间的关系:比如孩子的父亲会常买啤酒,也常买尿布;于是,啤酒和尿布就可能关联起来。
有些相关性,看似没有因果,但背后往往有某些特殊的规律或因素其作用(上述第二种情况)。比如,女孩子往往喜欢花衣服,与基因和文化的共性有关。但这种因果关系可能相隔太远,以至于难以考证了。
当人们需要根据关系作出决策时,需要研究因果的逻辑关系:到底是谁影响了谁。否则,根据分析结构的盲目行为可能适得其反。 “到底谁影响了谁”为什么会成为问题?大概有两类原因:
第一类原因是:忽视了时间因素。如“统计结果表明,练太极拳的身体差”。现实却是:很多人身体变差(包括衰老)以后,才练太极拳。一般来说,具有因果关系的两个要素之间,时间上有前后关系:原因早前,结果在后。
第二类原因是:忽视了前导因素。“公鸡一叫,天就亮了”。现实却是,天量之前的迹象被公鸡察觉到了。两者是第二种因果关系,只是看似“原因在后、结果在前”了。
一般来说,工业大数据分析更重视因果,而商务大数据分析对因果性的要求较弱。
5、数据分析的先导因素
从某种意义上说,数据分析的过程,就是寻找强的相关关系(必然性、因果性),或对弱的相关关系进行综合、得到强的相关关系。
用数据发现信息,需要用到各种知识。例如,把“云南白药是用于治疗外伤的”放入计算机,当某人购买白药的行为判断他或家人可能受伤,从而可以推荐相关产品。但注意到:这种类型的知识很可能是被人事先装入计算机的,而不是靠计算机自动学习得到的。
所有的学习过程,本质上都是基于这样一种假设:A和B的一部分属性类似,则推测另一部分属性也应该类似。例如,A和B的身高相似,则体重也可能相似。现实中,两个属性确实具有强烈的相关性,但身高相同而体重不同的也大有人在。这时,如果我们还知道他的体型,是瘦弱、偏瘦、正常、偏胖、肥胖型,对体重的估计就可以准确一些。由此可见,用数据发现知识的过程,本质上就是提高相关性、可靠性的过程。
一般来说,人们在做数据分析之前,一定会有一定的知识积淀, 但认识不清却是一种常态;人们希望通过对数据的分析,来改变这种常态。而改变认识的过程依赖于数据的质量和分析数据的方法。所以,刨除分析方法外,分析过程依赖于两个先导性因素:1、数据质量(包含多方面的含义)如何;人们已有的认识如何。
注意,这段说法有个潜台词:强调了人类可认识的知识,而不是机器用复杂函数关系表述的、人类难以用逻辑关系认知的知识(如神经元)。的确如此,笔者一直认为:这类方法的作用被学术界有意识地夸大了。
6、数据分析的过程
与商业大数据相比,工业大数据更重视可靠性和精确性。在很多情况下,猜出一个结论并不难,难的是论证一个结论。一般来说,凡是可靠的知识,都应该能够被机理和数据双重认证。
大数据分析的一个重要特征是:传统概率理论的假设往往不成立。例如:大数定理的条件往往不成立、模型的结构往往未知、因果关系不是天然清晰、自变量的误差往往不能忽略、数据分布往往是没有规律的。所以,为了得到可靠的结果,人们工作的重点很可能是验证这些条件、构造这些条件。从某种意义上说,数据分析的过程,主要是排除干扰的过程、特别是排除系统干扰的过程。而且,如果完全依照逻辑、用纯粹数学的办法加以论证,则数据需求量会遭遇“组合爆炸”,永远是不够的。这时,已有的领域知识就是降低数据需求量的一种手段。要记住:求得可靠性是一个过程而不是结果、可能永远没有终点;分析的过程只是不断增加证据而已。这个过程,是修正人的认识的过程;所以,错误或不恰当的认识常常是分析过程中最大的干扰——这个干扰一旦去除,我们可能就发现了真正的知识。
数据量大的直接好处,是排除随机性干扰。但排除系统性干扰却不那么容易,数据量大是必要条件但不充分,需要深入的方法研究才能解决问题。
系统性的干扰往往体现在:对主体进行分组,所体现的规律是不同的。比如,身高和体重的统计关系,男女是不同的、不同民族是有差异的、可能与年龄有关。如果不进行分类研究,统计的结果就会与样本的选取有很大关系。但分类研究也会遇到一个困难:遭遇组合爆炸,数据再多都不够用。这时,“领域知识”就会发生作用:
认定一个结论成立的办法,是确认它的“可重复性”。在许多情况下,“可重复性”指的是在各种分组下都成立的结论:最好能在不同时间分组中也能成立。分组越多、分组的维度越多、结论的可靠性越高。
但具有“可重复性”的结论,往往只在一定的范围内成立。在很多情况下,“明确结论成立的范围”也是数据分析的重要内容。
如何分组、如何确定范围、如何构筑逻辑链条、数据结果的解读、数据结果与领域知识的融合,都是重要的能力。事实上,根据领域知识,常常用于构造证据链、进行有效的数据选取和分组。
在精密论证时,我们就会发现:基础数据的质量很重要。因为许多干扰就来源于数据本身。从某种意义上说,数据的采集方法和环境不同,就是不同的数据。
在构建数据分析体系的过程中,也会发现,企业经营的数据分析也确实需要一个可展示的平台,实时展示业务,有问题就优化更新。
FineReport 数据决策系统
7、关于预测数字
许多问题分析的目的得到一个数字:如钢的强度、用电量、人口数量、钢产量。这类问题的特点之一是:最终的结果是各种影响因素相加得到的。
对于这种问题,我的观点是:要想得到可靠的结果,一定要拆成若干子问题来分析。其中,各个子问题要尽可能利用规律性的结果来分析。我认为:把人的认识和数据用到极致的时候,才能得到最好的结果。随便地建立回归模型是不懂数据的表现。
- ?
常用的数据分析方法都在这里了
语柔
展开
数据分析即用适当的数据分析方法及工具,对处理过的数据进行分析,提取有价值的数据,形成有效结论的过程。 常用的数据分析方法有对比分析法、分组分析法、结构分析法、平均分析法、交叉分析法、漏斗图分析法、 矩阵分析法、综合评价分析法、5W1H 分析法、相关分析法、回归分析法、聚类分析法、判别分析法、主成分分析法、因子分析法、时间序列、方差分析等。 数据分析师工作工程中会根据变量的不同采用不同的数据分析方法, 要想熟练运用这些方法,首先需要弄懂这些方法的定义。下面是关于常用的17种数据分许方法的定义,供参考。
你们还知道哪些数据分析方法?
你在工作或学习中最常使用哪种方法?
欢迎留言分享~
- ?
数据分析的框架和常用方法
xinxi
展开
第一部分:数据分析框架
为了分析问题的聚焦,我们具体拿互联网电商来举例子说明,至于其他的比如互联网金融、教育、社交等等,可以依此借鉴。
(1)从互联网实体角度分析。我们可以从以下7个角度构建互联网数据分析体系。
买家:基本特征分析、交易行为分析、流量行为分析、售后满意分析等
卖家:基本特征分析、经营效果分析、流量曝光分析、售后满意分析、产品分析等
产品:基本特征分析、交易行为分析、流量曝光分析、售后满意分析等
行业:基本特征分析、经营分析、曝光分析、售后分析、产品分析、买卖家分析等
设备:移动端分析、PC端分析、访问对象分析、cookie分析、session分析等
日志:访问对象URL分析、cookie分析、session分析等
事件:登录、流量、点击、曝光、下单、交易、支付、物流、评价、纠纷、仲裁等分析
这个实体分析方法,可以称得上是万能的数据分析框架,适用于所有的互联网企业。我曾工作过的阿里巴巴、腾讯、随手记等企业,我个人都是按照这个套路去构建互联网的分析体系。
(2)从用户的关键路径进行分析。
关键路径分析方法是一个行之有效的常用分析方法,也是做数据化运营的常用工具。关键路径分析让我们聚焦于核心环节,排除杂音,定位出业务的核心问题,快速的加以解决。在应用关键路径分析时候,我们往往先把可能的结果、以及最关心的结果梳理出来,以结果为导向追溯行为的根本,当然,也可以从行为的初始出发,梳理出所有可能的行为路径,找出关键行为,导向我们最终设计好的结果中去。下面我们举例子说明下:
在电商网站中,我们假设我们运营目标是让用户购买网站上的商品(在这里,我要插说几句,我们的目标有时候不只是购买,在精细化运营中,往往会根据用户的生命周期,确定关键路径的目标,比如对于一个进入期的新买家,我们通常会发一些购物攻略加以指导,针对流失期的买家,关键路径的结果我们可能导向申领我们的优惠劵之类,等等。关于这一部分数据化精细化运营方面,在大数据应用系列的数据化运营小讲,我们会详细加以分享,敬请关注)。刚才谈到,我们假设我们运营目标是让用户购买网站上的商品,那么我们可以把关键路径,也即,用户的购买路径梳理出来:
a.用户登录/注册》搜索关键词》查看商品详情》加入购物车》点击下单》确认付款》确认收货
b.用户搜索关键词》类目和店铺》卖家交流》点击下单》确认付款》确认收货
通过这种关键路径,我们还常常进行漏斗分析,从而进行流量的转化分析,找出影响到达最终结果的关键环节。
(3)从KPI拆解角度分析。
KPI拆解分析方法也是比较常见的互联网分析方法。核心思想是先定一个总体目标,比如今年营收12亿,那么可以把这个指标拆解到各个业务线去,业务线再进行拆分,比如分解为12个月,每个月需要达成营收额,接着,就是达成该营收额,根据流量的转化情况,估算出需要多少的流量,目前平台已有多少流量,需要外拓引流多少流量才能达成目标,这就可以层层的拆解指标,最终或落地到产品团队或部分到运营团队去承担KPI任务。
第二部分:数据分析常用分析方法
常用的数据分析方法有:PEST分析方法、5W2H分析法、4P营销分析法、逻辑树分析法、指标拆分法、对比分析法、漏斗分析法、用户行为分析法、用户生命周期分析法、金字塔分析法等等,下面我们逐个的简单说明下
(1)PEST分析方法
这个方法主要应用于行业研究中。从政治(Political)、经济(Economic)、社会(Social)、技术(Technical),简称PEST角度对一个行业进行比较分析。下面我们举一个例子:我们小讲开始就谈到数据分析行业前景,那么我们在此利用PEST分析下大数据行业前景如何?
(2)5W2H分析法
这个方法主要应用于用户行为研究和专项问题分析,从时间、地点、人物、事情、原因、方式、价格等7个方面对一个问题进行刻画研究。请看如下案例二:
(3)4P营销理论
这个方法主要应用于公司整体经营状况分析,是比较经典的营销分析方法。该方法从产品、价格、渠道、促销等四方面对企业经营状况进行全面分析。请看如下案例三:
(4)逻辑树分析法
这个方法也称作问题树分析方法,主要应用于针对业务存在的问题进行专题分析,是数据分析方法中非常常见的一种分析方法。请看案例四:
(5)指标拆分法
这个方法也是经常适用的方法,特别是为了达成业务目标,我们往往都会先定一个总的目标,然后再初步的拆解指标。下面我们讲讲案例五:
(6)对比分析法
对比分析法是非常常用的基础分析方法,虽然方法特别简单,但几乎所有的分析报告中,都会采取对比分析方法。比如去年同期相比、上个月环比、目标和实际达成相比、各个部门和业务线相比、行业内竞品比较、营销效果对比,等等。这里需要注意的是我们不管是横向比较还是纵向比较,比较的双方一定要有可比性,并且在同一个维度、粒度上去比较,要不是毫无意义的。
(7)漏斗分析法
漏斗分析方法经常应用于产品的转化分析。举个电商的例子:用户登录网站1千万,浏览商品详情页200万,加入购物车80万,下单支付50万,支付成功40万。每一步都是转化率的问题。针对关键路径进行漏斗分析能够帮助我们快速的定位到问题所在。从而能够及时做出决策。
(8)用户行为理论
也称用户的活动周期理论。该分析方法,往往用于对用户的基础研究中。用户行为过程分为认知、熟悉、试用、使用和忠诚5个步骤。
(9)用户生命周期理论
该分析方法,也往往用于用户基础研究中,在互联网领域应用广泛。用户的生命周期分为进入期、成长期、成熟期、衰退期、流失期。每一个阶段用户的行为特征是不一样的,其价值是不一样的,需要精细化的运营。不可急功近利。
(10)金字塔理论
金字塔这个分析方法正好和漏斗分析方法相反,它是基数大,上层小。最初是英国历史学家、政治学家诺斯科特·帕金森(C.Northcote Parkinson)在《帕金森定律》(Parkinson's Law)一书中,论述在行政管理中,行政机构会像金字塔一样不断增多,行政人员不断膨胀,每个人都很忙,但组织效率越来越低下。这条定律又被称为“金字塔上升”现象。后来,人们将这一理论延伸应用,不再只限于本意。大凡是基数大,上层小,符合金字塔特征的研究分析都可以套用到该理论中。所以,金字塔这幅图也常常见于各分析报告中。比如,分析用户群体特征(马斯洛需求层次模型、用户价值模型等等)
综上所述种种数据分析方法,如果在一份分析报告中,能够把这些分析方法都灵活反复体现和应用,那么,这个分析报告一定会比较丰满的。
第三部分:数据分析的流程
数据分析的流程主要分为六步骤,遵循这种方法,一个完整的数据分析项目就出来了。
(1)明确分析目的:我们接到一个分析任务,首先要弄清楚我们分析的对象是什么,要达成怎样的目的,不能陷于为了分析而分析。然后,要熟悉行业和业务,透彻的理解分析的目的,构建起分析的角度和体系。
(2)进行数据准备:我们有哪些数据,通过什么途径可以获取到需要的数据,往往涉及到内部数据和外部数据,内部数据常常是我们的业务库或者基础数据团队建立起来的数据仓库系统,外部数据方面,现在各行各业都有大数据交易源,还有大量的公开市场数据。
(3)进行数据加工处理:主要通过数据清洗工作,对重复值进行去重处理、对异常值错误值进行修正或剔除、对缺失值进行填充修正或删除。如果软件环境为支持大数据量情况下,还需要对数据进行抽样处理。经过这些预处理后,最重要的就是进行数据的计算统计、合并转换,让数据符合目标分析过程。
(4)进行数据分析挖掘:绝大部分的分析目标达成都可以刚才介绍的分析方法外加常见统计分析等达到。主要的分析:整体和组成分析、走势趋势分析、均值方差分析、排序TOP分析、同比环比纵横比较分析、频度频率分析、相关关系分析、数量和比例的双坐标分析、逻辑结构分析、金字塔分析、漏斗图分析、矩阵图分析、指标拆解分析、PEST分析、5W2H分析法、4P营销分析等等。还有一部分分析需要到更高级的数据分析方法才能得到结论。
(5)进行数据结果图表展现:数据分析的目的就是要解决问题的,往往数据分析师不是需求的发起人,那么这就需要数据分析师把分析的数据和结论展现给需求方。最佳的方式就是通过图表,有理有据形象的重点突出且专业的表达出来。根据第(4)步骤的分析,我们可以选取恰当的图标。比如常用的有:折线图、柱形图、条形图、饼图、冒泡图、散点图、矩阵图、雷达图、双坐标图、瀑布图、帕累托图、金字塔图、漏斗图等等。
正如我之前的一篇文章 《图说可视化,报表也能做得如此酷炫!》,讲到帆软报表制作数据可视化的几个关键点。
(6)写出分析报告:数据分析最终的结论全部体现在分析报告中,一个分析师水平如何,只要看他写过的一份分析报告就可以完全清楚了。综合灵活应用这么多的分析方法和各种各样的展示图表,分析报告一定会显得非常丰满。下面一个问题我们再详细和大家讨论数据分析报告的相关事情。
- ?
解析常见的数据分析方法——用户留存分析
凯马勒那
展开
据某第三方平台近期调研结果显示,在金融创业领域,2013年一家互联网金融创业公司的投资获客成本区间为300-500元,而2016年则涨为1000-3000元;在电商领域,新用户的获取成本,是维护一个老用户的3倍到10倍……
如今,高居不下的获客成本让互联网、移动互联网创业者们遭遇新的“天花板”,甚至陷入“纳不起”新客的窘境。而花费极高成本所获取的客户,可能仅打开一次APP、或完成一次交易,就流白白流失。随着市场饱和度上升,绝大多数企业亟待解决如何增加客户黏性,延长每一个客户的生命周期价值。因此留存分析分析模型备受青睐。
一、什么是留存分析
留存分析是一种用来分析用户参与情况/活跃程度的分析模型,考察进行初始行为的用户中,有多少人会进行后续行为。这是用来衡量产品对用户价值高低的重要方法。留存分析可以帮助回答以下问题:
一个新客户在未来的一段时间内是否完成了您期许用户完成的行为?如支付订单等;
某个社交产品改进了新注册用户的引导流程,期待改善用户注册后的参与程度,如何验证?
想判断某项产品改动是否奏效,如新增了一个邀请好友的功能,观察是否有人因新增功能而多使用产品几个月?
有人会疑惑:为什么要做留存分析,直接看活跃用户百分比不行吗?当然不行!如果产品目前处于快速增长阶段,很有可能新用户中的活跃用户数增长掩盖了老用户活跃度的变化。按初始行为时间分组的留存分析可以消除用户增长对用户参与数据带来的影响。通过留存分析,你可以将用户按照注册时间分段查看,得出类似如下结论:“三月份改版前,该月注册的用户 7 天留存只有 15%;但是四月份改版后,该月注册的用户 7 天留存提高到了 20%。”
二、神策分析留存分析模型特点与价值
神策分析留存分析根据实际需求灵活配置条件。可针对事件属性,根据具体需求筛选初始行为或后续行为的细分维度。另外,还可以针对用户属性筛选合适的分析对象。那么,留存分析有哪些价值呢?
第一,留存率是判断产品价值最重要的标准,揭示了产品保留用户的能力。
留存率反映的实际上是一种转化率,即由初期的不稳定的用户转化为活跃用户、稳定用户、忠诚用户的过程。随着统计数字的变化,运营人员可看到不同时期用户的变化情况,从而判断产品对客户的吸引力。
第二,宏观上把握用户生命周期长度以及定位产品可改善至之处;
通过留存分析,可以查看新功能上线之后,对不同群体的留存是否带来不同效果? 可以判断产品新功能或某活动是否提高了用户的留存率?结合版本更新、市场推广等诸多因素结合,砍掉使用频率低的功能,实现快速迭代验证,制定相应的策略。
三、神策分析留存分析应用场景
场景一:游戏行业提升活跃、留存——如何精准找到玩家“流失点”?
游戏的生命周期的时长差异、玩家的游戏粘度,直接体现了游戏的竞争能力和盈利能力。玩家对游戏的直观感受、游戏难度曲线、游戏节奏的松弛、游戏福利等游戏内涵都能够导致游戏玩家流失。正确找到玩家流失原因,是促进玩家、活跃挽留玩家的第一步。《迷城物语》是如何在神策分析做到这一点的?下面为《迷城物语》在删档测试期间的相关应用情景。(注:以下配图所涉及的数据,均为模拟真实应用场景下的虚拟数据)
在神策分析的平台上,可统计流失玩家的等级分布,判断玩家流失与关卡设置的相关性。
图1 玩家在首次登陆游戏之后的8周流失情况分析
上图显示,100~110级、80~90级是玩家流失较多的关卡。为精准导致玩家流失的关键因素,需要每个环节、具体场景进行深入追踪与分析,下略。
场景二:了解新用户的留存
运营人员可以根据新用户启动 App 的时间按日或按月进行分组,得到同期群,观察该群体用户发生投资的7日留存、14日留存或30日留存(可自由选择),通过比较不同的同期群,可以获知,从总体上看用户留存的情况是否越来越好了。也可以点击“曲线标识”按钮,就可以看到每天留存率的变化趋势了。
图 2 新用户群体七天留存趋势变化
对于 7 日或者 30 日仍留下来做投资的用户,显然是一批忠诚度非常高的用户,什么样的用户群体有这么高的留存率?以 4 月 10 号这天的新用户为例,一共有 1931 个新用户,在第 7 天有 68 人留下来了,点击“68”这个数字,我们进入了用户列表界面。
这里值得强调的是,神策分析支持用户路径分析结果的人群明细查看。迄今为止,神策数据所有用户行为分析中的人群明细均可查看,如下图。
图3 第 7 天用户留存 68 人基本信息明细
这里我们能够看到留存下来的用户的一些详细的基础信息,比如借款次数,借款金额、年龄等,通过总借款次数以及借款金额,可进行用户质量评估;通过年龄可以分析到金融平台吸引的群体用户的年龄分布。
若想深度挖掘高留存用户有哪些共性特征、具体操作流程,以作为后序产品优化与改进的借鉴,则可使用用户分群功能,命名为“ 4-10 号 7 日留存用”然后通过用户路径等其他分析模型进一步深度分析。
- ?
数据分析的九种方法
孙弘文
展开
微信公众号发展至今,整体的产业已趋向成熟,市场对其运营框架也有了大致的共识,基本上可分为:内容运营、活动运营、用户运营,以及渠道运营和数据运营等几大模块。每个不同的运营模块,它们各自独立,同时又相互地影响。
本文侧重于对运营初学者来说,提供一套简易、有效的数据运营方法论。在开展数据运营工作之前,我们首先得了解数据在整个公众号运营工作中,究竟充当着什么样的角色?
我认为:“数据是运营的基础,就像一条绳索,贯穿整个运营工作。它既是运营KPI考核的直接呈现方式,同时也是运营方向的理论支撑点”
在新媒体的数据运营中,数据分析是至关重要的步骤,而数据分析有大概九类方法,你们知道吗?今天小天就来带大家了解一下这些干货吧!
数据分析的九类方法:直接评判法 — 对比分析法 — 结构分析法 — 分组分析法 — 平均分析法 — 矩阵分析法 — 漏斗图分析法 — 雷达图分析法 — 回归分析法
1.直接评判法
直接评判法即根据经验直接判断数据的好坏并给予评判,通常用于内部过往运营状况评估,如评估近期阅读量是否过低,评判近期销售量是否异常,评估当日文章推送量是否正常。
直接评判法有两个必要的条件:一是运营者有一定的新媒体运营经验,能够对跳出率,阅读量等有正确的评估;二是经过加工处理的数据足够直观,可以直接代表某项数据的优缺点。
2.对比分析法
对比分析法,是将两个或两个以上的数据进行对比,分析差异进而揭示这些数据所代表的规律。
对比分析法包括横向比较及纵向比较。横向比较即同一时间下不同总体指标的对比,如今日头条同领域作者文章阅读量对比,粉丝数对比等;纵向比较不同时间条件下同一总体指标的对比,如本月文章阅读量与上月阅读量进行对比,本月粉丝增长数与上月增长数进行对比等。
通过对比分析,可以直接观察到目前的运营水平,一方面找到当前已经处于优秀水平的方面,后续予以保持;另一方面及时发现当前的薄弱环节,重点突破。
3.分组分析法
分组分析法是指通过一定的指标,将对象统计分组并计算和分析,以便于深入了解所要分析对象的不同特征,性质及相互关系的方法。
分组分析法遵循相互独立,完全穷尽的枚举分析法原则。所谓相互独立,即分组之间不能有交叉,组别之间具有明显的差异性,每个数据只能归属于某一组;所谓完全穷尽,即分组中不要遗漏任何数据,保持完整性,各组的空间足以容纳总体的所有数据。
4.结构分析法
结构分析法是在统计分组的基础上,将组内数据与总体数据之间进行对比的分析方法。结构分析法分析各组部分占总体的比例,属于相对指标。
例如,新媒体运营团队可以统计粉丝所在的地域分布,统计出各个地方粉丝的占比情况,此情景便属于结构分析法。
5.平均分析法
例如,在分析今日头条的文章阅读量时,借助Excel导出的数据可以快速找到阅读量大于平均值的文章,接下来可以继续挖掘这些文章的标题,排版,配图等规律,便于后续内容质量的提升。
6.矩阵分析法
矩阵分析法是一种定量分析问题的方法,它是指以数据两个重要指标作为分析依据,并将这两个指标作为横,纵坐标轴,构成四个象限,从而找出解决问题的办法,为运营者提供数据参考。
例如,某餐饮企业的大众点评评价分析,可以借助四个象限“紧急且重要,重要但不紧急,紧急但不重要,不紧急也不重要”进行矩阵分析,并重点处理“紧急且重要”的事项。
7.漏斗图分析法
漏斗图分析法因展现形式如漏斗,故而得名。漏斗图可以对文章阅读量,产品购买量等情况进行逐层分析,展示整个关键路径中每步的转化情况。
重要强调的是,单一的漏斗图难以衡量各个环节的好坏,运营者可以结合本节介绍的“对比分析法”,对同一环节不同时间对比,评估运营效果。
8.雷达图分析法
雷达图常用于指数分析,即通过对新媒体账号的内容质量,领域专注等不同维度的计算而得出的客观评分结果。分数越高,代表账号的质量越好。可以利用雷达图进行分析的指数,包括今日头条指数,大鱼号星级指数,百家号指数等。
9.回归分析法
回归分析法是通过研究事物发展变化的因果关系来预测事物发展走向,它是研究变量间相互关系的一种定量预测方法,又称回归模型预测法或因果法。
例如,将今日头条粉丝数据导出到Excel表格,对累计粉丝数进行一元线性分析,就可以尝试预测某个时间的粉丝量。
- ?
9种常用数据分析方法
朱幼旋
展开
数据分析是从数据中提取有价值信息的过程,过程中需要对数据进行各种处理和归类,只有掌握了正确的数据分类方法和数据处理模式,才能起到事半功倍的效果,以下是数据分析员必备的9种数据分析思维模式:
1. 分类
分类是一种基本的数据分析方式,数据根据其特点,可将数据对象划分为不同的部分和类型,再进一步分析,能够进一步挖掘事物的本质。
2. 回归
回归是一种运用广泛的统计分析方法,可以通过规定因变量和自变量来确定变量之间的因果关系,建立回归模型,并根据实测数据来求解模型的各参数,然后评价回归模型是否能够很好的拟合实测数据,如果能够很好的拟合,则可以根据自变量作进一步预测。
3. 聚类
聚类是根据数据的内在性质将数据分成一些聚合类,每一聚合类中的元素尽可能具有相同的特性,不同聚合类之间的特性差别尽可能大的一种分类方式,其与分类分析不同,所划分的类是未知的,因此,聚类分析也称为无指导或无监督的学习。
数据聚类是对于静态数据分析的一门技术,在许多领域受到广泛应用,包括机器学习,数据挖掘,模式识别,图像分析以及生物信息。
4. 相似匹配
相似匹配是通过一定的方法,来计算两个数据的相似程度,相似程度通常会用一个是百分比来衡量。相似匹配算法被用在很多不同的计算场景,如数据清洗、用户输入纠错、推荐统计、剽窃检测系统、自动评分系统、网页搜索和DNA序列匹配等领域。
5. 频繁项集
频繁项集是指事例中频繁出现的项的集合,如啤酒和尿不湿,Apriori算法是一种挖掘关联规则的频繁项集算法,其核心思想是通过候选集生成和情节的向下封闭检测两个阶段来挖掘频繁项集,目前已被广泛的应用在商业、网络安全等领域。
6. 统计描述
统计描述是根据数据的特点,用一定的统计指标和指标体系,表明数据所反馈的信息,是对数据分析的基础处理工作,主要方法包括:平均指标和变异指标的计算、资料分布形态的图形表现等。
7. 链接预测
链接预测是一种预测数据之间本应存有的关系的一种方法,链接预测可分为基于节点属性的预测和基于网络结构的预测,基于节点之间属性的链接预测包括分析节点资审的属性和节点之间属性的关系等信息,利用节点信息知识集和节点相似度等方法得到节点之间隐藏的关系。与基于节点属性的链接预测相比,网络结构数据更容易获得。复杂网络领域一个主要的观点表明,网络中的个体的特质没有个体间的关系重要。因此基于网络结构的链接预测受到越来越多的关注。
8. 数据压缩
数据压缩是指在不丢失有用信息的前提下,缩减数据量以减少存储空间,提高其传输、存储和处理效率,或按照一定的算法对数据进行重新组织,减少数据的冗余和存储的空间的一种技术方法。数据压缩分为有损压缩和无损压缩。
9. 因果分析
因果分析法是利用事物发展变化的因果关系来进行预测的方法,运用因果分析法进行市场预测,主要是采用回归分析方法,除此之外,计算经济模型和投人产出分析等方法也较为常用。
以上是数据分析员应熟练掌握的9种数据分析思维方法,数据分析员应根据实际情况合理运用不同的方法,才能够快速精确的挖掘出有价值的信息!
统计与数据分析方法
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并