中企动力 > 商学院 > 数据统计分析方法
  • ?

    数据分析:浅论统计学在市场营销中的运用,看完长见识了!

    静丹

    展开

    浅论统计学在市场营销中的运用

    当今社会中多数企业为了能够更好地促进市场营销效果,将本企业或者本行业几个月或者几个季度以及几年内的市场营销数据,通过数据加载分析来评估当前市场形势以及以后的发展趋势,而对数据的分析现代企业运用最多的手段就是统计学,统计学中的数理统计、多元统计分析,抽样调查都为企业的数据分析提供了最科学和可靠的方法。通过市场营销管理中统计学理论及方法的运用,为企业市场营销管理工作奠定基础、为企业的市场营销工作提供准确详实的市场信息。针对市场营销管理中对统计学应用的需求,现代企业市场营销管理中应加强对统计学理论及内容的关注。运用统计学方法解决企业营销管理中的实际问题,提高企业综合市场竞争力。  

     一、数据进行统计分析特点和管理方法   数理统计中统计分析的特征是定量和定性分析进行结合;把处理的数据作为依据,以统计的数据作为结果;分析方法具有特殊性;分析的范围具有广泛性。要紧紧依靠这些统计数据的特点,同时,充分把握好企业市场营销这一行业的特殊性,才能真正做好市场营销统计学分析的工作。正常来讲,企业市场营销管理的步骤可分为:分析市场所具备的机会、选择合适的目标市场、确立正确的营销组合策略、市场营销的决策和决策的实施与控制。这四个步骤与相应的统计学分析方法相配合,才能更好地为企业赢得更多的市场机遇,同时使企业的市场竞争力不断提升。   二、市场营销中的统计学分析方法   针对所属行业销售特点选择统计学方法的应用。针对不同行业的销售特点,企业市场营销管理中的统计学应用也存在着差异。根据行业销售特点,统计学方法的运用也有着一定的规律。在饮料、日用化工等快消品的销售收集整理中,描述统计、推断统计、顺序变量等方法的应用能够为快消品行业的市场营销管理提供翔实准确的市场信息,为快消品企业的市场营销策划方案提供科学的数据。通过统计学方法的运用使企业的快消品营销策划工作更加符合市场规律、符合市场销售特点,进而满足现代快消品企业销售目标需求、满足市场销售需求。   在现代社会里,企业如果要获得长远的竞争优势,一定离不开目标群体的满意度和支持度。目标群体,一般就是指顾客,当他们的需求被满足之后会产生心理的愉悦感。从统计学来分析,这个满意度就是指顾客的期望值与实际感知效果之间的差异函数,如果顾客实际感知的效果小于期望值,顾客就不会感到满意,反之,就会表现出满足。通常,顾客过去的购买经历,竞争者与销售者对自身产品的宣传与承诺,身边朋友的评论等,都会影响到顾客的期望值。因此,企业非常有必要通过统计学,对顾客满意度进行分析、测量,给企业的营销和决策提供更加可靠的依据。

     

     三、以数据为依托分析当前市场状况   通过对统计学知识的运用,以当近期市场的数据反馈为依托,对当前的市场行情进行分析与比对。在当今市场经济的营销管理中,对市场的动态信息进行科学合理的分析,能够帮助企业的决策者们及时修改营销方案,满足市场变化对企业营销管理的需求。这一现状要求企业的市场营销管理部门能够及时掌握市场动态,运用統计学知识及统计学理论中的调研、整理、分子技巧为企业的市场营销管理工作提供准去的市场信息,确保企业市场营销管理工作能够符合市场销售的实际需求。针对现代企业市场营销现状及营销管理工作的需求,现代企业的市场营销管理工作中应强化对市场销售信息的收集与整理。利用统计学原理及要知道市场销售信息收集与管理工作,以此使企业的市场营销信息收集、整理、分析以及方案制定在统计学理论指导下得到有效开展,满足现代市场经济发展过程中企业的营销管理需求。

      

    四、从市场的定价角度看统计分析的重要性   通常来说,企业的市场定价会受到多种因素的综合影响。成本导向、需求导向、竞争导向是企业市场定价的三种方法,这三种方法都是对于企业自身在市场上的竞争力而言,是企业为了让自己的产品或服务在如今激烈的市场竞争中更好的定位,赢得更多更大的市场份额而制定出的价格策略。这种定价策略要分析人为订立的利润与企业成本之间的比例,要充分研究竞争对手等各方面的定价因素,并认真分析消费者的有效需求,以寻求各个价格变量之间存在的近似的线性关系,从而准确进行营销策划。因子分析方法是市场定价中的统计学分析较多采用一种方法,根据几个不同因子的比较而获得多个值,并对这些值进行平均值的计算,从而确定产品的基准价格。本质上看,就是把统计模型的运算和决策问题运用到市场定价问题中,不同利润下的标准差和期望值制定出不同的市场定价方案。所以,在市场定价中准确的统计决策模型,不仅有利于提高资金周转速度,节约企业成本,还有利于提高企业的市场竞争力。在现代企业市场营销管理工作中,科学的市场调研是掌握市场动态、保障市场销售信息有效传达的关键。因此,在企业的市场营销管理工作中,应科学运用统计学调研方法对企业所属行业市场信息进行收集与整理。以基础数据、变量、统计逻辑学、管理统计学等内容及基础,对销售人员的调研信息进行统计与分析,对信息的科学性进行甄别。以翔实准确为中心进行市场信息的收集与调研、以科学性为重点进行信息的统计与分析,以此保障现代企业市场营销管理方案制定基础满足市场需求。统计学分析方法在市场调查过程中,无论是最初的信息收集阶段,还是信息处理阶段的分析过程和数据辨别,都发挥着无可辩驳的关键作用。在我们当前的市场经济活动中,要重视以人为本的管理方法,大力地强调定性向定量的方向发展,这一切都会涉及统计学方法。国家在进行经济调控时,也往往会使用到统计表格来表示一系列经济收支的情况,以便在宏观上对未来的经济投入比例进行相应的调整。   总之,企业要想得到最优化的市场营销方案,必须通过统计手段对市场的全面、科学分析才能获得,科学合理的统计分析,可以随时灵活地更改营销方案。

  • ?

    SPSS数据分析方法不知道如何选择

    特鲁维尔

    展开

    一提到数学,高等数学,线性代数,概率论与数理统计,数值分析,空间解析几何这些数学课程,头疼呀。作为文科生,遇见这些课程时,通常都是各种寻求帮助,班上有位宅男数学很厉害,各种被女生‘围观’,这数学为什么这么难,学了有啥用呀。

    有用的,当做数据分析的时候,使用到SPSS,在线SPSS分析的时候就知道用处了,在写论文的时候会用到SPSS数据分析,工作的时候也会用到SPSS数据分析。此时才知道原来数学很重要。我的数学不好肿么办?听我一 一道来。

    1. 数据类型

    学过数学的童鞋都知道,数学里面分了两类数据,离散和连续数据,听上去文绉绉的,不懂。那我问男人和女人知道不,知道,对了这种就是离散数据。身高体重知道不,知道,这种就是连续数据。离散数据可以理解为分类,类别,数个数;而连续数据理解为算平均值,度量,比如平均身高,平均年龄,但不能说成是平均性别。离散和连续数据是数学上文绉绉的称呼。如果我们是做数据分析,通常又换成另外一种称呼,定类和定量数据。定类就是离散数据,定量就是连续数据。这点get到后,数据分析方法啥都不在话下,让智能化软件SPSSAU【备注:在线网页版SPSS】这些去解决就好,默认出来智能化文字分析结果。

    2. X和Y

    除了数据类型外,数学上老是有一些符号,比如X,Y,Z, α, β,γ,还有好多拉丁符号,看着都头疼,而且更糟糕的是发音还那么奇怪。这些都是数学用词,如果是数据分析,只需要知道X和Y就可以。为什么这么简单呢?数据分析通常是用于业务场景,让所有人都会所有人都能懂的。而数学符号是专业性名词,一小部分学习数学专业的人群才懂。

    而X,Y基本所有人都懂,平面二维式思维,如果加上Y就变成空间三维思维。这种会变得复杂难懂,而数据分析出来结果是让人理解让人懂的,越简单易懂越有意义越有用的结论越受欢迎。因此从数据分析角度来看,只需要懂X,Y这两个符号就OK。别小看X,Y这两个符号,加上上述的数据类型,它们可以产生非常多的组合,也称作分析方法。

    有了X,Y,我们可以研究X和Y之间的关系情况,比如X对于Y的影响关系,X对于Y的差异关系等。下面一一讲述。

    3. X和Y的组合方法

    再讲组合之前,先单独讲下不区分X和Y的分析方法,如下表格:

    当不需要区分不区分X和Y时,比如我只研究性别1个数据,或者只研究身高,体重情况如何等。并不需要研究关联关系,所以并不涉及X和Y的关联关系。这种都可统称为数据基本描述统计,当然数据类型不一样时,方法不同。比如性别为定类数据,这时用频数分析;身高体重是定量数据,这时用描述分析。数据的基本描述统计是最基础的数据分析方法,而且通常都需要做这类分析方法,因为了解了基本情况是非常必要的。

    接下来将下X和Y之间的关联关系时,会使用到的数据研究方法;如下表格:

    从上表可以看到,通常会涉及到差异关系,相关关系和影响关系共三类。比如不同性别的兴趣爱好是否有差异,性别为定类数据,兴趣爱好也是定类数据;此时就应该使用交叉卡方分析方法。比如研究性别人群体重是否有差异,性别为定类数据,体重为定量数据,此时就需要使用T检验;除此之外,如果想研究不同专业(理科、工科、文科)的体重差异时,此时应该使用方差分析。当X是定类数据,Y是定量数据,研究X对于Y的差异时,可以使用T检验和方差分析;区分在哪里呢?如果X的类别个数(比如男和女)只有2个时,通常使用T检验;如果X的类别个数超过2个(比如理科、工科和文科)时,只能使用方差分析。差异关系就只能有3种,接下来继续相关关系。

    相关关系是研究X和Y的关系情况,比如身高和体重之间有没有关系;X和Y均是定量数据;此时应该使用相关关系,再具体一点应该叫Pearson相关关系(相关关系的数学公式是Pearson这人发明的)。

    最后一类是影响关系;X对于Y的影响;影响关系的分析方法区分,完全是根据Y的类别而定;比如Y是定量数据,我们则应该使用线性回归分析;如果Y为定类数据,此时我们应该使用Logit回归分析,而具体再细分,Logit回归可以有:二元Logit回归,多分类Logit回归,区分在于Y,举例如下表:

    如果X影响Y时,Y只分为两类,购买和不购买,愿意和不愿意,是和否等,这时候就需要使用二元Logit回归分析;如果Y分为n类(n>2)时,则需要使用多分类Logit回归。

    数据类型,X和Y;这两点搞明白后,绝大多数的数据研究方法都可以搞定,而这也是当前数学研究的核心思想。也是分析软件的设计理念,网页在线版本的SPSS即SPSSAU软件平台,它的设计核心理念就是这样,只需要会区分数据类型,知道X和Y;就可以自己进行数据分析,其它的全部都可以直接由SPSSAU生成智能化文字结果;当然,分析方法还有很多的,比如因子分析,聚类分析等,这些方法不是研究X和Y的关联性,而是别有用处。

    4. 其它研究方法

    除开X与Y的关联关系研究,其实还有一些其它的研究方法;比如对于很多个X同时进行分析应该使用什么方法呢?此时可能会结合分析用处而对应不同的方法;常见有因子分析和聚类分析两种,如下表:

    如果说了30句话,现在想把30句话概括浓缩成5个关键词,这种就叫浓缩;此时需要使用因子分析;如果有300个人想进行分类,分成3类人群,此时可使用聚类分析(常见是K-means聚类方法)。

    除了浓缩和聚类,事实还有非常多其它的研究方法,比如信度研究,多因素方差,非参数检验,正态性检验,配对T检验等等。后续慢慢再谈,更多知识也可使用网页版SPSS即SPSSAU【备注:在线网页版SPSS】进行学习,里面智能化分析结果一目了然,‘拖拽点一下’完成分析得到智能化结果,更多研究方法的详述也可直接查到。

  • ?

    干货 | 这是一份完整的大数据处理技术总结与分析

    Jay

    展开

    一 数据分析处理需求分类

    1 事务型处理

    在我们实际生活中,事务型数据处理需求非常常见,例如:淘宝网站交易系统、12306网站火车票交易系统、超市POS系统等都属于事务型数据处理系统。

    这类系统数据处理特点包括以下几点:

    一是事务处理型操作都是细粒度操作,每次事务处理涉及数据量都很小。

    二是计算相对简单,一般只有少数几步操作组成,比如修改某行的某列;

    三是事务型处理操作涉及数据的增、删、改、查,对事务完整性和数据一致性要求非常高。

    四是事务性操作都是实时交互式操作,至少能在几秒内执行完成;

    五是基于以上特点,索引是支撑事务型处理一个非常重要的技术。

    在数据量和并发交易量不大情况下,一般依托单机版关系型数据库,例如ORACLE、MYSQL、SQLSERVER,再加数据复制(DataGurad、 RMAN、MySQL数据复制等)等高可用措施即可满足业务需求。

    在数据量和并发交易量增加情况下,一般可以采用ORALCE RAC集群方式或者是通过硬件升级(采用小型机、大型机等,如银行系统、运营商计费系统、证卷系统)来支撑。

    事务型操作在淘宝、12306等互联网企业中,由于数据量大、访问并发量高,必然采用分布式技术来应对,这样就带来了分布式事务处理问题,而分布式事务处理很难做到高效,因此一般采用根据业务应用特点来开发专用的系统来解决本问题。

    2 数据统计分析

    数据统计主要是被各类企业通过分析自己的销售记录等企业日常的运营数据,以辅助企业管理层来进行运营决策。典型的使用场景有:周报表、月报表等固定时间提供给领导的各类统计报表;市场营销部门,通过各种维度组合进行统计分析,以制定相应的营销策略等。

    数据统计分析特点包括以下几点:

    一是数据统计一般涉及大量数据的聚合运算,每次统计涉及数据量会比较大。

    二是数据统计分析计算相对复杂,例如会涉及大量goupby、 子查询、嵌套查询、窗口函数、聚合函数、排序等;有些复杂统计可能需要编写SQL脚本才能实现。

    三是数据统计分析实时性相对没有事务型操作要求高。但除固定报表外,目前越来越多的用户希望能做做到交互式实时统计;

    传统的数据统计分析主要采用基于MPP并行数据库的数据仓库技术。主要采用维度模型,通过预计算等方法,把数据整理成适合统计分析的结构来实现高性能的数据统计分析,以支持可以通过下钻和上卷操作,实现各种维度组合以及各种粒度的统计分析。

    另外目前在数据统计分析领域,为了满足交互式统计分析需求,基于内存计算的数据库仓库系统也成为一个发展趋势,例如SAP的HANA平台。

    3 数据挖掘

    数据挖掘主要是根据商业目标,采用数据挖掘算法自动从海量数据中发现隐含在海量数据中的规律和知识。

    数据挖掘主要过程是:根据分析挖掘目标,从数据库中把数据提取出来,然后经过ETL组织成适合分析挖掘算法使用宽表,然后利用数据挖掘软件进行挖掘。传统的数据挖掘软件,一般只能支持在单机上进行小规模数据处理,受此限制传统数据分析挖掘一般会采用抽样方式来减少数据分析规模。

    数据挖掘的计算复杂度和灵活度远远超过前两类需求。一是由于数据挖掘问题开放性,导致数据挖掘会涉及大量衍生变量计算,衍生变量多变导致数据预处理计算复杂性;二是很多数据挖掘算法本身就比较复杂,计算量就很大,特别是大量机器学习算法,都是迭代计算,需要通过多次迭代来求最优解,例如K-means聚类算法、PageRank算法等。

    因此总体来讲,数据分析挖掘的特点是:

    1、数据挖掘的整个计算更复杂,一般是由多个步骤组成计算流,多个计算步骤之间存在数据交换,也就是会产生大量中间结果,难以用一条sql语句来表达。

    2、计算应该能够非常灵活表达,很多需要利用高级语言编程实现。

    二 大数据背景下事务型处理系统相关技术

    在google、facebook、taobao等大互联网公司出现之后,这些公司注册和在线用户数量都非长大,因此该公司交易系统需要解决“海量数据+高并发+数据一致性+高可用性”的问题。

    为了解决该问题,从目前资料来看,其实没有一个通用的解决方案,各大公司都会根据自己业务特点定制开发相应的系统,但是常用的思路主要包括以下几点:

    (1)数据库分片,结合业务和数据特点将数据分布在多台机器上。

    (2)利用缓存等机制,尽量利用内存,解决高并发时遇到的随机IO效率问题。

    (3)结合数据复制等技术实现读写分离,以及提高系统可用性。

    (4)大量采用异步处理机制,对应高并发冲击。

    (5)根据实际业务需求,尽量避免分布式事务。

    1相关系统介绍

    1) 阿里CORBAR系统

    阿里COBAR系统是一个基于MYSQL数据库的分布式数据库系统,属于基于分布式数据库中间件的分布式数据库系统。该系统是前身是陈思儒开发的“变形虫”系统(以前调研过),由于陈思儒离开阿里去了盛大,阿里当心“变形虫”稳定性等问题,重新开发该项目。

    该系统主要采用数据库分片思路,实现了:数据拆分、读写分离、复制等功能。由于此系统由于只需要满足事务型操作即可,因此相对真正并行数据库集群(例如TeraData等),此类系统提供操作没有也不需要提供一些复杂跨库处理,因此该系统存在以下限制:

    (1)不支持跨库的join、分页、排序、子查询。

    (2)insert等变更语句必须包括拆分字段等。

    (3)应该不支持跨机事务(以前变形虫不支持)。

    说白了此类系统不具备并行计算能力,基本上相当于数据库路由器!

    另外此类系统的在实际应用的关键问题是,根据什么对数据进行切分,因为切分不好会导致分布式的事务问题。

    2) 阿里OceanBase系统

    该系统也是淘宝为了解决高并发、大数据环境下事务型处理而定制开发的一个系统。该系统主要思路和特点如下:

    (1)他们发现在实际生成环境中,每天更新的数据只占总体数据的1%不到,因此他们把数据分为:基线数据和增量更新数据。

    (2)基线数据是静态数据,采用分布式存储方式进行存储。

    (3)只在一台服务器上存储和处理增量更新数据,并且是在内存中存储和处理更新数据。

    (4)在系统负载轻的时候,把增量更新批量合并到基线数据中。

    (5)数据访问时同时访问基线数据和增量更新数据并合并。

    因此这样好处是:

    (1)读事务和写事务分离

    (2)通过牺牲一点扩展性(写是一个单点),来避免分布式事务处理。

    说明:该系统虽然能处理高并发的事务型处理,号称很牛逼,但其实也只是根据电商的事务处理来定制开发的专用系统,个人认为其技术难度小于oracle等通用型的数据库。该系统无法应用到银行或者12306等,因为其事务处理的逻辑远远比电商商品买卖处理逻辑复杂。

    在目前的大数据时代,一定是基于应用定制才能找到好的解决方案!

    3) 基于Hbase的交易系统

    在hadoop平台下,HBASE数据库是一个分布式KV数据库,属于实时数据库范畴。支付宝目前支付记录就是存储在HBASE数据库中。

    HBASE数据库接口是非SQL接口,而是KV操作接口(基于Key的访问和基于key范围的scan操作),因此HBASE数据库虽然可扩展性非常好,但是由于其接口限制导致该数据库能支持上层应用很窄。基于HBASE应用的设计中,关键点是key的设计,要根据需要支持的应用来设计key的组成。

    可以认为HBASE数据库只支持作为KEY的这一列的索引。虽然目前HBASE有支持二级索引的方案,二级索引维护将会比较麻烦。

    2并发和并行区别

    并发是指同时执行通常不相关的各种任务,例如交易型系统典型属于高并发系统。

    并行是通过将一个很大的计算任务,划分为多个小的计算任务,然后多个小计算任务的并行执行,来缩短该计算任务计算时间。

    两者主要区别在于:

    (1)通讯与协调方面:在并行计算中,由于多个小任务同属一个大的计算任务,因此小任务之间存在依赖关系,小任务之间需要大量通讯和协调;相反,并发中的多个任务之间基本相互独立,任务与任务之间相关性很小。

    (2)容错处理方面:由于并发任务之间相互独立,某个任务执行失败并不会影响其它的任务。但是并行计算中的多个任务属于一个大任务,因此某个子任务的失败,如果不能恢复(粗粒度容错与细粒度容错),则整个任务都会失败。

    3本章总结

    数据量大不一定需要并行计算,虽然数据量大,数据是分布存储,但是如果每次操作基本上还是针对少量数据,因此每次操作基本上都是在一台服务器上完成,不涉及并行计算。只是需要通过数据复制、数据缓存、异步处理等方式来支撑高并发访问量

    三 大数据背景下数据统计分析技术介绍

    随数据量变大,和事务处理不同的是,单个统计分析涉及数据量会非常大,单个统计分析任务涉及数据会分散在多台服务器上,且由于计算量大,采用单台服务器进行计算,会导致计算时间非常长,单个统计分析任务必须采用并行计算方式来加快单个统计分析任务执行速度。

    1并行查询与并行计算技术介绍

    在大数据背景下的数据统计分析技术门类很多,常见的有:

    n MPP并行数据库 : TeraData、GreenPlum、Vertica等。

    n 基于MapReduce并行计算框架的数据仓库:

    HIVE(Hadoop平台) 、Tenzing(Google公司)

    n 基于Hbase的Phoenix系统

    n HadoopDB系统

    n EMC公司的hapt系统

    n MPP分布式查询引擎: Dremel、Impala、Presto、Shard query、Citusdb。

    n 基于SPARK的Shark、基于Dryad的SCOPE、基于Tez的stinger。

    n 基于hadoop+index的JethroData系统

    n 基于内存计算的Druid系统

    这些系统都解决了海量数据下的数据统计分析的问题,并且这些系统另外一个共同特点是都提供了SQL或者类SQL接口。

    为了能够较好研究这些系统,我们需要对并行查询与并行计算的相关技术做一个简要的介绍。

    首先所有的系统都可以分为三个层次: 语义层、并行计算引擎层、分布式存储层。语义层提供一个编程接口让用户表达所需要计算,并负责把该计算翻译成底层并行计算引擎可以执行的执行计划,并由并行计算引擎来执行,最下面一层是分布式存储层。

    对于提供类SQL接口并行计算系统,语义层可以认为是SQL解析层。

    1) 语义层

    SQL语言是一种声名式语言,SQL只是表达了要做什么,而没有表达怎么做。为此,SQL解析层主要作用是:将用户提交的基于SQL的统计分析请求,转化为底层计算引擎层可以执行的执行计划。也就是解决“怎么做”的问题。

    SQL解析层工作主要包括两个大方面:

    (1) 通过语法分析技术来理解要做什么。在关系数据库中,一般会把SQL语言分析后,形成树型结构的执行计划。

    (2) 在语法分析技术上,利用各种优化技术和算法,找出一种最经济物理执行计划。

    优化可以分为两个方面:一是逻辑层面优化、二是物理执行层面优化。

    (1) 逻辑层优化

    逻辑层面个人认为主要是因为同样表达一个分析请求,有的人SQL写的好,有的人SQL写的烂,因此在逻辑层面可以通过一些等价关系代数变换,实现查询重写,将写的比较烂的sql变换为好的写法。

    比较典型优化是:“把投影和过滤下沉,先执行过滤和投影操作”,减少中间结果。

    (2) 物理层优化

    物理层面优化是在逻辑优化后,结合实际物理执行过程,找出最优的物理执行计划。生成物理查询计划的工作包括:

    ü 增加一些操作符: 包括扫描和排序等。

    ü 确定各个操作符实现算法。例如扫描是全表扫描还是利用索引;Join是采用HASH连接、索引连接、合并排序等实现算法中的那一种。

    ü 确定操作符之间的数据流转方法:物化还是流水线方式。

    ü 采用基于代价估算方法确定最优的物理执行计划,目前代价估算主要是以估算该物理计划需要的IO量。另外对于并行数据库,则还要考虑通讯代价,即尽量减少数据在各个机器之间的传递。

    在物理层优化的代价估算过程中,代价估算需要依靠很多统计信息,如表有多大,表中相关列的值分布是什么样子等。传统数据库在数据Load过程中会事先计算好这些统计信息。并行计算中还需要考虑通讯代价。

    需要指出是,由于imapla、Presto、HIVE等系统只是一个查询引擎,它们可以直接查询以普通文件方式存储在HDFS系统上的文件,因此这些系统一般无法使用索引和各种统计信息来进行物理执行计划的优化,这些系统一般只能在逻辑层进行一些基于规则静态优化。根据SHARK论文,SHARK系统支持根据前面一些节点计算获得的信息,来动态优化后面执行计划。

    (3) 物化与流水线执行方法

    一条SQL语句对开发人员而言,感觉只是一次调用,但是实际上在数据库内部,一条SQL语句执行其实是有多个操作符组合而成的的树型结构计算流。如下图:

    针对该计算流有两种执行方式:一是基于物化或者是实体化执行方式,另外一种是基于数据流的执行方式。

    第一种方法的过程是: 把各个操作运算排序,并把每个操作运算的输出的中间结果存储在磁盘上,直到被另外一个操作运算所...

  • ?

    数据分析:浅谈大数据对统计学的挑战和机遇,看完长见识了!

    海伦

    展开

    浅谈大数据对统计学的挑战和机遇

    引言  国际数据公司的相关研究指出,2011年全球数据生产量达1.8ZB,且全球信息总量每隔两年增长一倍[1]。在大数据时代下,对于统计学发展而言,挑战与机遇并存,挑战指的是现阶段传统统计学相关方法难以适用大数据,机遇指的是基于统计学,大数据展开数据处理、分析,促使大数据具备可视化特性。由此可见,研究大数据对统计学的挑战和机遇有着十分重要的现实意义。  1.大数据及其目的  现阶段,关于大数据仍旧没有一个十分明确的界定,大数据起初是源自于技术领域。在信息量不断扩大的情况下,使得常规电脑原有存储空间已不能对新处理数据进行承载,新兴数据处理技术得以产生,好比雅虎的Hadoop平台、谷歌的MapReduce等。此类技术能够对僵化层次结构、一致性予以消除,促进数据无需通过常规数据库表格进行排列,极大程度地提升了人们可处理的数据量[1]。 

     2.大数据与统计学的对比  2.1样本统计与全样本统计的区别  样本统计属于统计学不可或缺的依赖,样本指的是结合相应的概率自总体中随机筛选并视作总体代表的集合内容,值得一提的是随机抽样是需要成本的,包括社会关系、资金成本或者时间成本等。基于样本数量提升有限前提下,样本估计误差会随着总体数量增多而增大,这亦是样本统计无法避免的不足。大数据时代下,收集整理庞大的数据信息应运而生,数据信息发展表现出总体即是样本的态势,该属性很好的消除了样本统计这一不足。大数据时代下的全样本统计,通常情况下可对完全总体进行覆盖,然而受大部分数据属于半结构、半结构数据影响,使得概率论应用遭受一定的制约[2]。鉴于此,将全样本统计应用到统计学中,应当就总体数据展开相应的归纳、筛选,即好比在样本统计中展开数据预处理。  2.2预测分析与非预测分析的区别  统计学的创立,是为了对变量相互相关关系展开分析,因此获取数据是发生于变量确定之后的,数据分析价值是能够被预测的。相较于统计学的预测分析,庞大数据将互联网、传感器作为载体,存在于分析需求之前,因此构建于大数据上的分析多为非预测性分析。在统计学中,出现大数据无法有效应用局面,这是由于不具备非预测分析所需的庞大数据,庞大数据产生与数据中心、存储系统存在紧密的联系,并非短期产生。也就是说,统计学中大数据的应用发展,说明了非预测分析正逐步取代传统统计学预测分析,数据多次利用正逐步取代传统数据一次性利用的。  3.大数据对统计学的挑战与机遇  3.1数据生产、处理与应用的转变 

     相关统计部门经开展严格的统计设计工作,获得相关的统计数据,数据的预处理分别有数据清洗、非全面数据填补以及数据矫正等。大数据时代下的统计手段尚不十分明确,自大数据流环境而言,要不断探索新型抽样方法,并确保抽样方法的实时、连贯及可行性。除去传统的统计分析方法,还应当开发大数据动态分析、数据流算法等[3]。  3.2大数据时代对市场营销的机遇  3.2.1大数据营销的特点与价值  大数据营销的特点:I.数据采集多平台化特点,即大数据时代下,大数据的数据大多来源于不同的领域、不同的渠道。II.时效性特点,随着信息技术的急速发展,互联网用户消费、购物行为方式往往会瞬间出现转变。国际先进大数据营销企业AdTime基于此大数据营销特点,采取了时间营销措施,即采取相应的技术方式全面获悉用户所需,于第一时间对用户当下的需求进行回应,以使用户在下决心购买的最佳时间及时看到对应的产品广告。III.个性化特点,在大数据时代下,广告商传统媒体导向的营销理念逐步由受众导向取代,现如今,广告商可应用大数据了解用户的地理方位,需求内容等信息,达到对用户个性化营销的目的。  大数据营销的价值:I.升级营销与用户的匹配度,大数据营销不仅可提供给企业了解用户有效的途径,还能够与网络环境下,选取相关技术方法达到对用户精确定位的目的,从而开展好营销工作,升级营销与用户的匹配度。II.改善用户体验,大数据营销促使企业真正意义上认识到用户及其所使用企业产品情况,以给予用户最人性化的提醒。  3.2.2大数据营销的应用  (1)与消费者建立紧密关系  现如今,我国一些企业营销行为仍旧处于个性化定位信息、创意设计阶段,而无法对不同消费者展开个性化的营销活动。大数据时代下,经采用相关数据分析技术方法,基于对消费群体喜好、传媒接触习惯等展开有效的分析,达到特定营销活动明确开展的目的,实现企业精心开展的营销活动精准的辐射至目标消费群体处,与消费者建立紧密关系,极大的改善营销效率、质量[4]。  (2)掌握竞争对手数据  企业通过对竞争对手数据的有效掌握,获悉竞争对手发展状况,基于此帮助企业制定科学合理的产品价格,提升企业产品市场竞争优势。与此同时,企业务必要全面实施以事实为前提的决策手段,广泛地应用数据分析方式对企业每一个发展运营步骤进行优化,经对企业一系列数据的充分优化、对接,促使业务环节中潜在的价值得以被有效挖掘,降低生产成本,知己知彼,促使企业在日趋白热化的市场竞争中占据有利位置。  (3)挖掘企业内部数据  “市场未动,数据先行”俨然转变为国际上企业有效运营发展的一致认识,为了提升企业管理效率,要求企业要充分挖掘企业内部数据,并展开有效的整合、分析,以为企业相关人员做决策提供有利的参考依据,提升决策准确性,促进企业可持续发展。

    3.2.4 企业的应用案例——以亚马逊为例  在应用大数据开展市场营销方面,美国亚马逊公司一直处于领先地位。亚马逊研发出“用户未下单,先发货”功能,即结合用户的购物需求数据信息,分析用户想要购买的产品,达到用户未下单,提前发货的目的。此外,亚马逊通过对用户检索信息的分析,评估流感的传播,但这仅仅为海量检索数据中的一项用途,相同的数据能够应用于预测大选结果、预测某类产品市场行情等等,极大地降低了统计成本[5]。  3.3大数据时代对市场营销的挑战  3.3.1信息收集  大数据并非就是对数据信息展开盲目的收集,即便收集了再多的数据,倘若这些数据并非是市场营销所需要的,如此便会导致前期收集来的数据信息,变成一堆“数据垃圾”。鉴于此,为了避免这一情况发生,务必要充分分析业务需求,再对自身存在价值的数据展开收集、归纳,如此方可实现大数据的有效收集应用。  3.3.2经验与数据  数据采集完毕后,面对参差不齐的数据,还应当做好数据评估工作,评估对何种目标受众开展市场营销工作。鉴于此,要求采取科学合理的手段,将这些参差不齐的数据整合成可被市场营销实践应用的,经结合过去的经验,与采集数据进行有机融合,实现对目标受众的有效分析确定。  3.3.3分析与优化  数据分析,一方面是实现数据优化,一方面是进行决策层面上的调整、转变。此环节对于专业人才的需求提出了严苛的挑战。数据分析、数据优化对于专业人才的知识框架要求大不相同,这要求相关企业不仅要培养专业的数据分析人才,还要打造数据优化人才队伍。 

     3.4大数据营销的未来发展趋势  信息技术不断发展,单一媒体导向的“消费者碎片化”俨然无法达到企业对于数据多样性的需求。大数据时代下,媒体的跨界融合实现对“碎片化”受众的充分聚合。在科学技术技术不断进步的背景下,跨媒介、跨平台、跨终端的多途径将不断被开拓,将使庞大的数据信息获取多维度的整合,并且在多样化网络环境下,消费者主观信息与客观数据有机融合,构筑全面用户数据库环节,将成为未来大数据营销发展的必然趋势[6]。  4.结束语  总而言之,大数据为传统统计学带来了严峻的考验,也为传统统计学有效发展创造了良好的契机。在大数据时代发展潮流中,我们应当充分的认识到大数据对于传统统计学而言,是补充而不是更替,构建于样本统计、预测分析内容上的传统统计学,仍旧于社会统计、经济分析中占据着主导位置。大数据时代下,为了实现企业市场营销的有效开展,相关人员务必要不断专研研究、总结经验,全面分析大数据与统计学的对比,充分认识大数据对统计学的挑战和机遇,“与消费者建立紧密关系”、“掌握竞争对手数据”、“挖掘企业内部数据”等,积极促进企业市场营销的科学合理化。

  • ?

    数据分析建立六步骤

    盼旋

    展开

    一、什么是数据分析?

    二、数据分析的分类

    数据分析的三大作用:现状分析、原因分析、预测分析。

    三、数据分析的六部曲

    1.明确目的和思路

    首先先明确分析目的,然后梳理分析思路,并搭建分析框架,把分析目的分解成若干个不同的分析要点,即如何具体开展数据分析,需要从哪几个角度进行分析,采用哪些分析指标(各类分析指标需合理搭配使用)。同时,确保分析框架的体系化和逻辑性。

    2.数据收集

    一般数据来源于四种方式:数据库、第三方数据统计工具、专业的调研机构的统计年鉴或报告、市场调查。

    3.数据处理

    数据处理主要包括数据清洗、数据转化、数据抽取、数据合并、数据计算等处理方法,将各种原始数据加工成为数据分析所要求的样式。

    4.数据分析

    常用的数据分析工具,掌握Excel的数据透视表,就能解决大多数的问题。需要的话,可以再有针对性的学习SPSS、R等工具。

    数据挖掘是一种高级的数据分析方法,侧重解决四类数据分析问题:分类、聚类、关联和预测,重点在寻找模式与规律。

    5.数据展现

    一般情况下,数据是通过表格和图形的方式来呈现的。

    常用的数据图表包括饼图、柱形图、条形图、折线图、气泡图、散点图、雷达图等。进一步加工整理变成我们需要的图形,如金字塔图、矩阵图、漏斗图、帕雷托图等。

    一般能用图说明问题的就不用表格,能用表说明问题的就不用文字。

    图表制作的五个步骤:

    1、确定要表达主题

    2、确定哪种图表最适合

    3、选择数据制作图表

    4、检查是否真实反映数据

    5、检查是否表达观点

    常用图表类型和作用:

    6.报告撰写

    一份好的数据分析报告,首先需要有一个好的分析框架,并且图文并茂,层次明晰,能够让阅读者一目了然。

    结构清晰、主次分明可以使阅读者正确理解报告内容;图文并茂,可以令数据更加生动活泼,提高视觉冲击力,有助于阅读者更形象、直观地看清楚问题和结论,从而产生思考。

    好的数据分析报告需要有明确的结论、建议或解决方案。

    四、数据分析的四大误区

    1.分析目的不明确,为了分析而分析,这是菜鸟常常容易出现的问题;

    2.缺乏行业、公司业务认知,分析结果偏离实际。数据必须和业务结合才有意义。摸清楚所在产业链的整个结构,对行业的上游和下游的经营情况有大致的了解,再根据业务当前的需要,制定发展计划,归类出需要整理的数据。同时,熟悉业务才能看到数据背后隐藏的信息;

    3.为了方法而方法,为了工具而工具,只要能解决问题的方法和工具就是好的方法和工具;

    4.数据本身是客观的,但被解读出来的数据是主观的。同样的数据由不同的人分析很可能得出完全相反的结论,所以一定不能提前带着观点去分析。

    内容来源:小蚊子数据分析

    百家号-【袁帅数据分析运营】运营者:袁帅,互联网数据分析运营实践者。会展业信息化、数字化领域专家。认证数据分析师、网络营销师、SEM搜索引擎营销师、SEO工程师、电子商务职业经理人。

  • ?

    解析常见的数据分析方法——用户留存分析

    盼波

    展开

    据某第三方平台近期调研结果显示,在金融创业领域,2013年一家互联网金融创业公司的投资获客成本区间为300-500元,而2016年则涨为1000-3000元;在电商领域,新用户的获取成本,是维护一个老用户的3倍到10倍……

    如今,高居不下的获客成本让互联网、移动互联网创业者们遭遇新的“天花板”,甚至陷入“纳不起”新客的窘境。而花费极高成本所获取的客户,可能仅打开一次APP、或完成一次交易,就流白白流失。随着市场饱和度上升,绝大多数企业亟待解决如何增加客户黏性,延长每一个客户的生命周期价值。因此留存分析分析模型备受青睐。

    一、什么是留存分析

    留存分析是一种用来分析用户参与情况/活跃程度的分析模型,考察进行初始行为的用户中,有多少人会进行后续行为。这是用来衡量产品对用户价值高低的重要方法。留存分析可以帮助回答以下问题:

    一个新客户在未来的一段时间内是否完成了您期许用户完成的行为?如支付订单等;

    某个社交产品改进了新注册用户的引导流程,期待改善用户注册后的参与程度,如何验证?

    想判断某项产品改动是否奏效,如新增了一个邀请好友的功能,观察是否有人因新增功能而多使用产品几个月?

    有人会疑惑:为什么要做留存分析,直接看活跃用户百分比不行吗?当然不行!如果产品目前处于快速增长阶段,很有可能新用户中的活跃用户数增长掩盖了老用户活跃度的变化。按初始行为时间分组的留存分析可以消除用户增长对用户参与数据带来的影响。通过留存分析,你可以将用户按照注册时间分段查看,得出类似如下结论:“三月份改版前,该月注册的用户 7 天留存只有 15%;但是四月份改版后,该月注册的用户 7 天留存提高到了 20%。”

    二、神策分析留存分析模型特点与价值

    神策分析留存分析根据实际需求灵活配置条件。可针对事件属性,根据具体需求筛选初始行为或后续行为的细分维度。另外,还可以针对用户属性筛选合适的分析对象。那么,留存分析有哪些价值呢?

    第一,留存率是判断产品价值最重要的标准,揭示了产品保留用户的能力。

    留存率反映的实际上是一种转化率,即由初期的不稳定的用户转化为活跃用户、稳定用户、忠诚用户的过程。随着统计数字的变化,运营人员可看到不同时期用户的变化情况,从而判断产品对客户的吸引力。

    第二,宏观上把握用户生命周期长度以及定位产品可改善至之处;

    通过留存分析,可以查看新功能上线之后,对不同群体的留存是否带来不同效果? 可以判断产品新功能或某活动是否提高了用户的留存率?结合版本更新、市场推广等诸多因素结合,砍掉使用频率低的功能,实现快速迭代验证,制定相应的策略。

    三、神策分析留存分析应用场景

    场景一:游戏行业提升活跃、留存——如何精准找到玩家“流失点”?

    游戏的生命周期的时长差异、玩家的游戏粘度,直接体现了游戏的竞争能力和盈利能力。玩家对游戏的直观感受、游戏难度曲线、游戏节奏的松弛、游戏福利等游戏内涵都能够导致游戏玩家流失。正确找到玩家流失原因,是促进玩家、活跃挽留玩家的第一步。《迷城物语》是如何在神策分析做到这一点的?下面为《迷城物语》在删档测试期间的相关应用情景。(注:以下配图所涉及的数据,均为模拟真实应用场景下的虚拟数据)

    在神策分析的平台上,可统计流失玩家的等级分布,判断玩家流失与关卡设置的相关性。

    图1 玩家在首次登陆游戏之后的8周流失情况分析

    上图显示,100~110级、80~90级是玩家流失较多的关卡。为精准导致玩家流失的关键因素,需要每个环节、具体场景进行深入追踪与分析,下略。

    场景二:了解新用户的留存

    运营人员可以根据新用户启动 App 的时间按日或按月进行分组,得到同期群,观察该群体用户发生投资的7日留存、14日留存或30日留存(可自由选择),通过比较不同的同期群,可以获知,从总体上看用户留存的情况是否越来越好了。也可以点击“曲线标识”按钮,就可以看到每天留存率的变化趋势了。

    图 2 新用户群体七天留存趋势变化

    对于 7 日或者 30 日仍留下来做投资的用户,显然是一批忠诚度非常高的用户,什么样的用户群体有这么高的留存率?以 4 月 10 号这天的新用户为例,一共有 1931 个新用户,在第 7 天有 68 人留下来了,点击“68”这个数字,我们进入了用户列表界面。

    这里值得强调的是,神策分析支持用户路径分析结果的人群明细查看。迄今为止,神策数据所有用户行为分析中的人群明细均可查看,如下图。

    图3 第 7 天用户留存 68 人基本信息明细

    这里我们能够看到留存下来的用户的一些详细的基础信息,比如借款次数,借款金额、年龄等,通过总借款次数以及借款金额,可进行用户质量评估;通过年龄可以分析到金融平台吸引的群体用户的年龄分布。

    若想深度挖掘高留存用户有哪些共性特征、具体操作流程,以作为后序产品优化与改进的借鉴,则可使用用户分群功能,命名为“ 4-10 号 7 日留存用”然后通过用户路径等其他分析模型进一步深度分析。

  • ?

    数据分析:统计学方法在数据挖掘中的应用探究,看完长见识了!

    Rabia

    展开

    统计学方法在数据挖掘中的应用探究

    数据挖掘就是指从众多实际应用数据中获取批量大、有噪声、且随机性强的数据,将潜在的信息与数据提取出来,就是从数据中挖掘有价值的知识,而大多数原始数据具有一定的结构化特征,比如,关系数据库中的数据;也可以通过文本、图形、图像等半结构化发掘有用知识,这些知识可以是数学的也可以是非数学形式的;数据挖掘能以归纳形式存在,能够被广泛应用到信息查询、信息管理、信息决策控制中,方便数据的维护与管理。由此可见,数据挖掘是一门交叉性强的学科,加强对其的研究非常有意义,下面将对统计方法在数据挖掘中的具体应用进行分析。 

     一、数据挖掘与统计学的关系  (一)数据挖掘的内涵  通常来说,数据挖掘的定义较为模糊,没有明确界定,大部分对其的定义只是停留在其背景与观点的内容上。通过对不同观点的统一整理,人们最终将其描述为:从大量多样化的信息中发现隐晦性、规律性等潜在信息,并对这些信息进行创造、加工的过程。数据挖掘作为一门重要的交叉学科,能够将数据库、人工智能、机器学习、统计学等众多的科学融入到一起,从而实现技术与理论的创新与发展[1]。其中,数据库、人工智能与统计学是数据挖掘当中的三大支柱理论。数据挖掘的目的是从数据库当中发掘各种隐含的知识与信息,此过程的方法非常多,有统计学知识、遗传算法、粗集方法、决策法、模糊逻辑法等,还可以应用向邻近的可视技术、模式识别技术等,在以上所有技术的支持上能够使数据挖掘更为科学、有序。  (二)数据挖掘与统计学间的关系  通常来说,统计学的主要功能是对统计原理与统计方法进行研究的科学。具体来说就是指对数字资料进行的收集、整理、排序、分析、利用的过程,数字资料是各种信息的归纳与总结,可以将其作为特性原理的认知、推理方法[2]。而统计学则表示的是使用专业的统计学、概率理论原理等对各种属性关系的统计与分析过程,通过分析成功找到属性间的关联与发展的规律。在此过程中,统计分析方法是数据挖掘最为重要的手段之一。

      在数据挖掘这一课题被提出来之前,统计分析技术对于人们来说更熟悉,也是人们日常开展工作、寻找数据间规律最常使用的收集整理方法。但是不能简单的将数据挖掘作为统计学的延伸与替代工具,而是要将两者的区别认识到位,再结合两者间的不同特点分析其应用特点[3]。大部分的统计学分析技术都是建立在数学理论与技巧上的,预测通常较为准确,效果能够让大部分人满意。数据挖掘能够充分借鉴并吸收统计学技术,在融入到自身特点以后成为一种数据挖掘技术。  统计学与数据挖掘存在的目标都是一致的,就是不断对数据结构进行发掘。鉴于统计学与数据挖掘在目标上的一致性,致使很多研究学者与专家将数据挖掘作为了统计学的一个分支机构[4]。但是这种认知非常不正确,因为数据挖掘不仅体现在与统计学的关系上还体现在思想、工具与方法上,尤其是在计算机科学领域对数据挖掘起到的作用非常大。比如,通过借助数据库技术与人工智能的学习,能够关注到更多统计学与数据挖掘上的共通点,但是两者存在的差异依然非常大。数据挖掘就是指对大量的数据信息不断挖掘的过程,DM能够对数据模式内的数据关系进行充分挖掘,并对观测到的数据库处理有着极高的关注度。  二、数据挖掘的主要过程  从数据本身出发探讨数据挖掘过程,数据挖掘的过程分为信息的收集、数据集成、数据处理、数据变换、数据挖掘实施等过程。

     

     首先,要将业务对象确定下来,明确不同业务定义,并认清数据挖掘的目的,这是做好数据挖掘最关键的一步,也是最重要的一步,虽然挖掘的结果不能被准确预测到,但却需要对问题的可预见性进行探索[5]。其次,还要做好数据准备工作,包含数据清理、数据变换等工作,数据清理的实际意义是将噪声与空缺值补全,针对这一问题,可以使用平滑技术,而空缺值的处理则是属性中最常见的,可以将统计中最可能出现的值作为一个空缺值[6]。  信息收集指的是按照特定的数据分析对象,可以将分析中需要的特征信息抽象出来,并在此基础上选择出较为科学、适合的信息收集方法,将全部的信息全部录入到特定的数据库中。如果数据量较大,则可以选择一个专门的管理数据的仓库,实现对信息的有效保护与管理;数据集成就是指将来源不同、格式不同、性质不同、特点不同的数据集成到一起,进而为企业提供更为全面、系统的数据共享平台;数据变换就是通过聚集、概化、规范化等方式对数据进行挖掘,对于一些实用数据,则可以通过分层与分离方式实现对数据的转换;数据挖掘就是结合数据仓库中的数据信息点,并选择正确的分析方法实现对有价值数据的挖掘,事例推理、规则推理、遗传算法等都是应用较多的方法[7]。  三、统计学方法中的聚类分析  在统计学聚类方法基础上能够构建出潜在的概率分布假设,可以使用试图优化的方法构建数据与统计模型的拟合效果。基于统计学聚类方法当中,Cobweb方法是在1987年由Fisher提出的,能够以分类树作为层次聚类创建的方法,在分类树上,每一个节点都能代表着一个概念,该方法就是对节点概率描述的过程。Cobweb方法还使用了启发式估算方式,使用分类效用对分类树的构建进行指导,从而实现对最高分类的划分目的,能够将不同分类对象全部归类到一个类别中,并依据这些内容创建出一个新的类别。但是这种方法也存在一定局限性,局限性在于假设的属性概率分布都是独立的,并不能始终处于成立状态中。

  • ?

    数据分析的框架和常用方法

    王不可

    展开

    第一部分:数据分析框架

    为了分析问题的聚焦,我们具体拿互联网电商来举例子说明,至于其他的比如互联网金融、教育、社交等等,可以依此借鉴。

    (1)从互联网实体角度分析。我们可以从以下7个角度构建互联网数据分析体系。

    买家:基本特征分析、交易行为分析、流量行为分析、售后满意分析等

    卖家:基本特征分析、经营效果分析、流量曝光分析、售后满意分析、产品分析等

    产品:基本特征分析、交易行为分析、流量曝光分析、售后满意分析等

    行业:基本特征分析、经营分析、曝光分析、售后分析、产品分析、买卖家分析等

    设备:移动端分析、PC端分析、访问对象分析、cookie分析、session分析等

    日志:访问对象URL分析、cookie分析、session分析等

    事件:登录、流量、点击、曝光、下单、交易、支付、物流、评价、纠纷、仲裁等分析

    这个实体分析方法,可以称得上是万能的数据分析框架,适用于所有的互联网企业。我曾工作过的阿里巴巴、腾讯、随手记等企业,我个人都是按照这个套路去构建互联网的分析体系。

    (2)从用户的关键路径进行分析。

    关键路径分析方法是一个行之有效的常用分析方法,也是做数据化运营的常用工具。关键路径分析让我们聚焦于核心环节,排除杂音,定位出业务的核心问题,快速的加以解决。在应用关键路径分析时候,我们往往先把可能的结果、以及最关心的结果梳理出来,以结果为导向追溯行为的根本,当然,也可以从行为的初始出发,梳理出所有可能的行为路径,找出关键行为,导向我们最终设计好的结果中去。下面我们举例子说明下:

    在电商网站中,我们假设我们运营目标是让用户购买网站上的商品(在这里,我要插说几句,我们的目标有时候不只是购买,在精细化运营中,往往会根据用户的生命周期,确定关键路径的目标,比如对于一个进入期的新买家,我们通常会发一些购物攻略加以指导,针对流失期的买家,关键路径的结果我们可能导向申领我们的优惠劵之类,等等。关于这一部分数据化精细化运营方面,在大数据应用系列的数据化运营小讲,我们会详细加以分享,敬请关注)。刚才谈到,我们假设我们运营目标是让用户购买网站上的商品,那么我们可以把关键路径,也即,用户的购买路径梳理出来:

    a.用户登录/注册》搜索关键词》查看商品详情》加入购物车》点击下单》确认付款》确认收货

    b.用户搜索关键词》类目和店铺》卖家交流》点击下单》确认付款》确认收货

    通过这种关键路径,我们还常常进行漏斗分析,从而进行流量的转化分析,找出影响到达最终结果的关键环节。

    (3)从KPI拆解角度分析。

    KPI拆解分析方法也是比较常见的互联网分析方法。核心思想是先定一个总体目标,比如今年营收12亿,那么可以把这个指标拆解到各个业务线去,业务线再进行拆分,比如分解为12个月,每个月需要达成营收额,接着,就是达成该营收额,根据流量的转化情况,估算出需要多少的流量,目前平台已有多少流量,需要外拓引流多少流量才能达成目标,这就可以层层的拆解指标,最终或落地到产品团队或部分到运营团队去承担KPI任务。

    第二部分:数据分析常用分析方法

    常用的数据分析方法有:PEST分析方法、5W2H分析法、4P营销分析法、逻辑树分析法、指标拆分法、对比分析法、漏斗分析法、用户行为分析法、用户生命周期分析法、金字塔分析法等等,下面我们逐个的简单说明下

    (1)PEST分析方法

    这个方法主要应用于行业研究中。从政治(Political)、经济(Economic)、社会(Social)、技术(Technical),简称PEST角度对一个行业进行比较分析。下面我们举一个例子:我们小讲开始就谈到数据分析行业前景,那么我们在此利用PEST分析下大数据行业前景如何?

    (2)5W2H分析法

    这个方法主要应用于用户行为研究和专项问题分析,从时间、地点、人物、事情、原因、方式、价格等7个方面对一个问题进行刻画研究。请看如下案例二:

    (3)4P营销理论

    这个方法主要应用于公司整体经营状况分析,是比较经典的营销分析方法。该方法从产品、价格、渠道、促销等四方面对企业经营状况进行全面分析。请看如下案例三:

    (4)逻辑树分析法

    这个方法也称作问题树分析方法,主要应用于针对业务存在的问题进行专题分析,是数据分析方法中非常常见的一种分析方法。请看案例四:

    (5)指标拆分法

    这个方法也是经常适用的方法,特别是为了达成业务目标,我们往往都会先定一个总的目标,然后再初步的拆解指标。下面我们讲讲案例五:

    (6)对比分析法

    对比分析法是非常常用的基础分析方法,虽然方法特别简单,但几乎所有的分析报告中,都会采取对比分析方法。比如去年同期相比、上个月环比、目标和实际达成相比、各个部门和业务线相比、行业内竞品比较、营销效果对比,等等。这里需要注意的是我们不管是横向比较还是纵向比较,比较的双方一定要有可比性,并且在同一个维度、粒度上去比较,要不是毫无意义的。

    (7)漏斗分析法

    漏斗分析方法经常应用于产品的转化分析。举个电商的例子:用户登录网站1千万,浏览商品详情页200万,加入购物车80万,下单支付50万,支付成功40万。每一步都是转化率的问题。针对关键路径进行漏斗分析能够帮助我们快速的定位到问题所在。从而能够及时做出决策。

    (8)用户行为理论

    也称用户的活动周期理论。该分析方法,往往用于对用户的基础研究中。用户行为过程分为认知、熟悉、试用、使用和忠诚5个步骤。

    (9)用户生命周期理论

    该分析方法,也往往用于用户基础研究中,在互联网领域应用广泛。用户的生命周期分为进入期、成长期、成熟期、衰退期、流失期。每一个阶段用户的行为特征是不一样的,其价值是不一样的,需要精细化的运营。不可急功近利。

    (10)金字塔理论

    金字塔这个分析方法正好和漏斗分析方法相反,它是基数大,上层小。最初是英国历史学家、政治学家诺斯科特·帕金森(C.Northcote Parkinson)在《帕金森定律》(Parkinson's Law)一书中,论述在行政管理中,行政机构会像金字塔一样不断增多,行政人员不断膨胀,每个人都很忙,但组织效率越来越低下。这条定律又被称为“金字塔上升”现象。后来,人们将这一理论延伸应用,不再只限于本意。大凡是基数大,上层小,符合金字塔特征的研究分析都可以套用到该理论中。所以,金字塔这幅图也常常见于各分析报告中。比如,分析用户群体特征(马斯洛需求层次模型、用户价值模型等等)

    综上所述种种数据分析方法,如果在一份分析报告中,能够把这些分析方法都灵活反复体现和应用,那么,这个分析报告一定会比较丰满的。

    第三部分:数据分析的流程

    数据分析的流程主要分为六步骤,遵循这种方法,一个完整的数据分析项目就出来了。

    (1)明确分析目的:我们接到一个分析任务,首先要弄清楚我们分析的对象是什么,要达成怎样的目的,不能陷于为了分析而分析。然后,要熟悉行业和业务,透彻的理解分析的目的,构建起分析的角度和体系。

    (2)进行数据准备:我们有哪些数据,通过什么途径可以获取到需要的数据,往往涉及到内部数据和外部数据,内部数据常常是我们的业务库或者基础数据团队建立起来的数据仓库系统,外部数据方面,现在各行各业都有大数据交易源,还有大量的公开市场数据。

    (3)进行数据加工处理:主要通过数据清洗工作,对重复值进行去重处理、对异常值错误值进行修正或剔除、对缺失值进行填充修正或删除。如果软件环境为支持大数据量情况下,还需要对数据进行抽样处理。经过这些预处理后,最重要的就是进行数据的计算统计、合并转换,让数据符合目标分析过程。

    (4)进行数据分析挖掘:绝大部分的分析目标达成都可以刚才介绍的分析方法外加常见统计分析等达到。主要的分析:整体和组成分析、走势趋势分析、均值方差分析、排序TOP分析、同比环比纵横比较分析、频度频率分析、相关关系分析、数量和比例的双坐标分析、逻辑结构分析、金字塔分析、漏斗图分析、矩阵图分析、指标拆解分析、PEST分析、5W2H分析法、4P营销分析等等。还有一部分分析需要到更高级的数据分析方法才能得到结论。

    (5)进行数据结果图表展现:数据分析的目的就是要解决问题的,往往数据分析师不是需求的发起人,那么这就需要数据分析师把分析的数据和结论展现给需求方。最佳的方式就是通过图表,有理有据形象的重点突出且专业的表达出来。根据第(4)步骤的分析,我们可以选取恰当的图标。比如常用的有:折线图、柱形图、条形图、饼图、冒泡图、散点图、矩阵图、雷达图、双坐标图、瀑布图、帕累托图、金字塔图、漏斗图等等。

    正如我之前的一篇文章 《图说可视化,报表也能做得如此酷炫!》,讲到帆软报表制作数据可视化的几个关键点。

    (6)写出分析报告:数据分析最终的结论全部体现在分析报告中,一个分析师水平如何,只要看他写过的一份分析报告就可以完全清楚了。综合灵活应用这么多的分析方法和各种各样的展示图表,分析报告一定会显得非常丰满。下面一个问题我们再详细和大家讨论数据分析报告的相关事情。

  • ?

    9种常用数据分析方法

    丹蝶

    展开

    数据分析是从数据中提取有价值信息的过程,过程中需要对数据进行各种处理和归类,只有掌握了正确的数据分类方法和数据处理模式,才能起到事半功倍的效果,以下是数据分析员必备的9种数据分析思维模式:

    1. 分类

    分类是一种基本的数据分析方式,数据根据其特点,可将数据对象划分为不同的部分和类型,再进一步分析,能够进一步挖掘事物的本质。

    2. 回归

    回归是一种运用广泛的统计分析方法,可以通过规定因变量和自变量来确定变量之间的因果关系,建立回归模型,并根据实测数据来求解模型的各参数,然后评价回归模型是否能够很好的拟合实测数据,如果能够很好的拟合,则可以根据自变量作进一步预测。

    3. 聚类

    聚类是根据数据的内在性质将数据分成一些聚合类,每一聚合类中的元素尽可能具有相同的特性,不同聚合类之间的特性差别尽可能大的一种分类方式,其与分类分析不同,所划分的类是未知的,因此,聚类分析也称为无指导或无监督的学习。

    数据聚类是对于静态数据分析的一门技术,在许多领域受到广泛应用,包括机器学习,数据挖掘,模式识别,图像分析以及生物信息。

    4. 相似匹配

    相似匹配是通过一定的方法,来计算两个数据的相似程度,相似程度通常会用一个是百分比来衡量。相似匹配算法被用在很多不同的计算场景,如数据清洗、用户输入纠错、推荐统计、剽窃检测系统、自动评分系统、网页搜索和DNA序列匹配等领域。

    5. 频繁项集

    频繁项集是指事例中频繁出现的项的集合,如啤酒和尿不湿,Apriori算法是一种挖掘关联规则的频繁项集算法,其核心思想是通过候选集生成和情节的向下封闭检测两个阶段来挖掘频繁项集,目前已被广泛的应用在商业、网络安全等领域。

    6. 统计描述

    统计描述是根据数据的特点,用一定的统计指标和指标体系,表明数据所反馈的信息,是对数据分析的基础处理工作,主要方法包括:平均指标和变异指标的计算、资料分布形态的图形表现等。

    7. 链接预测

    链接预测是一种预测数据之间本应存有的关系的一种方法,链接预测可分为基于节点属性的预测和基于网络结构的预测,基于节点之间属性的链接预测包括分析节点资审的属性和节点之间属性的关系等信息,利用节点信息知识集和节点相似度等方法得到节点之间隐藏的关系。与基于节点属性的链接预测相比,网络结构数据更容易获得。复杂网络领域一个主要的观点表明,网络中的个体的特质没有个体间的关系重要。因此基于网络结构的链接预测受到越来越多的关注。

    8. 数据压缩

    数据压缩是指在不丢失有用信息的前提下,缩减数据量以减少存储空间,提高其传输、存储和处理效率,或按照一定的算法对数据进行重新组织,减少数据的冗余和存储的空间的一种技术方法。数据压缩分为有损压缩和无损压缩。

    9. 因果分析

    因果分析法是利用事物发展变化的因果关系来进行预测的方法,运用因果分析法进行市场预测,主要是采用回归分析方法,除此之外,计算经济模型和投人产出分析等方法也较为常用。

    以上是数据分析员应熟练掌握的9种数据分析思维方法,数据分析员应根据实际情况合理运用不同的方法,才能够快速精确的挖掘出有价值的信息!

  • ?

    数据分析:浅谈企业如何运用统计分析,看完后真是长见识了!

    冰绿

    展开

    摘 要:统计分析是一种反映统计结果的工具,它在现在的企业中,被运用得很广泛,但它所使用的技术水平也在不断的提高,特别是在反映企业统计结果方面,更具有一定的实用性。企业在使用统计分析时,涉及到很多种行业中,例如:工业、商业、建筑业和交通以及邮电等各企业统计分析工作中。

    关键词:

    一、统计分析的概念统计分析是指运用统计方法及与分析对象有关的知识,从定量与定性的结合上进行的研究活动。它是继统计设计、统计调查、统计整理之后的一项十分重要的工作,是在前几个阶段工作的基础上通过分析从而达到对研究对象更为深刻的认识。它又是在一定的选题下,集分析方案的设计、资料的搜集和整理而展开的研究活动。系统、完善的资料是统计分析的必要条件。二、统计分析的特点  统计分析是对客观现象的一种认识活动,它在定性分析的基础上,经过定量研究,达到对现象本质及规律性的认识。  统计分析方法具有特殊性 统计分析方法是以总体现象的数量关系为对象的一类特殊科学研究方法的总称。从应用的角度来看,统计分析方法可分为经验方法和数学方法两大类。经验方法是指一些与初等数学知识和人们的实践经验相关联的方法。数学方法又称为数理统计方法,是以数学理论,特别是概率论为基础对客观现象进行研究的方法。它可以通过对现象貌似偶然的变动来探求其必然的规律性。

    统计分析的对象具有综合性 统计分析的对象不是某种社会经济现象的个体数量方面,而是现象的总体数量方面,分析研究其综合数量特征。从总体上对客观现象的数量方面进行分析,可以避免以偏概全,使认识较为全面和正确。三、统计分析方法 统计分析方法很多,但基本方法是定量分析 。l、从统计理论上看,我们所见到的统计学著作,除了统计设计、统计调查、统计整理等理论和方法外,其他大部分内容都是统计分析方法,这些统计分析方法有一个共同点,它们都是定量分析方法。 2、统计实践上看,统计分析所起的作用,是通过定量分析实现的。统计分析在人们的认识过程中有三个作用:第一,对客观事物量化,包括反映客观事物规律的数量表现;第二,根据量变程度确认事物的质,即确定区别事物质量的数量界限;第三,揭示新的规律,即通过分析数量关系,发现尚未被认识的事物的规律。  四、企业如何运用统计分析   随着社会主义市场经济的发展,统计为企业发展战略的研究和制定,为各项职能管理提供必要的信息,为防范和化解风险,发挥其预警作用,新经济时代统计信息是影响企业管理层决策成败的关键。

    (一)在企业经营过程中:在企业的经营管理中,统计分析占据着十分重要的地位。在认识统计的过程中,企业通过统计调查以及整理取得的统计资料能够对客观现象的数量特点取得一定的认识。若不进行深入的整理和分析,对于这些现象的认识还只停留在表面的初步认识状态,所以必须对这些统计资料加以分析和研究,才可以掌握事物的本质以及内在的发展规律,通过逐渐地深化认识,有效的深入的分析方法,查找出经营管理中存在的问题和薄弱环节,就可以提出改进的举措,给各级领导各级管理部门参考改进建议,是企业的各项管理工作不段得到改善和提高,充分显示出统计分析在企业经营管理中发挥的广泛应用。(二)在企业目标管理中:(1)在企业的各项经济指标的预测中,通常强调动态的分析预测与静态的分析预测相互结合,其中以静态分析预测为主。企业首先要根据自身发展的特点,寻找到经济运行波动的共性和差异,根据企业的总体规划以及企业的特殊性,依据企业的历史统计数据,运用相应的预测模型给出企业相关指标的科学性预测,根据预测数据制定出各项计划经营指标和各项KPI考核指标,再通过把企业的月度统计预测、季度统计预测和年度统计预测与月度、季度及年度各解段实际完成情况进行对比分析,进行不断调整修正完善,使得企业的目标管理以及考核指标得到实现和完成的保证。

    (三)、在企业的决策性分析中:在我国的经济管理领域,决策性分析方法是最先被引入和普及的定量化分析方法。随着企业信息化建设的推进,企业受外部环境的影响逐步加深,这就要求企业及时对相关信息进行处理和分析。一是对市场需求和供给能力的分析。主要包括居民的购买力、商品的潜在和实际市场需求量、品牌成熟度、订单满足率、消费偏好等。通过分析,可以判断企业的赢利空间、供需缺口等,为领导层确定商品销售规模、制定阶段性营销策略等提供依据。二是对社会经济环境的分析和影响。主要包括国内、国际的宏观环境对我国行业发展的影响和对地方法规、民风民俗对企业的发展的影响。三是对企业竞争力的分析。通过分析本行业其他企业的经营情况,在对比中认识自身发展的差距和潜力,从而为制定正确的发展战略提供参考。(四)在企业过程分析和阶段分析控制中:在计划方案的落实过程中,往往会出现一些不可预知的状况。需要及时的进行过程分析和阶段分析。企业利用统计数据定期分析计划完成情况、进度情况等,可以及时的发现执行过程中所存在的问题。通过对完成阶段的结果进行对比分析,有利于确定指标完成率。便于衡量市场潜力相同的不同市场之间的业绩。也作为销售目标制定的依据。  

    在企业当中,统计分析工作是了解现状、预测未来,为了更好的促进企业发展进步的重要方法。做好统计分析工作具有重要的作用和意义。因此,我们要提高对统计分析的研究,使统计分析工作更好地成为企业发展的有力推动力量。 参考文献:[1]百度百科.统计分析[EB/OL].  [2]赵井霞.试谈如何进行统计分析[J].商业经济.2004.4.   [3]宋安. 统计分析在企业管理与经营决策中的应用[J].经济师.2003.6

数据统计分析方法

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP