中企动力 > 商学院 > 数据分析和数据分析
  • ?

    数据分析师应该具备哪种基本能力?

    廖乐天

    展开

    在互联网时代,数据是重要的资源,随着数据的持续增长和大数据技术的成熟,数据分析变得越来越重要,要看清楚瞬息万变的网络世界,要知道表象背后的真相,非靠数据分析不可,不管是大数据分析还是传统数据分析,其本质是一样的。数据分析是为了通过对数据现象的查看来完成对产品,营销策略,运营策略的优化。达到最低成本,最优效果。因此,数据分析师对应的要求也越来越高。那么,作为一名优秀的数据分析师,需要有哪些基本能力,才能完成数据分析目标,保证结果的正确性?

    商业数据分析的根本目的就是要洞察数据背后的规律,基于此,企业可以制订决策、并采取相应措施和行动,进而达成想要的结果。这是商业数据分析的最大价值所在。

    数据分析的四个能力

    1. 对业务的理解能力

    数据分析之前,首先要进行的是业务梳理。只有在实践领域从事过数据分析工作,就会明白所有分析的重中之重都是业务知识本身。而业务知识的学习和掌握,需要的积累之深,培养一个业务专家,需要的周期之长,都远远超过后面所说的那些基本技能,成为业务专家实属不易,数据分析师其实是之于业务专家之上的更深层次的思考和总结,否则,谁指导谁都是个问题。业务学习的方式很多,比如将以前的分析报告和取数案例都拿过来研究一下,不懂就问,总是一个渐进的过程,但需要时间和行业的沉淀。数据分析师最需要不断提升的能力就是行业和业务知识,没有之一。

    提升业务理解能力有几个方法

    多使用产品本身,只有不断的尝试产品,体验和了解各种产品,才能在分析时有直观的思考和总结;与 产品相关的业务和技术同学沟通,尤其在进行数据理解和运营理解的时候,需要知道数据元素的含义以及当前运营的方式和形成这种运营方式的原因;多思考产品的内在逻辑,多问几个为什么,这样才不至于做分析方案的时候,遗漏其它的业务流程,或者进行错误的数据模型设计。2.有耐心,善于沟通

    数据处理和逻辑梳理需要足够的耐心,尤其是在各种数据格式不统一,数据表存放混乱,以及业务流程/逻辑异常复杂的情况下,作为数据分析师,一定要有足够的耐心,沉下来进行全面的数据流程确认,画出对应的流程图,理清分析重点。

    同时,数据分析贯穿BIT、数据、技术、业务整个链条,数据分析师将BIT最终转化成决策者理解的语言,跨越的流程很长,你需要面对不同的岗位,碰到不同的角色,采用不同的语言,表达你的要求和获得你需要的东西,成为数据和业务的桥梁,没有足够的沟通能力很难。所以,需要具备一定的沟通能力。在沟通之前,需要清楚的知道本次沟通的目的是什么,以及如何通过对方来达成自己有效数据分析的目标。与技术沟通,是理解参数含义,与运营沟通,是理解分析目标,与产品沟通,则是强调产品逻辑以及背后的思考。同时,如果你容易听取他人的意见,特别是智者的意见,则可以帮你找到另一条出路,你犯错的概率就会降低,相应的,你的分析就更有力量和说服力。

    3. 数据分析的技术

    数据分析有很多技术可以支持,包括SQL,Excle,SPSS,Matlab、Python等等,这些都是通过编程完成基本的数据分析语言编写,然后进行执行得出结果。

    因此,数据分析师必须掌握并精通一两种数据分析编程技巧。包括从数据仓库中获取数据,对数据进行清洗,简化,或者补全,处理数据,计算数据,最后进行可视化的表达。这样才能完成数据分析的目标。这种技术对产品和运营人员也非常重要,只有学会处理数据,分析数据,才能在每个决策上面有据可依。

    但在公司的数据分析中,你在看案例时,往往接触到的数据或使用的数据是局部的,因此,你的视野会受局限,在大多数公司里,很多数据分析师其实缺乏全局的数据视野,因为他不知道到底有多少数据,因此,永远只能在已知的数据里转圈圈,

    当然,大多数数据分析师可能不需要进行系统数据学习,在实践中慢慢熟悉就好了,但自顶向下的数据学习方式可以让你有一个更好的基础和更全局的数据视野。

    4.独立思考的能力

    数据分析并不仅仅是为了完成一些业务上面的数据需求和论证。数据分析者应该在理解业务的基础上,扩大自己的思考范围,提升洞察力。

    成为一个优秀的数据分析师,需要在不同的业务中进行磨练,同时需要足够的耐心和深入业务的思考进行决策支撑。一种客观,理性,同时又科学的数据分析心态是非常重要的,对于公司和产品的发展也是必需。

    数据总是在那里,它不会说话,你不仅要基于业务能力理解它,还要学会推演和分析,从中发现规律,迅速定位某个商业问题的关键属性和决定因素,形成自己独创性的见解,所谓心思缜密,滴水不漏,没有思考逻辑没有数据分析。而要形成独特的见解,则来自于个人不断的学习和思考,这里的学习更多的强调是跨领域和专业,思考则是更多的强调养成思考的习惯。思考本身就是一种实践,它可以将你的知识更加系统化和深入化,数据分析在一定程度上是用来验证思路和启发灵感的,“数据分析”从来不是“数据分析”本身,而是以“数据分析”为手段和表象,对业务的深刻理解、思考和判断。

    数据分析的四个层次

    描述性分析(Descriptive Analysis)诊断性分析(Diagnostic Analysis)预测性分析(Predictive Analysis)处方性分析(Prescriptive Analysis)描述性分析——发生了什么?

    如题目名字一样,该层次主要是对已经发生的事实用数据做出准确的描述。比如某企业本月订单签约额比上月增加2000万,至5500万,但是订单履约率从上月的98%下降到了95%,库存周转率从上月的0.8下降到了0.7。那么,这就是发生了什么?就需要去描述性分析。

    诊断性分析——为什么会发生?

    知道发生了什么,对我们的帮助不大,更重要的是,我们要明白为什么发生。比如经过分析,发现在描述性分析中提到的订单履约率下降的原因是成品生产不出来,无法完成交付。而成品生产不出来的原因则是部分原材料的供应商未能按时送货,导致原材料不齐套,无法开始生产。那么,这就是诊断性分析。

    预测性分析——可能会发生什么?

    基于上述两个层次的分析,我们发现了其中的规律,即原材料供应商的未能及时送货会影响成品订单的履约率。假如上月某原材料供应商A送货及时率只有70%,通过建模,我们可以预测本月该供应商会使我们的订单履约率下降2%。那么,这就是预测性分析。

    处方性分析——我们该做些什么?

    有了预测性分析的结果后,我们无需再做事后诸葛亮,而可以运筹帷幄,在事前就采取措施。上述中,供应商A会导致本月我们的订单履约率下降,我们可能采取的措施就是把A换掉,但是现在有B和C两个供应商供我们选择,该选择哪个呢?通过分析和计算得出:选用供应商B会比选C的订单履约率高1%,因此建议选择供应商B。这就是处方性分析。

    四个层次层层递进,经过这四个层次的分析以后,可以对企业的决策和行动提供有力支撑。

    分享 IT 技术和行业经验,请关注-技术学派。

  • ?

    干货 | 这是一份完整的大数据处理技术总结与分析

    艾比

    展开

    一 数据分析处理需求分类

    1 事务型处理

    在我们实际生活中,事务型数据处理需求非常常见,例如:淘宝网站交易系统、12306网站火车票交易系统、超市POS系统等都属于事务型数据处理系统。

    这类系统数据处理特点包括以下几点:

    一是事务处理型操作都是细粒度操作,每次事务处理涉及数据量都很小。

    二是计算相对简单,一般只有少数几步操作组成,比如修改某行的某列;

    三是事务型处理操作涉及数据的增、删、改、查,对事务完整性和数据一致性要求非常高。

    四是事务性操作都是实时交互式操作,至少能在几秒内执行完成;

    五是基于以上特点,索引是支撑事务型处理一个非常重要的技术。

    在数据量和并发交易量不大情况下,一般依托单机版关系型数据库,例如ORACLE、MYSQL、SQLSERVER,再加数据复制(DataGurad、 RMAN、MySQL数据复制等)等高可用措施即可满足业务需求。

    在数据量和并发交易量增加情况下,一般可以采用ORALCE RAC集群方式或者是通过硬件升级(采用小型机、大型机等,如银行系统、运营商计费系统、证卷系统)来支撑。

    事务型操作在淘宝、12306等互联网企业中,由于数据量大、访问并发量高,必然采用分布式技术来应对,这样就带来了分布式事务处理问题,而分布式事务处理很难做到高效,因此一般采用根据业务应用特点来开发专用的系统来解决本问题。

    2 数据统计分析

    数据统计主要是被各类企业通过分析自己的销售记录等企业日常的运营数据,以辅助企业管理层来进行运营决策。典型的使用场景有:周报表、月报表等固定时间提供给领导的各类统计报表;市场营销部门,通过各种维度组合进行统计分析,以制定相应的营销策略等。

    数据统计分析特点包括以下几点:

    一是数据统计一般涉及大量数据的聚合运算,每次统计涉及数据量会比较大。

    二是数据统计分析计算相对复杂,例如会涉及大量goupby、 子查询、嵌套查询、窗口函数、聚合函数、排序等;有些复杂统计可能需要编写SQL脚本才能实现。

    三是数据统计分析实时性相对没有事务型操作要求高。但除固定报表外,目前越来越多的用户希望能做做到交互式实时统计;

    传统的数据统计分析主要采用基于MPP并行数据库的数据仓库技术。主要采用维度模型,通过预计算等方法,把数据整理成适合统计分析的结构来实现高性能的数据统计分析,以支持可以通过下钻和上卷操作,实现各种维度组合以及各种粒度的统计分析。

    另外目前在数据统计分析领域,为了满足交互式统计分析需求,基于内存计算的数据库仓库系统也成为一个发展趋势,例如SAP的HANA平台。

    3 数据挖掘

    数据挖掘主要是根据商业目标,采用数据挖掘算法自动从海量数据中发现隐含在海量数据中的规律和知识。

    数据挖掘主要过程是:根据分析挖掘目标,从数据库中把数据提取出来,然后经过ETL组织成适合分析挖掘算法使用宽表,然后利用数据挖掘软件进行挖掘。传统的数据挖掘软件,一般只能支持在单机上进行小规模数据处理,受此限制传统数据分析挖掘一般会采用抽样方式来减少数据分析规模。

    数据挖掘的计算复杂度和灵活度远远超过前两类需求。一是由于数据挖掘问题开放性,导致数据挖掘会涉及大量衍生变量计算,衍生变量多变导致数据预处理计算复杂性;二是很多数据挖掘算法本身就比较复杂,计算量就很大,特别是大量机器学习算法,都是迭代计算,需要通过多次迭代来求最优解,例如K-means聚类算法、PageRank算法等。

    因此总体来讲,数据分析挖掘的特点是:

    1、数据挖掘的整个计算更复杂,一般是由多个步骤组成计算流,多个计算步骤之间存在数据交换,也就是会产生大量中间结果,难以用一条sql语句来表达。

    2、计算应该能够非常灵活表达,很多需要利用高级语言编程实现。

    二 大数据背景下事务型处理系统相关技术

    在google、facebook、taobao等大互联网公司出现之后,这些公司注册和在线用户数量都非长大,因此该公司交易系统需要解决“海量数据+高并发+数据一致性+高可用性”的问题。

    为了解决该问题,从目前资料来看,其实没有一个通用的解决方案,各大公司都会根据自己业务特点定制开发相应的系统,但是常用的思路主要包括以下几点:

    (1)数据库分片,结合业务和数据特点将数据分布在多台机器上。

    (2)利用缓存等机制,尽量利用内存,解决高并发时遇到的随机IO效率问题。

    (3)结合数据复制等技术实现读写分离,以及提高系统可用性。

    (4)大量采用异步处理机制,对应高并发冲击。

    (5)根据实际业务需求,尽量避免分布式事务。

    1相关系统介绍

    1) 阿里CORBAR系统

    阿里COBAR系统是一个基于MYSQL数据库的分布式数据库系统,属于基于分布式数据库中间件的分布式数据库系统。该系统是前身是陈思儒开发的“变形虫”系统(以前调研过),由于陈思儒离开阿里去了盛大,阿里当心“变形虫”稳定性等问题,重新开发该项目。

    该系统主要采用数据库分片思路,实现了:数据拆分、读写分离、复制等功能。由于此系统由于只需要满足事务型操作即可,因此相对真正并行数据库集群(例如TeraData等),此类系统提供操作没有也不需要提供一些复杂跨库处理,因此该系统存在以下限制:

    (1)不支持跨库的join、分页、排序、子查询。

    (2)insert等变更语句必须包括拆分字段等。

    (3)应该不支持跨机事务(以前变形虫不支持)。

    说白了此类系统不具备并行计算能力,基本上相当于数据库路由器!

    另外此类系统的在实际应用的关键问题是,根据什么对数据进行切分,因为切分不好会导致分布式的事务问题。

    2) 阿里OceanBase系统

    该系统也是淘宝为了解决高并发、大数据环境下事务型处理而定制开发的一个系统。该系统主要思路和特点如下:

    (1)他们发现在实际生成环境中,每天更新的数据只占总体数据的1%不到,因此他们把数据分为:基线数据和增量更新数据。

    (2)基线数据是静态数据,采用分布式存储方式进行存储。

    (3)只在一台服务器上存储和处理增量更新数据,并且是在内存中存储和处理更新数据。

    (4)在系统负载轻的时候,把增量更新批量合并到基线数据中。

    (5)数据访问时同时访问基线数据和增量更新数据并合并。

    因此这样好处是:

    (1)读事务和写事务分离

    (2)通过牺牲一点扩展性(写是一个单点),来避免分布式事务处理。

    说明:该系统虽然能处理高并发的事务型处理,号称很牛逼,但其实也只是根据电商的事务处理来定制开发的专用系统,个人认为其技术难度小于oracle等通用型的数据库。该系统无法应用到银行或者12306等,因为其事务处理的逻辑远远比电商商品买卖处理逻辑复杂。

    在目前的大数据时代,一定是基于应用定制才能找到好的解决方案!

    3) 基于Hbase的交易系统

    在hadoop平台下,HBASE数据库是一个分布式KV数据库,属于实时数据库范畴。支付宝目前支付记录就是存储在HBASE数据库中。

    HBASE数据库接口是非SQL接口,而是KV操作接口(基于Key的访问和基于key范围的scan操作),因此HBASE数据库虽然可扩展性非常好,但是由于其接口限制导致该数据库能支持上层应用很窄。基于HBASE应用的设计中,关键点是key的设计,要根据需要支持的应用来设计key的组成。

    可以认为HBASE数据库只支持作为KEY的这一列的索引。虽然目前HBASE有支持二级索引的方案,二级索引维护将会比较麻烦。

    2并发和并行区别

    并发是指同时执行通常不相关的各种任务,例如交易型系统典型属于高并发系统。

    并行是通过将一个很大的计算任务,划分为多个小的计算任务,然后多个小计算任务的并行执行,来缩短该计算任务计算时间。

    两者主要区别在于:

    (1)通讯与协调方面:在并行计算中,由于多个小任务同属一个大的计算任务,因此小任务之间存在依赖关系,小任务之间需要大量通讯和协调;相反,并发中的多个任务之间基本相互独立,任务与任务之间相关性很小。

    (2)容错处理方面:由于并发任务之间相互独立,某个任务执行失败并不会影响其它的任务。但是并行计算中的多个任务属于一个大任务,因此某个子任务的失败,如果不能恢复(粗粒度容错与细粒度容错),则整个任务都会失败。

    3本章总结

    数据量大不一定需要并行计算,虽然数据量大,数据是分布存储,但是如果每次操作基本上还是针对少量数据,因此每次操作基本上都是在一台服务器上完成,不涉及并行计算。只是需要通过数据复制、数据缓存、异步处理等方式来支撑高并发访问量

    三 大数据背景下数据统计分析技术介绍

    随数据量变大,和事务处理不同的是,单个统计分析涉及数据量会非常大,单个统计分析任务涉及数据会分散在多台服务器上,且由于计算量大,采用单台服务器进行计算,会导致计算时间非常长,单个统计分析任务必须采用并行计算方式来加快单个统计分析任务执行速度。

    1并行查询与并行计算技术介绍

    在大数据背景下的数据统计分析技术门类很多,常见的有:

    n MPP并行数据库 : TeraData、GreenPlum、Vertica等。

    n 基于MapReduce并行计算框架的数据仓库:

    HIVE(Hadoop平台) 、Tenzing(Google公司)

    n 基于Hbase的Phoenix系统

    n HadoopDB系统

    n EMC公司的hapt系统

    n MPP分布式查询引擎: Dremel、Impala、Presto、Shard query、Citusdb。

    n 基于SPARK的Shark、基于Dryad的SCOPE、基于Tez的stinger。

    n 基于hadoop+index的JethroData系统

    n 基于内存计算的Druid系统

    这些系统都解决了海量数据下的数据统计分析的问题,并且这些系统另外一个共同特点是都提供了SQL或者类SQL接口。

    为了能够较好研究这些系统,我们需要对并行查询与并行计算的相关技术做一个简要的介绍。

    首先所有的系统都可以分为三个层次: 语义层、并行计算引擎层、分布式存储层。语义层提供一个编程接口让用户表达所需要计算,并负责把该计算翻译成底层并行计算引擎可以执行的执行计划,并由并行计算引擎来执行,最下面一层是分布式存储层。

    对于提供类SQL接口并行计算系统,语义层可以认为是SQL解析层。

    1) 语义层

    SQL语言是一种声名式语言,SQL只是表达了要做什么,而没有表达怎么做。为此,SQL解析层主要作用是:将用户提交的基于SQL的统计分析请求,转化为底层计算引擎层可以执行的执行计划。也就是解决“怎么做”的问题。

    SQL解析层工作主要包括两个大方面:

    (1) 通过语法分析技术来理解要做什么。在关系数据库中,一般会把SQL语言分析后,形成树型结构的执行计划。

    (2) 在语法分析技术上,利用各种优化技术和算法,找出一种最经济物理执行计划。

    优化可以分为两个方面:一是逻辑层面优化、二是物理执行层面优化。

    (1) 逻辑层优化

    逻辑层面个人认为主要是因为同样表达一个分析请求,有的人SQL写的好,有的人SQL写的烂,因此在逻辑层面可以通过一些等价关系代数变换,实现查询重写,将写的比较烂的sql变换为好的写法。

    比较典型优化是:“把投影和过滤下沉,先执行过滤和投影操作”,减少中间结果。

    (2) 物理层优化

    物理层面优化是在逻辑优化后,结合实际物理执行过程,找出最优的物理执行计划。生成物理查询计划的工作包括:

    ü 增加一些操作符: 包括扫描和排序等。

    ü 确定各个操作符实现算法。例如扫描是全表扫描还是利用索引;Join是采用HASH连接、索引连接、合并排序等实现算法中的那一种。

    ü 确定操作符之间的数据流转方法:物化还是流水线方式。

    ü 采用基于代价估算方法确定最优的物理执行计划,目前代价估算主要是以估算该物理计划需要的IO量。另外对于并行数据库,则还要考虑通讯代价,即尽量减少数据在各个机器之间的传递。

    在物理层优化的代价估算过程中,代价估算需要依靠很多统计信息,如表有多大,表中相关列的值分布是什么样子等。传统数据库在数据Load过程中会事先计算好这些统计信息。并行计算中还需要考虑通讯代价。

    需要指出是,由于imapla、Presto、HIVE等系统只是一个查询引擎,它们可以直接查询以普通文件方式存储在HDFS系统上的文件,因此这些系统一般无法使用索引和各种统计信息来进行物理执行计划的优化,这些系统一般只能在逻辑层进行一些基于规则静态优化。根据SHARK论文,SHARK系统支持根据前面一些节点计算获得的信息,来动态优化后面执行计划。

    (3) 物化与流水线执行方法

    一条SQL语句对开发人员而言,感觉只是一次调用,但是实际上在数据库内部,一条SQL语句执行其实是有多个操作符组合而成的的树型结构计算流。如下图:

    针对该计算流有两种执行方式:一是基于物化或者是实体化执行方式,另外一种是基于数据流的执行方式。

    第一种方法的过程是: 把各个操作运算排序,并把每个操作运算的输出的中间结果存储在磁盘上,直到被另外一个操作运算所...

  • ?

    学习数据分析,推荐你几本数据分析师该读完的书籍

    卓翠阳

    展开

    来源:CPDA 数据分析师

    1. 《数据之美:一本书学会数据可视化设计》

    这是一本教大家如何制作一张精美的可视化图表、挖掘大数据背后意义、足够系统的数据可视化入门书。书中,作者提供了丰富的可视化信息及探索数据的多元视角,他避开了一些技术性细节,从宏观和感性的角度介绍如何将数据转变为直观可视的图形,并且深入浅出地介绍了数据可视化的步骤和思想,丰富了读者对数据及可视化的认知。

    上海数据分析网

    2. 《数据之魅:基于开源工具的数据分析》

    作者在书中详细分享了他从事数据分享工作的丰富经验,阐述了数据分析所涉及的概念和方法。包括如何用图形及表格来观察数据、如何建模分析数据等。书中的主题部分介绍了该如何进行数据挖掘,并包含了大量的模拟过程及结果分析。

    上海数据分析网

    3. 《社交网站的数据挖掘与分析》

    目前,各类社交网站已经渗入大家日常生活中的各个角落,它们无时无刻不在产生着大量宝贵的社交数据,而这本书中便告诉了大家如何利用这些社交网络数据并通过可视化技术来挖掘出数据背后更深层次的价值。

    书中分章节系统地介绍了如何在不同社交网络中应用数据挖掘技术。需要特别指出的是,阅读并学习这本书需要一定的编程知识及学习基本 Python 工具的意愿。

    上海数据分析网

    4.《数据挖掘技术》

    这本书是数据挖掘领域的经典著作之一,自 1997 年第一版出版以来便经久不衰。书中从技术、应用两个方面系统、全面地介绍了数据挖掘的商业环境、及其在商业环境中的应用。本书的包含了数据挖掘技术的核心内容,包括:

    决策树、神经网络、协同过滤、关联规则、链接分析、聚类和生存分析等,极具技术深度与广度。

    上海数据分析网

    5.《大数据时代》

    《大数据时代》一书在大数据研究领域具有举足轻重的地位,作者维克托 迈尔 舍恩伯格认为大数据的核心就是预测,并前瞻性地指出,大数据带来的信息风暴正在颠覆我们的生活、工作和思维,大数据开启了一次重大的时代转型。

    全书用三个部分讲述了大数据时代的思维、商业、管理变革。

    上海数据分析网

    6. 《集体智慧编程》

    此书是 Web 开发者、构架师、应用工程师的绝好读物。书中以机器学习和计算机统计为背景,着重讲述如何挖掘和分析 Web 上的数据和资源。包括协作过滤技术、集群数据分析、所搜引擎核心技术、社交网络的信息匹配技术。

    读书最好的时候是学生时期,其次是现在。有不少人求小编给推荐数据分析入门或者自我成长的书籍,今天刚好有空闲,小编就从入门级到高级的书籍循序渐进推荐给大家,大家根据自己的水平挑选,如果有更好的书,欢迎大家留言给小编!

    以下为入门级书籍

    适合对数据分析的入门者,对数据分析没有整体概念的人,常见于应届毕业生,经验尚浅的转行者。

    Excel

    《谁说菜鸟不会数据分析》

    上海数据分析网

    知名度比较高的一套书,适合新手,优点是它和数据分析结合,而不是单纯地学习函数。学会函数适用的场景和过程比它本身更重要。

    这本书不仅讲解了一些常见的分析技巧,并附带 Excel 的一些知识以及数据分析在公司中所处的位置,对职场了解亦有一定帮助。这本是入门篇,还有一本是专门介绍工具篇的,有兴趣的同学可以看看。

    数据分析

    《深入浅出数据分析》

    上海数据分析网

    HeadFirst 类的书籍,一向浅显易懂形象生动,可以对分析概念有个全面的认知。

    数据可视化

    数据可视化的书不多。市面上多以编程为主,面向新手和设计的教程寥寥无几。 如果只是了解图表,看 Excel 的书籍也管用。

    《鲜活的数据》

    上海数据分析网

    内容很丰富,涉及可视化的方方面面,也囊括更类编程语言和设计软件:Python+JS+R+Excel。作者还有另外一本书《数据之美》。

    可视化是一门侧重灵感的学科,有一种入门技巧是从他人设计中学习,从模仿开始,了解他人是如何设计的,这个网络上有大量的信息图可以参考。当然数据分析师更需要的是如何发现,别只学习展示。

    《赤裸裸的统计学》

    上海数据分析网

    本书的主旨,结合生活讲解统计知识,生动有趣。可以避免统计学一上来就大讲贝叶斯概率和随机分析的枯燥。

    进阶版

    具有一定的行业针对性,要求具备一定的分析常识,适合网站分析师,商业分析师以及数据产品经理。

    《数据化管理:洞悉零售及电子商务运营》

    上海数据分析网

    本书讲述了两个年轻人在大公司销售、商品、电商、数据等部门工作的故事,通过大量案例深入浅出地讲解了数据意识和零售思维。作者将各种数据分析方法融入到具体的业务场景中,最终形成数据化管理模型,从而帮助企业提高运营管理能力。书内全部案例均基于 Excel,每个人都能快速上手应用并落地。

    统计学

    统计学是比较大的范围,分析师往后还需要学线性代数和矩阵、关系代数等。初学者不需要掌握所有公式定理的数学推导,懂得如何应用就行用。

    《深入浅出统计学》

    上海数据分析网

    大概是最啰嗦的深入浅出系列,从卖橡皮鸭到赌博机的案例,囊括了常用的统计分析如假设检验、概率分布、描述统计、贝叶斯等。书本注重应用和趣味性,数学推理一般。

    SQL

    数据库有很多种,常见有 Oracle,MySQL,SQL Server 等。我推荐学习 MySQL,这是互联网公司的主流数据库。以后学习 Hadoop 生态时,MySQL 也是最接近 Hive 语法的语言。

    MySQL 不需要专门看书学习,因为数据分析师以查询为主,不需要考虑数据性能、数据安全和架构的问题。

    《MySQL 必知必会》

    上海数据分析网

    学习 SQL 的入门书,薄册子一本,看起来很快。SQL 是个性价比很高的技能,简单而强大。任何想进一步提高自己数据分析技能的产品 / 运营 / 分析师 同学,都建议点亮 这个技能点。

    《网站分析实战》

    上海数据分析网

    互联网不再是网站的天下,但是移动端依旧有 Web,我们在朋友圈看到的所有 H5 活动、第三方内容等,都是依托网页实现。网站的数据分析依旧有存在空间,网站的数据指标还是能够指导我们运营。

    Python/R

    欢迎来到数据分析的最后殿堂,Python 和 R 都是大分支,基本是前面所有内容的实现。Python 的学习以 PY3 为前提,毕竟 2017 年了,我实在想不出不用 Python3 的理由。

    除了书籍,Python/R 更多依靠博客和文档学习。Python 的学习路径不陡峭,新手水平取决于查询能力,所以也请学会如何高效搜索。

    《深入浅出 Python》

    上海数据分析网

    还是深入浅出系列,完全适合零基础的新人。需要注意的是,编程学习不同于其他知识,如果计算机基础不稳固,在使用中会遇到各类问题。知其然不知其所以然,这是本书缺点:能掌握,但是 Bug 比较多。

    《Python 学习手册》

    上海数据分析网

    对于拥有编程基础的人,这本书系无巨细的有些啰嗦,不过对新人,可以避免不必要的坑。把它当作一本工具文档吧,当遇到不理解的内容随时翻阅。这是纸质书比电子书好的优势之一。

    《Python Cookbook》

    上海数据分析网

    Python 的进阶书,如果想要掌握更好的编程能力,这是一本经典,值得时时翻阅。注意,它更偏向程序员。

    《R 语言实战》

    上海数据分析网

    R 语言的入门书籍,从数据读取到各类统计函数的使用。虽然没有涉及机器学习,依靠这本书入门 R 是绰绰有余了。

    《统计学:从数据到结论》

    上海数据分析网

    这本书是将 R 语言和统计学结合的教材,可以利用这本书再复习一遍统计知识。缺点是书本后面的内容质量不如前部分。

    到这里,入门到进阶级别的书籍推荐完毕,当然好书不嫌多,例如《数学之美》、《集体智慧编程》、《统计学习方法》等,有兴趣不妨阅读。上面的内容都吃透,不论是成为一名数据分析师,还是往后向机器学习、数据科学家、数据产品发展、都有了良好的基础。

    希望小伙伴们都能沉下心阅读。

  • ?

    十种常用的数据分析方法

    秦芷蕾

    展开

    道家强调四个字,叫“道、法、术、器”。

    层次区别:

    “器”是指物品或工具,在数据分析领域指的就是数据分析的产品或工具,“工欲善其事,必先利其器”;

    “术”是指操作技术,是技能的高低、效率的高下,如对分析工具使用的技术(比如用Excel进行数据分析的水平);

    “法”是指选择的方法,有句话说“选择比努力重要”;

    “道”是指方向,是指导思想,是战略。

    在数据分析和产品、运营优化方面,数据分析方法是其核心,属于“法”和“术”的层次。

    那么如何做好数据分析呢,今天我们来讲讲互联网运营中的十大数据分析方法。

    01 细分分析

    细分分析是分析的基础,单一维度下的指标数据的信息价值很低。

    细分方法可以分为两类, 一类逐步分析, 比如:来北京市的访客可分为朝阳,海淀等区; 另一类是维度交叉, 如:来自付费SEM的新访客。

    细分用于解决所有问题。

    比如漏斗转化,实际上就是把转化过程按照步骤进行细分,流量渠道的分析和评估也需要大量用到细分的方法。

    02 对比分析

    对比分析主要是指将两个相互联系的指标数据进行比较,从数量上展示和说明研究对象的规模大小,水平高低,速度快慢等相对数值, 通过相同维度下的指标对比,可以发现,找出业务在不同阶段的问题。

    常见的对比方法包括: 时间对比,空间对比,标准对比。

    时间对比有三种: 同比,环比,定基比。

    例如: 本周和上周进行对比就是环比;本月第一周和上月第一周对比就是同比;所有数据同今年的第一周对比则为定基比。通过三种方式,可以分析业务增长水平,速度等信息。

    03 漏斗分析

    转化漏斗分析是业务分析的基本模型, 最常见的是把最终的转化设置为某种目的的实现,最典型的就是完成交易。但也可以是其他任何目的的实现,比如一次使用app的时间超过10分钟。

    漏斗帮助我们解决两方面的问题:

    在一个过程中是否发生泄漏,如果有泄漏,我们能在漏斗中看到,并且能够通过进一步的分析堵住这个泄漏点。

    在一个过程中是否出现了其他不应该出现的过程,造成转化主进程收到损害。

    04 同期群分析

    同期群(cohort)分析在数据运营领域十分重要,互联网运营特别需要仔细洞察留存情况。 通过对性质完全一样的可对比群体的留存情况的比较,来分析哪些因素影响用户的留存。

    同期群分析深受欢迎的重要原因是十分简单,但却十分直观。 同期群只用简单的一个图表,直接描述了用户在一段时间周期(甚至是整个LTV)的留存或流失变化情况。

    以前留存分析只要用户有回访即定义为留存,这会导致留存指标虚高。

    05 聚类分析

    聚类分析具有简单,直观的特征, 网站分析中的聚类主要分为:用户,页面或内容,来源。

    用户聚类主要体现为用户分群,用户标签法;页面聚类则主要是相似,相关页面分组法;来源聚类主要包括渠道,关键词等。

    例如: 在页面分析中,经常存在带?参数的页面。 比如: 资讯详情页面,商品页面等,都属于同一类页面。简单的分析容易造成跳出率,退出率等指标不准确的问题,通过聚类分析可以获取同类页面的准确数据用于分析场景。

    06 AB测试

    增长黑客的一个主要思想之一,是不要做一个大而全的东西,而是不断做出能够快速验证的小而精的东西。 快速验证,那如何验证呢?主要方法就是AB测试。

    比如: 你发现漏斗转化中中间有漏洞,假设一定是商品价格问题导致了流失,你看到了问题-漏斗,也想出了主意-改变定价。但主意是否正确,要看真实的用户反应,于是采用AB测试,一部分用户还是看到老价格,一部分用户看到新价格,若你的主意真的管用,新价格就应该有更好的转化,若真如此,新价格就应该确定下来,如此反复优化。

    07 埋点分析

    只有采集了足够的基础数据,才能通过各种分析方法得到需要的分析结果。

    通过分析用户行为,并细分为:浏览行为,轻度交互,重度交互,交易行为,对于浏览行为和轻度交互行为的点击按钮等事件,因其使用频繁,数据简单,采用无埋点技术实现自助埋点,即可以提高数据分析的实效性,需要的数据可立即提取,又大量减少技术人员的工作量,需要采集更丰富信息的行为。

    如: 重度交互(注册,邀请好友等)和交易事件(加购物车,下订单等)则通过SDK批量埋点的方式来实施。

    08 来源分析

    流量红利消失,我们对获客来源的重视度极高,如何有效的标注用户来源,至关重要。

    传统分析工具,渠道分析仅有单一维度,要深入分析不同渠道不同阶段效果,SEM付费搜索等来源渠道和用户所在地区进行交叉分析,得出不同区域的获客详细信息,维度越细,分析结果也越有价值。

    09 用户分析

    用户分析是互联网运营的核心, 常用的分析方法包括:活跃分析,留存分析,用户分群,用户画像,用户细查等。

    可将用户活跃细分为浏览活跃,互动活跃,交易活跃等,通过活跃行为的细分,掌握关键行为指标;通过用户行为事件序列,用户属性进行分群,观察分群用户的访问,浏览,注册,互动,交易等行为,从而真正把握不同用户类型的特点,提供有针对性的产品和服务。

    用户画像基于自动标签系统将用户完整的画像描绘清晰,更有力的支撑运营决策。

    10 表单分析

    填写表单是每个平台与用户交互的必备环节,优秀的表单设计,对转化率的提升起到重要作用。

    用户从进入表单页面之时起,就产生了微漏斗,从进入总人数到最终完成并成功提交表单人数,这个过程之中,有多少人开始填写表单,填写表单时,遇到了什么困难导致无法完成表单,都影响最终的转化效果。

    以上是常见的数据分析方法,更多应用方法需要根据业务场景灵活应用。

  • ?

    入门必备!数据分析的3大思维和7种技巧

    Mahon

    展开

    为什么数据分析思维重要

    如果我们在分析一个问题前,思维缺失就像下面图中所表达的一样,往往不知道问题从哪里下手,在这个时候就轮到平时锻炼的数据分析思维了。

    核心数据分析思维

    结构化

    可以看作金字塔思维,把待分析问题按不同方向去分类,然后不断拆分细化,能全方位的思考问题,一般是先把所有能想到的一些论点先写出来,然后在进行整理归纳成金字塔模型。主要通过前面介绍的思维导图来写我们的分析思维。

    案例现在有一个线下销售的产品。我们发现8月的销售额度下降,和去年同比下降了20%。我想先观察时间趋势下的波动,看是突然暴跌还是逐渐下降。再按照不同地区的数据看一下差异,有没有地区性的因素影响。我也准备问几个销售员,看一下现在的市场环境怎么样,听说有几家竞争对手也缩水了,是不是这个原因。客户访谈也要做,但是往常一直找不出原因,这次我也不抱希望,姑且试试吧。要是还找不出原因,那我也很绝望啊。

    公式化

    在结构化的基础上,这些论点往往会存在一些数量关系,使其能进行+、-、×、÷的计算,将这些论点进行量化分析,从而验证论点。

    业务化

    业务化即是深入了解业务情况,结合该项目的具体业务进行分析,并且能让分析结果进行落地执行。用结构化思考+公式化拆解得出的最终分析论点再很多时候表示的是一种现象,不能体现产生结果的原因。所以需要继续去用业务思维去思考,站在业务人员或分析对象的角度思考问题,深究出现这种现象的原因或者通过数据推动业务。

    增加业务思维方法:贴近业务,换位思考,积累经验

    数据分析的思维技巧

    在数据分析中,三种核心数据分析思维是框架型的指引,实际应用中还是需要很多技巧工具的。7种数据分析技巧,它们分别是象限法,多维法,假设法,指数法,二八法,对比法,漏斗法。

    象限法

    通过对两种维度的划分,运用坐标的方式表达出想要的价值,由价值直接转变为策略,从而进行一些落地的推动。象限法是一种策略驱动的思维,广泛应用于战略分析,产品分析,市场分析,客户管理,用户管理,商品管理等。

    下图是RFM模型,把客户按最近一次消费(Recency)、消费频率(Frequency)、消费金额 (Monetary)三个维度分成八个象限。

    菜品销售增长率和销售利润

    多维法

    多维法是指对分析对象从多个维度去分析,这里一般是三个维度,每个维度有不同数据分类,这样代表总数据的大正方体就被分割成一个个小方块,落在同一个小方块的数据拥有同样的属性,这样可以通过对比小方块内的数据进行分析。如图,这是一个快餐店的外卖订单多维表:

    虽然只有下单时间、菜品名称、平台三个维度。但根据这个立方体,已经能解决很多掌柜急需了解的问题了。

    我们可以通过切片实现每个平台每种菜品的销量,每个月每种菜品的销量,某个月某平台菜品销售情况等等操作。

    假设法

    在一些情况下,如进入新市场的销量、商品提价后销量的变化情况,可能没有明细数据进行分析,那么就需要用到假设法。假设法也就是假设一个变量或者比率成立,然后根据部分数据进行反推,这是一种启发思维的技巧,一般过程是先假设后验证然后判断出分析结果。

    例题:你是自营电商分析师,现在想将商品提价,你分析下销售额会有怎样的变化?解答思路:首先可以确定销量会下降,那么下降多少?这里就要假设商品流量情况,提价后转化率的变化情况,然后根据历史数据汇总出销量下降百分百,从而得出销售额的变化情况。

    指数法

    指数法

    指数法是把某个数据多个指标按一定的计算转化为同度量的一个值,这个度量值称为指数。例如在一场游戏竞技比赛中要确定该场的MVP,则是需要根据击杀数、死亡数、助攻数、经济、补兵等指标进行综合计算出一个得分,得分高的为MVP。

    指数法常用的有线性加权、反比例、log三种。线性加权即是把每个指标乘以一个系数后相加,反比例即是用数学上的反比例函数y=k/x变化后在计算,log即是数学中所说的对数一般以2为底数或者10为底数。指数法使用没有统一标准,一般是根据经验来做,将无法利用的数据加工成可以可利用的。例如,NBA计算最有价值球员的指数参考:

    二八法

    二八法即是二八法则也可以叫做帕累托法则,比如在个人财富上可以说世界上20%的人掌握80%的财富。而在数据分析中,则可以理解为20%的数据产生了80%的效果需要围绕这20%的数据进行挖掘。往往在使用二八法则的时候和排名有关系,排在前20%的才算是有效数据。二八法是抓重点分析,适用于任何行业。找到重点,发现其特征,然后可以思考如何让其余的80%向这20%转化,提高效果。

    对比法

    对比法就是用两组或两组以上的数据进行比较,常见的是用于在时间维度上的同比和环比、定基比,与竞争对手的对比、类别之间的对比、特征和属性对比等。对比法可以发现数据变化规律,使用非常频繁,多与前面的技巧结合使用。

    漏斗法

    漏斗法即是漏斗图,有点像倒金字塔,是一个流程化思考方式,常用于像新用户的开发、购物转化率这些有变化和一定流程的分析中。不过,单一的漏斗分析是没有用的,不能得出什么结果,要与其它相结合,如与历史数据的对比等。

    下图我用BI商业智能工具FineBI连接了CRM系统的数据,对客户的行为数据做了漏斗图形式的展现。

  • ?

    如何靠数据分析“上位”?——一位银行业务分析专家的实践

    何南莲

    展开

    身处传统行业,数据分析的工作可能会无所适从。我们既没有互联网行业强大的数据驱动基因,甚至都没有大企业完善的信息基础和数据环境。个人不论是数据分析师和DBA,成长都有所局限。

    数据分析很火,懂行的都深知数据对于业务,对于企业生产经营的重要性。但是没有数据、数据不完整、业务不重视、数据分析沦为取数和报表制作......这些问题都阻挠着数据行业的发展,也影响个人自身。

    关于企业的数据分析,如何从0——1着手分析工作?这里想分享一个来自我们客户“小唐”的真实故事,没有鸡汤,只有浓浓的方法论值得借鉴。

    小唐就职于一家股份制银行A,近两年由于银行改制,A银行开始逐渐重视银行信息化的提升,以及数据分析的应用,小唐在对公业务一线做过2年,被委派到的数据部门做业务分析。

    委派到新部门的小唐负责对公业务,需要对下属一级支行南京支行的业务做针对性分析:风险预估、坏账分析、创新业务跟踪。

    从存款金额和贷款金额入手,分析该支行总体的经营状况;想了解存款和贷款主体业务的状况,尤其是坏账的风险;想了解下属各二级机构的经营状况;下属二级支行瑞金支行是新增的二级试点支行,投放了许多创新业务,想在分析过程中对该二级支行加强关注;

    小唐是怎么做的呢?

    分析过程

    业务分析需要借助良好的分析工具,且考虑到上层战略的需要,此项业务分析不仅仅是单一问题的解决,而是需要长期监控的,给部门业务经理监控的。基于这样的场景,小唐需要一个自住性较强、易操作、能实时同步数据、且具有协同功能的数据工具,自然而然的想到了商业智能BI工具FineBI,开展了分析工作,从0-1进行数据分析搭建业务分析模型的工作。

    1、提出问题/需求

    即最原始的问题/需求。

    领导提出“小唐啊,我想看一看部门最近的业绩怎么样?”或者自己发现“最近XX产品的推出好像在市场受到了阻碍,想看看原因在哪”,这都是最原始的问题/需求。这部分问题/需求不直接涉及业务数据,但是和目标“解决问题,提高效益”直接相关,最表象也是大家最关心的事情。

    2、明确问题/需求

    上面提出的问题/需求,不管是领导提出还是自己的诉求,都比较宽泛,如果想要通过数据分析解决问题/需求,自然而然地,需要把问题/需求往数据上靠,用我们的业务去明确问题/需求。可以分成两个步骤:

    ①用我们熟悉的业务名词精简描述

    ②化零为整。

    (1)从存款金额和贷款金额入手,分析该支行总体的经营状况——存款金额、贷款金额→日期即研究不同日期下支行的存款金额和贷款金额。(2)想了解存款和贷款主体业务的状况,尤其是坏账的风险——存款类型、贷款类型,不良贷款额即研究不同业务类型的存款金额和贷款金额的情况,尤其是五级不良贷款。(3)想了解下属各二级机构的经营状况——机构即研究不同机构的存款金额和贷款金额的情况。(4)下属二级支行瑞金支行是新增的二级试点支行,投放了许多创新业务,想在分析过程中对该二级支行加强关注;即研究单一机构的存款金额和贷款金额的情况。

    这样,通过用熟悉的业务名词去明确我们的需求,就变得十分具体,数据分析的切入点就有了突破口。但是这样的描述还是比较零散而且互有重叠,通过化零为整,整合一下我们的需求,即“研究不同时间不同机构不同存款类型/贷款类型下的存款金额/贷款金额”。

    3、梳理指标

    对于“不同时间不同机构不同存款类型/贷款类型下的存款金额/贷款金额”这一明确需求,将相关涉及的所有指标进行进一步梳理,可以先用我们最熟悉的明细表做一个展示,对数据能够有一个非常直观的感知。

    4、搭建业务包(指标分类)

    根据分析思路框架,利用FineBI数据分类的功能来针对性地搭建业务包。

    由于存款类型、贷款类型和贷款质量是三个接近平行的维度,互相之间不干扰,所以我们可以设计三条平行线,分别来看各日期机构下的存款类型、贷款类型、贷款质量的情况,并搭建以下业务包:

    三张事实表(存款数据事实表、贷款数据事实表、不良贷款数据实施表)三张维度表(机构维度表、贷款类型维度表和存款类型维度表),并建立和业务关联。

    5-6、 自助创建仪表板-分析决策

    创建仪表板的过程,实际上是将我们的分析思路以各种指标和图表具象化的过程,是数据分析思维的具体体现,所以做仪表板和分析决策是不能够分开的。这也就决定了创建仪表板的时候,我们需要掌握两个步骤,一是用常用的分析形式和分析指标结合需求落地,二是用分析决策检验和完善我们的仪表板。

    以各日期机构下的存款类型情况进行分析为例,即存款分析为例,先用我们常用的分析形式和分析指标结合需求落地。在这里只需要控制单一变量:

    a. 固定机构,分析它的日期维度。常见对日期进行分析方法有

    趋势分析对比分析(比昨日、比上月、比年初、同比)

    当然还有一些其它的业务分析形式,我们都可以进行尝试。在进行数据分析的时候,我们应该养成看到时间维度就能立马复现出这些分析方法的习惯,不管不是所有对日期进行分析的方法都应该囫囵吞枣,但是把每个分析方法都过一遍是十分有利于我们的思考过程,从而甄别出适合出当前分析的分析形式和指标。

    先对日期进行趋势分析。研究存款总额、对公存款和对私存款的时间变化趋势。而历史数据对于当前的业务影响小,我们更关心近期的数据走势,因此可以过滤出最近10天的数据。

    可以看出南京支行的主体存款业务是由对公存款组成,因此存款总额的变化趋势几乎只受到对公存款业务的影响;对公存款是处于起伏不定的状态,处于停滞不增长的状态,而对私业务乍看也是处于一条水平线,没有什么起伏,然而,当我们取消关注对公存款和存款总额的时候,可以发现对私业务的存款总额竟然是下降的。

    综上,我们发现,最近该支行的总体存款业务是下降的,对公业务没有什么增长,对私业务虽然体量相对较小,但是呈下降趋势,发展出现问题。因此我们可能需要对该机构的存款业务进行重要调整,想办法推进对公业务的继续增长,考虑改变对私业务的推广策略或者放弃相对该支行来说比较鸡肋的对私存款业务。

    同样地,对日期继续进行对比分析,研究比昨日、比上月、比年初、同比的对比情况。

    将当日的营业额度和历史同期比较是非常有说服力的,也可能更能反映时间的周期性问题。可以发现,对公业务和对私业务尽管在近期的发展态势一般,但是较历史同期而言,都几乎有着成倍的增长。

    这说明,过去的经营策略确实取得了巨大的成效,但是可能由于市场饱和或者过去的经营策略所能取得的成效已经饱和,导致了近期的业务增长一般。说明,对于现在支行的发展,可能到达了一个瓶颈,需要对经营的策略进行重大调整,以适应现在的业务情况。

    b. 固定时间,分析它的机构维度。常见对机构进行分析方法有:

    排名分析比例分析机构分析穿透分析指标(平均值)

    同样地,我们只需要将这些分析方法逐一套用,最后结合我们实际的业务需求,选择出合适的分析形式和指标。

    这里对最常用的排名分析和机构分析进行一个介绍。这里由于存款总额是每天累计汇总的,因此关注当天具体的额度变化情况更加有意义。

    可以看到各机构存款总额较上日增幅的排名;对于增幅靠前的机构,可以研究具体这些机构的业务策略进行推广,而对于存款净增额落后的机构单位,一般我们都比较关注在平均值以下的机构,可以进行标红处理做警示作用,同时对于尤其关注的某些特别支行,如瑞金二级支行,可以进行特别关注处理。同样的分析还能用于产品类别、产品、供应商等品类。

    穿透分析、比例分析的落地过程我们略去。这样将我们熟悉和常见的分析形式和指标,结合分析决策的过程去套用,创建我们所需要的仪表板,很快就可以做出以下存款分析报表。

    贷款分析和不良贷款分析,我们也同样地按着存款分析的分析思路过程进行落地。FineBI有一个比较方便的功能,可以直接将模板复用,然后简单地替换成贷款分析和不良贷款分析的各个指标,就快速生成了对应的分析模型。

    分析总结

    在从无到有搭建完业务模型之后,一定要对我们形成的分析模型进行总结,沉淀成为企业内部的指标库,这部分是我们数据分析最终沉淀的内核。

    同时,在进行数据分析时,小唐给了大家两个非常受用的小贴士:

    1、自主分析是个反复尝试的过程,实际上也是思维不断突破的过程。需要养成良好的设计习惯,用常见维分析形式和分析指标去落地,不要希望每次都能一步到位精准反映业务问题,需要踏实做好数据分析,用实际问题来改进分析模型。

    2、不要企图用一张报表解决所有问题 。往往需要制作多张报表来分析发现问题,需要建立系统性,同时也鼓励多部门对于同一类需求/问题进行分析,可以对结论形成互补。

  • ?

    大数据工程师和数据分析师有何区别?

    杨飞兰

    展开

    大数据并不是一种概念,而是一种方法论。简单来说,就是通过分析和挖掘全量的非抽样的数据辅助决策。大数据可以实现的应用可以概括为两个方向,一个是精准化定制,第二个是预测。比如像通过搜索引擎搜索同样的内容,每个人的结果却是大不相同的。

    随着大数据的愈演愈热,相关大数据的职业也成为热门,给人才发展带来带来了很多机会。数据工程师、数据分析师已经成为大数据行业最热门的职位。

    数据分析师是什么?

    数据分析师不同行业中获取数据,并通过获取到的数据对问题进行解答。最后还需要以合适的方式对结果进行展示,以辅助企业做出商业决策。一般来讲,数据分析师的任务是对数据进行清洗、分析以及可视化。

    根据行业的不同,数据分析师的头衔也可能不同。比如:业务分析师、商业智能分析师、运营分析师、数据库分析师等等。不管头衔是什么,数据分析师都可谓是通才。他们能够胜任诸多岗位与团队角色,同时也能在极大程度上帮助企业做出基于数据的决策。

    数据分析师所需技能

    编程,统计学和数学,机器学习,数据可视化和通信技术,数据处理和数据集定义

    数据工程师是什么?

    在大数据的时代,数据工程师的角色愈发地重要。数据工程师一般被定义成“深刻理解统计学科的明星软件工程师”。数据工程师是系统的构建者与优化者,所有公司正常运营的基础之一,数据工程师的职责就是保证数据在接收、转移的准确性,并且保证其它用户对数据的可访问性。

    和数据分析师不同,他们不太关注统计、分析技能、建模等。他们的工作重点在于数据架构、计算、数据存储、数据流等。因此,数据工程师必须具备相当强的编程能力—包括编写数据查询程序的能力。也就是说,他们的能力必须达到开发运营高手的级别。

    数据工程师还负责数据库设计、仓储数据库、建立数据库等。 这就意味着,他们必须十分熟悉现有的数据库技术和数据管理系统,比如和大数据有关的Hadoop与HBase 等。此外,非功能性的基础设施问题,如数据的可扩展性、可靠性、韧性、有效性,备份等也由数据工程师来负责。

    数据工程师所需技能

    数学和统计学,程序设计和计算机科学,分析技能,商业战略

    对于招聘市场端在大数据工程师和大数据分析师二个方向所涉及的岗位具体名称如下图所示:

    大数据工程师方向:

    大数据分析师方向:

    总结:

    数据工程师的重心在“后端”,他们需要持续的优化数据通道,才能保证企业数据的准确性与可用性。同时还需确保在需要的时候能够顺畅地将数据提供给用户。

    数据分析师则是通过使用数据工程师所构建的自定义API来提取新的数据集,并对其中的数据趋势进行识别,同时对异常数据进行分析。分析师们将会对结果进行总结,并以一种清晰直观的方式来展示这些结果,以便于其它非技术团队能够更好地了解他们目前的工作效果。

    有了以上信息,数据分析师和大数据工程师之间的差异应该清楚。对于数据驱动的职位来说,通过数据来找到正确的问题,并据此进行更加精确的试验,这就是其最根本的工作内容。进一步的,数据科学领域将不断发展进步,同时也会对相关从业人员提出持续学习的要求。

    分享 IT 技术和行业经验,请关注-技术学派。

  • ?

    什么是数据分析?数据分析的作用是什么?

    伟祺

    展开

    1.什么是数据分析?

    数据分析的目的是把隐藏在一些看似杂乱无章的数据背后的信息提炼出来,总结出所研究对象的内在规律。在实际工作中,数据分析能够帮助管理者进行判断和决策,以便采取适当策略与行动。比如:企业的高管希望通过市场分析和研究,把握当前产品的市场动向,从而制定合理的产品研发和销售计划,这就必须依赖数据分析才能够完成。

    简单的说,就是对数据进行分析,比较专业的说法是,数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,未提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。以求最大化地开发数据的功能,发挥数据的作用。

    数据分析包含“数据”和“分析”两个方面一方面包括加工和整理数据,另一方面也包括分析数据,从中提取有价值的信息并形成对业务有帮助的结论。

    数据分析的成果通常以分析报告的形式呈现。对于数据分析报告,分析就是论点,数据就是论据,两者缺一不可。

    2.数据分析类别

    其中,探索性数据分析侧重于在数据中发现新的特征,而验证性数据分析则侧重于验证已有假设的真伪证明。

    数据分析的划分:描述性数据分析、探索性数据分析、验证性数据分析。

    1)描述性数据分析:属于初级数据分析,常见的分析方法有对比分析法、平均分析法、交叉分析法。

    2)探索性数据分析:侧重于再数据之中发现新的特征

    3)验证性数据分析:侧重于验证已有假设的真伪证明

    其中探索性数据分析和验证性数据分析属于高级数据分析,常见的分析方法有相关分析、因子分析、回归分析等等。

    3.数据分析的作用

    数据分析在日常企业运营中主要有三大作用:

    1.现状分析

    简单的说就是告诉你过去发生了什么。

    具体表现在:

    第一,告诉你企业现阶段的整体运营情况,通过各个经营指标的完成情况来衡量企业的运营状态,以说明企业整体运营是更好了还是坏了,好的程度是如何,坏的程度又到哪里。

    第二,告诉你企业各项业务的构成,让你了解企业各项业务的发展及变动情况,对企业经营状况有更深入的了解。

    现状分析一般通过日常通报来完成,如日报、周报、月报等形式。

    2.原因分析

    简单的说就是告诉你某一现状为什么发生。经过第一阶段的现状分析,我们对企业的运营情况有了一个基本的了解,但是不知道运营情况具体好在哪里,差在哪里,是什么原因引起的。这时候我们就需要开展原因分析,以进一步确定业务变动的具体原因。

    原因分析一般通过专题分析来完成,根据企业运营情况选择针对某一现状进行原因分析。

    3.预测分析

    简单来说就是告诉你将来会发生什么。

    在了解企业运营现状后,有时候还需要对企业未来发展趋势做出预测,为企业制定经营目标以及提供有效的策略参考与决策依据,以确保企业的可持续健康发展。

    预测分析一般通过专题分析来完成,通常在制定企业季度、年度等计划时进行,其开展的频率没有现状分析及原因分析高。

    什么时候开展什么样的数据分析,需要根据自身的需求及目的来确定。

    分享 IT 技术和行业经验,请关注-技术学派。

  • ?

    大数据分析与数据分析的根本区别在哪里?

    飙尘

    展开

    作者:CDA数据分析师

    大数据分析与数据分析这几年一直都是个高频词,很多人都开始纷纷转行到这个领域,也有不少人开始跃跃欲试,想找准时机进到大数据或数据分析领域。如今大数据分析和数据分析火爆,要说时机,可谓处处都是时机,关键要明了的一点是,大数据分析和数据分析两者的根本区别在哪里,只有真正了解了,才会知晓更加适合自己的领域是大数据分析师还是数据分析师。毕竟职场如战场,时间就是生活,不容儿戏,更不容怠慢。下面我来好好告诉大家两者的本质区别到底是什么!

    大数据分析:指无法在可承受的时间范围内用常规软件工具进行捕捉、管理和处理的数据集合。是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    在维克托·迈尔-舍恩伯格及肯尼斯·库克耶编写的《大数据时代》 中大数据分析指不用随机分析法(抽样调查)这样的捷径,而采用所有数据进行分析处理,因此不用考虑数据的分布状态(抽样数据是需要考虑样本分布是否有偏,是否与总体一致)也不用考虑假设检验,这点也是大数据分析与一般数据分析的一个区别。

    数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。

    大数据分析与数据分析最核心的区别是处理的数据规模不同,由此导致两个方向从业者的技能也是不同的。在CDA人才能力标准中从理论基础、软件工具、分析方法、业务分析、可视化五个方面对数据分析师与大数据分析师进行了定义。

    【数据分析师的要求】

    数据分析师的理论要求:统计学、概率论和数理统计、多元统计分析、时间序列、数据挖掘。

    工具要求:必要:Excel、SQL可选:SPSS MODELER、R、Python、SAS等

    分析方法要求:除掌握基本数据处理及分析方法以外,还应掌握高级数据分析及数据挖掘方法(多元线性回归法,贝叶斯,神经网络,决策树,聚类分析法,关联规则,时间序列,支持向量机,集成学习等)和可视化技术。

    业务分析能力:可以将业务目标转化为数据分析目标;熟悉常用算法和数据结构,熟悉企业数据库构架建设;针对不同分析主体,可以熟练的进行维度分析,能够从海量数据中搜集并提取信息;通过相关数据分析方法,结合一个或多个数据分析软件完成对海量数据的处理和分析。

    结果展现能力:报告体现数据挖掘的整体流程,层层阐述信息的收集、模型的构建、结果的验证和解读,对行业进行评估,优化和决策。

    【大数据分析师的要求】

    理论要求:统计学、概率论和数据库、数据挖掘、JAVA基础、Linux基础。

    工具要求:必要: SQL、Hadoop、HDFS、Mapreduce、Mahout、Hive、Spark可选:RHadoop、Hbase、ZooKeeper等

    分析方法要求:熟练掌握hadoop集群搭建;熟悉nosql数据库的原理及特征,并会运用在相关的场景;熟练运用mahout、spark提供的进行大数据分析的数据挖掘算法,包括聚类(kmeans算法、canopy算法)、分类(贝叶斯算法、随机森林算法)、主题推荐(基于物品的推荐、基于用户的推荐)等算法的原理和使用范围。

    业务分析能力:熟悉hadoop+hive+spark进行大数据分析的架构设计,并能针对不同的业务提出大数据架构的解决思路。掌握hadoop+hive+ Spark+tableau平台上Spark MLlib、SparkSQL的功能与应用场景,根据不同的数据业务需求选择合适的组件进行分析与处理。并对基于Spark框架提出的模型进行对比分析与完善。

    结果展现能力:报告能体现大数据分析的优势,能清楚地阐述数据采集、大数据处理过程及最终结果的解读,同时提出模型的优化和改进之处,以利于提升大数据分析的商业价值。

    综上大数据分析与数据分析的根本区别就是分析的思维与分析所用的工具不同。大家在求职或转行过程认清自己对两者的偏好和自己的兴趣所在,以及自己的能力更适合在哪个领域发挥,还有自己所在城市对两者的职业需求,综合天时地利人和三个条件,我们才能做出更理智更客观更科学的抉择。

  • ?

    什么是数据分析、数据分析本质又是什么?

    祝尔丝

    展开

    一般情况下,我们所说的分析是指,使用大量数据、统计和定量分析、解释和预测以及基于事实的管理来推动决策过程与实现价值增生。

    根据分析的方法和目的,分析可以被划分为描述性分析(descri-ptive analytics)、预测性分析(predictive analytics)和规范性分析(prescriptive analytics)。描述性分析包括数据收集、整理、制表、制图以及描述正要研究的食物的特征,这类分析以往被称为“报告”。描述性分析可能非常有用,但它不能解释某种结果出现的原因或者未来可能会发生的事情。

    预测性分析不仅可以对数据特征和变量(可以假定取消范围的因素)之间的关系进行描述,还可以基于过去的数据预测未来。预测性分析首先会确定变量值之间的关联,然后基于这种已知的关联预测另一种现象出现的可能性,比如在看到某个广告后,一位消费者可能会去买产品的可能性。虽然预测性分析中的预测是基于变量之间的关系做出来的,但这不代表预测性分析中都需要明确因果关系。事实上,准确的预测并不一定与需要基于因果关系。

    规范性分析是更高层次的分析,如实验设计和优化等。就像医生会在出处方建议患者采取什么行动一样,实验设计试图通过做实验给出某些事情发生的原因。为了能够在因果关系研究中信心饱满地做出推断,研究人员必须妥善处理一个或多个独立的变量,并有效控制其他的变量。如果处于试验环境下的测试组的表现大大优于照相,决策制定者就应该立即推广这种实验环境。

    优化是规范性分析采用的一种方法,指试图识别出一个特定变量和另一个变量之间理想的关系水平。例如,我们可以能会对识别最有可能让产品实现高收益的价格感兴趣。同样地,优化这种方法能够识别出使了零售企业最大限制避免缺货情况的库存水平。

    根据分析采用的方法以及收集和分析的数据类型,我们可以将分析分为定性分析(qualitative analysis)和定量分析(quantitative analysis)。定性分析的目的是深入了解某种现象的根本原因和诱因。非结构化数据通常是从少数非代表性案例中收集而来,并进行了非统计性分析。定量分析是分析的最初阶段,他通常是探索性分析的有效工具,定量分析是指通过统计、数学或者计算的方式对现象进行系统的实证研究。通常情况下,结构化数据是从大量典型案例中收集而来,并进行统计分析。

    为了服务于研究者的不同研究目的,存在以下几种类型的分析:

    *统计学:收集、整理、分析、说明和呈现数据的学科;

    *预测:根据已有数据,预测一下一些感兴趣的变量在未来某个特定的时间点的情况;

    *数据挖掘:通常使用算法和统计技术,自动或半自动地提取大量数据中未知的有趣模式;

    *文字挖掘:用类似数据挖掘的方式从文本中得模式和趋势的过程;

    *优化:在同时满足约束条件的情况下,按照某些标准利用数学方法来寻找最优的解决方案;

    *实验设计:给各组随机分配被试。然后使用测试组和对照组来推导出特定结果中存在的因果关系。

    虽然此处给出了一些列常用的分析方法,但在使用过程中会不可避免地出现相当大的重叠。例如,回归分析(regression analysis)是预测分析中最常用的方法,与此同时,他也是统计学、预测和数据挖掘中常用的方法。此外,时间序列分析(time seties analysis)是用于分析数据随时间变化的一种具体统计方法、在统计学和预测中经常被用到。

数据分析和数据分析

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP