中企动力 > 商学院 > 数据分析不全
  • ?

    关于数据分析那些事,看这一篇文章就够了

    阮山雁

    展开

    目录」

      1.什么是数据分析;

      2.数据分析职业介绍;

      3.数据分析生涯规划;

      4.数据分析薪酬情况;

      5.数据分析基本素质;

    一、到底什么是数据分析呢?

      数据分析是基于商业目的,有目的的进行收集、整理、加工和分析数据,提炼有价信息的一个过程。

      ▊其过程概括起来主要包括:明确分析目的与框架、数据收集、数据处理、数据分析、数据展现和撰写报告等6个阶段。

      1、明确分析目的与框架

      一个分析项目,你的数据对象是谁?商业目的是什么?要解决什么业务问题?数据分析师对这些都要了然于心。

      基于商业的理解,整理分析框架和分析思路。例如,减少新客户的流失、优化活动效果、提高客户响应率等等。不同的项目对数据的要求,使用的分析手段也是不一样的。

      2、数据收集

      数据收集是按照确定的数据分析和框架内容,有目的的收集、整合相关数据的一个过程,它是数据分析的一个基础。

      3、数据处理

      数据处理是指对收集到的数据进行加工、整理,以便开展数据分析,它是数据分析前必不可少的阶段。这个过程是数据分析整个过程中最占据时间的,也在一定程度上取决于数据仓库的搭建和数据质量的保证。

      数据处理主要包括数据清洗、数据转化等处理方法。

      4、数据分析

      数据分析是指通过分析手段、方法和技巧对准备好的数据进行探索、分析,从中发现因果关系、内部联系和业务规律,为商业目提供决策参考。

      到了这个阶段,要能驾驭数据、开展数据分析,就要涉及到工具和方法的使用。其一要熟悉常规数据分析方法,最基本的要了解例如方差、回归、因子、聚类、分类、时间序列等多元和数据分析方法的原理、使用范围、优缺点和结果的解释;其二是熟悉1+1种数据分析工具,Excel是最常见,一般的数据分析我们可以通过Excel完成,后而要熟悉一个专业的分析软件,如数据分析工具SPSS/SAS/R/Matlab等,便于进行一些专业的统计分析、数据建模等。

      5、数据展现

      一般情况下,数据分析的结果都是通过图、表的方式来呈现,俗话说:字不如表,表不如图。。借助数据展现手段,能更直观的让数据分析师表述想要呈现的信息、观点和建议。。

      常用的图表包括饼图、折线图、柱形图/条形图、散点图、雷达图等、金字塔图、矩阵图、漏斗图、帕雷托图等。

      6、撰写报告

      最后阶段,就是撰写数据分析报告,这是对整个数据分析成果的一个呈现。通过分析报告,把数据分析的目的、过程、结果及方案完整呈现出来,以供商业目的提供参考。

      一份好的数据分析报告,首先需要有一个好的分析框架,并且图文并茂,层次明晰,能够让阅读者一目了然。结构清晰、主次分明可以使阅读者正确理解报告内容;图文并茂,可以令数据更加生动活泼,提高视觉冲击力,有助于阅读者更形象、直观地看清楚问题和结论,从而产生思考。

      另外,数据分析报告需要有明确的结论、建议和解决方案,不仅仅是找出问题,后者是更重要的,否则称不上好的分析,同时也失去了报告的意义,数据的初衷就是为解决一个商业目的才进行的分析,不能舍本求末。

    二、数据分析师职业介绍

      做数据分析前我们首先要明确分析目的和内容,对于数据分析师而言,他们的进阶需求无外乎是各个企业对数据分析师的职位要求。在前程无忧、中华英才网以及智联招聘上,我们随便搜索下数据分析的岗位信息,都能找到大量类似于下面的一些职位要求信息:

      ▊别看岗位职责,任职要求这么多,说白了主要就三点要求:

      1)对相关业务的理解;

      2)掌握一到二种数据分析工具;

      3)良好的沟通。

      可能不同的公司因为需求不同,会在要求上有点小小的不同,而这个不同主要集中在数据库上。了解数据分析师的具体需求之前,我们有必要先了解数据分析师的职位体系。

    「数据分析师的职位体系」

      在传统行业中,数据分析更多存在移动、银行、超市等行业,在这些行业中你才会偶尔听到数据分析师这个职位,也许更多是听到数据挖掘工程师、数据建模师。在中国也许只在电信的项目中,才会存在真正的意义上的数据挖掘。

      ▊数据行业从广义上讲可以分为以下几个职位:

      1、数据分析师

      更注意是对数据、数据指标的解读,通过对数据的分析,来解决商业问题。主要有以下几个次层次:

      1)业务监控:诊断当前业务是否正常?是否存在问题?业务发展是否达到预期(KPI)?如果没有达到预期,问主要问题在哪?是什么原因引起的?

      2)建立分析体系:这些数据分析师已经对业务有一定的理解,对业务也相对比较熟悉,更多帮业务方建立一套分析体系,或者更高级是做成数据产品。例如:营销活动。分析师会告诉业务方,在活动前你应该分析哪些数据,从而制定恰当的营销计划。在营销过程中,你应该看哪些数据,从而及时做出营销活动调整。在营销活动,应该如何进行活动效果评估。

      3)行业未来发展的趋势分析:这应该是数据分析师最高级别,有的公司叫做战略分析师/商业分析师。这个层次的数据分析师站的更高,在行业、宏观的层面进行业务分析,预测未来行业的发展,竞争对手的业务构成,帮助公司制定战略发展计划,并及时跟踪、分析市场动态,从而及时对战略进行不断优化。

       主要技能要求:

      数据库知识(SQL至少要熟悉)、基本的统计分析知识、EXCEL要相当熟悉,对SPSS或SAS有一定的了解,对于与网站相关的业务还可能要求掌握GA等网站分析工具,当然PPT也是必备的。

      2、数据挖掘工程师

      更多是通过对海量数据进行挖掘,寻找数据的存在模式、或者说规律,从而通过数据挖掘来解决具体问题。数据挖掘更多是针对某一个具体的问题,是以解决具体问题为导向的。例如:聚类分析,通过对于会员各种人口统计学、行为数据进行分析,对会员进行分类,对不同的类型的会员建立相应的profiling,从而更好的理解会员,知道公司会员是到底如何?高、中、低低价值的会员构成,既可以后期各种会员的运营提供指导,提高活动效率,可以指导公司的营销,例如广告的投放策略。以及用于公司各种战略的制定。

       主要技能要求:

      1)数据库必须精通。很多时候,你模型的数据预处理,可能完成在数据库里完成,你用到的数据库技巧更高。

      2)必须要会成熟的数据挖掘工具、数据挖掘算法,例如:SPSS/CELEMENTINE、SAS/EM等,当然如果你会一、二款开源软件,并会写一些程序代码那是最好的,大公司都喜欢用开源的软件,例如:R、WEKA。

      3、数据建模师

      这个职位与数据挖掘工程师还是有本质区别的。数据建模师,更多偏向于中、小数据量,而且其使用更多更多是统计学的方法,而数据挖掘中的例如:决策树、神经网络、SVM等在这里是根据不会涉及的。

      当然二者有一个共同之处都是,针对很具体的问题,都是会解决某个具体问题,例如:营销反应率,你就可能历史的邮箱、短信的反应情况,来建模型进行预测,从而提高邮件反应率,或者减少对用户来说的“垃圾”邮箱,提高用户体验。所以从掌握的技能上讲,这二者就有很大的区别,数据建模师其实很少会提到算法这个词,更多说使用什么模型,有感觉吗?但是从实务界来看,这二个模型越来越没有明确的分工,一般来说都会二个职位的人都会去学习对方的知识,所以这二个职位有合并的趋势,但在未来几年来,我觉得公司要招人的时候应该还是要有区别的。

      新进入数据行业的同学,可以根据自己的背景背景选择相应的职位,学数据、统计学的朋友更多可以偏向于建模师,而计算机特别是写编程出现和同学,可以走数据挖掘工程师,也许适应性更好,但这不是绝对的。

      ▊数据分析师的职位级别划分:

      不同公司对数据分析师的职位划分骚有不同,在一些中小型企业,没有成立独立的数据中心前,数据分析的相关职位往往是在譬如市场部、运营部这些部门之下,通常数据分析成员在2-4人不等。对于一些大型企业,有独立的数据部门的企业,其数据分析团队人员则是十到百人不等,其职位头衔有通俗的总监、经理、主管划分,也有助理、资深、专家之类的划分。下面是一张微博上传的比较火的某集团的数据分析师职位级别划分图表,大家可根据自身的情况对号入座。

    「下图来自微博阿里的朋友分享」

    (单击图片可缩放查看大图)

    三、数据分析职业生涯规划

      ▊按照不同分析方法所能给人带来的智能程度,可以把分析能力划分为以下8个等级:

      上面的8级划分源自SAS网站的Eight levels of analytics,由IDMer编译而成,个人觉得其中的8张图片非常形象生动,网友@数据小宇军用两个图表将它们更好地展示出来了:

      ▊数据分析师的级别:

      1、数据跟踪员:机械拷贝看到的数据,很少处理数据

      虽然这个工作的人还不能称作数据分析师,但是往往作这样工作的人还都自称是数据分析师,这样的人,只能通过×××系统看到有限的数据,并且很少去处理数据,甚至不理解数据的由来和含义,只是机械的把自己看到的数据拷贝出来,转发给相应的人。这类人发出来的数据,是否有意义,怎么解读,他自己是不知道的,只能期望收到数据的人了。

      2、数据查询员/处理员:数据处理没问题,缺乏数据解读能力

      这些人可以称为分析师了,他们已经对数据有一定的理解了,对于大部分数据,他们也知道数据的定义,并且可以通过监控系统或者原始的数据,处理得到这些数据。统计学的方法,这批人还是很精通的,统计学的工具,他们也是用起来得心应手,你让他们做一下因子分析,聚类肯定是没问题,各类检验也是用的炉火纯青。他们的不足是:1、如果不告诉他们命题,那么他们就不知道该应用什么样的方法去得到结论了。2、对于数据的处理没问题,但是却...

  • ?

    来看看我们数据分析过程中的那些坑

    Xena

    展开

    今天端午节,小2哥祝所有商家和网友节日快乐,端午安康,对于做淘宝的人来说,是没有节日这个概念的,我今天也继续奋斗在工作岗位,闲暇之际,抽点时间来和大家分享分享自己的一些对数据分析的感悟。

    我在很多场合经常听到有人说:数据有毒

    其实,有毒的不是数据,而是我们不懂的分析数据,只知道看表面的数据,没有理解出数据背后的东西。

    我在书友会和书友们说:很多的时候,如果你没有跟着我学数据分析的时候,你凭借着你的经验和第一直觉做可能你还会做的更好一点,但是如果你跟了我学数据分析之后,可能你反而会做的越来越差?

    因为有很多人他第一直觉和经验其实比较好的,不听数据分析他做的决策反而可能正确一些,但是自从他听了我的数据分析之后,他开始不相信自己的直觉和经验,他只相信数据了,特别是看到那些直观的图表的时候,他更愿意去相信数据,可是遗憾的是他只看到了数据表面的东西,并没有把隐藏在数据背后的东西挖出来了,所以他反而让数据表现的东西给误导了,做出了错误的决策。

    我们来看看那些经常因为数据误导我们的案例,这里先举一个例子,很多人经常会去分析关键词的人群画像,下面这个数据来自的是"长袖T恤女"这个关键词的数据

    从这个数据我们可以看到的是18-25岁的人占比最高。所以很多人说,这个关键词背后搜索和喜欢的人群是18-25岁

    其实,如果你说关键词背后搜索人数最多的是18-25岁,那么这句话肯定是对的,这数据也肯定能说明的,但是你没办法说明长袖T恤最受欢迎的人群是18-25岁

    我们再来看一个图,这个图是2015年6月和2016年6月网民的年龄结构分布图,当然,很遗憾的是我没找到今年淘宝网民年龄的结构分布数据。但是从上面这个图里面我们可以看出40-49岁的网民只占了总网民的百分之13%左右,而这个数据还是网民数据,不是淘宝用户的数据,淘宝用户的数据只会比这个数据低很多,因为现在很多40-49岁的人都会玩微信,他们算网民,但是这里面有很多的人从来是不淘宝购物的,他们就算不上淘宝用户,特别是广大农村地区,这个年龄阶段的人用微信的特别多,但是用淘宝的非常小,

    这个时候我们再回过头来看第一个数据,搜索长袖T恤女这个关键词占比最多的人群是18-25岁,但是这个只能说明搜索这个关键词人数最多的是18-25岁人群,并不能说明长袖T恤在18-25岁的人群里面更受欢迎。因为本身这个18-25岁人群在淘宝用户中基数就是最大的,同样的我们再看,40-49岁的这个人群,他虽然只占比16%,比起其他的年龄阶段来说人群占比算比较低的,但是他在淘宝用户这个人群中占比也是非常小的。如果这个数据换一种表达方法,就是每个占比只以各自的年龄阶段为基础,那么估计40-49岁的数据就要比18-25岁的数据大很多了。

    我们继续来看另外的一个案例,很多人都喜欢做市场容量的分析图,去分析市场的容量,他会把过去一段时间的支付金额做成饼图,然后分析根据这个图的占比来分析他的市场容量

    例如,我们在图上看到裤子的市场容量占比是10%,而T恤的市场容量占比是8%,如果从表面上来看,裤子的市场容量是比T恤要更大,但是如果你仔细了解一下背后的数据来源你可能就会有不一样的答案,裤子的数据是有打底裤,休闲裤,西装裤,棉裤/羽绒裤等多个子类目组成,而T恤下面并无子类目,他的所有数据都是来自T恤这个子类目,而且,T恤主要是集中在夏季这一个季节,到了冬季的时候,虽然也有长袖T恤,但是那个占比已经比较少了。而裤子不同,长裤,短裤都是裤子类目,除了牛仔裤外,其他的子类目裤子都是在裤子这个类目,因此,如果你完全根据这个数据的大小去选择市场容量的话,你可能就会出现问题

    有些人在选择市场切入的时候,喜欢选择这种数据大的市场容量的市场,不会去选择数据小的市场容量的市场,他们认为数据小的说明没有市场。

    其实,这里面也是会经常误读的,例如上图,有一个抹胸市场容量占比是0%,可能很多人会觉得这个类目没有什么市场,不值得的去做。

    但是你搜索抹胸这个关键词然后按照销量排名,你觉得这个市场容量会小吗?

    很多的时候我们就是容易让数据表面给误导,例如抹胸我们做的图之所以市场容量为0%,是因为第一个我们统计的数据是按照支付金额统计的,而抹胸因为客单价非常低所以他的支付金额特别比较低,可能三四件抹胸的都没有一件T恤的价格高,这也就导致了他的支付今天看起来比较低,如果你换成的是成交件数,那么肯定你就会得出另外一种结果,另外,0%不代表是真的0,而是因为四舍五入最后的结果是0%。0.4%的结果也是0%,可能很多人还是会说0.4%还是比较低,其实,低和高要看你的基数有多大,如果你的基数是100000亿,那么这个0.4%的数量也不少了的。

    继续再来看一个例子,我们在优化标题的时候都喜欢去看关键词的搜索指数,很多人只要看到搜索指数低的人就认为是没有人在搜索,这种词就不应该用

    例如大家看到上面这个图,可能很多人会觉得这个词带不来流量,因为都没有人搜索,而我曾经有一个宝贝前期就是靠这个关键词带来流量的,虽然每天没有太多,就那么几十个,但是,因为这个词特别精准,我的宝贝竟然每天能成交那么一两单,对于前期来说,这个数据已经非常好了。

    其实,这个也是很多人对数据没有去了解他背后造成原因导致的结果,他把搜索人气零当成了是没有人搜索,其实根本就不是这个意思,搜索人气是根据统计周期内的用户搜索人数拟合出的指数类指标,也就是说,这个数据让淘宝处理了,0只是代表他趋势很小,相对其他的关键词来说,他的这个搜索人数可以忽略不计。但是并不代表他完全没有搜索,中国好几亿的淘宝用户,每天如果只有几十百来个人在搜索,这个数据相对于整体来说基本可以忽略不计,但是如果没有人和你竞争,那么这几十百来个流量也就是你一个人了,对于很多新店铺来说,前期每天能有几十百来个流量也是好的,最关键的是因此词精准,转化率高,虽然每天只能带来一两单,但是相对那些一天一单都带不来的商家,这个数据也算好的。

    举例了这么多,其实都只是想说明一个点,在分析数据的时候,一定要重点分析的是数据背后的东西,他是怎么造成这个数据的,要从多个维度去分析数据。而不是简单的只看看表现的数据,然后根据表面的数据就下决定。

  • ?

    一个完整的数据分析思路是怎么炼成的?

    道罡

    展开

    做数据分析首先得要有一个完整的思路。《谁说菜鸟不会数据分析》书中举了一个很生动的例子。做数据分析就好比做一件衣服,首先的先有设计图,然后在根据设计图分步骤的去制作成成品。今天我们说的数据分析的完整思路就相当于衣服的设计图,有了完整的思路,才不至于漫无目的的,没有一个清晰的目标去做分析。

    那么我们如何才能建立一个完整的数据分析的思路呢呢?《谁说菜鸟不会数据分析》给大家提供了几种数据分析方法论来助力大家形成完整的数据分析思路。主要有PEST分析法,5W2H分析法,逻辑树分析法,4P营销理论(现在用的比较多是4C),用户行为理论。下面呢,我就以5W2h分析方法,给大家详细的说明一下怎么建立完整的数据分析思路。

    首先,先介绍一下什么是5W2H。

    (1)WHAT——是什么?目的是什么?做什么工作?

    (2)WHY——为什么要做?可不可以不做?有没有替代方案?

    (3)WHO——谁?由谁来做?

    (4)WHEN——何时?什么时间做?什么时机最适宜?

    (5)WHERE——何处?在哪里做?

    (6)HOW ——怎么做?如何提高效率?如何实施?方法是什么?

    (7)HOW MUCH——多少?做到什么程度?数量如何?质量水平如何?费用产出如何?

    例如要不要增加一个推广渠道,我们来形成一个完整的分析思路。

    WHAT:一个引流的渠道,对这个渠道要有一定认识。

    WHY :目前其他的渠道的流量不能满足,做了渠道之后可能会增加多少流量。

    WHO:是直接让其他渠道的人来负责,还是重新招一个操作过这个渠道的人。

    WHEN:如果要做这个渠道,有没有时间来做,什么时候开始实施。

    WHERE:如果是大公司,要考虑是总公司来做,还是分公司来做。

    HOW:怎么做,是否有详细的解决方案,是否先参考同行竞争对手。

    HOW MUCH:新增加的这个渠道,需要投入多少成本,人力成本,广告成本等等。

    对每个环节进行分析,评估,然后综合每个环节,看看这个渠道是否值得开发。

  • ?

    作为数据分析师,鬼知道我经历了什么!

    Kerr

    展开

    谨以此文献给所有数据从业苦逼之人,如有中伤之处,请自行戴好盔甲,以防中伤过深。同时也以此文献给后期对数据热情,想长期从事此行业的年轻人,希望对你们有所启发,并快速的调整思路和方向,以对自己的职业生涯有更好的发展。

    最近听到一些段子,很有意思,分享给大家!

    这些段子是很多数据分析人员的真实写照:

    新招进公司做大数据分析师,好开心好兴奋好激动!!!然而...

    入职第一天,老板给了我一张 50M 的 Excel 表说:

    “你看我们有 100多万条用户信息,这么大的数据,来个大数据分析下!”

    还没从震惊中恢复过来,业务部又神补一刀:

    “我们准备跟星巴克合作,来预测下明年多少人喝咖啡,几千万的大项目,预测不准公司要亏很多钱的,你加油哈!”

    面对这样的业务部,我只想说:“我要是未卜先知为啥不去炒股来给你打工”

    IT大哥贼兮兮的说:“哥们你可来了,那失散到天涯的数据有娘啦!”

    没法,最终还是把数据拼起来开始分析...

    发现好有规律啊~好工整啊~这...是不是有坑?!

    去业务部一问才知道,这些都是被经销商篡改操纵的数据...

    后来拿到了全真实的数据!全部没有规律了!喜极而泣!!

    擦干泪仔细一看,80%的记录缺失,10%记录不全,5%记录出错……

    整完数据开始统计,然而领导觉得只做加减乘除太简单了,有没有更深度的方法(解读:需要纠正的是,有用为先,花哨次之,这种说法不太合理)

    简单了就做个模型吧,然而检验值还没讲完领导表示太复杂搞不懂,能简单点不(解读:这个是解读能力的问题,跟领导没关系...没关系..没关系...)

    改来改去已很多遍了!我已不太记得领导唠叨了什么,总之又听到一句:“再改一下,看看其他维度深入分析分析”,然后默默新建一个文件:《分析报告V16-8版》

    输出结果和业务部的认知差不多,被评价为:

    “我们都知道了啊,这大数据做了跟没做一样啊”

    输出结果和业务部的认知差很多,被评价为:

    “这个与业务经验完全不同,肯定是数据的问题,我们都十多年经验了,快回去检查数据,上次我去见XXX客户人家就不是这样的!一定是你错了!一定!”

    此段子一出,群里都炸开了锅,大家都开始不断的煽风点火,各种数据背锅,各种吐槽,说尽了数据分析师的辛酸苦辣。

    我做数据分析师的时候也经常遇到上面这些遭遇,乃至后来找到了一些规避这些问题的方法,希望对大家有所帮助。

    同时,我也希望借此号召所有的数据从业者,在数据应用实践上能够深入思考并有所突破,在正确的轨道上更好的发挥出数据的价值,从而让数据从业者有更大的 ,不再拘泥于每天的抱怨和自怨自艾中。

    数据之苦

    进入正文,数据人之苦最苦的是:有好处想不到你,出了问题都是你的错

    这句话的意思就是你做好是应该的,做得不好就得承担责任。这种痛苦完全命中了马云蜀黍对离职的两点看法:

    心累(得不到价值肯定)、钱少(没业绩肯定哪来的升职加薪)

    区分数据流程的不同阶段,数据人之苦又有所区分侧重不同,说一下我的个人浅见。

    根据数据应用的不同阶段,我的划分方法如下,从数据底层到最后应用:

    大数据平台

    目前很火,数据源头,各种炫酷新技术,搭建 Hadoop、Hive、Spark、Kylin、Druid、Beam~,前提是你要懂 Java,很多平台都是用 Java 开发的。

    现在很多企业都把数据采集下来了。对于传统的业务,用传统的数据是完全够用的;可是对于用户行为和点击行为这些数据或者很多非结构化的数据,文本、图像和文本类的,由于数据量太大,很多公司都不知道怎么进行存储。

    这里面要解决的是实时、近实时和离线的大数据框架如何搭建,各数据流之间如何耦合和解耦,如何进行容灾、平台稳定、可用是需要重点考虑的。

    我的感觉是:最近两三年中,这块人才还是很稀缺的,因为大数据概念炒作的这么厉害,很多企业都被忽悠说,我们也来开始进入大数据行业吧。但是,进入的前提之一就是需要把数据存储下来,特别是很多用户行为方面的数据,对于业务的提升了比较明显的,如果你能很好的刻画用户,那么对你的产品设计、市场营销、开发市场都是有帮助的。

    现阶段,很多公司都要做第一步:存储更多的数据。这也就是我们这块人员流动性比较高,因为都被高薪挖走了。

    和传统的 SQL 不同的是,针对大数据量的非结构式数据,我们所想的就是:用最廉价的成本存储数据同时能够达到容灾、扩展性高、高性能、跨域,从目前来看有两个方向

    分布式已经被证明是个很好的一个方式。云端会是个很好的方向。不是每个公司都养得起这么多这么贵的大数据平台开发人员和运维人员 OPS,从事这个行业的我们要有很好的危机意识,及时贡献出自己的价值,积极主动的学习新技术、否则你就要被淘汰了。

    此外,花点钱把数据托管给云服务提供商对于创业公司或者一些传统的企业来说是个很好的思路,这样能够最快速地确定数据对你的价值是什么,而不用采购这么多的服务器、雇佣这么多的运维和网站开发人员。

    说了以上这些,主要是想给未来会从事这块的人或者想存储数据的公司一点方向。我自己不做这块,体会不深,大家看看就行。

    这块工作最被吐槽的一点就是:Hive 速度好慢,SQL 查询好慢,集群怎么又挂掉了,Hadoop 版本升级后,怎么数据跑出来不对了等等。

    因此,在这个领域内工作,需要有强大的

    攻坚能力。快速定位和解决 bug 的能力。因为有很多工具都是开源的。Java 开发能力。因为是开源的,所以会出现各种坑爹,甚至出现无法向下兼容的情况。

    如果想在这块做的很好,还需要有整个系统架构的设计能力、比较的强的抗压能力和解决问题的能力、资源收集的能力,可以打入开源社区,这样就可以随时 follow 最新的潮流和技术。

    数据仓库-ETL

    确实做仓库的人很辛苦,单单 Oncall 就会让人望而却步。有很多数据库工程师,晚上睡觉的时候经常被 Oncall 电话吵醒,因为数据流程出问题,需要第一时间去排查,是哪个数据源出问题,并且要立即解决,否则整个数据流程都会受到影响。

    如果数据流程受到了影响,你就可能会被大领导一言不合叫到办公室说:我要的数据怎么还没有准备好,我的业务报表今天怎么没有发出来。

    通过上面这个情景,我们可以知道:这是个很重要的岗位,因为数据流程很重要,决定了数据从源头杂乱无章的状况,通过 ETL 之后变成了整齐的数据,这些整齐一致性的数据可以让你很方便地把各业务的统计结果计算出来,并且能够统一口径。要不然就会变成有几个部门,就有几种统计结果,到时候 A 部门说业务增长了 5%,B 部门说业务涨了 10%,OMG,到底信谁?

    至少在以下几点上,我觉得数据仓库人员是应该要做好:

    数据字典的完整性,用的人都希望能够清晰的知道这个字段的逻辑是什么。字段要保持很好的一致性,不要同样一个字段在不同表里有不同的定义。核心流程的稳定性,不要让每天订单主表能够使用的时间很不稳定,有的时候很早,有的时候要中午才出来,如果不稳定就会导致使用数据的人对你很没有信心。仓库版本迭代不要过于频繁,要保持不同版本之间的兼容性。不要做好了仓库 1.0,很快就把原来的推倒重来,变成了 2.0。在数据仓库中需要考虑到延续性,主表的变动不要太频繁,否则使用的人会非常痛苦,好不容易才用习惯了 1.0 的表结构,没办法这么快进行切换。简单地说,要能向下兼容。在这点上,我是深有体会,之前出现过每来一个大领导都来换一次数据仓库的。保持各业务逻辑的统一性,不要出现同样的业务逻辑,同一个组别的人统计出来的结果不同。原因在于共同的逻辑没有落地成通用的东西,所以导致每个人写法不同。这点其实需要特别注意。

    针对以上,这个岗位的技能要求是:不要成为仅仅会写 SQL 的人,现在工具都很发达,如果你的技能很单一的话,那么可替代指数是非常高的,并且你自身也没有什么成就感。这里并不是说会写 SQL 的人很 low,只是说应该多学一些技能,否则你很危险。

    技能上,除了 SQL 熟练之外,还需要知道如何写 Transform,MapReduce,因为有很多业务逻辑用 SQL 实现起来非常复杂,但是如果你会其他脚本语言,那么就能给你提供便利,让你的效率提升很多。

    另外好的仓库人员需要写 Java 或者 Scala,通过写 UDTF 或者 UDAF 来提升你的效率是很有必要的。

    仓库人员应该要常常思考,如何进行架构设计是最合理的,你要考虑是否需要字段冗余、行存储还是列存储、字段如何扩展最有效,热数据和冷数据如何拆分等,所以需要有架构思维。

    数据仓库人员也应该常常考虑自动化和工具化方面的事情,需要很好的工具或者模块的抽象能力,动手实现自动化的工具来提高整个组织效能。针对经常碰到的数据倾斜问题,需要很快定位问题并进行优化。

    说完了数据存储这块,接下来是数据应用的几个关键职位,在此之前,我想说数据应用的一个最关键的前提是:数据质量、数据质量、数据质量!!在每次阐述你的观点、分析结论或者用算法的时候,都需要先检查,源头数据正确性,否则任何结论都是伪命题。

    数据可视化

    这是个很炫的工作,最好是能懂点前端,比如 js。

    数据可视化人员需要有很好的分析思维,不能为了炫技而忽视对业务的帮助程度。因为我对这个岗位客串的不多,所以没有特别深入的感悟,不过我觉得这个岗位需要有分析的能力,才能把可视化做好。

    另外一方面来说,做数据应用的人都应该懂点数据可视化,要知道观点表达的素材顺序是:图片>表格>文字,一个能够用图片来阐述的机会千万别用文字来描述,因为这样更易于让别人理解。要知道,给大领导讲解事情的时候,需要把大领导设想成是个“数据白痴”,这样才能把一件事情说的比较生动。

    4

    数据分析师

    现在对数据分析的需求是很大的,因为大家都想着说:数据有了,但是能做些什么呢?这就需要有数据分析师, 。

    对数据分析师吐槽最多的是:你分析出来的不就是正常的业务逻辑吗,还需要你分析什么?或者是你分析的结论不对,跟我们的业务逻辑不符合。

    特别是 ABTest 的结果和当初设定的预期不相符合的时候,分析师会常常被拉过去说:分析一下,为什么我的 AB 实验结果不显著,里面肯定有原因的。

    很多时候,宝宝的心里苦啊,你说这个转化率下降了,从数据上可以看出哪个细分渠道下降了,至于为什么客户不下单,我们得问用户去,很多时候,数据上也体现不出来为什么,只能告诉你现状是什么。

    如果你一直在写分析报告,给结论中,持续周而复始,没有直接在业务中体现成绩的时候,数据分析师们该醒醒了,你该想想这个是你要的岗位吗?

    对于数据分析师的定位:个人认为,成为优秀的数据分析师是非常难的,现在市面上也没有多少优秀的分析师。

    我个人对数据分析师的技能要求除了会数据分析、提炼结论、洞察数据背后的原因之外,还需要了解业务,懂算法。只有这样,当面对一个业务问题时,数据分析师们才可以针对问题抽丝剥茧,层层递进去解决问题,再根据定位的问题进行策略的应对,比如是先做上策略进行测试还是应用算法进行优化,用算法用在哪个场景上,能不能用算法来解决问题。

    一个优秀的数据分析师,是个精通业务和算法的全能数据科学家,不是那个只会听从业务的需求而进行拉数据、做报表、只做分析的闲杂人等。

    我们都说分析要给出结论,优秀分析师的结论就是一个能解决问题的一揽子策略和应对措施,同时很多需求是分析师去主动发现并通过数据来挖掘出来的。

    从上述描述中,可以看到对数据分析师的要求是:

    会写sql拉数据精通业务会数据洞察精通算法主动性强

    如果你一直只是忙于应付日常分析需求,热衷于写华丽的报告,那么你要记得,你很危险,因为会有一堆人在那里质疑你存在的价值,特别是小公司。因为数据人员的薪资是个不小的支出。

    大部分不落地的分析都是伪分析,有一些探索性的可行性研究可以不考虑落地,但是其他的特定业务需求的分析都需要考虑落地,然后通过实践来反推你的作用,如此反复,才能慢慢的给你价值的肯定,同时提升你的分析技能,也只有这样才能证明你作为分析师、数据落地者的价值。

    数据挖掘/算法

    这块的话,经过这三年的摸爬滚打,感触蛮多的。体会比较深的吐槽主要有以下几点:

    一个规则搞定了,还用什么算法。你的准确率怎么这么低?!你的准确率可以到 99% 吗?你的推荐有价值吗?你不推荐客人也会下那个产品的订单的。帮我做个大数据预测他想要什么?

    很多时候,不同的场景对准确率的要求是不同的,所以在一定合理的场景下和业务进行据理力争是必要,不要害怕让业务吐槽,更多的时候管理...

  • ?

    十种常用的数据分析方法

    褚如雪

    展开

    道家强调四个字,叫“道、法、术、器”。

    层次区别:

    “器”是指物品或工具,在数据分析领域指的就是数据分析的产品或工具,“工欲善其事,必先利其器”;

    “术”是指操作技术,是技能的高低、效率的高下,如对分析工具使用的技术(比如用Excel进行数据分析的水平);

    “法”是指选择的方法,有句话说“选择比努力重要”;

    “道”是指方向,是指导思想,是战略。

    在数据分析和产品、运营优化方面,数据分析方法是其核心,属于“法”和“术”的层次。

    那么如何做好数据分析呢,今天我们来讲讲互联网运营中的十大数据分析方法。

    01 细分分析

    细分分析是分析的基础,单一维度下的指标数据的信息价值很低。

    细分方法可以分为两类, 一类逐步分析, 比如:来北京市的访客可分为朝阳,海淀等区; 另一类是维度交叉, 如:来自付费SEM的新访客。

    细分用于解决所有问题。

    比如漏斗转化,实际上就是把转化过程按照步骤进行细分,流量渠道的分析和评估也需要大量用到细分的方法。

    02 对比分析

    对比分析主要是指将两个相互联系的指标数据进行比较,从数量上展示和说明研究对象的规模大小,水平高低,速度快慢等相对数值, 通过相同维度下的指标对比,可以发现,找出业务在不同阶段的问题。

    常见的对比方法包括: 时间对比,空间对比,标准对比。

    时间对比有三种: 同比,环比,定基比。

    例如: 本周和上周进行对比就是环比;本月第一周和上月第一周对比就是同比;所有数据同今年的第一周对比则为定基比。通过三种方式,可以分析业务增长水平,速度等信息。

    03 漏斗分析

    转化漏斗分析是业务分析的基本模型, 最常见的是把最终的转化设置为某种目的的实现,最典型的就是完成交易。但也可以是其他任何目的的实现,比如一次使用app的时间超过10分钟。

    漏斗帮助我们解决两方面的问题:

    在一个过程中是否发生泄漏,如果有泄漏,我们能在漏斗中看到,并且能够通过进一步的分析堵住这个泄漏点。

    在一个过程中是否出现了其他不应该出现的过程,造成转化主进程收到损害。

    04 同期群分析

    同期群(cohort)分析在数据运营领域十分重要,互联网运营特别需要仔细洞察留存情况。 通过对性质完全一样的可对比群体的留存情况的比较,来分析哪些因素影响用户的留存。

    同期群分析深受欢迎的重要原因是十分简单,但却十分直观。 同期群只用简单的一个图表,直接描述了用户在一段时间周期(甚至是整个LTV)的留存或流失变化情况。

    以前留存分析只要用户有回访即定义为留存,这会导致留存指标虚高。

    05 聚类分析

    聚类分析具有简单,直观的特征, 网站分析中的聚类主要分为:用户,页面或内容,来源。

    用户聚类主要体现为用户分群,用户标签法;页面聚类则主要是相似,相关页面分组法;来源聚类主要包括渠道,关键词等。

    例如: 在页面分析中,经常存在带?参数的页面。 比如: 资讯详情页面,商品页面等,都属于同一类页面。简单的分析容易造成跳出率,退出率等指标不准确的问题,通过聚类分析可以获取同类页面的准确数据用于分析场景。

    06 AB测试

    增长黑客的一个主要思想之一,是不要做一个大而全的东西,而是不断做出能够快速验证的小而精的东西。 快速验证,那如何验证呢?主要方法就是AB测试。

    比如: 你发现漏斗转化中中间有漏洞,假设一定是商品价格问题导致了流失,你看到了问题-漏斗,也想出了主意-改变定价。但主意是否正确,要看真实的用户反应,于是采用AB测试,一部分用户还是看到老价格,一部分用户看到新价格,若你的主意真的管用,新价格就应该有更好的转化,若真如此,新价格就应该确定下来,如此反复优化。

    07 埋点分析

    只有采集了足够的基础数据,才能通过各种分析方法得到需要的分析结果。

    通过分析用户行为,并细分为:浏览行为,轻度交互,重度交互,交易行为,对于浏览行为和轻度交互行为的点击按钮等事件,因其使用频繁,数据简单,采用无埋点技术实现自助埋点,即可以提高数据分析的实效性,需要的数据可立即提取,又大量减少技术人员的工作量,需要采集更丰富信息的行为。

    如: 重度交互(注册,邀请好友等)和交易事件(加购物车,下订单等)则通过SDK批量埋点的方式来实施。

    08 来源分析

    流量红利消失,我们对获客来源的重视度极高,如何有效的标注用户来源,至关重要。

    传统分析工具,渠道分析仅有单一维度,要深入分析不同渠道不同阶段效果,SEM付费搜索等来源渠道和用户所在地区进行交叉分析,得出不同区域的获客详细信息,维度越细,分析结果也越有价值。

    09 用户分析

    用户分析是互联网运营的核心, 常用的分析方法包括:活跃分析,留存分析,用户分群,用户画像,用户细查等。

    可将用户活跃细分为浏览活跃,互动活跃,交易活跃等,通过活跃行为的细分,掌握关键行为指标;通过用户行为事件序列,用户属性进行分群,观察分群用户的访问,浏览,注册,互动,交易等行为,从而真正把握不同用户类型的特点,提供有针对性的产品和服务。

    用户画像基于自动标签系统将用户完整的画像描绘清晰,更有力的支撑运营决策。

    10 表单分析

    填写表单是每个平台与用户交互的必备环节,优秀的表单设计,对转化率的提升起到重要作用。

    用户从进入表单页面之时起,就产生了微漏斗,从进入总人数到最终完成并成功提交表单人数,这个过程之中,有多少人开始填写表单,填写表单时,遇到了什么困难导致无法完成表单,都影响最终的转化效果。

    以上是常见的数据分析方法,更多应用方法需要根据业务场景灵活应用。

  • ?

    数据分析的8种方法详解

    月醉人

    展开

    对于具体的业务场景问题,我们该怎么办呢?我们以一个电子商务网站为例,用数据分析产品 GrowingIO 对该网站进行快速地数据采集、清晰和可视化展示,然后给大家分享这 8 种常见的数据分析方法。

    1 数字和趋势

    看数字、看趋势是最基础展示数据信息的方式。

    在数据分析中,我们可以通过直观的数字或趋势图表,迅速了解例如市场的走势、订单的数量、业绩完成的情况等等,从而直观的吸收数据信息,有助于决策的准确性和实时性。

    对于电子商务网站,流量是非常重要的指标。

    上图中,我们将网站的访问用户量(UV)和页面浏览量(PV)等指标汇汇聚到统一的数据看板(Dashboard),并且实时更新。

    这样的一个数据看板,核心数字和趋势一目了然,对于首席增长官来说一目了然。

    2 维度分解

    当单一的数字或趋势过于宏观时,我们需要通过不同的维度对于数据进行分解,以获取更加精细的数据洞察。

    在选择维度时,需要仔细思考其对于分析结果的影响。

    举个例子,当监测到网站流量异常时,可以通过拆分地区、访问来源、设备、浏览器等等维度,发现问题所在。

    3 用户分群

    针对符合某种特定行为或背景信息的用户,进行归类处理,是我们常常讲到的用户分群(segmentation )的手段。

    我们也可以通过提炼某一群用户的特定信息,创建该群体用户的画像。 例如访问购物网站、寄送地址在北京的用户,可以被归类为“北京”用户群体。

    而针对“北京”用户群体,我们可以进一步观察他们购买产品的频度、类别、时间,这样我们就创建出该用户群体的画像。

    在数据分析中,我们往往针对特定行为、特定背景的用户进行有针对性的用户运营和产品优化,效果会更加明显。

    上图中,我们通过 GrowingIO 的用户分群功能将一次促销活动中支付失败的用户挑选出来,然后推送相应的优惠券。

    这样精准的营销推广,可以大幅度提高用户支付的意愿和销售金额。

    4 转化漏斗

    绝大部分商业变现的流程,都可以归纳为漏斗。

    漏斗分析是我们最常见的数据分析手段之一,无论是注册转化漏斗,还是电商下单的漏斗。

    通过漏斗分析可以从先到后还原用户转化的路径,分析每一个转化节点的效率。  其中,我们往往关注三个要点: 第一,从开始到结尾,整体的转化效率是多少?  第二,每一步的转化率是多少?  第三,哪一步流失最多,原因在什么地方?流失的用户符合哪些特征?

    上图中注册流程分为 3 个步骤,总体转化率为45.5%;

    也就是说有 1000 个用户来到注册页面,其中 455 个成功完成了注册。

    但是我们不难发现第二步的转化率是 56.8% ,显着低于第一步 89.3% 和第三步转化率 89.7%,可以推测第二步注册流程存在问题。

    显而易见第二步的提升空间是最大的,投入回报比肯定不低;如果要提高注册转化率,我们应该优先解决第二步。

    5 行为轨迹

    关注行为轨迹,是为了真实了解用户行为。

    数据指标本身往往只是真实情况的抽象,例如,网站分析如果只看访问用户量(UV)和页面访问量(PV)这类指标,断然是无法全面理解用户如何使用你的产品。通过大数据手段,还原用户的行为轨迹,有助于增长团队关注用户的实际体验、发现具体问题,根据用户使用习惯设计产品、投放内容。

    上图中展示了一位用户在某电商网站上的详细行为轨迹,从官网到落地页,再到商品详情页,最后又回到官网首页。

    网站购买转化率低,以往的业务数据无法告诉你具体的原因;通过分析上面的用户行为轨迹,可以发现一些产品和运营的问题(比如是不是商品不匹配等等),从而为决策提供依据。

    6 留存分析

    在人口红利逐渐消褪的时代,留住一个老用户的成本要远远低于获取一个新用户。

    每一款产品,每一项服务,都应该核心关注用户的留存,确保做实每一个客户。

    我们可以通过数据分析理解留存情况,也可以通过分析用户行为或行为组与回访之间的关联,找到提升留存的方法。

    在 LinkedIn,增长团队通过数据发现,如果新用户进来后添加 5 个以上的联系人(上图红色线条),那么他/她在 LinkedIn 上留存要远远高于那些没有添加联系人(上图绿色和紫色的线条)的留存。

    这样,添加联系人称为 LinkedIn 留存新用户的最核心手段之一。除了需要关注整体用户的留存情况之外,市场团队可以关注各个渠道获取用户的留存度,或各类内容吸引来的注册用户回访率,产品团队关注每一个新功能对于用户的回访的影响等等,这些都是常见的留存分析场景。

    7 A/B 测试

    A/B 测试用来对比不同产品设计/算法对结果的影响。

    产品在上线过程中经常会使用 A/B 测试来测试不同产品或者功能设计的效果,市场和运营可以通过 A/B 测试来完成不同渠道、内容、广告创意的效果评估。

    举个例子,我们设计了两种不同的产品交互形式,通过比较实验组(A 组)和对照组(B 组)的访问时长和页面浏览量两个衡量指标,来评估哪一种交互形式更佳。要进行 A/B 测试有两个必备因素:

    第一,有足够的时间进行测试;

    第二,数据量和数据密度较高。

    因为当产品流量不够大的时候,做 A/B 测试得到统计结果是很难的。而像 LinkedIn 这样大体量的公司,每天可以同时进行上千个 A/B 测试。所以 A/B 测试往往在公司数据规模较大时使用会更加精准,更快得到统计的结果。

    8 数学建模

    当一个商业目标与多种行为、画像等信息有关联性时,我们通常会使用数学建模、数据挖掘的手段进行建模,预测该商业结果的产生。

    作为一家 SaaS 企业,当我们需要预测判断客户的流失时,可以通过用户的行为数据、公司信息、用户画像等数据建立流失模型。

    利用统计学的方式进行一些组合和权重计算,从而得知用户满足哪些行为之后流失的可能性会更高。

    我们常常说,不能度量,就无法增长,数据分析对于企业商业价值的提升有着至关重要的作用。

    当然,仅仅掌握单纯的理论还远远不够,实践出真知。数据分析的方法大家不妨在自己日常工作中,有分析相关项目里尝试使用,相信可以事半功倍,创造更多商业价值。

  • ?

    做大数据分析时,这几个技巧可以带来帮助

    站长

    展开

    现在数据已经成为了一些企业的“天”。近年来,近年来越来越多的公司已经意识到数据分析可以带来的价值,并且已经跳上了大数据旅行车。实际上,现在所有的一切都在被监控和测量,创造了大量的数据流,通常比公司可以处理的速度更快。问题是,根据定义,大数据很大,因此数据收集中的小差异或错误可能导致重大问题,错误信息和不准确的推论。

    对于大数据而言,以业务为中心的方式分析它的挑战是实现这一目标的唯一方法,即确保公司制定数据管理策略。

    但是,有一些技术可以优化您的大数据分析,并最大限度地减少可能渗入这些大型数据集的“噪音”。以下是几个技术技巧做参考:

    优化数据收集

    数据收集是事件链中的第一步,最终导致业务决策。确保收集的数据与业务感兴趣的指标的相关性非常重要。

    定义对公司有影响的数据类型以及分析如何为底线增加价值。从本质上讲,考虑客户行为以及这对您的业务有何针对性,然后使用这些数据进行分析。

    存储和管理数据是数据分析中的重要一步。必须保持数据质量和分析效率。

    把垃圾带出去

    肮脏的数据是大数据分析的祸害。这包括不准确,冗余或不完整的客户信息,可能会对算法造成严重破坏并导致分析结果不佳。基于脏数据做出决策是一个有问题的场景。

    清理数据至关重要,涉及丢弃无关数据并仅保留高质量,最新,完整和相关的数据。人工干预不是理想的范例,是不可持续和主观的,因此数据库本身需要清理。这种类型的数据以各种方式渗透到系统,包括时间相关的转移,例如更改客户信息或数据孤岛中的存储,这可能会破坏数据集。脏数据可能会影响营销和潜在客户生成等明显的行业,但财务和客户关系也会因基于错误信息的业务决策而受到不利影响。后果很普遍,包括盗用资源,重点和时间。

    这个脏数据难题的答案是确保进入系统的数据干净的控制措施。具体而言,重复免费,完整和准确的信息。有些应用程序和公司专门研究反调试技术和清理数据,这些途径应该针对任何对大数据分析感兴趣的公司进行调查。数据卫生是营销人员的首要任务,因为不良数据质量的连锁效应可能会大大降低企业的成本。

    为了在数据方面获得最大收益,必须花时间确保质量足以为决策和营销策略提供准确的业务视图。

    标准化数据集

    在大多数业务情况下,数据来自各种来源和各种格式。这些不一致可能转化为错误的分析结果,这可能会大大扭曲统计推断。为了避免这种可能性,必须确定数据的标准化框架或格式并严格遵守它。

    数据集成

    如今,大多数企业都包含不同的自治部门,因此许多企业都拥有孤立的数据存储库或“孤岛”。这很具挑战性,因为来自一个部门的客户信息的变化不会转移到另一个部门,因此他们将根据不准确的源数据做出决策。

    为了解决这个问题,中央数据管理平台是必要的,集成了所有部门,从而确保了数据分析的准确性,因为任何变更都可以立即被所有部门访问。

    数据隔离

    即使数据干净,有组织和集成在那里,也可能是分析问题。在这种情况下,将数据分组成小组很有帮助,同时牢记分析正在努力实现的目标。这样,可以分析子组内的趋势,这可能更有意义并且具有更大的价值。在查看可能与整个数据集无关的高度特定的趋势和行为时尤其如此。

    数据质量对于大数据分析至关重要。许多公司试图用分析软件直奔潜水,而不考虑进入系统的内容。导致不准确的推断和解释,这可能是昂贵的并且对公司造成损害。一个定义明确,管理良好的数据库管理平台是企业利用大数据分析不可或缺的工具

  • ?

    如何靠数据分析“上位”?——一位银行业务分析专家的实践

    葛如彤

    展开

    身处传统行业,数据分析的工作可能会无所适从。我们既没有互联网行业强大的数据驱动基因,甚至都没有大企业完善的信息基础和数据环境。个人不论是数据分析师和DBA,成长都有所局限。

    数据分析很火,懂行的都深知数据对于业务,对于企业生产经营的重要性。但是没有数据、数据不完整、业务不重视、数据分析沦为取数和报表制作......这些问题都阻挠着数据行业的发展,也影响个人自身。

    关于企业的数据分析,如何从0——1着手分析工作?这里想分享一个来自我们客户“小唐”的真实故事,没有鸡汤,只有浓浓的方法论值得借鉴。

    小唐就职于一家股份制银行A,近两年由于银行改制,A银行开始逐渐重视银行信息化的提升,以及数据分析的应用,小唐在对公业务一线做过2年,被委派到的数据部门做业务分析。

    委派到新部门的小唐负责对公业务,需要对下属一级支行南京支行的业务做针对性分析:风险预估、坏账分析、创新业务跟踪。

    从存款金额和贷款金额入手,分析该支行总体的经营状况;想了解存款和贷款主体业务的状况,尤其是坏账的风险;想了解下属各二级机构的经营状况;下属二级支行瑞金支行是新增的二级试点支行,投放了许多创新业务,想在分析过程中对该二级支行加强关注;

    小唐是怎么做的呢?

    分析过程

    业务分析需要借助良好的分析工具,且考虑到上层战略的需要,此项业务分析不仅仅是单一问题的解决,而是需要长期监控的,给部门业务经理监控的。基于这样的场景,小唐需要一个自住性较强、易操作、能实时同步数据、且具有协同功能的数据工具,自然而然的想到了商业智能BI工具FineBI,开展了分析工作,从0-1进行数据分析搭建业务分析模型的工作。

    1、提出问题/需求

    即最原始的问题/需求。

    领导提出“小唐啊,我想看一看部门最近的业绩怎么样?”或者自己发现“最近XX产品的推出好像在市场受到了阻碍,想看看原因在哪”,这都是最原始的问题/需求。这部分问题/需求不直接涉及业务数据,但是和目标“解决问题,提高效益”直接相关,最表象也是大家最关心的事情。

    2、明确问题/需求

    上面提出的问题/需求,不管是领导提出还是自己的诉求,都比较宽泛,如果想要通过数据分析解决问题/需求,自然而然地,需要把问题/需求往数据上靠,用我们的业务去明确问题/需求。可以分成两个步骤:

    ①用我们熟悉的业务名词精简描述

    ②化零为整。

    (1)从存款金额和贷款金额入手,分析该支行总体的经营状况——存款金额、贷款金额→日期即研究不同日期下支行的存款金额和贷款金额。(2)想了解存款和贷款主体业务的状况,尤其是坏账的风险——存款类型、贷款类型,不良贷款额即研究不同业务类型的存款金额和贷款金额的情况,尤其是五级不良贷款。(3)想了解下属各二级机构的经营状况——机构即研究不同机构的存款金额和贷款金额的情况。(4)下属二级支行瑞金支行是新增的二级试点支行,投放了许多创新业务,想在分析过程中对该二级支行加强关注;即研究单一机构的存款金额和贷款金额的情况。

    这样,通过用熟悉的业务名词去明确我们的需求,就变得十分具体,数据分析的切入点就有了突破口。但是这样的描述还是比较零散而且互有重叠,通过化零为整,整合一下我们的需求,即“研究不同时间不同机构不同存款类型/贷款类型下的存款金额/贷款金额”。

    3、梳理指标

    对于“不同时间不同机构不同存款类型/贷款类型下的存款金额/贷款金额”这一明确需求,将相关涉及的所有指标进行进一步梳理,可以先用我们最熟悉的明细表做一个展示,对数据能够有一个非常直观的感知。

    4、搭建业务包(指标分类)

    根据分析思路框架,利用FineBI数据分类的功能来针对性地搭建业务包。

    由于存款类型、贷款类型和贷款质量是三个接近平行的维度,互相之间不干扰,所以我们可以设计三条平行线,分别来看各日期机构下的存款类型、贷款类型、贷款质量的情况,并搭建以下业务包:

    三张事实表(存款数据事实表、贷款数据事实表、不良贷款数据实施表)三张维度表(机构维度表、贷款类型维度表和存款类型维度表),并建立和业务关联。

    5-6、 自助创建仪表板-分析决策

    创建仪表板的过程,实际上是将我们的分析思路以各种指标和图表具象化的过程,是数据分析思维的具体体现,所以做仪表板和分析决策是不能够分开的。这也就决定了创建仪表板的时候,我们需要掌握两个步骤,一是用常用的分析形式和分析指标结合需求落地,二是用分析决策检验和完善我们的仪表板。

    以各日期机构下的存款类型情况进行分析为例,即存款分析为例,先用我们常用的分析形式和分析指标结合需求落地。在这里只需要控制单一变量:

    a. 固定机构,分析它的日期维度。常见对日期进行分析方法有

    趋势分析对比分析(比昨日、比上月、比年初、同比)

    当然还有一些其它的业务分析形式,我们都可以进行尝试。在进行数据分析的时候,我们应该养成看到时间维度就能立马复现出这些分析方法的习惯,不管不是所有对日期进行分析的方法都应该囫囵吞枣,但是把每个分析方法都过一遍是十分有利于我们的思考过程,从而甄别出适合出当前分析的分析形式和指标。

    先对日期进行趋势分析。研究存款总额、对公存款和对私存款的时间变化趋势。而历史数据对于当前的业务影响小,我们更关心近期的数据走势,因此可以过滤出最近10天的数据。

    可以看出南京支行的主体存款业务是由对公存款组成,因此存款总额的变化趋势几乎只受到对公存款业务的影响;对公存款是处于起伏不定的状态,处于停滞不增长的状态,而对私业务乍看也是处于一条水平线,没有什么起伏,然而,当我们取消关注对公存款和存款总额的时候,可以发现对私业务的存款总额竟然是下降的。

    综上,我们发现,最近该支行的总体存款业务是下降的,对公业务没有什么增长,对私业务虽然体量相对较小,但是呈下降趋势,发展出现问题。因此我们可能需要对该机构的存款业务进行重要调整,想办法推进对公业务的继续增长,考虑改变对私业务的推广策略或者放弃相对该支行来说比较鸡肋的对私存款业务。

    同样地,对日期继续进行对比分析,研究比昨日、比上月、比年初、同比的对比情况。

    将当日的营业额度和历史同期比较是非常有说服力的,也可能更能反映时间的周期性问题。可以发现,对公业务和对私业务尽管在近期的发展态势一般,但是较历史同期而言,都几乎有着成倍的增长。

    这说明,过去的经营策略确实取得了巨大的成效,但是可能由于市场饱和或者过去的经营策略所能取得的成效已经饱和,导致了近期的业务增长一般。说明,对于现在支行的发展,可能到达了一个瓶颈,需要对经营的策略进行重大调整,以适应现在的业务情况。

    b. 固定时间,分析它的机构维度。常见对机构进行分析方法有:

    排名分析比例分析机构分析穿透分析指标(平均值)

    同样地,我们只需要将这些分析方法逐一套用,最后结合我们实际的业务需求,选择出合适的分析形式和指标。

    这里对最常用的排名分析和机构分析进行一个介绍。这里由于存款总额是每天累计汇总的,因此关注当天具体的额度变化情况更加有意义。

    可以看到各机构存款总额较上日增幅的排名;对于增幅靠前的机构,可以研究具体这些机构的业务策略进行推广,而对于存款净增额落后的机构单位,一般我们都比较关注在平均值以下的机构,可以进行标红处理做警示作用,同时对于尤其关注的某些特别支行,如瑞金二级支行,可以进行特别关注处理。同样的分析还能用于产品类别、产品、供应商等品类。

    穿透分析、比例分析的落地过程我们略去。这样将我们熟悉和常见的分析形式和指标,结合分析决策的过程去套用,创建我们所需要的仪表板,很快就可以做出以下存款分析报表。

    贷款分析和不良贷款分析,我们也同样地按着存款分析的分析思路过程进行落地。FineBI有一个比较方便的功能,可以直接将模板复用,然后简单地替换成贷款分析和不良贷款分析的各个指标,就快速生成了对应的分析模型。

    分析总结

    在从无到有搭建完业务模型之后,一定要对我们形成的分析模型进行总结,沉淀成为企业内部的指标库,这部分是我们数据分析最终沉淀的内核。

    同时,在进行数据分析时,小唐给了大家两个非常受用的小贴士:

    1、自主分析是个反复尝试的过程,实际上也是思维不断突破的过程。需要养成良好的设计习惯,用常见维分析形式和分析指标去落地,不要希望每次都能一步到位精准反映业务问题,需要踏实做好数据分析,用实际问题来改进分析模型。

    2、不要企图用一张报表解决所有问题 。往往需要制作多张报表来分析发现问题,需要建立系统性,同时也鼓励多部门对于同一类需求/问题进行分析,可以对结论形成互补。

  • ?

    数据分析没效果,是因为缺少这4种提升!

    百里冰

    展开

    在数据分析过程中,会遇到各种瓶颈,除去自身技能,分析的内容本身还有很多讲究,你的很多分析反映不出实质,解决不了问题,往往是缺少以下四种提升。

    01

    深度

    深度是指数据分析对企业的支持程度,当企业面临决策难题时,数据分析要有深度,需要理清楚这三个问题:企业的现状和问题是什么?问题为什么会产生?该怎么解决?

    比如某数据分析师做得满意度分析

    这样的分析远远不够,虽然通过分析,利用“满意度”来衡量出了各关键指标的大小,但是这样的分析并没有暴露提出哪些指标需要改进,也没有分析和竞争对手相比,满意度水平处在什么地位。

    于是,将这样的满意度分析通过象限图展示,增加了重要性维度,就能很明显看出需要改进的地方。

    接下来与竞争对手相比,处于水平,可以再增加一系列,可得出结论A的整体表现优于B,但在品类和宣传方面需要改进。

    之后可以再细化,从数据上寻找是哪个细化指标的表现使宣传满意度最低。宣传覆盖面和宣传频率,所以接下来就要着手这两方面的问题解决了。

    02

    信度

    信度是指分析结果的可靠程度,需要满足对比要可比、差异要显著、描述要全面。

    1、对比要可比

    比如A国与B国交战时期,A国军员的死亡率是9%,居民死亡率是16%,后来征兵是就以这些数据来证明参军更安全,显然不可靠。因为这两个数字的计算基数是不同的,韩军死亡率的基数是身强力壮的军人,而居民死亡率的基数包括了老弱病残者。

    2、差异要显著

    尤其是企业在利用大数据做精细化分析时,往往要用数据来理解不同指标的差异。那么数据差异多大才能表明不同用户间崔在差异呢?

    能否根据满意度的排序就断定低收入者对商场最满意,高收入者最不满意,显然不行,收入这一因素并没有做对照分析,应该列出同一收入水平,其他因素对满意度的影响。

    3、描述要全面

    最有代表性的例子就是全国平均水平,平均工资只能反映工资的平均水平,并不能刻画工资水平的差异,平均工资的增长并不能以为着每个人真是收入的增长。

    03

    效度

    效度是指分析的效率,效率的衡量标准有两个:速度和成本,这方面,社交网络分析更效度。

    传染病分析的传统方法是国家疾病控制中心从医生、实验室那里收集数据分析疾病的流行性和发病率。当不同的病人在不同地方被诊断时,所有数据经过一定的延迟后,都送到一个中心数据库。几个星期之后,你才会知道你身边的传染病还在什么地方发生了。

    这样的分析显然是滞后和无效的。无法起到传染病的预警效果。社交网络分析则不同。社交网络分析思路是处在社交网络中心且连接数目较多的中心群体比随机人群更容易影响外界和受到外界的影响。按照这一思路,中心群体比随机人群更容易受到传染病的感染,因此,在同一段时间内中心群体的感染率更大。

    04

    通度

    数据分析前要了解需求,后期要呈现分析结果。通度即沟通的通畅度,通度高低直接影响数据价值的发挥水平。

    提高数据分析的通度有三个原则:

    1、能用图表就不用数据

    比如左右两边的数据对比

    2、能用图片就不用文字

    与文字相比,图片更色调化,图表数据图形化的创新,更能让人们产生视觉冲击。

    3、能用动态呈现就不用静态

    在表达失误随时间的变化而变化时,动态呈现能还原真实,比静态展示更能让人产生身临其境之感,如FineBI的气泡图展示,自然而然的重力下沉,让人的视角自然聚焦到下方。

    除去动态的图表,在利用FineBI做可视化数据分析过程中,联动、钻取、螺旋式分析也是图表信息“再生”的主流方式。即在已经展示好的图表面前进一步做自助式的分析。

    联动&钻取

    数据分析没效果,是因为缺少这4种提升!

    切片换维

  • ?

    大数据分析:最难的不是分析,而是大数据

    青烟

    展开

    从先进的BI工具到机器学习,人工智能,现代企业拥有着各式各样整理分析数据的方法和途径。数据科学家和企业领导人都关注着这些新技术的巨大潜力,然而,当我们将焦点放在分析工具身上时,我们也可能忽略了数据本身的重要性。毕竟如果没有正确的数据,视觉化和预测分析也没有任何用处。

    每一个企业需要将他们的基础数据进行分析和甄别,在此基础上,对数据进行不同层次和结构的分类。原因如下:

    数据深度融入在商业的各个环节

    现代企业逐渐意识到,纷繁复杂的数据固然重要,而这些数据是否真的被企业职工运用,并对其工作产生了相关性的影响,才是企业领导所看重的。不同的层级岗位和职位角色都需要做出正确的决策,而良好的决策必须是基于用户数据所提出的。因此,不仅仅是数据科学团队,从产品部门到客户服务部门,再到销售等各个部门都应该获得这些数据资源和信息。

    在现代企业中,对数据的处理还仅仅是在每个月的全体会议上查看各项指标还远远不够。组织必须要将数据驱动纳入到决策制定中。以现代营销团队为例。营销人员有大量的丰富的数据可供他们自由支配,尤其是在智能手机,平板电脑,社交媒体平台爆炸式普及的今天,这样,一个品牌可以远距离地与观众互动,并了解顾客的相关信息。如果所有的这些数据被收集到一个中心位置,进行数据分析,那么对客户的长期行为分析并进行消费预判则成为了可能。同样地,根据这样的方法,其他部门,如销售、产品和客户服务部门也能获得前所未有的数据量。

    零碎数据共同形成宏观趋势判断

    如今,数据在各个行业和企业扮演着越来越重要的角色,企业应该将数据视为机会。每个数据集——CRM、CMS、ERP、营销软件,都包含大量信息和基础数据。现在或许看起来很微小,可是对数据深入的挖掘和分析将会给企业带来巨大的财富。而在现实生活当中,由于不可能预先知道哪些数据很重要,所以企业需要收集尽可能多的数据,这样即使市场环境发生大的改变,企业也能够做出合理的预判和尽可能贴近市场的决策。

    基础数据和数据分析同样重要

    数据质量是重中之重,倾斜的数据会导致错误的结果。如果你的判断来源于不完整的数据基础,你的决策便会产生一定的偏差甚至产生错误,而这最终将会侵蚀在数据驱动文化背景下人们对数据分析的信心。因此,简洁、完整和正确的数据是有效决策产生的必要前提。

    2016年美国总统大选的预测分析,很好地证明了数据质量的重要性。在当时的预测中,大多数数据是基于州级和国家级的电话投票进行的。但是电话调查中很容易出现无人接听的现象,而各州无人接听的占比率也存在着很大的区别,这会很大程度上影响选举团的预测(选举团制度是美国特有的一种选举方式, 选民在大选日投票时,不仅要在总统候选人当中选择,而且要选出代表50个州和华盛顿特区的538名选举人,以组成选举团。当选的选举人必须宣誓在选举团投票时把票投给在该州获胜的候选人。美国总统由选举团选举产生,并非由选民直接选举产生,获得半数以上选举人票者当选总统),结果就是,倾斜的数据产生错误的预测。

    如今,机器学习已经受到了大量的炒作。而机器依据大数据分析出来的预判,是否真的能符合事实情况,很大程度上决定于是否拥有坚实的数据基础:一个将数据驱动纳入到组织文化的企业,采集到的简介、完整和正确的数据。”数据驱动”一词已存在多年,但在今天快节奏和迅猛发展的数字经济中,它将成为当代企业的文化使命。

数据分析不全

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP