- ?
数据分析4要素,常用的“套路”也要会!
Jacob
展开
要做一名优秀数据分析师,首先对数据分析岗位有基本的概念,其次,要明白数据分析中有哪些套路和方法,如此,才能举一反三,才能不同场景数据分析切换自如。下面我们高屋建瓴,抽茧剥丝般讲讲数据分析四大要素。
-任何数据分析过程都逃不掉四大要素-
任何数据分析过程都包括四大要素:场景+数据+工具+方法,数据分析起点必须来源于某个场景下的需求,根据需求目标(场景),搭建分析框架(方法),提取需要的数据指标(数据),用适合的工具实现,最后提炼结论,给出建议或策略。
01 场景
首先,移动互联网化+传统企业转型触网使数据获取难度大大降低,其次,云存储和云计算使存储和计算成本降低,最后,人工智能和商业智能使数据价值凸显,越来越多企业愿意花大钱于数据基础建设,那么数据分析场景也越来越丰富,从行业来看,主要有互联网、移动互联网、金融、汽车、房地产和供应链等。
每个行业具体业务场景也会不同,比如同样是互联网,可以分为游戏、社交、电商、安全、新零售、娱乐、外卖、航旅、共享经济、搜索、人工智能.....,应用场景和边界不断扩展,不同场景分析套路和重点也不完全相同,但有一点,场景越丰富,数据分析岗越有必要和价值,思路和想象也可无限扩展。
02 数据
百科定义:数据指对客观事件进行记录并可以鉴别的符号,是对客观事物的性质、状态以及相互关系等进行记载的物理符号或这些物理符号的组合。它是可识别的、抽象的符号。它不仅指狭义上的数字,还可以是具有一定意义的文字、字母、数字符号的组合、图形、图像、视频、音频等,也是客观事物的属性、数量、位置及其相互关系的抽象表示。
数据特征:变异性和规律性,变异性是指不同事件量化的数据不同,具有差异性,正是因为数据变异性,数据分析才有必要;规律性是指包罗万象的数据中,数据是有规律可寻的,从而得出有价值的结论,正是因为规律性数据分析才有价值。
数据类型:数据可分为结构性和非结构性数据。结构化数据是指可以用数字量化的,相对规整的数据,比如生产、业务、交易和客户信息等的结构化数据,数据分析和方法很长时期都集中在这类数据上,这块的方法和工具也相对成熟;但相比结构化数据,非结构化数据存储量更大,也蕴含着非常丰富的价值,比如合约、发票、书信与采购记录等营运内容;如文书处理、电子表格、简报档案与电子邮件等部门内容;如HTML与XML等格式信息的Web内容;以及如声音、影片、图形等媒体内容。非结构数据处理算法和方法在近几年有很大的进步,比如在图像、语音、翻译等有广泛应用。
数据简史:数据规模和存储方式在1991年之前,增长是缓慢的,之后在互联网的推动下,数据量开始爆发,2005年hadoop诞生,标志着人类对海量数据处理有了解决方案,近几年在很多学者和企业的推波助澜下,数据价值越来越受到企业重视。
03 工具
工欲善其事必先利其器,工具在数据分析过程中也是非常重要的一环,下面列举些常用的工具类型:
1>笔记本电脑,电脑配置还是要高点儿,尤其是在数据量比较大的公司,如果计算内存小,很容易出现死机,严重影响工作效率。至于电脑操作系统是选择os,还是ws,建议选择后者,从电脑普及率来看是ws更高,ws分析工具更全,功能更强大;
2>基础分析和展示工具:数据分析中最常用的数据汇总和展示工具是excel和ppt,excel是最常用的数据分析工具,哪怕是在大的数据公司,比如阿里巴巴、美团、腾讯、百度,通常会先在云上把需要的指标进行初步汇总,取出放到excel中分析,excel功能很强大,除了透视汇总,图表、分类外,还有简单模型、规划求解等功能。
因此,excel是最基础也最常用的分析工具,数据分析师必须要好好掌握;数据分析完成后,通常要把成果展示给听众,ppt是非常好的选择,数据分析报告ppt不像营销同学做的花哨,形式为辅,核心是结论、信息传达,数据作为论据,如果能将数据分析报告类ppt做的很美观,也很厉害,可以参考咨询公司的报告,比如麦肯锡、埃森哲等,网上可以找到很多。
3>数据提取工具:数据提取如果数据量比较小,很多公司会有直接下载的功能,但如果数据量比较大,就需要自己加工了,常用的数据查询工具有sql、hive,很多大的互联网公司都是用hive,hive和sql语法有点类似,也是很多数据仓库同学必须掌握的语言,作为一名大公司的数据分析同学,hive是必须要掌握的,hive最早是谷歌搞出来的,不少公司在此基础上封装成自己的语言,加些自己的函数等,但总体语法和架构是一样的。
4>可视化工具:ppt中有些可视化的功能,但在可视分析上还不是特别专业,市场上认可度比较高的可视化分析工具有tableau、spotfire等,前者市场推广做的更好,知名度更高,后者功能更强大,可视化组件更丰富。如果想给人耳目一新的感觉,这些可视化工具是不错的选择,而且所见即所得,tableau和spotfire都收费,前者差不多1万元左右,如果是学生,可以申请教育版的,这样可以省一笔钱。当然,大的互联网公司也会有自己的数据产品,相对外部工具,数据接入更容易。
5>高阶数据分析工具:如果你想用一些算法、模型解决日常的工作,可以学习R软件、python,还有传统的一些spss、matlab、spss modler等,除了这些工具外,大公司也会有自己的模型或算法平台,可以通过java、python等语言直接调取已有算法包,也可以用这些语言重新封装新的算法再使用。
市面上工具很多,但要做一名合格的数据分析师,掌握1/2/3中的工具就可以解决80%的商业分析问题,另外,20%需要高阶的工具。
04 方法
数据分析思维数据分析方法包括两个层面,一个是数据分析思维层面,另一个是套路层面,常用的数据分析思维有:
1> MEMC(Mutually Exclusive Collectively Exhaustive)——“相互独立、完全穷尽”,这个是金字塔原理中非常经典的复杂问题拆解方法,尤其是针对比较大的研究课题,可能开始无从下手,这个时候通过这种方法,可以把整体分解成很多局部模块,再针对每个模块进行可能性假设和论证,最终得出满意的答案。
2>归纳,指从许多个别的事物中概括出一般性概念、原则或结论的思维方法,每次数据分析探索可能很多维度、视角都会尝试,最终要写成分析报告的时候需要提炼核心观点,这就是一个信息归纳的过程。
3> 演绎,演绎推理是由普通性的前提推出特殊性结论的推理,我们在数据分析中经常会沿用原有的经验,很多都是采用演绎的方式进行,比如 28法则是人类收入分配中有这种倾向,电商卖家收入也会有这种倾向。
4>对比思维,数据分析中很多时候要回答某个结果是好还是坏,需要有具体的参考系,常用的参考系有四类,去年同期对比如何,上期环比如何,和目标比如何,和竞争对手比如何,只有通过对比才有实际的意义,否则只是陈列数据。
5>抽茧剥丝,数据分析要像剥洋葱一样,一层层往下分解,直接不能再分解,或者可落地解决为止,如果只停留在表象,会发现不接地气,数据无法真正驱动业务。
6>5W1H,数据分析不一定都要回答6方面的问题,想表达的是如何面对复杂case,要了解这个需求的前因后果,只有先做综合性的判断,才能清楚地判断需求是否靠谱,是要接着往下做,还是要放弃,很多需求是没有意义的。另外,通过5W1H方式的沟通,会获得解决方向灵感,以及判断需求所能影响的范围。
“套路”方法常用的套路层面,需要结合具体的业务场景,比如电商流量、安全、市场营销、会员运营、销售管理等不同场景的数据分析套路是不完全一样的,下面大概讲下,后续会退出更详细的
1>流量:常用的分析方法是流量漏掉,不管是在电商、搜索、还是在社交游戏,通过流量漏斗思路,做流量转化效率优化都是这块的核心。
2>安全:安全最主要的思路是攻防(规则识别、模型识别),流程或政策优化,比如针对账号被盗这样的风险,可以在登录时增加校验流程,或者增加校验难度,也可在不改变流程情况下,提高规则、模型对异常攻击识别的准确率和覆盖度。原则要做安全和用户体验平衡。
3>成交:成交很重要的思路是从流量端做成交驱动拆解,成交金额=uv*转化率*客单价,每个指标都可以再细分,也可以从供给端做供给数量和效率拆解,再从不同维度细分,比如行业、商家类型等。
4>用户:用户主要关注的是用户粘性,和ARUP值,常用的方法是RFM,将用户分成不同类型精细化运营,终极目标是让用户离不开你,情愿花更多钱。
5>销售管理:销售核心的工作是KPI制定和分配,佣金激励,过程管理,数据分析更多是KPI制定的方法,佣金系数制定的方法,过程指标分解的方法。
6>市场营销:市场营销核心分析思路是影响面,以及投入产出比(roi)。
以上就是数据分析4要素,希望您对数据分析岗有全面的了解。
End.
作者:anyway
原文链接:https://zhuanlan.zhihu/p/33010889
- ?
数据分析运用的4要点,你可以看看!
Kyle
展开
我是企业文化从心开始,20余年职场历练,高级企业文化师,中国首届企业自媒体大会优秀总编,中国内刊协会优秀内刊主编。欢迎关注、点赞、评论、转发、收藏、交流!
时代在发展,信息在进步,目前,许多企业对数据分析的作用已经有了更深刻的认识,那么做好数据分析工作,从企业文化的角度来看,应该把握哪四个要点呢?
1、随着信息技术的高速发展,数据分析为企业决策提供了有力的支撑。
众所周知,随着信息技术的高速发展,数据分析的技术条件不断成熟,各类软件的开发和使用已经不再是价格高昂、可望而不可及了。特别是通过数据库、数据软件的使用,已经可以极大的方便各类情况的统计、汇总、分析、运用,节约了领导分析情况的时间,提升了领导做出科学决策的全面性、实时性、针对性和有效性,已经成为信息时代的一个重要工具。从企业文化的角度来说,应该通过各种宣传、培训等方式,在企业内部大力营造学习信息技术、运用信息技术的良好氛围。
2、数据分析掌握在人的手中,首先要搞定人这个关键。
做好数据分析,首先要做好人的工作。因为数据分析相较于传统的分析方式虽然有许多的优点,但对于一些年龄较大或者运用传统方法熟练的领导来说,需要他们放下已经得心应手的方法,重新学习新的信息技术知识,对他们的思想和学习能力是一个考验。同时,各类数据的统计、汇总、分析均依赖于最基础的数据来源,对于每个终端数据的提供和录入人员来说,既可能大幅增加了他们的工作量,也可能会影响他们与上级沟通、交流的话语权,是否能够获得他们的支持是数据分析可否真正发挥作用的关键点。从企业文化的角度来说,应通过典型树立、问题剖析、成果分享等方式,不断地提升大家对信息数据的认识程度,强化大家积极学习、主动运用、沟通协作的意识。
3、数据分析只有更好地服务业务发展,才会有生命力。
做数据分析工作,最容易出现的一个问题是为分析而分析,为统计而统计,最终成为形而上学的数据,无法为生产经营和业务发展服务。从数据分析工作开始的第一天起,就必须强化全体人员数据分析应为生产经营和业务发展服务的意识。比如说成本控制,以往,许多企业的采购、物流、储存、生产、销售都依靠人工来处理,不仅速度慢,而且错误多。而通过大数据库建设,可以全过程的录入、比对、控制相关数据,实现信息数字化、数据实时化,通过将成本控制所涉及的从原料采购到产品生产、运输、储存、销售(部分可能包括回收、报废)等各环节有机结合起来,形成一个闭合的环,为成本控制提供可靠的数字化的依据。并以此为基础,通过数据分析不断优化,从而达到一个相对合理的平衡状态,最终实现有效控制成本的目的。
4、数据分析运用应小步快跑,持续为公司创造价值。
对数据分析运用来说,企业的日常生产经营都可以实施数据分析,但人的精力是有限的,数据分析这个团队的精力也是有限的。必须根据企业生产经营的总体规划,首先进行全面的摸排、梳理,确定企业目前最需要改善、通过数据分析可以实现改善的项目。在项目确定后,数据分析团队应进行充分的现场沟通了解与现状分析,再形成具体的方案,包括目前现状、准备采取的措施、需要公司支持的资源、预期的时间及效果等内容,报公司领导批准后,再正式实施。在这个项目的数据分析运用取得成功之后,再进行第二个项目的实施。在取得一批项目的成功实施后,再组织专题讨论研究会,梳理成功的经验与存在的问题,以及公司目前可以实施数据分析、以改善工作的具体项目,提出可行性的建议,请与会成员集中研究,最终报公司领导批准后实施。
如此,数据分析通过一次次为企业解决问题、创造价值,不断强化大家对数据分析的正面评价与正向认知,在不断积累经验的基础上,培养人才,营造氛围,从而更好地融入业务工作、服务业务工作,推进生产经营。
(图片来源自网络,版权属于原作者,如有侵权,请联系本人,以便及时删除处理)
我是企业文化从心开始,坚持原创,支持原创,如果您有关于企业文化的相关问题,欢迎关注、评论、留言、交流!
- ?
大数据分析的四个关键环节
卢小之
展开
▌ 什么是大数据?
随着大数据时代的到来,AI 概念的火热,人们的认知有所提高。为什么说大数据有价值?这是不是只是一个虚的概念?大家怎么考虑数据驱动问题?为什么掌握更多的数据就会更有效?这些问题很难回答,但是,大数据绝不是大而空洞的。
信息论之父香农曾表示,信息是用来消除不信任的东西,比如预测明天会不会下雨,如果知道了今天的天气、风速、云层、气压等信息,有助于得出更准确的结论。所以大数据是用来消除不确定性的,掌握更多的有效数据,可以驱动企业进行科学客观的决策。
桑文锋对大数据有着自己的理解,数据采集遵循“大”、“全”、“细”、“时”四字法则。
“大”强调宏观的“大”,而非物理的“大”。大数据不是一味追求数据量的“大”。比如每天各地级市的苹果价格数据统计只有 2MB,但基于此研发出一款苹果智能调度系统,就是一个大数据应用,而有些数据虽然很大,却价值有限;
“全”强调多种数据源。大数据采集讲求全量,而不是抽样。除了采集客户端数据,还需采集服务端日志、业务数据库,以及第三方服务等数据,全面覆盖,比如美国大选前的民意调查,希拉里有70%以上胜算,但是川普成为了美国总统,因为采样数据有偏差,支持川普的底层人民不会上网回复。
“细”强调多维度数据采集,即把事件的维度、属性、字段等都进行采集。如电商行业“加入购物车”的事件,除了采集用户的 click 数据,还应采集用户点击的是哪个商品、对应的商户等数据,方便后续交叉分析。
“时”强调数据的时效性。显然,具有时效性的数据才有参考价值。如国家指数,CPI 指数,月初收集到信息和月中拿到信息,价值显然不同,数据需要实时拿到,实时分析。
从另一个视角看待数据的价值,可以分为两点,数据驱动决策,数据驱动产品智能。数据的最大价值是产品智能,有了数据基础,再搭建好策略算法,去回灌产品,提升产品本身的学习能力,可以不断迭代。如今日头条的新闻推荐,百度搜索的搜索引擎优化,都是数据驱动产品智能的体现。
▌ 数据分析四个关键环节
桑文锋把数据分析分为四个环节,数据采集、数据建模、数据分析、指标。他提出了一个观点,要想做好数据分析,一定要有自底向上的理念。很多公司的数据分析自顶向下推动,用业务分析指标来决定收集什么数据,这是需求驱动工程师的模式,不利于公司长久的数据采集。而一个健康的自底向上模式,可以帮助公司真正建立符合自己业务的数据流和数据分析体系。
一、数据采集
想要真正做好大数据分析,首先要把数据基础建好,核心就是“全”和“细”。
搜集数据时不能只通过 APP 或客户端收集数据,服务器的数据、数据库数据都要同时收集打通,收集全量数据,而非抽样数据,同时还要记录相关维度,否则分析业务时可能会发现历史数据不够,所以不要在意数据量过大,磁盘存储的成本相比数据积累的价值,非常廉价。
常见的数据采集方式归结为三类,可视化/全埋点、代码埋点、数据导入工具。
第一种是可视化/全埋点,这种方式不需要工程师做太多配合,产品经理、运营经理想做分析直接在界面点选,系统把数据收集起来,比较灵活。但是也有不好的地方,有许多维度信息会丢失,数据不够精准。
第二种是代码埋点,代码埋点不特指前端埋点,后端服务器数据模块、日志,这些深层次的都可以代码埋点,比如电商行业中交易相关的数据可以在后端采集。代码埋点的优势是,数据更加准确,通过前端去采集数据,常会发现数据对不上,跟自己的实际后台数据差异非常大。可能有三个原因:第一个原因是本身统计口径不一样,一定出现丢失;第二点是流量过大,导致数据丢失异常;第三点是SDK兼容,某些客户的某些设备数据发不出去,导致数据不对称。而代码埋点的后台是公司自己的服务器,自己核心的模拟可以做校准,基本进行更准确的数据采集。
第三种是通过导入辅助工具,将后台生成的日志、数据表、线下数据用实时批量方式灌到里面,这是一个很强的耦合。
数据采集需要采集数据和分析数据的人共同参与进来,分析数据的人明确业务指标,并且对于数据的准确性有敏感的判断力,采集数据的人再结合业务进行系统性的采集。
二、数据建模
很多公司都有业务数据库,里面存放着用户注册信息、交易信息等,然后产品经理、运营人员向技术人员寻求帮助,用业务数据库支持业务上的数据分析。但是这样维护成本很高,且几千万、几亿条数据不能很好地操作。所以,数据分析和正常业务运转有两项分析,数据分析单独建模、单独解决问题。
数据建模有两大标准:易理解和性能好。
数据驱动不是数据分析师、数据库管理员的专利,让公司每一个业务人员都能在工作中运用数据进行数据分析,并能在获得秒级响应,验证自己的新点子新思维,尝试新方法,才是全员数据驱动的健康状态。
多维数据分析模型(OLAP)是用户数据分析中最有效的模型,它把用户的访问数据都归类为维度和指标,城市是维度,操作系统也是维度,销售额、用户量是指标。建立好多维数据分析模型,解决的不是某个业务指标分析的问题,使用者可以灵活组合,满足各种需求。
三、数据分析
数据分析支持产品改进
产品经理在改进产品功能时,往往是拍脑袋灵光一现,再对初级的点子进行再加工,这是不科学的。《精益创业》中讲过一个理念,把数据分析引入产品迭代,对已有的功能进行数据采集和数据分析,得出有用的结论引入下一轮迭代,从而改进产品。在这个过程中大数据分析很关键。
Facebook 的创始人曾经介绍过他的公司如何确定产品改进方向。Facebook 采用了一种机制:每一个员工如果有一个点子,可以抽样几十万用户进行尝试,如果结果不行,就放弃这个点子,如果这个效果非常好,就推广到更大范围。这是把数据分析引入产品迭代的科学方法。
桑文锋在 2007 年加入百度时,也发现了一个现象,他打开邮箱会收到几十封报表,将百度知道的访问量、提问量、回答量等一一介绍。当百度的产品经理提出一个需求时,工程师会从数据的角度提出疑问,这个功能为什么好?有什么数据支撑?这个功能上线时如何评估?有什么预期数据?这也是一种数据驱动产品的体现。
数据驱动运营监控
运营监控通常使用海盗模型,所谓的运营就是五件事:触达是怎么吸引用户过来;然后激活用户,让用户真正变成有效的用户;然后留存,提高用户粘性,让用户能停留在你的产品中不断使用;接下来是引荐,获取用户这么困难,能不能发动已有的用户,让已有用户带来新用户,实现自传播;最后是营收,做产品最终要赚钱。要用数据分析,让运营做的更好。
数据分析方法
互联网常见分析方法有几种,多维分析、漏斗分析、留存分析、用户路径、用户分群、点击分析等等,不同的数据分析方法适用于不同的业务场景,需要自主选择。
举个多维分析的例子,神策数据有一个视频行业的客户叫做开眼,他们的软件有一个下载页面,运营人员曾经发现他们的安卓 APP 下载量远低于 iOS,这是不合理的。他们考虑过是不是 iOS 用户更愿意看视频,随后从多个维度进行了分析,否定了这个结论,当他们发现某些安卓版本的下载量为零,分析到屏幕宽高时,看出这个版本下载按钮显示不出来,所以下载比例非常低。就这样通过多维分析,找出了产品改进点。
举个漏斗分析的例子,神策数据的官网访问量很高,但是注册-登录用户的转化率很低,需要进行改进。所以大家就思考如何把转化漏斗激活地更好,后来神策做了小的改变,在提交申请试用后加了一个查看登录页面,这样用户收到账户名密码后可以随手登录,优化了用户体验,转化率也有了可观的提升。
四、指标
如何定义指标?对于创业公司来说,有两种方法非常有效:第一关键指标法和海盗指标法。
第一关键指标法是《精益数据分析》中提出的理论,任何一个产品在某个阶段,都有一个最需要关注的指标,其他指标都是这个指标的衍生,这个指标决定了公司当前的工作重点,对一个初创公司来说,可能开始关注日活,围绕日活又扩展了一些指标,当公司的产品成熟后,变现就会成为关键,净收入(GMV)会变成第一关键指标。
- ?
这才是正确的数据分析步骤
孙强炫
展开
做好数据分析需要考虑三个问题,数据从哪来,数据到哪去,数据怎么去?今天我们来讲讲数据怎么去的问题,也就是数据分析步骤。
一、定义
“勿忘初心,方得始终”,做数据分析前要想好针对的问题是什么,想通过数据分析解决什么问题,数据分析的结果能帮助你达到什么目的,对现阶段你的产品有何实际的意义。
基于分析目的确定分析范围。比如你想分析用户流失原因,你分析的范围就是流失的用户,你不能去分析新增的用户,再比如电商类产品,你想对高价值用户进行分析,那么什么是高价值用户,那么你可能确定范围:“xx年xx月xx号-xx年xx月xx号,购买次数5次以上,总金额在3000元以上的用户”,这些都是我们在数据分析之前需要确定的,只有范围确定清楚了,分析的数据才具有指导意义。
规划分析的进度和质量。比如说你要做数据的采集,你就需要考虑清楚用什么样的技术手段采集数据,用什么样的方法进行分析,然后这个过程中产生的误差多大范围内是可接受的,或者是自身有了预判,我知道这种数据分析方式会带来什么样的影响,对最后的结论带来多少干扰。
二、测量
测量包含收集获取数据和数据预处理。
收集获取数据。是用问卷的方式定量分析?还是从服务器调取日志进行分析...,这些都是数据的来源
预处理:比如说做调查问卷,对于回收来的问卷我们需要判断哪些数据是有效的,哪些数据是无效的,比如调查问卷共15道题,用户就答了一道题,这个就属于无效问卷,需要剔除出去,这个时候他的数据是不完整的,放进去反而会影响最终的数据结果。同样对数据库的数据也需要预处理,比如说你想统计新增用户,但是来了很多羊毛党用户,这部分用户对你是没有价值的,也需要处理掉。预处理的好坏,直接决定数据分析结果的质量。
三、分析
分析包含对数据的统计描述和针对问题的归纳和总结。
数据的统计描述。统计是对数据的定量分析,描述是对数据的定性分析,就是对你的数据进行定性和定量的客观性描述。
问题的归纳总结。这个是最重要的,也就是拿出我们的结论,数据本身没有价值,数据分析的结果才有价值。
四、改进
改进就是找到问题的解决方案和降低负面影响。
给出解决方案。比如最近产品用户流失比较厉害,你通过调查问卷和用户访谈了解用户流失原因,当得到分析结果以后,你需要给出解决方案。是你的体验没做好,还是竞争对手挖墙脚,亦或是你的商品价格提高了...这些都是原因,找到主要原因,给出专业的解决方案,老板要的是方案,不关心你分析的过程。
降低负面影响。比如电商的购物流程,浏览商品--》加入购物车--》下单--》支付--》完成购买,你通过漏斗模型分析,发现从加入购物车到下单流失很多,你通过数据分析发现流失的原因是设计上的问题,那么就可以重新优化设计方案,降低负面影响。
五、控制
数据分析是一个持续性的过程,所以需要持续的跟踪反馈,比如做数据的日报、周报、月报,它是一个非常持久的工作,而且数据分析的结果发出去以后,不同的人可能会有不同的看法,那么我们产品经理就需要收集不同的观点。
更新迭代。更新迭代是我们产品经理的一份重要的工作内容,不论是功能上的更新迭代,还是数据上的更新迭代。有的人可能说为什么要做数据上的跟踪迭代呢?因为数据具有时效性,我们分析的往往是一个时间段内的数据,数据会随着时间的推移发生变化,根据这些变化,我们需要做一轮新的数据分析。
- ?
最常用的四种大数据分析方法
料峭
展开
本文主要讲述数据挖掘分析领域中,最常用的四种数据分析方法:描述型分析、诊断型分析、预测型分析和指令型分析。
当刚涉足数据挖掘分析领域的分析师被问及,数据挖掘分析人员最重要的能力是什么时,他们给出了五花八门的答案。
其实我想告诉他们的是,数据挖掘分析领域最重要的能力是:能够将数据转化为非专业人士也能够清楚理解的有意义的见解。
使用一些工具来帮助大家更好的理解数据分析在挖掘数据价值方面的重要性,是十分有必要的。其中的一个工具,叫做四维分析法。
简单地来说,分析可被划分为4种关键方法。
下面会详细介绍这四种方法。
1. 描述型分析:发生了什么?
这是最常见的分析方法。在业务中,这种方法向数据分析师提供了重要指标和业务的衡量方法。
例如,每月的营收和损失账单。数据分析师可以通过这些账单,获取大量的客户数据。了解客户的地理信息,就是“描述型分析”方法之一。利用可视化工具,能够有效的增强描述型分析所提供的信息。
2. 诊断型分析:为什么会发生?
描述性数据分析的下一步就是诊断型数据分析。通过评估描述型数据,诊断分析工具能够让数据分析师深入地分析数据,钻取到数据的核心。
良好设计的BI dashboard能够整合:按照时间序列进行数据读入、特征过滤和钻取数据等功能,以便更好的分析数据。
3. 预测型分析:可能发生什么?
预测型分析主要用于进行预测。事件未来发生的可能性、预测一个可量化的值,或者是预估事情发生的时间点,这些都可以通过预测模型来完成。
预测模型通常会使用各种可变数据来实现预测。数据成员的多样化与预测结果密切相关。
在充满不确定性的环境下,预测能够帮助做出更好的决定。预测模型也是很多领域正在使用的重要方法。
4. 指令型分析:需要做什么?
数据价值和复杂度分析的下一步就是指令型分析。指令模型基于对“发生了什么”、“为什么会发生”和“可能发生什么”的分析,来帮助用户决定应该采取什么措施。通常情况下,指令型分析不是单独使用的方法,而是前面的所有方法都完成之后,最后需要完成的分析方法。
例如,交通规划分析考量了每条路线的距离、每条线路的行驶速度、以及目前的交通管制等方面因素,来帮助选择最好的回家路线。
结论
最后需要说明,每一种分析方法都对业务分析具有很大的帮助,同时也应用在数据分析的各个方面。
原文链接:http://kdnuggets/2017/07/4-types-data-analytics.html
转载请注明出自:葡萄城控件
关于葡萄城
葡萄城是全球控件行业领导者,世界领先的企业应用定制工具、企业报表和商业智能解决方案提供商,为超过75%的全球财富500强企业提供服务。
- ?
数据分析全流程(内附案例)
吉莉安
展开
(图片来源于网络)
作者:苏格兰折耳喵
来源: 运营喵是怎样炼成的 (yymzylc)
(温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )
本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:
1 分析背景
1.1 分析原理---为什么选择分析虎嗅网
在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。
综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:
由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。
鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。
虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。
因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。
1.2 本文的分析目的
笔者在本项目中的分析目的主要有4个:
(1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;
(2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;
(3)展现文本挖掘在数据分析领域的实用价值;
(4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。
1.3 分析方法---分析工具和分析类型
本文中,笔者使用的数据分析工具如下:
Python3.5.2(编程语言)
Gensim(词向量、主题模型)
Scikit-Learn(聚类和分类)
Keras(深度学习框架)
Tensorflow(深度学习框架)
Jieba(分词和关键词提取)
Excel(可视化)
Seaborn(可视化)
新浪微舆情(情绪语义分析)
Bokeh(可视化)
Gephi(网络可视化)
Plotly(可视化)
使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。
2 数据采集和文本预处理
2.1 数据采集
笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:
2.2 数据预处理
数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:
(1) 文本分词
要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:
· 精确模式:试图将句子最精确地切开,适合文本分析;
· 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;
· 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。
现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:
【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用
【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用
【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用
为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。
(2) 去停用词
这里的去停用词包括以下三类:
标点符号:, 。! /、*+-
特殊符号:▲等
无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等
(3) 去掉高频词、稀有词和计算Bigrams
去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。
Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。
3 描述性分析
该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。
3.1 发文数量、评论量和收藏量的变化走势
从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。
此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。
下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。
3.2 发文时间规律分析
笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:
上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。
3.3 相关性分析
笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。
首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。
上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。
接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。
注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。
3.4 城市提及分析
在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。
上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:
将上述结果绘制成如下动态的流向图:
由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:
京津冀城市群
长江三角洲城市群
珠江三角洲城市群
中原城市群
成渝城市群
长江中游城市群
上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。
4 文本挖掘
数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。
本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。
4.1 关键词提取
对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:
它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。
由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。
下面是笔者利用jieba在经预处理...
- ?
新手入门:数据分析的四种形式
落斜阳
展开
在我过去的博客文章中,我们已经介绍了数据分析的一些基本原理和陷阱。在这篇博文中,我们专注于数据科学中会遇到的四种数据分析:描述性分析,诊断性分析,预测性分析和规范性分析。
当我与刚刚进入数据科学世界的年轻分析师相遇时,我经常会问他们 “你认为数据科学家最重要的技能是什么?”。他们的答案是非常多样。
我对他们的回馈是:数据科学家最重要的技能应该是将数据转化为非定量的、清晰的、有意义的见解的能力。瑞典统计学家汉斯·罗斯林(Hans Rosling)为此而闻名。这是一个经常被忽视的技能。
围绕今天主题,非常有必要为大家详细介绍一些帮助个人如何使用分析相关的知识提炼出有价值的见解的工具。其中的一款工具就是四维范式分析。
简单地,可以将数据分析分类成四个主要类型。下面我将会详细介绍里面的细节。
一、描述性分析:发生了什么?
这是所有形式中最常见的。在业务中,它为分析人员提供了业务中关键指标和措施的视图。
例如公司每月的收支表。类似地,分析师可以获得大量客户的数据。了解客户的人口统计信息(例如我们的客户的30%是个体经营者)将被归类为“描述性分析”,利用有效的可视化工具可以增强描述性分析的信息。
二、诊断性分析:为什么发生?
这是数据分析的复杂性的下一步是诊断性分析。在对描述性数据进行评估时,诊断分析工具将使分析师能够深入到细分的数据,从而隔离出问题的根本原因。
精心设计的商业信息(BI)仪表板包含读取时间序列数据(即多个连续时间点的数据),并具有过滤器和钻取能力,可进行此类分析。
三、预测性分析:将发生什么?
预测分析是关于预测的。无论是将来发生事件的可能性,预测可量化的数量还是估计可能发生事件的时间点。这些都是通过预测模型完成的。
预测模型通常利用各种可变数据进行预测。组件数据的变异性将与可能预测的关系(例如,一个较老的人,他们对心脏病发作的敏感程度越高 - 我们会说年龄与心脏病发作风险呈线性相关),然后将这些数据一起编译成分数或预测。
在一个很大的不确定性的世界中,能够预测能够做出更好的决定。预测模型是许多领域中最重要的一些模型。
这是预测中需要避开的坑:http://insights.principa.co.za/the-top-predictive-analytics-pitfalls-to-avoid
四、规范性分析:需要做什么?
在价值和复杂性方面的下一步是规范性模式。规范模型利用对发生的事情的理解,为什么发生了这种情况以及各种“可能发生的”分析,以帮助用户确定采取的最佳行动方案。规定性分析通常不仅仅是一个单独的行动,而且实际上是其他一些行动。
一个很好的例子是一个交通应用程序,帮助您选择最佳路线回家,并考虑每个路线的距离,每个路上可以行驶的速度,以及当前的交通限制。
另一个例子可能是制作考试时间表,使得各个班级的学生没有冲突的时间表。
总结
虽然不同形式的分析可能为企业提供不同数量的价值,但它们都具有自己的位置。
- ?
企业数据分析分四步走:描述、诊断、预测、指导
冯瑾瑜
展开
谈到数据,大家都喜欢拿大数据说事儿,精准营销、客户管理、企业洞察,但事实上,对于大部分中小型企业来说,把创立至今多少年来各个渠道积攒下来的数据统合到一起,也仅仅只是小数据而已。
这些数据,选用合适的工具,可以非常轻松的管好。不过,在选工具之前可以先问自己这样一个问题:我要用这些企业数据,做什么样的分析?
FineReport数据报表
采用数据分析的逻辑,这里关于“如何分析企业数据”也设定两个维度:价值和复杂程度。依据不同程度可划分为四种类型:描述型、诊断型、预测型、指导型。
[描述型]的分析回答what的问题:我的企业发生了什么?
数据类型通常是综合的、广泛的、实时的、精确的,以高效的可视化来展现。
比如说,某公司的销售月报,就是[描述型]分析。
一个看板上,汇总了各个地区的月度指标,完成率,完成度,它是实时变动的,到月底自动汇总。它不光“描述”,还有一定程度的分析,可以满足日常管理需求。比方说扬州这个地区,本月的目标完成率最低,但是年度目标完成率却较好,是否是本月的销售目标太高,还是考核上有松懈。如果是人为的松懈,年度考核是否也要记录阅读的考核成绩?
高效的可视化展现,一方面是说,做这个报告的速度要快,即问即答,不能我想知道今天的情况怎么样,但你三天之后才告诉我答案;另一方面是,这个报告以“模版”的形式存在,数据变了,报告也会随之变动,什么时候打开,什么时候都是最新的。
[诊断型]的分析回答why的问题:为什么我的企业发生了这样的事情?
需要有从全局钻取到细节的能力
需要有隔离所有混淆信息的能力
比如查看数据地图,我发现江苏的市场销售额较高,想知道是什么原因?于是点击该省份,能定位到各类产品的销售数据和响应的合作客户数据。
FineReport数据决策系统
[预测型]的分析回答的是what likely的问题:我的企业将要发生什么?
主要回答战略性的问题:我的商业策略是否在一段时期内保持一致,根据算法,用历史模于预测某个具体的结果。
就像玩儿三国杀的时候,很多人喜欢诸葛亮,不停地使用“观星”一样,我们希望能够预测某件事在未来发生的可能性,或是预测一个可以量化的值,甚至预测某个结果可能发生的时间点。如何达成预测,一方面取决于你的工具,但更重要的,取决于你的预测模型。
所有的工具用到最后,拼的都不再是工具,而是用工具的人。
就像同样一台相机,马格南和司马南,用出来效果肯定不一样。
[指导型]的分析,回答的也是一个what的问题,但这个问题很直接:我需要做些什么?
最后,基于你已经知道的“发生了什么”、“为什么会发生”以及“未来可能发生什么”的分析,[指导型]分析可以帮助你确定可以采取的措施,也就是:驱动行动。
虽然我们习惯地称后两种分析为“高级分析”,但是比较客观地说法是:不同类型的分析能提供不同的商业价值,每一种分析都有它自己的用处。对于中小企业团队来说,80%对于数据的需求,都集中在[描述型]分析与[诊断型]分析之中。那么,要如何管理数据,才能更高效地利用企业数据完成[描述]与[诊断]呢?
管理数据的方法:
1、弱水三千,先取三千,再取一瓢
中小企业的数据缺乏系统化、规模化的管理,企业数据通常散落在各个部门手中,然后每个部门的数据,散落在不同业务人的手中。若想对企业的全景做出[描述]甚至[诊断]性分析,所要做的第一步是,把所有的数据集中管理——此为“弱水三千,先取三千”。
集中在一起之后,砍掉冗余数据,统一数据格式与粒度,梳理有业务需要的指标体系,形成CEO管理看板、财务管理看板、销售管理看板、市场部管理看板、人力资源管理看板等等。每个人看到的,都是跟自己工作密切、直接、实时相关的指标,这叫做“再取一瓢”。
FineReport数据决策系统(样本)
2、突破IT瓶颈,学会自问自答
管理人员有自己的管理看板,看的可能是比较宏观的方面。如果发现问题,再进行下钻分析,让工作变得更为高效。但业务人员如想要精进业务,不可能满足于一个固定的看板。最好的方式是,[精准的数据权限]+[自助式的分析工具]打配合,让业务人员能够突破IT瓶颈,用手中的数据,自问自答。
[精准的数据权限]突破的是数据的所有权;我的业务数据我做主,除了篡改,我应该可以随时都能看到它们,并且运用它们进行分析,而不是等着IT部门的“施舍”。
[自助式的分析工具],突破的是数据的使用程度,我的业务数据我自己就能分析,而且可以根据我自己的角度来分析,甚至一边分析一边修正思路,而不是写好了需求让IT人员帮忙分析,想改需求还得愧疚请求,并且耐心等待。
自助式的BI工具有很多,譬如我用FineBI分析时,IT的同事帮我把数据规整到业务包内,需要分析数据时就去业务包内找,数据每晚12点会进行一波更新,以保证数据的时效性。
3、统一认知化工作为合作
最后,我认为,中小企业拼的是活力,是即时反应,是通力合作。企业已经很小了,就不要销售部门跟市场部门、前端跟后台、人力和行政各种扔锅撕逼了。用客观的数据说话,统一对企业目前状况以及背后原因的认知,把用来撕逼、抛锅、扔猴儿的时间花在solution与action上,会更棒。
- ?
数据分析建立六步骤
穷街
展开
一、什么是数据分析?
二、数据分析的分类
数据分析的三大作用:现状分析、原因分析、预测分析。
三、数据分析的六部曲
1.明确目的和思路
首先先明确分析目的,然后梳理分析思路,并搭建分析框架,把分析目的分解成若干个不同的分析要点,即如何具体开展数据分析,需要从哪几个角度进行分析,采用哪些分析指标(各类分析指标需合理搭配使用)。同时,确保分析框架的体系化和逻辑性。
2.数据收集
一般数据来源于四种方式:数据库、第三方数据统计工具、专业的调研机构的统计年鉴或报告、市场调查。
3.数据处理
数据处理主要包括数据清洗、数据转化、数据抽取、数据合并、数据计算等处理方法,将各种原始数据加工成为数据分析所要求的样式。
4.数据分析
常用的数据分析工具,掌握Excel的数据透视表,就能解决大多数的问题。需要的话,可以再有针对性的学习SPSS、R等工具。
数据挖掘是一种高级的数据分析方法,侧重解决四类数据分析问题:分类、聚类、关联和预测,重点在寻找模式与规律。
5.数据展现
一般情况下,数据是通过表格和图形的方式来呈现的。
常用的数据图表包括饼图、柱形图、条形图、折线图、气泡图、散点图、雷达图等。进一步加工整理变成我们需要的图形,如金字塔图、矩阵图、漏斗图、帕雷托图等。
一般能用图说明问题的就不用表格,能用表说明问题的就不用文字。
图表制作的五个步骤:
1、确定要表达主题
2、确定哪种图表最适合
3、选择数据制作图表
4、检查是否真实反映数据
5、检查是否表达观点
常用图表类型和作用:
6.报告撰写
一份好的数据分析报告,首先需要有一个好的分析框架,并且图文并茂,层次明晰,能够让阅读者一目了然。
结构清晰、主次分明可以使阅读者正确理解报告内容;图文并茂,可以令数据更加生动活泼,提高视觉冲击力,有助于阅读者更形象、直观地看清楚问题和结论,从而产生思考。
好的数据分析报告需要有明确的结论、建议或解决方案。
四、数据分析的四大误区
1.分析目的不明确,为了分析而分析,这是菜鸟常常容易出现的问题;
2.缺乏行业、公司业务认知,分析结果偏离实际。数据必须和业务结合才有意义。摸清楚所在产业链的整个结构,对行业的上游和下游的经营情况有大致的了解,再根据业务当前的需要,制定发展计划,归类出需要整理的数据。同时,熟悉业务才能看到数据背后隐藏的信息;
3.为了方法而方法,为了工具而工具,只要能解决问题的方法和工具就是好的方法和工具;
4.数据本身是客观的,但被解读出来的数据是主观的。同样的数据由不同的人分析很可能得出完全相反的结论,所以一定不能提前带着观点去分析。
内容来源:小蚊子数据分析
百家号-【袁帅数据分析运营】运营者:袁帅,互联网数据分析运营实践者。会展业信息化、数字化领域专家。认证数据分析师、网络营销师、SEM搜索引擎营销师、SEO工程师、电子商务职业经理人。
- ?
4个步骤分析运营数据
Santos
展开
数据能真实反映产品运营的效果,了解哪一块做的好,哪方面有待改进,转化率、留存率等核心指标(也可称为KPI)是多少。这里的产品包括实物、虚拟、内容、活动等,可以当做产品来运营的事物。
01-数据分析目的
这是数据分析的起因:为什么要进行数据分析。有了目的,后续开展的相关工作都是围绕这个目的展开。公司上半年会议提出要深度优化产品APP,因此运营部需要通过问卷调查和在官方微信号、微博、APP引导用户反馈使用情况。
了解用户对之前的产品使用体验怎样,有哪些功能妨碍了正常使用,需要增添什么新功能满足新需求,以及其他意见和建议。这些都是通过分析反馈回来的问卷数据来确定的。
02-收集什么数据
有了目的后,就要着手制定执行方案,理清哪些是必要的关键性数据,哪些是辅助性数据,需要多少样本。既然要优化产品APP,那么就要考虑到:
(1)APP相关数据:APP下载总量、打开次数、使用时长,分析竞争对手的APP。
(2)用户留存率:某段时间内,有多少用户下载、使用或卸载。
(3)平均访问时长:每次打开使用多长时间,使用哪部分内容较多,哪部分较少。
(4)订单数据:通过APP产生的消费情况。
所谓的关键性数据,就是涉及到产品活的好不好的真实反馈。
03-数据统计分析
先了解所要收集的数据代表的内容及统计方式,比如“APP下载总量”指在某段时间内APP在各应用平台的总下载量、新增下载量,同时分为安卓端和ISO端。同时使用数据图表描述,能用图表示的就不用文字叙述。
对统计出的大量数据,分析出导致这样的结果的原因具体是什么,涉及到哪些因素,怎么去优化。
04-意见和建议
通过大量数据统计分析得出的结果,是否符合当初设定的目的和指标,或相差甚远。哪一块需要加强,哪方面需要保持,有什么好的建议让下次做的更好。可以开会讨论各抒己见,或单人面对面交流,或提供报告,多渠道收集反馈,详细分析。
通过分析产品运营数据,能了解产品、活动或内容推送整体状态,为运营提供决策,也为周报、月报、季报的撰写及其他项目的规划提供分析素材。
数据分析四步骤
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并