- ?
数据分析师和数据科学家有什么区别?
邱涵雁
展开
关于数据分析师,数据工程师和数据科学家有什么区别,三者有着相关的共同点,又有着不同点,数据科学家的影响力与互联网同进同退。数据工程师和数据分析师与数据科学家携手共同完成这幅“大数据时代”巨作。
数据科学家是什么样一个存在呢?
通常情况下,数据科学家有数学或物理方面的高等学位。有博士学位的情况并不少见,硕士学位仅是一个前提条件。数据科学家精通统计建模以及如何构建与定制高级数学算法。这既在他们专业范围内,也是他们所擅长的地方。我听到过有人这样形容一个数据科学家“软件工程技能牛过多数人的酷炫统计学家”。
我结合加工的说:所谓数据科学家,是指运用统计分析、机器学习、分布式处理等技术,从大量数据中提取出对业务有意义的信息,以易懂的形式传达给决策者,并创造出新的数据运用服务的人才。
数据工程师如何定义呢?
数据工程师一般被定义成“深刻理解统计学科的明星软件工程师”。如果你正为一个商业问题烦恼,那么你需要一个数据工程师。这些伙计就是那些能提供可建模数据所需平台的人。他们的核心价值在于他们借由清晰数据创建数据管道的能力。
如何区分数据科学家,数据工程师与数据分析师
数据工程师对演算法有相当好的理解。因此,数据工程师理应能运行基本数据模型。商业需求的高端化催生了演算高度复杂化的需求。很多时候,这些需求超过了数据工程师掌握知识范围,这个时候你就需要打电话寻求数据科学家的帮助。
数据分析师如何理解呢?
数据分析师能洞悉一个方程式的商业意义。他们知道如何提出正确的问题,非常善于数据分析,数据可视化和数据呈现。不管是给另一个数据分析师还是C级执行做演讲,数据分析师都是数据提取,模式识别以及从大量数据中洞察问题方面的能手。
如果你或者你的公司正考虑顺应这股大数据浪潮的发展,你应该从明确你想利用大数据解决所面临的商业问题处下手。接着找出你真正的需求:是数据采集,检索,仓储还是数据分析?然后编写相应的职位描述并做好准备。
想要快速进入大数据行业,西线学院大数据培训是不错的选择,除了坚持小班化教学之外,还以项目式教学为宗旨,手把手辅导学员,进行大量的案例操作,保障学员不光学会书本上的知识,更具有实际操作的能力。
- ?
最常用的四种大数据分析方法
费戎
展开
本文主要讲述数据挖掘分析领域中,最常用的四种数据分析方法:描述型分析、诊断型分析、预测型分析和指令型分析。
当刚涉足数据挖掘分析领域的分析师被问及,数据挖掘分析人员最重要的能力是什么时,他们给出了五花八门的答案。
其实我想告诉他们的是,数据挖掘分析领域最重要的能力是:能够将数据转化为非专业人士也能够清楚理解的有意义的见解。
使用一些工具来帮助大家更好的理解数据分析在挖掘数据价值方面的重要性,是十分有必要的。其中的一个工具,叫做四维分析法。
简单地来说,分析可被划分为4种关键方法。
下面会详细介绍这四种方法。
1. 描述型分析:发生了什么?
这是最常见的分析方法。在业务中,这种方法向数据分析师提供了重要指标和业务的衡量方法。
例如,每月的营收和损失账单。数据分析师可以通过这些账单,获取大量的客户数据。了解客户的地理信息,就是“描述型分析”方法之一。利用可视化工具,能够有效的增强描述型分析所提供的信息。
2. 诊断型分析:为什么会发生?
描述性数据分析的下一步就是诊断型数据分析。通过评估描述型数据,诊断分析工具能够让数据分析师深入地分析数据,钻取到数据的核心。
良好设计的BI dashboard能够整合:按照时间序列进行数据读入、特征过滤和钻取数据等功能,以便更好的分析数据。
3. 预测型分析:可能发生什么?
预测型分析主要用于进行预测。事件未来发生的可能性、预测一个可量化的值,或者是预估事情发生的时间点,这些都可以通过预测模型来完成。
预测模型通常会使用各种可变数据来实现预测。数据成员的多样化与预测结果密切相关。
在充满不确定性的环境下,预测能够帮助做出更好的决定。预测模型也是很多领域正在使用的重要方法。
4. 指令型分析:需要做什么?
数据价值和复杂度分析的下一步就是指令型分析。指令模型基于对“发生了什么”、“为什么会发生”和“可能发生什么”的分析,来帮助用户决定应该采取什么措施。通常情况下,指令型分析不是单独使用的方法,而是前面的所有方法都完成之后,最后需要完成的分析方法。
例如,交通规划分析考量了每条路线的距离、每条线路的行驶速度、以及目前的交通管制等方面因素,来帮助选择最好的回家路线。
结论
最后需要说明,每一种分析方法都对业务分析具有很大的帮助,同时也应用在数据分析的各个方面。
原文链接:http://kdnuggets/2017/07/4-types-data-analytics.html
转载请注明出自:葡萄城控件
关于葡萄城
葡萄城是全球控件行业领导者,世界领先的企业应用定制工具、企业报表和商业智能解决方案提供商,为超过75%的全球财富500强企业提供服务。
- ?
十种常用的数据分析方法
白亦
展开
道家强调四个字,叫“道、法、术、器”。
层次区别:
“器”是指物品或工具,在数据分析领域指的就是数据分析的产品或工具,“工欲善其事,必先利其器”;
“术”是指操作技术,是技能的高低、效率的高下,如对分析工具使用的技术(比如用Excel进行数据分析的水平);
“法”是指选择的方法,有句话说“选择比努力重要”;
“道”是指方向,是指导思想,是战略。
在数据分析和产品、运营优化方面,数据分析方法是其核心,属于“法”和“术”的层次。
那么如何做好数据分析呢,今天我们来讲讲互联网运营中的十大数据分析方法。
01 细分分析
细分分析是分析的基础,单一维度下的指标数据的信息价值很低。
细分方法可以分为两类, 一类逐步分析, 比如:来北京市的访客可分为朝阳,海淀等区; 另一类是维度交叉, 如:来自付费SEM的新访客。
细分用于解决所有问题。
比如漏斗转化,实际上就是把转化过程按照步骤进行细分,流量渠道的分析和评估也需要大量用到细分的方法。
02 对比分析
对比分析主要是指将两个相互联系的指标数据进行比较,从数量上展示和说明研究对象的规模大小,水平高低,速度快慢等相对数值, 通过相同维度下的指标对比,可以发现,找出业务在不同阶段的问题。
常见的对比方法包括: 时间对比,空间对比,标准对比。
时间对比有三种: 同比,环比,定基比。
例如: 本周和上周进行对比就是环比;本月第一周和上月第一周对比就是同比;所有数据同今年的第一周对比则为定基比。通过三种方式,可以分析业务增长水平,速度等信息。
03 漏斗分析
转化漏斗分析是业务分析的基本模型, 最常见的是把最终的转化设置为某种目的的实现,最典型的就是完成交易。但也可以是其他任何目的的实现,比如一次使用app的时间超过10分钟。
漏斗帮助我们解决两方面的问题:
在一个过程中是否发生泄漏,如果有泄漏,我们能在漏斗中看到,并且能够通过进一步的分析堵住这个泄漏点。
在一个过程中是否出现了其他不应该出现的过程,造成转化主进程收到损害。
04 同期群分析
同期群(cohort)分析在数据运营领域十分重要,互联网运营特别需要仔细洞察留存情况。 通过对性质完全一样的可对比群体的留存情况的比较,来分析哪些因素影响用户的留存。
同期群分析深受欢迎的重要原因是十分简单,但却十分直观。 同期群只用简单的一个图表,直接描述了用户在一段时间周期(甚至是整个LTV)的留存或流失变化情况。
以前留存分析只要用户有回访即定义为留存,这会导致留存指标虚高。
05 聚类分析
聚类分析具有简单,直观的特征, 网站分析中的聚类主要分为:用户,页面或内容,来源。
用户聚类主要体现为用户分群,用户标签法;页面聚类则主要是相似,相关页面分组法;来源聚类主要包括渠道,关键词等。
例如: 在页面分析中,经常存在带?参数的页面。 比如: 资讯详情页面,商品页面等,都属于同一类页面。简单的分析容易造成跳出率,退出率等指标不准确的问题,通过聚类分析可以获取同类页面的准确数据用于分析场景。
06 AB测试
增长黑客的一个主要思想之一,是不要做一个大而全的东西,而是不断做出能够快速验证的小而精的东西。 快速验证,那如何验证呢?主要方法就是AB测试。
比如: 你发现漏斗转化中中间有漏洞,假设一定是商品价格问题导致了流失,你看到了问题-漏斗,也想出了主意-改变定价。但主意是否正确,要看真实的用户反应,于是采用AB测试,一部分用户还是看到老价格,一部分用户看到新价格,若你的主意真的管用,新价格就应该有更好的转化,若真如此,新价格就应该确定下来,如此反复优化。
07 埋点分析
只有采集了足够的基础数据,才能通过各种分析方法得到需要的分析结果。
通过分析用户行为,并细分为:浏览行为,轻度交互,重度交互,交易行为,对于浏览行为和轻度交互行为的点击按钮等事件,因其使用频繁,数据简单,采用无埋点技术实现自助埋点,即可以提高数据分析的实效性,需要的数据可立即提取,又大量减少技术人员的工作量,需要采集更丰富信息的行为。
如: 重度交互(注册,邀请好友等)和交易事件(加购物车,下订单等)则通过SDK批量埋点的方式来实施。
08 来源分析
流量红利消失,我们对获客来源的重视度极高,如何有效的标注用户来源,至关重要。
传统分析工具,渠道分析仅有单一维度,要深入分析不同渠道不同阶段效果,SEM付费搜索等来源渠道和用户所在地区进行交叉分析,得出不同区域的获客详细信息,维度越细,分析结果也越有价值。
09 用户分析
用户分析是互联网运营的核心, 常用的分析方法包括:活跃分析,留存分析,用户分群,用户画像,用户细查等。
可将用户活跃细分为浏览活跃,互动活跃,交易活跃等,通过活跃行为的细分,掌握关键行为指标;通过用户行为事件序列,用户属性进行分群,观察分群用户的访问,浏览,注册,互动,交易等行为,从而真正把握不同用户类型的特点,提供有针对性的产品和服务。
用户画像基于自动标签系统将用户完整的画像描绘清晰,更有力的支撑运营决策。
10 表单分析
填写表单是每个平台与用户交互的必备环节,优秀的表单设计,对转化率的提升起到重要作用。
用户从进入表单页面之时起,就产生了微漏斗,从进入总人数到最终完成并成功提交表单人数,这个过程之中,有多少人开始填写表单,填写表单时,遇到了什么困难导致无法完成表单,都影响最终的转化效果。
以上是常见的数据分析方法,更多应用方法需要根据业务场景灵活应用。
- ?
数据分析方法(一):对比与对标
梦露
展开
对比是数据分析最基本的方法,通过对比识别数据差异。但是对比有得失。在分析过程中,对比得当可获得精准结论,但对比分析也存在陷阱,比如某产品近期销售数据在下滑,想当然得会得出结论此产品受欢迎度在下降,但是查看销售比(销售数/DAU)却在上升,所以只是因为DAU下降了。
所以如何去有效对比?
1、 横向、纵向多维度对比
对比的前提是两个事物或统一个事物的两个状态,其次必须要有一个对比的指标或标准(这里可称为对比的度量)。对比的两事物一个是主体,另一个是客体。也就是明确对比的三要素:主体、客体和度量。比如小明比小王高5cm,就是一个最简单的对比,这里小明是主体,小王是客体,度量身高,且人们对于身高这个度量存有共识。但如果去大排档吃一碗炒饭50元,可能觉得很贵。那如果是取希尔顿吃一碗炒饭128元可能就不觉得贵,这里我们选择了常识作为比较的基准,客体也没有问题,问题在于我们所谓的“常识”并非所有人的“共识”,如果不是共识,就要非常谨慎地得出结论,否则就容易从自我出发做出判断,影响结论的中肯性。
2、建立标准化的对比客体和度量
就是因为标准可以是认为确定的,所以存在质疑和不确定性。
建立标准化的对比可以是时间标准、空间标准、特定标准、计划标准。
3、 比率的对比
常见的对比是大小的对比、数量的对比,比如销售额的对比,人数的对比,使用不同的对比指标会得到不同的结论,我们把对比标准的选择叫做视角,视角不同,结论不同。比如上述对比小明小王俩同学,身高是视角事宜,除此之外还有年龄、学习成绩、颜值等等。在对比各种变化的原因时,我们也有各种模型,我们所要做的就是找到合适的对比视角。
直接描述事物的变量:长度、数量、高度、宽度等
加工后可得到:增速、效率、效益等指标,这才是数据分析时常用的。
如下图的AB公司销售额对比,虽然A公司销售额总体上涨且高于B公司,但是B公司的增速迅猛,高于A公司,即使后期增速下降了,最后的销售额还是赶超。(数据都是笔者瞎编的,工具用的是FineBI)
3、 指标的逻辑与管理指标
数据分析师有一个关键的职能就是要设计“指标”来对比,设计指标和应用指标有着天壤之别。比如某保健品公司,他们的产品是各类补品及奶粉,他们的业务与市场中人口的出生率、老龄化速度、市场整体购买力、对保健品的消费观念有着直接关系,还与政府对这个市场的管控力度有关。分析这么多之后,有没有一个指标来反映这些综合的因素,它的正反代表着好坏。
考虑到以上因素需要构建一个综合性的指标,这需要各种数据的加权计算。在不考虑市场规模的情况才,可以先构建一个指标指数模型:
Y=aX1 + bX2 + cX3 + dX4+……
Y 可定为市场吸引力指标值
X1 可定为老龄化程度
X2 可定为市场整体购买力
X3 可定为市场对保健品的品牌的看法
X4 可定为政府对这个市场的管控力度
abcd是系数,分别代表影响力程度
当然以上只是简单的罗列,实际情况比如X2还能分解出多个影响指标,甚至整体可以换成乘法模型,指数模型。。。
4、 对标的层次和维度
设定了各项管理指标后,剩下的就是比较工作了。从变化到追踪事物变化的诡计,找到问题的根源,从而找到书屋发展规律,这个过程叫对标。对标可以和自己比,也要和别人和竞品比。
对标的维度有规模指标、速度指标、效率指标、效益指标。
规模指标比如营业额、销售额,电商平台的UV、日活,医院的一天接诊数量,年营业收入额;
速度指标往往代表着活力,也是看未来趋势和潜能的重要指标类,包括各种运营管理指标的速度指标。
效率指标即投入和产出比,如果投入的是时间,月度产值、季度产值;如果投入的是净资产、则净资产周转率;如果投入的是人,人均产值,人均销售额。
- ?
大数据分析与数据分析的根本区别在哪里?
寒珊
展开
作者:CDA数据分析师
大数据分析与数据分析这几年一直都是个高频词,很多人都开始纷纷转行到这个领域,也有不少人开始跃跃欲试,想找准时机进到大数据或数据分析领域。如今大数据分析和数据分析火爆,要说时机,可谓处处都是时机,关键要明了的一点是,大数据分析和数据分析两者的根本区别在哪里,只有真正了解了,才会知晓更加适合自己的领域是大数据分析师还是数据分析师。毕竟职场如战场,时间就是生活,不容儿戏,更不容怠慢。下面我来好好告诉大家两者的本质区别到底是什么!
大数据分析:指无法在可承受的时间范围内用常规软件工具进行捕捉、管理和处理的数据集合。是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
在维克托·迈尔-舍恩伯格及肯尼斯·库克耶编写的《大数据时代》 中大数据分析指不用随机分析法(抽样调查)这样的捷径,而采用所有数据进行分析处理,因此不用考虑数据的分布状态(抽样数据是需要考虑样本分布是否有偏,是否与总体一致)也不用考虑假设检验,这点也是大数据分析与一般数据分析的一个区别。
数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。
大数据分析与数据分析最核心的区别是处理的数据规模不同,由此导致两个方向从业者的技能也是不同的。在CDA人才能力标准中从理论基础、软件工具、分析方法、业务分析、可视化五个方面对数据分析师与大数据分析师进行了定义。
【数据分析师的要求】
数据分析师的理论要求:统计学、概率论和数理统计、多元统计分析、时间序列、数据挖掘。
工具要求:必要:Excel、SQL可选:SPSS MODELER、R、Python、SAS等
分析方法要求:除掌握基本数据处理及分析方法以外,还应掌握高级数据分析及数据挖掘方法(多元线性回归法,贝叶斯,神经网络,决策树,聚类分析法,关联规则,时间序列,支持向量机,集成学习等)和可视化技术。
业务分析能力:可以将业务目标转化为数据分析目标;熟悉常用算法和数据结构,熟悉企业数据库构架建设;针对不同分析主体,可以熟练的进行维度分析,能够从海量数据中搜集并提取信息;通过相关数据分析方法,结合一个或多个数据分析软件完成对海量数据的处理和分析。
结果展现能力:报告体现数据挖掘的整体流程,层层阐述信息的收集、模型的构建、结果的验证和解读,对行业进行评估,优化和决策。
【大数据分析师的要求】
理论要求:统计学、概率论和数据库、数据挖掘、JAVA基础、Linux基础。
工具要求:必要: SQL、Hadoop、HDFS、Mapreduce、Mahout、Hive、Spark可选:RHadoop、Hbase、ZooKeeper等
分析方法要求:熟练掌握hadoop集群搭建;熟悉nosql数据库的原理及特征,并会运用在相关的场景;熟练运用mahout、spark提供的进行大数据分析的数据挖掘算法,包括聚类(kmeans算法、canopy算法)、分类(贝叶斯算法、随机森林算法)、主题推荐(基于物品的推荐、基于用户的推荐)等算法的原理和使用范围。
业务分析能力:熟悉hadoop+hive+spark进行大数据分析的架构设计,并能针对不同的业务提出大数据架构的解决思路。掌握hadoop+hive+ Spark+tableau平台上Spark MLlib、SparkSQL的功能与应用场景,根据不同的数据业务需求选择合适的组件进行分析与处理。并对基于Spark框架提出的模型进行对比分析与完善。
结果展现能力:报告能体现大数据分析的优势,能清楚地阐述数据采集、大数据处理过程及最终结果的解读,同时提出模型的优化和改进之处,以利于提升大数据分析的商业价值。
综上大数据分析与数据分析的根本区别就是分析的思维与分析所用的工具不同。大家在求职或转行过程认清自己对两者的偏好和自己的兴趣所在,以及自己的能力更适合在哪个领域发挥,还有自己所在城市对两者的职业需求,综合天时地利人和三个条件,我们才能做出更理智更客观更科学的抉择。
- ?
8000字深度总结:运营必懂的33个数据指标与分析方法!
牧以南
展开
2017 年马云在某次年会演讲中提到一件让他惊讶的事情。
在西湖边上他曾看到乞丐在用支付宝收款码进行乞讨,从界面操作上看该乞丐还能熟练应用支付宝提供的「生意通」功能,研究本周的乞讨收入趋势以及单位小时的乞讨金额,从而为自己制定更加高效的的乞讨策略。
图片来源于网络
乞丐都在用数据分析来武装自己了,身为互联网从业者,你还敢落后?为了让你感知到数据分析对工作效率提升价值,我们来看一个真实的运营案例。
你为什么要学习数据分析
运营研究社在 2018 年以前,公众号图文的推送时间是不固定的,在早上、中午、下班时间、深夜都有过推送,所以相应的阅读量的波动也非常大。
在今年年初我提出了一个假设“如果把推送时间固定的话,会不会对图文打开率(阅读量)的提升有促进作用”。
为了检验这一设想,当时我需要解决的第一个问题是:
“运营研究社的公众号黄金推送时间在哪?”
我导出了运营研究社过去 1 年里的图文数据,并拿推送时间、打开率、标题 3 个数据字段来构建散点图。
运营研究社过去半年图文数据
从过去 1 年的推送时间和打开率的散点分布图来看,高打开率的图文主要集中在中午 12 点、13 点两个个时间段,于是我把将这两个时间点定义成运营研究社图文推送的黄金时间。
在实践中也证明了“在固定时间推送内容有利用提升打开率”假设是正确的,从阅读数据上的反馈就是我们的阅读量在 3 个月时间里提升了 200%。
无论是在生活还是工作,数据分析已是一项必备技能。
我在招聘网站上研究了近 100 个运营岗位的职责要求,用户运营、内容运营、产品运营、社群运营、渠道运营,它们几乎都会在靠前的位置写上这样一行文字:
“通过有效的数据分析(点击率,访问,转化率等),研究分析用户的需求制定运营策略”。
为了让你能够掌握最实用的数据分析技能,本篇文章将带你了解数据分析字段与产品指标、熟知数据驱动运营的底层方法。
“竟巧妇难为无米之炊”,为了让小伙伴们赢在起跑线,下面将开始系统讲解数据分析里的底层元素——数据字段。
你的基础数据字段足够全嘛?
2015 年我在百度贴吧在内容运营,当时的我们核心 KPI 是将次日留存率提升至 45%,于是我就想研究用户首次登入的内容消费量与次日留存的关系,以期通过优化内容推荐系统来提升次日留存。
想法很好,现实却很悲剧,我在给技术同学提数据分析需求时,他们很佛性的回了句:
“抱歉,我们没有统计用户的内容消费数据”。
由于缺乏用户的内容消费数据,我当时只能搁置这套数据分析方案了(在补充统计用户消费字段的 1 个月后才最终落地执行)。
跟大家分享这个案例,主要是希望大家能够理解,数据分析的底层关键支撑是基础数据字段,没有基础数据字段你的任何数据分析方案都执行不了,没有基础数据字段,你再老司机也无法用数据驱动运营。
所以,为了能够做好数据分析,你需要尽可能全面的提出你的数据字段需求,具体来说包括如下 2 类基础数据字段:
1)用户信息数据字段
它指的是用户的社会信息数据,比如姓名、性别、出生年月、籍贯、婚姻、学历,手机、邮箱等字段
对于电商和母婴类产品来说,还需要基于「用户行为数据」推导家庭类型、家庭人数、家庭小孩标签、工作岗位、所处行业等高级用户信息数据字段。
2)用户行为数据字段
用户行为数据字段在记录时的格式通常是User id(哪个用户)+Active(哪种操作)+Time(何时产生)。
比如今天上午,我在贴吧客户端首页看了一篇与 China Joy 有关的的贴子,并且还对妹子们的颜值留进行了评轮。那么贴吧官方会将我的看贴行为数据,以如下格式被统计下来。
用户行为数据字段是每一位用户在产品上操作行为的数据记录,不同产品类型需要的需要记录的用户行为是不一样的。
阅读内容、点赞、评论、分享是社区产品的关键用户行为字段,点击产品、添加购物车、下单、付费、评价是电商产品的关键用户行为字段……
相比于用户信息数据而言,用户行为数据是数据分析的重中之重,可以基于用户行为数据的处理加工,分析出每天产品的登入用户总量(DAU)、新用户留存以及评论用户总量等产品数据指标。
促进数据增长指标都有那些?
有两位内容运营的同学,有一天领导问他们最近的产品情况怎么样。
其中一位运营说产品表现很不错,每天都有很多人互动和称赞,另外一位运营回答说产品有问题,用户都不怎么会将内容分享出去。
如果你作为老板,你应该相信谁?
我想这两位同学你应该都不会相信,甚至还会很生气,因为你的员工没有一点点的数据分析意识。
现代管理学之父彼得·德鲁克说过一句很经典的话:
如果你不能衡量它,那么你就不能有效增长它。
为了能够让数据驱动业务增长,我们需要制定业务的衡量标准,用统一的衡量标准来定义和评价业务,这个统一的标准在数据分析中叫做指标。
案例中的两位内容运营如果能够以互动率和点赞率、分享率这 3 个产品数据指标来向领导汇报自己的运营工作的话,或许就能够在领导心中留个好印象了。
了解和使用指标是数据分析思维的第二步,我们需要基于具体的业务需求设定能够驱动产品增长的指标。(Ps:数据指标是由用户基础数据字段处理加工而成)
按照比较受大家认可的 AARRR 产品增长模型,我们可以将指标分为五大类:拉新指标、活跃指标、留存指标、转化指标、传播指标。
5个产品的拉新指标
运营通过渠道投放让“用户”接触到产品,当“用户”觉得产品不错就会去下载它,打开产品发现里边的内容蛮适合自己,“用户”就会注册产品,最终成为产品真正的用户。
以上是绝大部分运营都会经历的拉新过程,如果你想监控整个过程,并且评估拉新的执行效果,那么你就需要设置如下数据指标。
1)浏览量
俗称曝光量,指的是产品的推广信息在朋友圈、搜索引擎、应用商店等渠道渠道中被多少用户看到。与浏览量相对应的是点击量,它们俩的比例在业内有一个专业词汇 CTR(CTR=点击量/浏览量),很多广告平台会用 CTR 来评估广告质量。
2)下载量
指的是 App 的安装次数,是衡量拉新效果的结果指标。不过,App 下载其实是一个中间态,为了让产品从曝光到下载有一个高转化,你需要注意应用大小、介绍文案的打磨。
比如游戏类 App,为了避免怕漫长的下载时间造成玩家流失,会选择让用户下载后以补丁形式完成全部素材的加载。
3)新增用户
下载并不是意味着就是用户,如果某个“用户”只下载了并没有注册,那它就是一个无效的用户。对于用户的界定,每个产品是不一样的,大部分的产品是用户注册了 App,就被定义为用户了,比如知乎、微博、小红书、百度贴吧。
4)获取成本
用户获取必然涉及成本,而这是运营新手最容易忽略的。目前常见的成本的计算方式有 CPM(千次曝光成本)、CPC(单次点击成本)、CPA(单次获客成本)。
5个产品的活跃指标
相比于下载量和用户量而言,在人口红利消失后,大家开始更关注实实在在的东西了——你到底有多少活跃用户。
用户活跃作为运营的核心工作,不论移动端、网页端或者微信端,都有相关指标可以衡量。
1)活跃用户数
DAU 指的是日活跃用户数量,指的是在 24 小时内活跃用户的总量。把时间周期拉长的还有周活跃 WAU 和月活跃 MAU。(MAU 指的是一个月时间周期里去重后的活跃用户总和)
Ps:与活跃用户相对应的还有流失用户、忠实用户、回流用户,其中流失用户是长期不活跃,忠诚用户是长期活跃,回流用户是曾经不活跃或流失,后来又再次打开产品的活跃用户。
2)活跃率
活跃用户数衡量的是产品的市场体量,活跃率看的则是产品的健康。
比如说某款产品的 DAU 是 100 万,可能你觉得还不错,但是我跟你说它的总注册用户是 1 亿,活跃率仅为 1%,你的感受可能就是这款产品很不错了。
3)在线时长
现在数据分析也越来越注重用户行为了,为了深入研究一款 App 的活跃健康度就需要去研究在线时长(它是视频类网站的核心数据指标)。
不同产品类型的访问时长不同,社交肯定长于工具类产品,内容平台肯定长于金融理财,如果你是做内容的产品的,发现大部分用户访问时长只有几十秒,那么最好分析一下原因。
4)启动次数
它体现的是用户的使用频率,用户的日均启动次数越多,说明用户对产品的依赖性越高,活跃度也就越好。
社交产品的人均启动次数会在 3-5 次之间,是通互联网中在启动次数指标中数值最高的。
5)页面浏览量
PV(PageView)是页面浏览量,UV(Unique Visitor)是一定时间内访问网页的人数,用户在网页的一次访问请求可以看作一个 PV,用户看了十个网页,则 PV 为 10。
PV 是互联网早期 Web 站点时代的活跃指标,也可以理解为网页版活跃。
5个产品的留存指标
如果说活跃数和活跃率是产品的市场大小和健康程度的话,那么用户留存衡量产品是否产品能够可持续发展,如果你是早期产品就更应该关注是留存指标了。
1)用户留存率
留存率 = 留存用户 / 当初的总用户量
用户在某段时间使用产品,过了一段时间后,仍旧继续使用的用户,被称为留存用户。
假设产品某天在某渠道新增了用户 1000 个,第二天仍旧登入产品的用户有 350 个,第 7 天仍旧登入产品的有 100 人,那么这个渠道获取来的用户次日留存率有 35%,那么称七日留存率为 10%。
Facebook 有一个著名的 40-20-10 法则,即新用户次日留存率为 40%,七日留存率为 20%,三十日留存率为 10%,有此表现的产品属于数据比较好的。
2)用户流失率
用户流失率和留存率恰好相反,如果某产品新用户的次日留存为 30%,那么反过来说明有 70% 的用户流失了。
流失率在一定程度能预测产品的发展,如果产品某阶段有用户 10 万,月流失率为 20%,简单推测,5 个月后产品将失去所有的用户。
Ps:这里可以引出一个公式,生命周期 = (1 / 流失率)*流失率的时间维度。比如产品的周流失率为 50%,那么平均用户生命周期为 14 天。
15个产品的转化指标
运营而言,拉新和活跃、留存都只是手段,最终衡量你工作业绩的是你手上掌握了多少有价值的用户。
运营就像用户成长路上的指引者,指引者产品里的用户成为能够产生价值的超级用户,即回归商业的本质。
交易类产品转化指标
1)GMV
它是一个虚荣指标,只要用户下单,生成订单号,便可以算在 GMV 里,不管用户是否真的购买了,京东在双十一对外发布的战报是 GMV。
2)成交额
成交金额指的是用户付款的实际流水,是用户购买后的消费金额,天猫在双十一对外发布的战报是成交额。
3)销售收入
它指的是成交金额减去退款后剩余的金额,属于内部机密数据了。
如果把上述的三个指标看作用户支付的动态环节,则能再产生两个新指标。
成交金额与 GMV 的比率,实际能换算成订单支付率,它体现的支付的流畅度;销售收入和成交金额,也涉及到了退款率,它体现的是产品质量。
4)付费用户量
在产品里边产生过交易行为的用户总量,同活跃用户一样,交易用户也可以区分为首单用户(第一次消费),忠诚消费用户(持续购买的用户),流失消费用户(流失后又回来的用户)等。
同时,为了研究用户的付费潜力,你还可以研究下产品的付费用户比例:
付费用户比例 = 付费用户 ÷ 总注册用户
5)ARPU
在单个促销活动中,它指的是每一笔用户订单的收入,总收入/订单数。而在整个产品生命周期中,我们更关注用户平均付费,总收入/用户数。
ARPU 可以再一步细分,当普通用户占比太多,往往还会采用每付费用户平均收入:ARPPU = 总收入÷ 收费用户数
6)复购率
和新增用户一样,获得一个新付费用户的成本已经高于维护熟客的成本。复购率更多用在整体的重复购买次数统计:单位时间内,消费两次以上的用户数占购买总用户数。
比如运营研究社的技能训练营在第一季度有 1789 个付费用户,购买次数在两次以上的有 657 人,那么我们季度复购率是 36%。
社区型产品转化指标
社区型产品的首要目的是将用户聚集在一起,并且引入用户生成内容,它的核心关键在于培养一个能够生成内容的活跃用户社区。
1)内容生成者
参与内容生存的用户...
- ?
数据分析的8种方法详解
远侵
展开
对于具体的业务场景问题,我们该怎么办呢?我们以一个电子商务网站为例,用数据分析产品 GrowingIO 对该网站进行快速地数据采集、清晰和可视化展示,然后给大家分享这 8 种常见的数据分析方法。
1 数字和趋势
看数字、看趋势是最基础展示数据信息的方式。
在数据分析中,我们可以通过直观的数字或趋势图表,迅速了解例如市场的走势、订单的数量、业绩完成的情况等等,从而直观的吸收数据信息,有助于决策的准确性和实时性。
对于电子商务网站,流量是非常重要的指标。
上图中,我们将网站的访问用户量(UV)和页面浏览量(PV)等指标汇汇聚到统一的数据看板(Dashboard),并且实时更新。
这样的一个数据看板,核心数字和趋势一目了然,对于首席增长官来说一目了然。
2 维度分解
当单一的数字或趋势过于宏观时,我们需要通过不同的维度对于数据进行分解,以获取更加精细的数据洞察。
在选择维度时,需要仔细思考其对于分析结果的影响。
举个例子,当监测到网站流量异常时,可以通过拆分地区、访问来源、设备、浏览器等等维度,发现问题所在。
3 用户分群
针对符合某种特定行为或背景信息的用户,进行归类处理,是我们常常讲到的用户分群(segmentation )的手段。
我们也可以通过提炼某一群用户的特定信息,创建该群体用户的画像。 例如访问购物网站、寄送地址在北京的用户,可以被归类为“北京”用户群体。
而针对“北京”用户群体,我们可以进一步观察他们购买产品的频度、类别、时间,这样我们就创建出该用户群体的画像。
在数据分析中,我们往往针对特定行为、特定背景的用户进行有针对性的用户运营和产品优化,效果会更加明显。
上图中,我们通过 GrowingIO 的用户分群功能将一次促销活动中支付失败的用户挑选出来,然后推送相应的优惠券。
这样精准的营销推广,可以大幅度提高用户支付的意愿和销售金额。
4 转化漏斗
绝大部分商业变现的流程,都可以归纳为漏斗。
漏斗分析是我们最常见的数据分析手段之一,无论是注册转化漏斗,还是电商下单的漏斗。
通过漏斗分析可以从先到后还原用户转化的路径,分析每一个转化节点的效率。 其中,我们往往关注三个要点: 第一,从开始到结尾,整体的转化效率是多少? 第二,每一步的转化率是多少? 第三,哪一步流失最多,原因在什么地方?流失的用户符合哪些特征?
上图中注册流程分为 3 个步骤,总体转化率为45.5%;
也就是说有 1000 个用户来到注册页面,其中 455 个成功完成了注册。
但是我们不难发现第二步的转化率是 56.8% ,显着低于第一步 89.3% 和第三步转化率 89.7%,可以推测第二步注册流程存在问题。
显而易见第二步的提升空间是最大的,投入回报比肯定不低;如果要提高注册转化率,我们应该优先解决第二步。
5 行为轨迹
关注行为轨迹,是为了真实了解用户行为。
数据指标本身往往只是真实情况的抽象,例如,网站分析如果只看访问用户量(UV)和页面访问量(PV)这类指标,断然是无法全面理解用户如何使用你的产品。通过大数据手段,还原用户的行为轨迹,有助于增长团队关注用户的实际体验、发现具体问题,根据用户使用习惯设计产品、投放内容。
上图中展示了一位用户在某电商网站上的详细行为轨迹,从官网到落地页,再到商品详情页,最后又回到官网首页。
网站购买转化率低,以往的业务数据无法告诉你具体的原因;通过分析上面的用户行为轨迹,可以发现一些产品和运营的问题(比如是不是商品不匹配等等),从而为决策提供依据。
6 留存分析
在人口红利逐渐消褪的时代,留住一个老用户的成本要远远低于获取一个新用户。
每一款产品,每一项服务,都应该核心关注用户的留存,确保做实每一个客户。
我们可以通过数据分析理解留存情况,也可以通过分析用户行为或行为组与回访之间的关联,找到提升留存的方法。
在 LinkedIn,增长团队通过数据发现,如果新用户进来后添加 5 个以上的联系人(上图红色线条),那么他/她在 LinkedIn 上留存要远远高于那些没有添加联系人(上图绿色和紫色的线条)的留存。
这样,添加联系人称为 LinkedIn 留存新用户的最核心手段之一。除了需要关注整体用户的留存情况之外,市场团队可以关注各个渠道获取用户的留存度,或各类内容吸引来的注册用户回访率,产品团队关注每一个新功能对于用户的回访的影响等等,这些都是常见的留存分析场景。
7 A/B 测试
A/B 测试用来对比不同产品设计/算法对结果的影响。
产品在上线过程中经常会使用 A/B 测试来测试不同产品或者功能设计的效果,市场和运营可以通过 A/B 测试来完成不同渠道、内容、广告创意的效果评估。
举个例子,我们设计了两种不同的产品交互形式,通过比较实验组(A 组)和对照组(B 组)的访问时长和页面浏览量两个衡量指标,来评估哪一种交互形式更佳。要进行 A/B 测试有两个必备因素:
第一,有足够的时间进行测试;
第二,数据量和数据密度较高。
因为当产品流量不够大的时候,做 A/B 测试得到统计结果是很难的。而像 LinkedIn 这样大体量的公司,每天可以同时进行上千个 A/B 测试。所以 A/B 测试往往在公司数据规模较大时使用会更加精准,更快得到统计的结果。
8 数学建模
当一个商业目标与多种行为、画像等信息有关联性时,我们通常会使用数学建模、数据挖掘的手段进行建模,预测该商业结果的产生。
作为一家 SaaS 企业,当我们需要预测判断客户的流失时,可以通过用户的行为数据、公司信息、用户画像等数据建立流失模型。
利用统计学的方式进行一些组合和权重计算,从而得知用户满足哪些行为之后流失的可能性会更高。
我们常常说,不能度量,就无法增长,数据分析对于企业商业价值的提升有着至关重要的作用。
当然,仅仅掌握单纯的理论还远远不够,实践出真知。数据分析的方法大家不妨在自己日常工作中,有分析相关项目里尝试使用,相信可以事半功倍,创造更多商业价值。
- ?
excel中常见数据处理与分析,你工作中一定用的到!
鄂穆
展开
excel中有很多功能用起来方便,快捷,特别是当数据多的时候,你还在一个个的进行操作吗? 下面带着大家来学习数据的数字排序,文字排序,筛选,高级筛选。
排序:
单列排序
光标定于列中--数据菜单下--排序与筛选--升序和降序按钮,完成按照当前列的排序。
2.多列排序
光标定于数据区域中或选择要排序的记录--数据菜单下--排序与筛选--“排序”按钮--弹出对话框:设定条件与方式----添加条件----确定。
3.自定义排序:在进行排序时,针对于文本可以进行笔画,拼音和自定义排序。
1、数字排序
2、文字排序
筛选:
自动:光标定于数据区域中或选择要筛选的记录--数据菜单下--排序与筛选--“筛选”按钮--此时发现标题行出现下拉三角符号,根据条件进行筛选
高级:先把条件打出来放在一边,直接点击高级,设置条件区域,注意题中的年龄设置,以及符号的设置(小写)
3、自动筛选
4、高级筛选
在表格本身筛选出结果今天的分享就到这里,明天接着给大家更新更精彩的内容。全都是手码,希望大家能够多多支持,欢迎关注转发,谢谢大家!!
- ?
如何对客户进行数据挖掘与分析
马飞阳
展开
数据挖掘与分析可以说是信息领域发展最快的技术,很多不同领域的专家都从中获得了发展的空间,使得数据挖掘成为企业界讨论的热门话题。
随着信息技术的发展,人们采集数据的手段越来越丰富,由此积累的数据日益膨胀,数据量达到GB甚至TB级,而且高位数据也成为了主流,于是数据挖掘这一融合多种分析手段,从大量数据中发现有用知识的方法就应运而生了,它的出现为商业决策提供了有价值的知识,让企业获得了利润,在客户内在需求管理中,数据挖掘正在起着导向的作用。
一、以客户为中心的数据分析框架思想
信息时代到今天已经发生了三个变迁,从80年代的硬件时代,到90年代的软件时代,到2000年开始的客户为中心的信息时代。
我们也在这个阶段看到了服务业的竞争也发生了翻天覆地的变化——从以服务内容取胜,到服务渠道取胜,到现阶段的客户体验取胜。
1、从客户视角构建业务框架
从宏观视角看,业务战略方向逐渐深入以客户为中心的思想,从微观视角看,在客户为中心的思想驱动下,企业需要进行一整套的机制流程改变,包括客户为中心的数据挖掘与分析,客户为中心的业务规划,客户为中心的营销规划,客户为中心的设计,客户为中心的绩效体系构建等。
传统业务规划我们通常只考虑业务之间的逻辑关系,较小的考虑客户操作视角中形成的一连串的心理反映、行为特征、价值取向等等,而在客户为中心的业务规划中,客户的每个操作都需要详细分析,记录在案,通过行为轨迹综合分析客户心理特征,所以能够更有效的促进客户完成业务,以下为传统业务规划和客户为中心的业务规划的两个对比:
(1)传统业务规划
①大脑风暴构建业务流程,从业务规划者角度而非客户角度出发。
②我们不知道客户需要什么,更糟糕的是客户可能也不知道。
③每个环节都存在客户流失,而我们不知道发生了什么。
④客户每次点击都是营销机会,但是我们错过了每一次机会。
⑤客户在每一个环节都错过了本来他可能会购买的商品。
⑥当客户离开时我们永久的失去了该客户,没有留下有价值的信息。
(2)从客户视角构建业务框架
①以客户为中心的思维方式构建业务框架。
②系统需要满足不同类型的客户的个性化需求,其核心为数据挖掘和应用。
③系统需要协助客户达成实现客户期望,并帮助客户发现并实现潜在需求。
④系统需要智能寻找最佳的帮助时机,智能的进行客户协助。
⑤系统建设需要考虑未来系统的发展方向,其核心为客户需求挖掘。
2、业务及营销为中心的数据体系建设
今天的营销正在发生巨大的转变,客户需要更大的参与度,与企业更多的互动,特别在电子渠道中互动营销正在成为主角。
客户对企业的要求越来越高,对应的行为也在发生变化,而传统以推送方式为主体的营销方式不仅仅效率低下,而且使客户越来越厌恶,这充分体现在了营销转化率低下,客户拒绝率提升,满意度下降等数据上。
如果我们细心观察今天的广告价格,您可以发现今天的营销行为已经不再是把广告投放到“新媒体”那么简单,今天的营销人员必须找到出路,努力在多种高度互动的营销渠道中展开高级个性化和相关沟通,创造良好的客户体验,努力提升营销效率。
以购买为例,我们经过客户研究发现几个行为特征,消费者首先对产品开始感兴趣,此时销售人员虽然可以帮助客户,但是不宜直接对话,最佳方式通过系统智能的与消费者进行互动,帮助消费者决策,而当消费者产生了真正购买的冲动之后,消费者更愿意主动通过IM方式与客服沟通形成购买行为。
所以,营销人员必须对整个每个营销时机有提前预估,这就要求我们在数据体系构建时,必须能够帮助营销人员统计客户变化情况,并且需要满足营销人员针对客户每时每刻不断变化的需求进行个性化营销定制的需求,协助营销人员展开精准营销活动。
①数据框架建设必须以业务及营销为中心
②数据框架建设需要满足现有的业务需求,并且需要尽可能满足未来业务发展的需求
③数据框架建设重点在于实现智能交互
④数据需要能够用于分析,判断,决策,使用
⑤数据框架建设需要能够反应出数据的变化趋势,协助业务的分析判断
二、数据分析框架的主要事件
主要事件事件描述分类根据业务的需要进行必要的分类,比如对客户评级的分类,AA等级或AAA等级估计根据业务数据判断的需要定义需要估计的数据和数据区间值,对业务进行补充和协助。
例如根据客户储蓄和投资行为估计客户投资风格预测根据数据的变化趋势预测数据的发展方向;例如根据历史投资数据帮助客户预测投资行情等数据分组根据业务需要对数据进行分组;例如购买A类的客户通常也会购买B类,购买A的客户后有一个B周期会产生C行为聚类数据集合的逻辑关系,比如同时拥有A特征和B特征的数据,可以推断出其也拥有C特征描述描述性数据有助于提取关键要素进行数据归纳;例如从数据关键词中进行近似业务营销,备忘录等复杂数据挖掘例如Video,Audio,图形图像等等。
1、分类(Classification)
在业务构建中,最重要的分类一般是对客户数据的分类,主要用于精准营销。
通常分类数据最大的问题在于分类区间的规划,例如分类区间的颗粒度以及分类区间的区间界限等,分类区间的规划需要根据业务流来设定,而业务流的设计必须以客户需要为核心,因此,分类的核心思想在于能够完成满足客户需要的业务。
由于市场需求是变化的,分类通常也是变化的,例如银行业务中VIP客户的储蓄区间。
2、估计(Estimation)
通常数据估计是互动营销的基础,基于客户行为进行数据估计为基础进行互动营销已经被证实具有较高的业务转化率,银行业中通常通过客户数据估计客户对金融产品的偏好,电信业务和互联网业务则通常通过客户数据估计客户需要的相关服务或者估计客户的生命周期。
数据估计必须基于数据的细分和数据逻辑关联性,数据估计需要有较高的数据挖掘和数据分析水平。
3、预测(Prediction)
根据数据变化趋势进行未来预测通常是非常有力的产品推广方式,例如证券业通常会推荐走势良好的股票,银行会根据客户的资本情况协助客户投资理财以达到某个未来预期,电信行业通常以服务使用的增长来判断业务扩张和收缩以及营销等。
数据预测通常是多个变量的共同结果,每组变量之间一般会存在某个相互联系的数值,我们根据每个变量的关系通常可以计算出数据预测值,并以此作为业务决策的依据展开后续行动。
4、数据分组(Affinity Grouping)
数据分组是精准营销的基础,当数据分组以客户特征为主要维度时,通常可以用于估计下一次行为的基础,例如通过客户使用的服务特征的需要来营销配套服务和工具,购买了A类产品的客户一般会有B行为等等。
数据分组的难点在于分组维度的合理性,通常其精确性取决于分组逻辑是否与客户行为特征一致。
5、聚类(Clustering)
数据聚类是数据分析的重点项目之一,例如在健康管理系统中通过症状组合可以大致估计病人的疾病,在电信行业产品创新中客户使用的业务组合通常是构成服务套餐的重要依据,在银行业产品创新中客户投资行为聚合也是其金融产品创新的重要依据。
数据聚类的要点在于聚类维度选取的正确性,需要不断的实践来验证其可行性。
6、描述(Description)
描述性数据的最大效用在于可以对事件进行详细归纳,通常很多细微的机会发现和灵感启迪来自于一些描述性的客户建议,同时客户更愿意通过描述性的方法来查询搜索等,这时就需要技术上通过较好的数据关联方法来协助客户。
描述性数据的使用难点在于大数据量下数据要素提取和归类,其核心在于要素提取规则以及归类方法,要素提取和归类是其能够被使用的基础。
7、复杂数据挖掘
复杂数据挖掘比如Video,Audio等,其要素目前依然难以通过技术手段提取,但也可以从上下文与语境中提取一些要素帮助聚类,例如重要客户标记了高度重要性的Video一般优先权重也应该较高。
复杂数据的挖掘目前处理的方式一般通过数据录入的标准化来解决,核心在于数据录入标准体系的规划,马海祥建议为了整理的方便,初期规划是尽可能考虑完善,不仅仅适用现在,而且可以适用于未来。
三、从客户需求到业务
针对不同客户群体的特点和需求,我们也应有针对性的数据挖掘和分析,用个性化的服务赢得了广大客户。
1、客户为中心的业务规划思想
客户为中心的业务规划大致有三个环节:从客户研究到需求挖掘,从需求信息到数据化的需求管理,从需求文档到业务规划与设计。
客户为中心的业务规划不仅仅需要考虑业务需求是否能够满足需求的问题,还需要考虑到业务的变化趋势,业务的营销重点。
2、数据挖掘技术
对于客户数据的挖掘,我们可以通过以下几种方法来获取:
(1)Clickstream Data点击流数据
①直接访问数量
③访客地理位置
④点击流跟踪
(2)Outcomes Data结果型数据
①访客(初次访问数,访问总数,平均回访数,关注点)
②页面浏览(平均浏览数,总PV ,访问超过一页的访客比)
③时间(全局,人均)
④关键行为(如:注册,购买)
⑤转化率
(3)Research Data研究性数据
①客户研究
②启发式评估,客户体验测试
③客户属性(数据库分析)
④客户期望分析(从数据到服务)
(4)Competitive Data 竞争性数据
①“面”数据测量(大众分析)
②网络服务数据测量(行业分析)
③搜索引擎测量(舆情分析)
3、数据分析技术
对于数据分析技术,我们有可以分为初级数据分析和高级数据分析2种:
(1)初级数据分析
①Click Density Analysis 点击密度分析
②Visitor Primary Purpose 访客首要目的
③Task Completion Rates 任务完成率
③数据估计值组合
④数据预期值组合
⑤聚类组合分析
⑥客户深层次研究
4、跨渠道的数据交互思想
①跨渠道数据交互一般服务或者营销为目的。
②跨渠道数据交互必须客户为中心。
③跨渠道数据交互能够给客户立体式体验,有效提升品牌体验。
5、基于数据的互动式业务规划
①基于数据交互的业务规划对象一般是一个系列产品或服务链条,通常广泛应用于通信业,银行业,保险业,零售业等。
②基于数据交互的业务规划必须以客户为中心,分析客户出现需求的各种时机,并智能匹配以产品或服务,其实现以数据挖掘为核心。
6、基于数据的互动式营销规划
基于数据的交互式营销主要指互动营销,核心思想为分析客户的特定时机需求,并根据该需求推荐相关产品或服务满足客户需要,广泛应用于各种行业。
基于数据交互的业务规划同样必须以客户为中心,分析客户出现需求的各种时机,并智能匹配以产品或服务,其实现同样以数据挖掘为核心。
7、数据预测
数据分析:对照A服务和B服务的使用记录,使用A服务的客户在1个月收益小于B服务,而3个月会产生收益大于B服务。
互动营销:建议需要1个月服务的客户使用B服务,建议需要3个月的客户使用A服务。
业务创新:面向需要两个月服务的客户开发非A非B的C类型服务。
Udesk 精品文章
Udesk功能专题
工单处理时间
每日5000+工单的解决之策
Udesk系统之用户互动
通过Udesk获取客户需求点
呼叫中心
如何用呼叫中心提升用户体验
下一代客服型呼叫中心发展方向
呼叫中心客服交流三大法宝
在呼叫中心成长:认知比行为更重要
突破呼叫中心,小企业客服的化蝶之路
如何正确利用呼叫中心来实现客服管理
客服系统
如何选择一款优秀的客服系统?
好的客服系统让客服成为企业行销利器
客服系统发展带来新的营销套路
从Udesk看未来客服系统发展
移动互联网时代客服系统的变革之路
客服系统比企业更懂客户需求
客户服务
教你如何绕开他们踩过的“坑”
客户服务对企业影响有多大
洞察客户,创造更好的客户服务
未来的战役——“客户服务“之争
别再浪费时间和资源,客户服务这么做
什么是好的客户服务?
提升企业服务的5个技巧
客户管理
如何客户定位及管理?
是什么抢走了你客户的忠诚度?
搞定客户15招,忠诚才是你的拥护者
如何将你的客户转化为企业效益
将潜在客户转换成真实客户的4个秘诀
干货技能
如何晋升到呼叫中心管理层?
呼叫中心客服主管初入秘籍
客服中心服务质量提升——不妨这样做!
做客服3年,我学到了什么?
客户案例
海底捞为什么选择Udesk客服系统?
星巴克高效内部沟通背...
- ?
干货 | 这是一份完整的大数据处理技术总结与分析
新梅
展开
一 数据分析处理需求分类
1 事务型处理
在我们实际生活中,事务型数据处理需求非常常见,例如:淘宝网站交易系统、12306网站火车票交易系统、超市POS系统等都属于事务型数据处理系统。
这类系统数据处理特点包括以下几点:
一是事务处理型操作都是细粒度操作,每次事务处理涉及数据量都很小。
二是计算相对简单,一般只有少数几步操作组成,比如修改某行的某列;
三是事务型处理操作涉及数据的增、删、改、查,对事务完整性和数据一致性要求非常高。
四是事务性操作都是实时交互式操作,至少能在几秒内执行完成;
五是基于以上特点,索引是支撑事务型处理一个非常重要的技术。
在数据量和并发交易量不大情况下,一般依托单机版关系型数据库,例如ORACLE、MYSQL、SQLSERVER,再加数据复制(DataGurad、 RMAN、MySQL数据复制等)等高可用措施即可满足业务需求。
在数据量和并发交易量增加情况下,一般可以采用ORALCE RAC集群方式或者是通过硬件升级(采用小型机、大型机等,如银行系统、运营商计费系统、证卷系统)来支撑。
事务型操作在淘宝、12306等互联网企业中,由于数据量大、访问并发量高,必然采用分布式技术来应对,这样就带来了分布式事务处理问题,而分布式事务处理很难做到高效,因此一般采用根据业务应用特点来开发专用的系统来解决本问题。
2 数据统计分析
数据统计主要是被各类企业通过分析自己的销售记录等企业日常的运营数据,以辅助企业管理层来进行运营决策。典型的使用场景有:周报表、月报表等固定时间提供给领导的各类统计报表;市场营销部门,通过各种维度组合进行统计分析,以制定相应的营销策略等。
数据统计分析特点包括以下几点:
一是数据统计一般涉及大量数据的聚合运算,每次统计涉及数据量会比较大。
二是数据统计分析计算相对复杂,例如会涉及大量goupby、 子查询、嵌套查询、窗口函数、聚合函数、排序等;有些复杂统计可能需要编写SQL脚本才能实现。
三是数据统计分析实时性相对没有事务型操作要求高。但除固定报表外,目前越来越多的用户希望能做做到交互式实时统计;
传统的数据统计分析主要采用基于MPP并行数据库的数据仓库技术。主要采用维度模型,通过预计算等方法,把数据整理成适合统计分析的结构来实现高性能的数据统计分析,以支持可以通过下钻和上卷操作,实现各种维度组合以及各种粒度的统计分析。
另外目前在数据统计分析领域,为了满足交互式统计分析需求,基于内存计算的数据库仓库系统也成为一个发展趋势,例如SAP的HANA平台。
3 数据挖掘
数据挖掘主要是根据商业目标,采用数据挖掘算法自动从海量数据中发现隐含在海量数据中的规律和知识。
数据挖掘主要过程是:根据分析挖掘目标,从数据库中把数据提取出来,然后经过ETL组织成适合分析挖掘算法使用宽表,然后利用数据挖掘软件进行挖掘。传统的数据挖掘软件,一般只能支持在单机上进行小规模数据处理,受此限制传统数据分析挖掘一般会采用抽样方式来减少数据分析规模。
数据挖掘的计算复杂度和灵活度远远超过前两类需求。一是由于数据挖掘问题开放性,导致数据挖掘会涉及大量衍生变量计算,衍生变量多变导致数据预处理计算复杂性;二是很多数据挖掘算法本身就比较复杂,计算量就很大,特别是大量机器学习算法,都是迭代计算,需要通过多次迭代来求最优解,例如K-means聚类算法、PageRank算法等。
因此总体来讲,数据分析挖掘的特点是:
1、数据挖掘的整个计算更复杂,一般是由多个步骤组成计算流,多个计算步骤之间存在数据交换,也就是会产生大量中间结果,难以用一条sql语句来表达。
2、计算应该能够非常灵活表达,很多需要利用高级语言编程实现。
二 大数据背景下事务型处理系统相关技术
在google、facebook、taobao等大互联网公司出现之后,这些公司注册和在线用户数量都非长大,因此该公司交易系统需要解决“海量数据+高并发+数据一致性+高可用性”的问题。
为了解决该问题,从目前资料来看,其实没有一个通用的解决方案,各大公司都会根据自己业务特点定制开发相应的系统,但是常用的思路主要包括以下几点:
(1)数据库分片,结合业务和数据特点将数据分布在多台机器上。
(2)利用缓存等机制,尽量利用内存,解决高并发时遇到的随机IO效率问题。
(3)结合数据复制等技术实现读写分离,以及提高系统可用性。
(4)大量采用异步处理机制,对应高并发冲击。
(5)根据实际业务需求,尽量避免分布式事务。
1相关系统介绍
1) 阿里CORBAR系统
阿里COBAR系统是一个基于MYSQL数据库的分布式数据库系统,属于基于分布式数据库中间件的分布式数据库系统。该系统是前身是陈思儒开发的“变形虫”系统(以前调研过),由于陈思儒离开阿里去了盛大,阿里当心“变形虫”稳定性等问题,重新开发该项目。
该系统主要采用数据库分片思路,实现了:数据拆分、读写分离、复制等功能。由于此系统由于只需要满足事务型操作即可,因此相对真正并行数据库集群(例如TeraData等),此类系统提供操作没有也不需要提供一些复杂跨库处理,因此该系统存在以下限制:
(1)不支持跨库的join、分页、排序、子查询。
(2)insert等变更语句必须包括拆分字段等。
(3)应该不支持跨机事务(以前变形虫不支持)。
说白了此类系统不具备并行计算能力,基本上相当于数据库路由器!
另外此类系统的在实际应用的关键问题是,根据什么对数据进行切分,因为切分不好会导致分布式的事务问题。
2) 阿里OceanBase系统
该系统也是淘宝为了解决高并发、大数据环境下事务型处理而定制开发的一个系统。该系统主要思路和特点如下:
(1)他们发现在实际生成环境中,每天更新的数据只占总体数据的1%不到,因此他们把数据分为:基线数据和增量更新数据。
(2)基线数据是静态数据,采用分布式存储方式进行存储。
(3)只在一台服务器上存储和处理增量更新数据,并且是在内存中存储和处理更新数据。
(4)在系统负载轻的时候,把增量更新批量合并到基线数据中。
(5)数据访问时同时访问基线数据和增量更新数据并合并。
因此这样好处是:
(1)读事务和写事务分离
(2)通过牺牲一点扩展性(写是一个单点),来避免分布式事务处理。
说明:该系统虽然能处理高并发的事务型处理,号称很牛逼,但其实也只是根据电商的事务处理来定制开发的专用系统,个人认为其技术难度小于oracle等通用型的数据库。该系统无法应用到银行或者12306等,因为其事务处理的逻辑远远比电商商品买卖处理逻辑复杂。
在目前的大数据时代,一定是基于应用定制才能找到好的解决方案!
3) 基于Hbase的交易系统
在hadoop平台下,HBASE数据库是一个分布式KV数据库,属于实时数据库范畴。支付宝目前支付记录就是存储在HBASE数据库中。
HBASE数据库接口是非SQL接口,而是KV操作接口(基于Key的访问和基于key范围的scan操作),因此HBASE数据库虽然可扩展性非常好,但是由于其接口限制导致该数据库能支持上层应用很窄。基于HBASE应用的设计中,关键点是key的设计,要根据需要支持的应用来设计key的组成。
可以认为HBASE数据库只支持作为KEY的这一列的索引。虽然目前HBASE有支持二级索引的方案,二级索引维护将会比较麻烦。
2并发和并行区别
并发是指同时执行通常不相关的各种任务,例如交易型系统典型属于高并发系统。
并行是通过将一个很大的计算任务,划分为多个小的计算任务,然后多个小计算任务的并行执行,来缩短该计算任务计算时间。
两者主要区别在于:
(1)通讯与协调方面:在并行计算中,由于多个小任务同属一个大的计算任务,因此小任务之间存在依赖关系,小任务之间需要大量通讯和协调;相反,并发中的多个任务之间基本相互独立,任务与任务之间相关性很小。
(2)容错处理方面:由于并发任务之间相互独立,某个任务执行失败并不会影响其它的任务。但是并行计算中的多个任务属于一个大任务,因此某个子任务的失败,如果不能恢复(粗粒度容错与细粒度容错),则整个任务都会失败。
3本章总结
数据量大不一定需要并行计算,虽然数据量大,数据是分布存储,但是如果每次操作基本上还是针对少量数据,因此每次操作基本上都是在一台服务器上完成,不涉及并行计算。只是需要通过数据复制、数据缓存、异步处理等方式来支撑高并发访问量
三 大数据背景下数据统计分析技术介绍
随数据量变大,和事务处理不同的是,单个统计分析涉及数据量会非常大,单个统计分析任务涉及数据会分散在多台服务器上,且由于计算量大,采用单台服务器进行计算,会导致计算时间非常长,单个统计分析任务必须采用并行计算方式来加快单个统计分析任务执行速度。
1并行查询与并行计算技术介绍
在大数据背景下的数据统计分析技术门类很多,常见的有:
n MPP并行数据库 : TeraData、GreenPlum、Vertica等。
n 基于MapReduce并行计算框架的数据仓库:
HIVE(Hadoop平台) 、Tenzing(Google公司)
n 基于Hbase的Phoenix系统
n HadoopDB系统
n EMC公司的hapt系统
n MPP分布式查询引擎: Dremel、Impala、Presto、Shard query、Citusdb。
n 基于SPARK的Shark、基于Dryad的SCOPE、基于Tez的stinger。
n 基于hadoop+index的JethroData系统
n 基于内存计算的Druid系统
这些系统都解决了海量数据下的数据统计分析的问题,并且这些系统另外一个共同特点是都提供了SQL或者类SQL接口。
为了能够较好研究这些系统,我们需要对并行查询与并行计算的相关技术做一个简要的介绍。
首先所有的系统都可以分为三个层次: 语义层、并行计算引擎层、分布式存储层。语义层提供一个编程接口让用户表达所需要计算,并负责把该计算翻译成底层并行计算引擎可以执行的执行计划,并由并行计算引擎来执行,最下面一层是分布式存储层。
对于提供类SQL接口并行计算系统,语义层可以认为是SQL解析层。
1) 语义层
SQL语言是一种声名式语言,SQL只是表达了要做什么,而没有表达怎么做。为此,SQL解析层主要作用是:将用户提交的基于SQL的统计分析请求,转化为底层计算引擎层可以执行的执行计划。也就是解决“怎么做”的问题。
SQL解析层工作主要包括两个大方面:
(1) 通过语法分析技术来理解要做什么。在关系数据库中,一般会把SQL语言分析后,形成树型结构的执行计划。
(2) 在语法分析技术上,利用各种优化技术和算法,找出一种最经济物理执行计划。
优化可以分为两个方面:一是逻辑层面优化、二是物理执行层面优化。
(1) 逻辑层优化
逻辑层面个人认为主要是因为同样表达一个分析请求,有的人SQL写的好,有的人SQL写的烂,因此在逻辑层面可以通过一些等价关系代数变换,实现查询重写,将写的比较烂的sql变换为好的写法。
比较典型优化是:“把投影和过滤下沉,先执行过滤和投影操作”,减少中间结果。
(2) 物理层优化
物理层面优化是在逻辑优化后,结合实际物理执行过程,找出最优的物理执行计划。生成物理查询计划的工作包括:
ü 增加一些操作符: 包括扫描和排序等。
ü 确定各个操作符实现算法。例如扫描是全表扫描还是利用索引;Join是采用HASH连接、索引连接、合并排序等实现算法中的那一种。
ü 确定操作符之间的数据流转方法:物化还是流水线方式。
ü 采用基于代价估算方法确定最优的物理执行计划,目前代价估算主要是以估算该物理计划需要的IO量。另外对于并行数据库,则还要考虑通讯代价,即尽量减少数据在各个机器之间的传递。
在物理层优化的代价估算过程中,代价估算需要依靠很多统计信息,如表有多大,表中相关列的值分布是什么样子等。传统数据库在数据Load过程中会事先计算好这些统计信息。并行计算中还需要考虑通讯代价。
需要指出是,由于imapla、Presto、HIVE等系统只是一个查询引擎,它们可以直接查询以普通文件方式存储在HDFS系统上的文件,因此这些系统一般无法使用索引和各种统计信息来进行物理执行计划的优化,这些系统一般只能在逻辑层进行一些基于规则静态优化。根据SHARK论文,SHARK系统支持根据前面一些节点计算获得的信息,来动态优化后面执行计划。
(3) 物化与流水线执行方法
一条SQL语句对开发人员而言,感觉只是一次调用,但是实际上在数据库内部,一条SQL语句执行其实是有多个操作符组合而成的的树型结构计算流。如下图:
针对该计算流有两种执行方式:一是基于物化或者是实体化执行方式,另外一种是基于数据流的执行方式。
第一种方法的过程是: 把各个操作运算排序,并把每个操作运算的输出的中间结果存储在磁盘上,直到被另外一个操作运算所...
数据与分析
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并