- ?
成为一名数据分析师需要会哪些技能?
香露
展开
上海数据分析网数据分析师这个职业越来越火,越来越多的人想往这个方向发展。
有在校生,也有转行的小伙伴来咨询数据分析师这个职业的相关问题。
从大部分情况来看,大家对于数据分析师的职业发展和技能非常关心。
那么别的先不说,数据分析入门到底要学什么?怎么学?
Excel
作为数据分析师,Excel是必备技能。Excel 是经过检验的可靠的数据分析工具,它广泛存在,非程序人员也能便捷操作,所以大多数企业即使也使用其他工具,但 Excel 工具还是他们的不二选择。
统计学
统计学同样是数据分析师的必备技能之一,你只有学好了统计学才能谈得上数据分析。统计知识会要求我们以另一个角度看待数据。当你知道AB两组的差异用平均值看是多傻的事情,你的分析技巧也会显著提高。如果你想成为一名出色的数据分析师,那么你就必须要会统计学。
推荐图书:《深入浅出统计学》
上海数据分析网大概是最啰嗦的深入浅出系列,从卖橡皮鸭到赌博机的案例,囊括了常用的统计分析如假设检验、概率分布、描述统计、贝叶斯等。书本注重应用和趣味性,数学推理一般。
SQL
sql是所有数据库查询的语言,sql非常容易入手。
针对不同的数据库,如mysql、sqlserver、oracle等,sql语法会有所不同,但是总体上大同小异,只是细微处的差别。
而且如果你有数据库基础的话,只需要找些sql查询的习题来做一下,就会很快的得到提高。
推荐图书:《MySQL必知必会》
上海数据分析网学习 SQL 的入门书,薄册子一本,看起来很快。SQL 是个性价比很高的技能,简单而强大。任何想进一步提高自己数据分析技能的产品/运营/分析师 同学,都建议点亮 这个技能点。
数据分析思维
作为一名数据科学家需要很挑剔,并且善于发现他人会遗漏的东西。那么我们应该如何做到像数据科学家一样思考呢?
梳理分析思路,并搭建分析框架,把分析目的分解成若干个不同的分析要点,即如何具体开展数据分析,需要从哪几个角度进行分析,采用哪些分析指标(各类分析指标需合理搭配使用)。同时,确保分析框架的体系化和逻辑性。
推荐图书:金字塔原理
上海数据分析网金字塔的基本结构是:中心思想明确,结论先行,以上统下,归类分组,逻辑递进。先重要后次要,先全局后细节,先结论后原因,先结果后过程。
行业知识
对于数据分析师来说,业务的了解比数据方法论更重要。而且业务学习没有捷径。这一部分也没有什么书可以看的了,基本都靠搜索,总结,思考,再搜索,总结,思考。
- ?
最常用的4种大数据分析方法,你知道吗?
弗朗西斯
展开
大数据分析之描述型分析:发生了什么——这是最常见的分析方法。在业务中,这种方法向大数据分析师提供了重要指标和业务的衡量方法。例如每月的营收和损失账单。大数据分析师可以通过这些账单,获取大量的客户大数据。了解客户的地理信息,就是“描述型分析”方法之一。利用可视化工具,能够有效的增强描述型分析所提供的信息。
大数据分析之诊断型分析:为什么会发生——描述性大数据分析的下一步就是诊断型大数据分析。通过评估描述型大数据,诊断分析工具能够让大数据分析师深入地分析大数据,钻取到大数据的核心。良好设计的数据分析能够整合:按照时间序列进行大数据读入、特征过滤和钻取大数据等功能,以便更好的分析大数据。
大数据分析之预测型分析:可能发生什么——预测型分析主要用于进行预测。事件未来发生的可能性、预测一个可量化的值,或者是预估事情发生的时间点,这些都可以通过预测模型来完成。预测模型通常会使用各种可变大数据来实现预测。大数据成员的多样化与预测结果密切相关。在充满不确定性的环境下,预测能够帮助做出更好的决定。预测模型也是很多领域正在使用的重要方法。
大数据分析之指令型分析:需要做什么——大数据价值和复杂度分析的下一步就是指令型分析。指令模型基于对“发生了什么”、“为什么会发生”和“可能发生什么”的分析,来帮助用户决定应该采取什么措施。通常情况下,指令型分析不是单独使用的方法,而是前面的所有方法都完成之后,最后需要完成的分析方法。例如交通规划分析考量了每条路线的距离、每条线路的行驶速度、以及目前的交通管制等方面因素,来帮助选择最好的回家路线。
- ?
什么是数据分析?数据分析的作用是什么?
忆枫
展开
1.什么是数据分析?
数据分析的目的是把隐藏在一些看似杂乱无章的数据背后的信息提炼出来,总结出所研究对象的内在规律。在实际工作中,数据分析能够帮助管理者进行判断和决策,以便采取适当策略与行动。比如:企业的高管希望通过市场分析和研究,把握当前产品的市场动向,从而制定合理的产品研发和销售计划,这就必须依赖数据分析才能够完成。
简单的说,就是对数据进行分析,比较专业的说法是,数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,未提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。以求最大化地开发数据的功能,发挥数据的作用。
数据分析包含“数据”和“分析”两个方面一方面包括加工和整理数据,另一方面也包括分析数据,从中提取有价值的信息并形成对业务有帮助的结论。
数据分析的成果通常以分析报告的形式呈现。对于数据分析报告,分析就是论点,数据就是论据,两者缺一不可。
2.数据分析类别
其中,探索性数据分析侧重于在数据中发现新的特征,而验证性数据分析则侧重于验证已有假设的真伪证明。
数据分析的划分:描述性数据分析、探索性数据分析、验证性数据分析。
1)描述性数据分析:属于初级数据分析,常见的分析方法有对比分析法、平均分析法、交叉分析法。
2)探索性数据分析:侧重于再数据之中发现新的特征
3)验证性数据分析:侧重于验证已有假设的真伪证明
其中探索性数据分析和验证性数据分析属于高级数据分析,常见的分析方法有相关分析、因子分析、回归分析等等。
3.数据分析的作用
数据分析在日常企业运营中主要有三大作用:
1.现状分析
简单的说就是告诉你过去发生了什么。
具体表现在:
第一,告诉你企业现阶段的整体运营情况,通过各个经营指标的完成情况来衡量企业的运营状态,以说明企业整体运营是更好了还是坏了,好的程度是如何,坏的程度又到哪里。
第二,告诉你企业各项业务的构成,让你了解企业各项业务的发展及变动情况,对企业经营状况有更深入的了解。
现状分析一般通过日常通报来完成,如日报、周报、月报等形式。
2.原因分析
简单的说就是告诉你某一现状为什么发生。经过第一阶段的现状分析,我们对企业的运营情况有了一个基本的了解,但是不知道运营情况具体好在哪里,差在哪里,是什么原因引起的。这时候我们就需要开展原因分析,以进一步确定业务变动的具体原因。
原因分析一般通过专题分析来完成,根据企业运营情况选择针对某一现状进行原因分析。
3.预测分析
简单来说就是告诉你将来会发生什么。
在了解企业运营现状后,有时候还需要对企业未来发展趋势做出预测,为企业制定经营目标以及提供有效的策略参考与决策依据,以确保企业的可持续健康发展。
预测分析一般通过专题分析来完成,通常在制定企业季度、年度等计划时进行,其开展的频率没有现状分析及原因分析高。
什么时候开展什么样的数据分析,需要根据自身的需求及目的来确定。
分享 IT 技术和行业经验,请关注-技术学派。
- ?
数据分析的8种方法详解
尹飞丹
展开
对于具体的业务场景问题,我们该怎么办呢?我们以一个电子商务网站为例,用数据分析产品 GrowingIO 对该网站进行快速地数据采集、清晰和可视化展示,然后给大家分享这 8 种常见的数据分析方法。
1 数字和趋势
看数字、看趋势是最基础展示数据信息的方式。
在数据分析中,我们可以通过直观的数字或趋势图表,迅速了解例如市场的走势、订单的数量、业绩完成的情况等等,从而直观的吸收数据信息,有助于决策的准确性和实时性。
对于电子商务网站,流量是非常重要的指标。
上图中,我们将网站的访问用户量(UV)和页面浏览量(PV)等指标汇汇聚到统一的数据看板(Dashboard),并且实时更新。
这样的一个数据看板,核心数字和趋势一目了然,对于首席增长官来说一目了然。
2 维度分解
当单一的数字或趋势过于宏观时,我们需要通过不同的维度对于数据进行分解,以获取更加精细的数据洞察。
在选择维度时,需要仔细思考其对于分析结果的影响。
举个例子,当监测到网站流量异常时,可以通过拆分地区、访问来源、设备、浏览器等等维度,发现问题所在。
3 用户分群
针对符合某种特定行为或背景信息的用户,进行归类处理,是我们常常讲到的用户分群(segmentation )的手段。
我们也可以通过提炼某一群用户的特定信息,创建该群体用户的画像。 例如访问购物网站、寄送地址在北京的用户,可以被归类为“北京”用户群体。
而针对“北京”用户群体,我们可以进一步观察他们购买产品的频度、类别、时间,这样我们就创建出该用户群体的画像。
在数据分析中,我们往往针对特定行为、特定背景的用户进行有针对性的用户运营和产品优化,效果会更加明显。
上图中,我们通过 GrowingIO 的用户分群功能将一次促销活动中支付失败的用户挑选出来,然后推送相应的优惠券。
这样精准的营销推广,可以大幅度提高用户支付的意愿和销售金额。
4 转化漏斗
绝大部分商业变现的流程,都可以归纳为漏斗。
漏斗分析是我们最常见的数据分析手段之一,无论是注册转化漏斗,还是电商下单的漏斗。
通过漏斗分析可以从先到后还原用户转化的路径,分析每一个转化节点的效率。 其中,我们往往关注三个要点: 第一,从开始到结尾,整体的转化效率是多少? 第二,每一步的转化率是多少? 第三,哪一步流失最多,原因在什么地方?流失的用户符合哪些特征?
上图中注册流程分为 3 个步骤,总体转化率为45.5%;
也就是说有 1000 个用户来到注册页面,其中 455 个成功完成了注册。
但是我们不难发现第二步的转化率是 56.8% ,显着低于第一步 89.3% 和第三步转化率 89.7%,可以推测第二步注册流程存在问题。
显而易见第二步的提升空间是最大的,投入回报比肯定不低;如果要提高注册转化率,我们应该优先解决第二步。
5 行为轨迹
关注行为轨迹,是为了真实了解用户行为。
数据指标本身往往只是真实情况的抽象,例如,网站分析如果只看访问用户量(UV)和页面访问量(PV)这类指标,断然是无法全面理解用户如何使用你的产品。通过大数据手段,还原用户的行为轨迹,有助于增长团队关注用户的实际体验、发现具体问题,根据用户使用习惯设计产品、投放内容。
上图中展示了一位用户在某电商网站上的详细行为轨迹,从官网到落地页,再到商品详情页,最后又回到官网首页。
网站购买转化率低,以往的业务数据无法告诉你具体的原因;通过分析上面的用户行为轨迹,可以发现一些产品和运营的问题(比如是不是商品不匹配等等),从而为决策提供依据。
6 留存分析
在人口红利逐渐消褪的时代,留住一个老用户的成本要远远低于获取一个新用户。
每一款产品,每一项服务,都应该核心关注用户的留存,确保做实每一个客户。
我们可以通过数据分析理解留存情况,也可以通过分析用户行为或行为组与回访之间的关联,找到提升留存的方法。
在 LinkedIn,增长团队通过数据发现,如果新用户进来后添加 5 个以上的联系人(上图红色线条),那么他/她在 LinkedIn 上留存要远远高于那些没有添加联系人(上图绿色和紫色的线条)的留存。
这样,添加联系人称为 LinkedIn 留存新用户的最核心手段之一。除了需要关注整体用户的留存情况之外,市场团队可以关注各个渠道获取用户的留存度,或各类内容吸引来的注册用户回访率,产品团队关注每一个新功能对于用户的回访的影响等等,这些都是常见的留存分析场景。
7 A/B 测试
A/B 测试用来对比不同产品设计/算法对结果的影响。
产品在上线过程中经常会使用 A/B 测试来测试不同产品或者功能设计的效果,市场和运营可以通过 A/B 测试来完成不同渠道、内容、广告创意的效果评估。
举个例子,我们设计了两种不同的产品交互形式,通过比较实验组(A 组)和对照组(B 组)的访问时长和页面浏览量两个衡量指标,来评估哪一种交互形式更佳。要进行 A/B 测试有两个必备因素:
第一,有足够的时间进行测试;
第二,数据量和数据密度较高。
因为当产品流量不够大的时候,做 A/B 测试得到统计结果是很难的。而像 LinkedIn 这样大体量的公司,每天可以同时进行上千个 A/B 测试。所以 A/B 测试往往在公司数据规模较大时使用会更加精准,更快得到统计的结果。
8 数学建模
当一个商业目标与多种行为、画像等信息有关联性时,我们通常会使用数学建模、数据挖掘的手段进行建模,预测该商业结果的产生。
作为一家 SaaS 企业,当我们需要预测判断客户的流失时,可以通过用户的行为数据、公司信息、用户画像等数据建立流失模型。
利用统计学的方式进行一些组合和权重计算,从而得知用户满足哪些行为之后流失的可能性会更高。
我们常常说,不能度量,就无法增长,数据分析对于企业商业价值的提升有着至关重要的作用。
当然,仅仅掌握单纯的理论还远远不够,实践出真知。数据分析的方法大家不妨在自己日常工作中,有分析相关项目里尝试使用,相信可以事半功倍,创造更多商业价值。
- ?
人人都在说的大数据到底是什么?(技术层)
Easter
展开
前沿技术普及系列·写在前面
不知道大家有没有和象牙妹儿一样的感觉,便是最近1年很多AI产品铺天盖地的来到了我们的生活,比如某些家的智能陪伴音响、翻译棒、智能机器人、AR拍照手机等等。
这里面背后的前沿技术大数据、云计算、区块链、物联网、 5G、数字化…前几年甚至到现在听着还很遥远,但却已有不少在冲击着商业的世界,渗透进我们的生活!
如何拨开层层浓雾,抵达未来的彼岸?如何把握技术的钥匙,启开未来商业世界的大门!
大象互联网圈发起主办的第二届中国【郑州】开发者大会不但关注技术·商业的融合,也关注着前沿技术的分享。
因此,从今天起,大象互联网圈公众号将目光聚焦在大数据、云计算、物联网IOT、人工智能AI、区块链、VR/AR等板块,一一从概念层、目前行业发展状况、企业实际应用层、技术层、岗位前景等为大家带来干货的普及,快来和象牙儿妹一块围观吧!
上一篇:人人都在说的大数据到底是什么?(概念层)
本文由“壹伴编辑器”提供技术支持
提到大数据技术,最基础和核心的仍是大数据的分析和计算。在2017年,大数据分析和计算技术仍旧在飞速的发展,无论老势力Hadoop还是当红小生Spark,亦或是人工智能,都在继续自己的发展和迭代。
目前绝大部分传统数据计算和数据分析服务均是基于批量数据处理模型:使用ETL系统或OLTP系统进行构造数据存储,在线的数据服务通过构造SQL语言访问上述数据存储并取得分析结果。这套数据处理的方法伴随着关系型数据库在工业界的演进而被广泛采用。
本文将分别讨论大数据技术涉及到的技术框架、平台以及未来的发展趋势。
本文由“壹伴编辑器”提供技术支持
1.批处理框架
传统的批量数据处理模型通常基于如下处理模型:
1.使用ETL系统或者OLTP系统构造原始的数据存储,以提供后续的数据服务进行数据分析和数据计算。用户装载数据,系统根据自己的存储和计算情况,对于装载的数据进行索引构建等一些列查询优化工作。
因此,对于批量计算,数据一定需要加载到计算机系统,后续计算系统才在数据加载完成后方能进行计算。
2.用户或系统主动发起一个计算作用并向上述数据系统进行请求。此时计算系统开始调度(启动)计算节点进行大量数据计算,该过程的计算量可能巨大,耗时长达数分钟乃至数小时。
同时,由于数据累计的不可及时性,上述计算过程的数据一定是历史数据,无法保证数据的实时性。
3.计算结果返回,计算作业完成后将数据以结果集形式返回用户,或者可能由于计算结果数量巨大保存着数据计算系统中,用户进行再次数据集成到其他系统。一旦数据结果巨大,整体的数据集成过程漫长,耗时可能长达数分钟乃至数小时。
典型代表:Hadoop
Hadoop是Apache的一个开源项目,是可以提供开源、可靠、可扩展的分布式计算工具。它主要包括HDFS和MapReduce两个组件,分别用于解决大数据的存储和计算。
HDFS是独立的分布式文件系统,为MapReduce计算框架提供存储服务,具有较高的容错性和高可用性,基于块存储以流数据模式进行访问,数据节点之间项目备份。默认存储块大小为64M,用户也可以自定义大小。
HDFS是基于主从结构的分布式文件系统,结构上包括NameNode目录管理、DataNode的数据存储和Client的访问客户端3部分。
NameNode主要负责系统的命名空间、集群的配置管理以及存储块的复制;DataNode是分布式文件系统存储的基本单元;Client为分布式文件系统的应用程序。
对于数据存储,HDFS采用的是多副本的方式来存储数据,即Client将数据首先通过NameNode获取数据将要存储在哪些DataNode上,之后这些存储到最新数据的DataNode将变更数据以同步或异步方式同步到其他DataNode上。
在Hadoop3.0之后,采用Erasure Coding可以大大的降低数据存储空间的占用。对于冷数据,可以采用EC来保存,这样才能降低存储数据的花销,而需要时,还可以通过CPU计算来读取这些数。
MapReduce是一种分布式计算框架,适用于离线大数据计算。采用函数式编程模式,利用Map和Reduce函数来实现复杂的并行计算,主要功能是对一个任务进行分解,以及对结果进行综合汇总。
具体来说,MapReduce是将那些没有经过处理的海量数据进行数据分片,即分解成多个小数据集;每个Map并行地处理每一个数据集中的数据,然后将结果存储为
,并把key值相同的数据进行归并发送到Reduce处理。 本文由“壹伴编辑器”提供技术支持
2.流计算框架
不同于批量计算模型,流式计算更加强调计算数据流和低时延,流式计算数据处理模型如下:
1.使用实时集成工具,将数据实时变化传输到流式数据存储(即消息队列,如RabbitMQ);此时数据的传输编程实时化,将长时间累积大量的数据平摊到每个时间点不停地小批量实时传输,因此数据集成的时延得以保证。
2.数据计算环节在流式和批量处理模型差距更大,由于数据集成从累计变成实时,不同于批量计算等待数据集成全部就绪后才启动计算作业,流式计算作业是一种常驻计算服务,一旦启动将一直处于等待事件触发的状态,一旦小批量数据进入流式数据存储,流计算立刻计算并迅速得到结果。
3.不同于批量计算结果数据需要等待数据计算结果完成后,批量将数据传输到在线系统;流式计算作业在每次小批量数据计算后可以立刻将数据写入在线系统,无需等待整个数据的计算结果,可以立刻将数据结果投递到在线系统,进一步做到实时计算结果的实时化展现。
典型代表:Spark
Spark是一个快速且通用的集群计算平台。它包含Spark Core、Spark SQL、Spark Streaming、MLlib以及Graphx组件。
Spark SQL是处理结构化数据的库,它支持通过SQL查询数据。Spark Streming是实时数据流处理组件。MLlib是一个包含通用机器学习的包。GraphX是处理图的库,并进行图的并行计算一样。
Spark提出了弹性分布式数据集的概念(Resilient Distributed Dataset),简称RDD,每个RDD都被分为多个分区,这些分区运行在集群的不同节点上。一般数据操作分为3个步骤:创建RDD、转换已有的RDD以及调用RDD操作进行求值。
在Spark中,计算建模为有向无环图(DAG),其中每个顶点表示弹性分布式数据集(RDD),每个边表示RDD的操作。
RDD是划分为各(内存中或者交换到磁盘上)分区的对象集合。在DAG上,从顶点A到顶点B的边缘E意味着RDD B是RDD A上执行操作E的结果。有两种操作:转换和动作。
转换(例如;映射、过滤器、连接)对RDD执行操作并产生新的RDD。
本文由“壹伴编辑器”提供技术支持
3.交互式分析框架
在解决了大数据的可靠存储和高效计算后,如何为数据分析人员提供便利日益受到关注,而最便利的分析方式莫过于交互式查询。
这几年交互式分析技术发展迅速,目前这一领域知名的平台有十余个,包括Google开发的Dremel和PowerDrill,Facebook开发的Presto,Hadoop服务商Cloudera和HortonWorks分别开发的Impala和Stinger,以及Apache项目Hive、Drill、Tajo、Kylin、MRQL等。
一些批处理和流计算平台如Spark和Flink也分别内置了交互式分析框架。由于SQL已被业界广泛接受,目前的交互式分析框架都支持用类似SQL的语言进行查询。早期的交互式分析平台建立在Hadoop的基础上,被称作SQL-on-Hadoop。
后来的分析平台改用Spark、Storm等引擎,不过SQL-on-Hadoop的称呼还是沿用了下来。SQL-on-Hadoop也指为分布式数据存储提供SQL查询功能。
典型代表:Hive
ApacheHive是最早出现的架构在Hadoop基础之上的大规模数据仓库,由Facebook设计并开源。Hive的基本思想是,通过定义模式信息,把HDFS中的文件组织成类似传统数据库的存储系统。
Hive保持着Hadoop所提供的可扩展性和灵活性。Hive支持熟悉的关系数据库概念,比如表、列和分区,包含对非结构化数据一定程度的SQL支持。它支持所有主要的原语类型(如整数、浮点数、字符串)和复杂类型(如字典、列表、结构)。
它还支持使用类似SQL的声明性语言HiveQueryLanguage(HiveQL)表达的查询,任何熟悉SQL的人都很容易理解它。HiveQL被编译为MapReduce过程执行。下图说明如何通过MapReduce实现JOIN和GROUPBY。
部分HiveQL操作的实现方式
Hive与传统关系数据库对比如下:
Hive的主要弱点是由于建立在MapReduce的基础上,性能受到限制。很多交互式分析平台基于对Hive的改进和扩展,包括Stinger、Presto、Kylin等。其中Kylin是中国团队提交到Apache上的项目,其与众不同的地方是提供多维分析(OLAP)能力。
Kylin对多维分析可能用到的度量进行预计算,供查询时直接访问,由此提供快速查询和高并发能力。Kylin在eBay、百度、京东、网易、美团均有应用。
本文由“壹伴编辑器”提供技术支持
5.其他类型的框架
除了上面介绍的几种类型的框架外,还有一些目前还不太热门但具有重要潜力的框架类型。图计算是DAG之外的另一种迭代式计算模型,它以图论为基础对现实世界建模和计算,擅长表达数据之间的关联性,适用于PageRank计算、社交网络分析、推荐系统及机器学习。这一类框架有GooglePregel、ApacheGiraph、ApacheHama、PowerGraph、,其中PowerGraph是这一领域目前最杰出的代表。很多图数据库也内置图计算框架。
另一类是增量计算框架,探讨如何只对部分新增数据进行计算来极大提升计算过程的效率,可应用到数据增量或周期性更新的场合。这一类框架包括GooglePercolator、MicrosoftKineograph、阿里Galaxy等。
另外还有像
ApacheIgnite、ApacheGeode(GemFire的开源版本)这样的高性能事务处理框架。
本文由“壹伴编辑器”提供技术支持
6.总结与展望
从Hadoop横空出世到现在10余年的时间中,大数据分布式计算技术得到了迅猛发展。不过由于历史尚短,这方面的技术远未成熟。各种框架都还在不断改进,并相互竞争。
性能优化毫无疑问是大数据计算框架改进的重点方向之一。而性能的提高很大程度上取决于内存的有效利用。这包括前面提到的内存计算,现已在各种类型的框架中广泛采用。
拥抱机器学习和人工智能也是大数据计算的潮流之一。Spark和Flink分别推出机器学习库SparkML和FlinkML。更多的平台在第三方大数据计算框架上提供机器学习,如Mahout、Oryx及一干Apache孵化项目SystemML、HiveMall、PredictionIO、SAMOA、MADLib。
在同一平台上支持多种框架也是发展趋势之一,尤其对于那些开发实力较为雄厚的社区。
Spark以批处理模型为核心,实现了交互式分析框架SparkSQL、流计算框架SparkStreaming(及正在实现的StructuredStreaming)、图计算框架GraphX、机器学习库SparkML。
本文由“壹伴编辑器”提供技术支持
7.学习资料
最后介绍一下大数据计算方面的学习资料。
论坛
首推知乎、Quora、StackOverflow,运气好的话开发者亲自给你解答。其他值得关注的网站或论坛包括炼数成金、人大经济论坛、CSDN、博客园、云栖社区、360大数据、推酷、伯乐在线、小象学院等。
微信订阅号
InfoQ是最权威的,其他还有THU数据派、大数据杂谈、CSDN大数据、数据猿、Hadoop技术博文等,各人根据偏好取舍。
官方网站文档
若要进行系统的学习,则首先应参考官方网站文档。不少大数据平台的官方文档内容都比较详实,胜过多数教材。
书籍
国外O\'Reilly、Manning两家出版社在大数据领域出版了不少优秀书籍,特别是Manning的InAction系列和O\'Reilly的DefinitiveGuide系列。
本篇关于大数据的技术层面分析就介绍到这,下一篇我们将对大数据的最终价值体现——大数据实践进行分析介绍。
END
第二届中国【郑州】开发者大会
线上报名通道全面开放
本次大会将开设从数字化到大数据落地专场,现已开放报名通道,门票分为49.9普通票和VIP票两种,其中VIP票权益非常丰富,票价为199元且仅限200张,下面是两种票的权益对比:
- ?
一个工作3年的数据分析师,所具备的能力有哪些?
温安南
展开
文 | 邹昕-知乎
来源:再生谈|reborn_chat
受本人背景和知识水平所限,本答案局限性如下(包括但不限于):
1. 更适用于中大型公司;
2. 更适用于互联网公司;
3. 可能更适用于美国的工作环境。
个人以为,一个三年工作经验的数据分析师应该具备以下方面的能力:对技术的掌握,对产品的理解,对数据的敏锐性,数据和产品之间互相转化的能力,分析思维的广度、深度和速度,数理统计的能力,沟通的能力,辅导新人的能力,面试把关的能力。
以下分开来说,同时举例的时候假设这个数据分析师是知乎这个产品的,目的是为了增长活跃用户。
【1】对技术的掌握
不一定需要非常高深的技术,但是基本的一定要过关。比如针对互联网行业的数据分析,SQL 是一定要过关的。在这基础之上,掌握公司惯用的BI工具或者报表工具,譬如帆软系列;Python / R 可以提高长期的工作效率,但在初期并不一定需要。
简单来说,技术能力决定了一名数据分析能力的下限,而对产品和业务的理解则决定了上限。
如果缺乏技术的支持,那就只能去当 CEO 了。
就好比在电影 Margin Call 里,底下的小兵负责分析数据,各种模型预测金融危机什么时候会发生。
而对于 CEO 来说,他的任务就是猜。
【2】对产品的理解
数据分析的目的是为了改进产品。如果缺乏对产品的理解,那么技术再好,也有可能像是无头苍蝇到处乱撞。
或者是变成 data dump,提供一堆一堆的图表,但其中有互相什么关联,能说明什么问题,提供什么样的建议,却并没有好的想法。
如果是初入行的话,这还是问题不大的。
因为新人可以有老板带着,或者是老人带着,但是如果想要更进一步,那就必须能够自己独立的做项目。
尤其是在互联网行业更是如此,除了新人之外,对大多数人的基本要求都是能单兵作战,不需要详细的指导。
同时在很多情况下,问题是很开放性的,对于如何解决并没有一个非常固定的套路,或者是因为这完全就是一个新的问题,或者因为不同产品之间套路无法直接套用,需要做大量的调整和创新。
比如这里面增长的例子,哪些是可以借用于知乎的,哪些是需要调整的,哪些是完全不适用的?
【3】对数据的敏锐性
对数据的敏锐性体现在两方面,一是在结果还不是那么清晰的时候,甚至根本就没有什么数据的时候,能够大致感觉往哪个方向深挖是更有可能出成果的;二是在数据出问题的时候,能够反应出来,及时找出原因。
比如做知乎的数据分析,目的是为了增长活跃用户,可以做的地方有很多,比如增加获新、增加内容、增加用户关注话题数、增加用户关注人数等等。一个经验丰富的老司机可以快糙猛的大概估算一下各个方面的机会有多大,大致的实施难度如何,风险是大是小,产品哪些方面是有缺陷可以改进的。
另一方面,是人就会犯错,最大的区别在于有的人可以很好的纠错,而有的人则需要别人提醒,还有的人即使别人提醒了也反应不过来。
【4】数据和产品之间互相转化的能力
在互联网行业,多数时候问题是很不清晰的,比如说问题可能是2017年新用户留存远差于2015年的用户,如何解决?
对数据分析师来说,并不会有一个详细的单子来告诉你都有哪些步骤,而是需要自己灵活处理。
一方面这些问题本身就比较新,虽然会有一个大致的套路,比如 AARRR 模型,解决增长需要先解决留存等等;然而再往下具体的时候,套路就没有那么固定了,因为不同的产品之间可以差别很大。
即使像是 Quora 和知乎这样理应非常类似的产品,也可能因为一些或大或小的差异,导致给分析数据也带来差别。
比如 Quora 的 upvote 并不完全代表赞同,而更多带有传播的意味。
而对于知乎来说,点赞即是赞同,传播只是副产品而已。
如果只懂数据不懂产品的话,很容易进入一个误区,要么产品/业务方追着问数据,要么没活儿干。
【5】分析思维的广度、深度和速度
速度这个比较好理解,尤其是在互联网行业,讲究快糙猛,没有时间精细打磨。
比如一个项目可以花两个月时间做出 95%,也可以花两周时间做 80%,那么多数时候都会是后者。
广度:产品的各个方面之间总是互相牵扯的。最简单的例子,如果知乎的拉新做得非常好,那么留存就有可能降低,用户活跃度也有会降低。
如何分析各者之间的关系,如何保持一个合理的平衡,如何增加其中一个不过于负面影响其它,这些数据分析都需要在广度上有一定的了解。
深度:有些问题一个人解决不了或者很难,多几个人就可以了,比如说搬砖,十人人搬总会比一个人搬快得多,哪怕不是十倍速度。而有些问题,靠堆人力是没用的。
【6】数理统计的能力
这一部分跟 1,3,5 是相关的。不一定需要特别高精尖,但是对于分析问题会有很大的帮助。比如说如何识别数据分析里可能出现的错误。
【7】沟通的能力
除非兼任软件工程师和产品经理的职,否则数据分析师总是需要通过说服产品和工程方面来改变产品,产生影响力。
有了好的结果是第一位,如何影响合作伙伴,让他们接受自己的建议甚至比有好的结果还重要。
毕竟,没有声音,再好的戏也出不来。
【8】辅导新人的能力
毛主席说过,人多力量大,要把敌人淹没在人民战争的汪洋大海中。
辅导新人,不只是团队 leader/manager 的要求,对于独立贡献者(inpidual contributor)也是一样重要的。
闻道有先后,术业有专攻。
一个人的力量终究是有限的,如果把自己的能力复制到整个团队甚至整个公司,是增大自己影响力最有效的办法之一。
【9】面试把关的能力
大多数人应该都希望自己的公司处于一个增长的状况,如果是高速增长那就更好不过了。
有增长,就必然要招人。
而招人并不是简单的招人来干活,而是招来更优秀的人进一步提高团队的水平。
这对于高速增长的团队来说是一个很大的挑战,所以提高面试技能和精准的判断面试者的能力,无疑是有效的扩张团队的不二法则。
【10】少睡的能力
比如说七周不睡觉,快速成为数据分析师(开玩笑的)。
- ?
数据分析师常用的数据分析方法有哪些?
朱飞烟
展开
很多做数据分析或者刚接触数据分析的小伙伴,不知道怎么做数据分析?一点思维都没有,今天小编给大家盘点2万名数据分析师常用的数据分析方法有哪些?希望看完此文的小伙伴,有一个清晰的数据分析思维。
数据分析思维混乱的小伙伴,需要宏观的方法论和微观的方法来指导。
方法论和方法有什么区别?
方法论是从宏观角度出发,从管理和业务的角度提出的分析框架,指导我们接下来具体分析的方向。方法是微观的概念,是指我们在具体分析过程中使用的方法。
上海数据分析网数据分析方法论
数据分析的方法论很多,这里我给大家介绍一些常见的框架。
PEST分析法:PEST 为一种企业所处宏观环境分析模型,从政治(Politics)、经济(Economy)、社会(Society)、技术(Technology)四个方面分析内外环境,适用于宏观分析。四点因素也被称之为“pest有害物”,PEST要求高级管理层具备相关的能力及素养。PEST分析与外部总体环境的因素互相结合就可归纳出SWOT分析中的机会与威胁。PEST/PESTLE、SWOT 与 SLEPT 可以作为企业与环境分析的基础工具。SWOT分析法:从优势(Strength)、劣势(Weakness)、机遇(Opportunity)、威胁(Threat)四个方面分析内外环境,适用于宏观分析。SWOT分析法是用来确定企业自身的竞争优势、竞争劣势、机会和威胁,从而将公司的战略与公司内部资源、外部环境有机地结合起来的一种科学的分析方法。运用这种方法,可以对研究对象所处的情景进行全面、系统、准确的研究,从而根据研究结果制定相应的发展战略、计划以及对策等。5W2H分析法:从Why、When、Where、What、Who、How、How much 7个常见的维度分析问题。广泛用于企业管理和技术活动,对于决策和执行性的活动措施也非常有帮助,也有助于弥补考虑问题的疏漏。4P理论:经典营销理论,认为产品(Product)、价格(Price)、渠道(Place)和促销(Promote)是影响市场的重要因素。AARRR:增长黑客的海盗法则,精益创业的重要框架,从获取(Acquisition)、激活(Activition)、留存(Retention)、变现(Revenue)和推荐(Referral)5个环节增长增长。AARRR在应用推广运营各个层次(各个阶段)需要关注的一些指标。在整个AARRR模型中,这些量化指标都具有很重要的地位,而且很多指标的影响力是跨多个层次的。及时准确地获取这些指标的具体数据,对于应用的成功运营是必不可少的。
数据分析的方法论很多,这里不能一一列举;没有最好的方法论,只有最合适的。
从数据分析方法论也可得知,数据分析的意义在于将杂乱无章的数据转化为清晰可见的可视图,从而进行精准决策。“大数据时代,技术和分析哪个更重要”一文中也阐述了分析的重要性。
上海数据分析网数据分析的七个方法
1、趋势分析
趋势分析是最简单、最基础,也是最常见的数据监测与数据分析方法。通常我们在数据分析产品中建立一张数据指标的线图或者柱状图,然后持续观察,重点关注异常值。
在这个过程中,我们要选定第一关键指标(OMTM,One Metric That Metter),而不要被虚荣指标(Vanity Metrics )所迷惑。
以社交类APP为例,如果我们将下载量作为第一关键指标,可能就会走偏;因为用户下载APP并不代表他使用了你的产品。在这种情况下,建议将DAU(Daily Active Users,日活跃用户)作为第一关键指标,而且是启动并且执行了某个操作的用户才能算上去;这样的指标才有实际意义,运营人员要核心关注这类指标。
2、多维分解
多维分解是指从业务需求出发,将指标从多个维度进行拆分;这里的维度包括但不限于浏览器、访问来源、操作系统、广告内容等等。
为什么需要进行多维拆解?有时候一个非常笼统或者最终的指标你是看不出什么问题来的,但是进行拆分之后,很多细节问题就会浮现出来。
举个例子,某网站的跳出率是0.47、平均访问深度是4.39、平均访问时长是0.55分钟。如果你要提升用户的参与度,显然这样的数据会让你无从下手;但是你对这些指标进行拆解之后就会发现很多思路。
下面展示的是一个产品在不同操作系统下的用户参与度指标数据。
上海数据分析网仔细观察的话,你会发现移动端平台(Android、Windows Phone、IOS)的用户参与度极差,表现在跳出率极高、访问深度和平均访问时长很低。这样的话你就会发现问题,是不是我们的产品在移动端上没有做优化导致用户体验不好?在这样一个移动互联网时代,这是非常重要的一个问题。
3、用户分群
用户分群主要有两种分法:维度和行为组合。第一种根据用户的维度进行分群,比如从地区维度分,有北京、上海、广州、杭州等地的用户;从用户登录平台进行分群,有PC端、平板端和手机移动端用户。第二种根据用户行为组合进行分群,比如说每周在社区签到3次的用户与每周在社区签到少于3次的用户的区别,这个具体的我会在后面的留存分析中介绍。
4、用户细查
正如前面所说的,用户行为数据也是数据的一种,观察用户在你产品内的行为路径是一种非常直观的分析方法。在用户分群的基础上,一般抽取3-5个用户进行细查,即可覆盖分群用户大部分行为规律。
我们以一个产品的注册流程为例:
上海数据分析网用户经历了如下的操作流程:【访问官网】-【点击注册】-【输入号码】-【获取验证码】。本来是非常流畅的一个环节,但是却发现一个用户连续点击了3次【获取验证码】然后放弃提交。这就奇怪了,用户为什么会多次点击验证码呢?
这个时候我建议您去亲自体验一下您的产品,走一遍注册流程。你会发现,点击【获取验证码】后,经常迟迟收不到验证码;然后你又会不断点击【获取验证码】,所以就出现了上面的情况。
绝大多数产品都或多或少存在一些反人类的设计或者BUG,通过用户细查可以很好地发现产品中存在的问题并且及时解决。
5、漏斗分析
漏斗是用于衡量转化效率的工具,因为从开始到结束的模型类似一个漏斗,因而得名。漏斗分析要注意的两个要点:
第一,不但要看总体的转化率,还要关注转化过程每一步的转化率;
第二,漏斗分析也需要进行多维度拆解,拆解之后可能会发现不同维度下的转化率也有很大差异。
某企业的注册流程采用邮箱方式,注册转化率一直很低,才27%;通过漏斗分析发现,主要流失在【提交验证码】的环节。
上海数据分析网经过了解发现,邮箱验证非常容易出现注册邮箱收不到邮件的情况,原因包括邮件代理商被屏蔽、邮件含有敏感字被归入垃圾邮箱、邮件送达时间过长等等。既然这么多不可控因素影响注册转化率,那就换一种验证方式。换成短信验证后,总体转化率提升到了43%,这是非常大的一个增长。
6、留存分析
留存,顾名思义就是新用户留下来持续使用产品的含义。 衡量留存的常见指标有:次日留存率、7日留存率、30日留存率等等。我们可以从两个方面去分析留存,一个是新用户的留存率,另一个是产品功能的留存。
上海数据分析网第一个案例:以社区网站为例,“每周签到3次”的用户留存率明显高于“每周签到少于3次”的用户。签到这一功能在无形中提升了社区的用户的粘性和留存率,这也是很多社群或者社区主推这个功能的原因。
第二个案例:首次注册微博,微博会向你推荐关注10个大V;首次注册LinkedIn,LinkedIn会向你推荐5个同事;申请信用卡时,发卡方会说信用卡消费满4笔即可抽取【无人机】大奖;很多社交产品规定,每周签到5次,用户可以获得双重积分或者虚拟货币。
在这里面“关注10个大V”、“关注5个同事”、“消费4笔”、“签到5次”就是我想说的Magic Number,这些数字都是通过长期的数据分析或者机器学习的方式发现的。实践证明,符合这些特征的用户留存度是最高的;运营人员需要不断去push,激励用户达到这个标准,从而提升留存率。
7、A/B测试与A/A测试
A/B测试是为了达到一个目标,采取了两套方案,一组用户采用A方案,一组用户采用B方案。通过实验观察两组方案的数据效果,判断两组方案的好坏。在A/B测试方面,谷歌是不遗余力地尝试;对于搜索结果的显示,谷歌会制定多种不同的方案(包括文案标题,字体大小,颜色等等),不断来优化搜索结果中广告的点击率。
这里需要注意的一点,A/B测试之前最好有A/A测试或者类似准备。什么是A/A测试?A/A测试是评估两个实验组是否是处于相同的水平,这样A/B测试才有意义。其实这和学校里面的控制变量法、实验组与对照组、双盲试验本质一样的。
- ?
9种常用数据分析方法
欧阳志勇
展开
数据分析是从数据中提取有价值信息的过程,过程中需要对数据进行各种处理和归类,只有掌握了正确的数据分类方法和数据处理模式,才能起到事半功倍的效果,以下是数据分析员必备的9种数据分析思维模式:
1. 分类
分类是一种基本的数据分析方式,数据根据其特点,可将数据对象划分为不同的部分和类型,再进一步分析,能够进一步挖掘事物的本质。
2. 回归
回归是一种运用广泛的统计分析方法,可以通过规定因变量和自变量来确定变量之间的因果关系,建立回归模型,并根据实测数据来求解模型的各参数,然后评价回归模型是否能够很好的拟合实测数据,如果能够很好的拟合,则可以根据自变量作进一步预测。
3. 聚类
聚类是根据数据的内在性质将数据分成一些聚合类,每一聚合类中的元素尽可能具有相同的特性,不同聚合类之间的特性差别尽可能大的一种分类方式,其与分类分析不同,所划分的类是未知的,因此,聚类分析也称为无指导或无监督的学习。
数据聚类是对于静态数据分析的一门技术,在许多领域受到广泛应用,包括机器学习,数据挖掘,模式识别,图像分析以及生物信息。
4. 相似匹配
相似匹配是通过一定的方法,来计算两个数据的相似程度,相似程度通常会用一个是百分比来衡量。相似匹配算法被用在很多不同的计算场景,如数据清洗、用户输入纠错、推荐统计、剽窃检测系统、自动评分系统、网页搜索和DNA序列匹配等领域。
5. 频繁项集
频繁项集是指事例中频繁出现的项的集合,如啤酒和尿不湿,Apriori算法是一种挖掘关联规则的频繁项集算法,其核心思想是通过候选集生成和情节的向下封闭检测两个阶段来挖掘频繁项集,目前已被广泛的应用在商业、网络安全等领域。
6. 统计描述
统计描述是根据数据的特点,用一定的统计指标和指标体系,表明数据所反馈的信息,是对数据分析的基础处理工作,主要方法包括:平均指标和变异指标的计算、资料分布形态的图形表现等。
7. 链接预测
链接预测是一种预测数据之间本应存有的关系的一种方法,链接预测可分为基于节点属性的预测和基于网络结构的预测,基于节点之间属性的链接预测包括分析节点资审的属性和节点之间属性的关系等信息,利用节点信息知识集和节点相似度等方法得到节点之间隐藏的关系。与基于节点属性的链接预测相比,网络结构数据更容易获得。复杂网络领域一个主要的观点表明,网络中的个体的特质没有个体间的关系重要。因此基于网络结构的链接预测受到越来越多的关注。
8. 数据压缩
数据压缩是指在不丢失有用信息的前提下,缩减数据量以减少存储空间,提高其传输、存储和处理效率,或按照一定的算法对数据进行重新组织,减少数据的冗余和存储的空间的一种技术方法。数据压缩分为有损压缩和无损压缩。
9. 因果分析
因果分析法是利用事物发展变化的因果关系来进行预测的方法,运用因果分析法进行市场预测,主要是采用回归分析方法,除此之外,计算经济模型和投人产出分析等方法也较为常用。
以上是数据分析员应熟练掌握的9种数据分析思维方法,数据分析员应根据实际情况合理运用不同的方法,才能够快速精确的挖掘出有价值的信息!
- ?
最常用的四种大数据分析方法
元槐
展开
本文主要讲述数据挖掘分析领域中,最常用的四种数据分析方法:描述型分析、诊断型分析、预测型分析和指令型分析。
当刚涉足数据挖掘分析领域的分析师被问及,数据挖掘分析人员最重要的能力是什么时,他们给出了五花八门的答案。
其实我想告诉他们的是,数据挖掘分析领域最重要的能力是:能够将数据转化为非专业人士也能够清楚理解的有意义的见解。
使用一些工具来帮助大家更好的理解数据分析在挖掘数据价值方面的重要性,是十分有必要的。其中的一个工具,叫做四维分析法。
简单地来说,分析可被划分为4种关键方法。
下面会详细介绍这四种方法。
1. 描述型分析:发生了什么?
这是最常见的分析方法。在业务中,这种方法向数据分析师提供了重要指标和业务的衡量方法。
例如,每月的营收和损失账单。数据分析师可以通过这些账单,获取大量的客户数据。了解客户的地理信息,就是“描述型分析”方法之一。利用可视化工具,能够有效的增强描述型分析所提供的信息。
2. 诊断型分析:为什么会发生?
描述性数据分析的下一步就是诊断型数据分析。通过评估描述型数据,诊断分析工具能够让数据分析师深入地分析数据,钻取到数据的核心。
良好设计的BI dashboard能够整合:按照时间序列进行数据读入、特征过滤和钻取数据等功能,以便更好的分析数据。
3. 预测型分析:可能发生什么?
预测型分析主要用于进行预测。事件未来发生的可能性、预测一个可量化的值,或者是预估事情发生的时间点,这些都可以通过预测模型来完成。
预测模型通常会使用各种可变数据来实现预测。数据成员的多样化与预测结果密切相关。
在充满不确定性的环境下,预测能够帮助做出更好的决定。预测模型也是很多领域正在使用的重要方法。
4. 指令型分析:需要做什么?
数据价值和复杂度分析的下一步就是指令型分析。指令模型基于对“发生了什么”、“为什么会发生”和“可能发生什么”的分析,来帮助用户决定应该采取什么措施。通常情况下,指令型分析不是单独使用的方法,而是前面的所有方法都完成之后,最后需要完成的分析方法。
例如,交通规划分析考量了每条路线的距离、每条线路的行驶速度、以及目前的交通管制等方面因素,来帮助选择最好的回家路线。
结论
最后需要说明,每一种分析方法都对业务分析具有很大的帮助,同时也应用在数据分析的各个方面。
原文链接:http://kdnuggets/2017/07/4-types-data-analytics.html
转载请注明出自:葡萄城控件
关于葡萄城
葡萄城是全球控件行业领导者,世界领先的企业应用定制工具、企业报表和商业智能解决方案提供商,为超过75%的全球财富500强企业提供服务。
- ?
十种常用的数据分析方法
Fawley
展开
道家强调四个字,叫“道、法、术、器”。
层次区别:
“器”是指物品或工具,在数据分析领域指的就是数据分析的产品或工具,“工欲善其事,必先利其器”;
“术”是指操作技术,是技能的高低、效率的高下,如对分析工具使用的技术(比如用Excel进行数据分析的水平);
“法”是指选择的方法,有句话说“选择比努力重要”;
“道”是指方向,是指导思想,是战略。
在数据分析和产品、运营优化方面,数据分析方法是其核心,属于“法”和“术”的层次。
那么如何做好数据分析呢,今天我们来讲讲互联网运营中的十大数据分析方法。
01 细分分析
细分分析是分析的基础,单一维度下的指标数据的信息价值很低。
细分方法可以分为两类, 一类逐步分析, 比如:来北京市的访客可分为朝阳,海淀等区; 另一类是维度交叉, 如:来自付费SEM的新访客。
细分用于解决所有问题。
比如漏斗转化,实际上就是把转化过程按照步骤进行细分,流量渠道的分析和评估也需要大量用到细分的方法。
02 对比分析
对比分析主要是指将两个相互联系的指标数据进行比较,从数量上展示和说明研究对象的规模大小,水平高低,速度快慢等相对数值, 通过相同维度下的指标对比,可以发现,找出业务在不同阶段的问题。
常见的对比方法包括: 时间对比,空间对比,标准对比。
时间对比有三种: 同比,环比,定基比。
例如: 本周和上周进行对比就是环比;本月第一周和上月第一周对比就是同比;所有数据同今年的第一周对比则为定基比。通过三种方式,可以分析业务增长水平,速度等信息。
03 漏斗分析
转化漏斗分析是业务分析的基本模型, 最常见的是把最终的转化设置为某种目的的实现,最典型的就是完成交易。但也可以是其他任何目的的实现,比如一次使用app的时间超过10分钟。
漏斗帮助我们解决两方面的问题:
在一个过程中是否发生泄漏,如果有泄漏,我们能在漏斗中看到,并且能够通过进一步的分析堵住这个泄漏点。
在一个过程中是否出现了其他不应该出现的过程,造成转化主进程收到损害。
04 同期群分析
同期群(cohort)分析在数据运营领域十分重要,互联网运营特别需要仔细洞察留存情况。 通过对性质完全一样的可对比群体的留存情况的比较,来分析哪些因素影响用户的留存。
同期群分析深受欢迎的重要原因是十分简单,但却十分直观。 同期群只用简单的一个图表,直接描述了用户在一段时间周期(甚至是整个LTV)的留存或流失变化情况。
以前留存分析只要用户有回访即定义为留存,这会导致留存指标虚高。
05 聚类分析
聚类分析具有简单,直观的特征, 网站分析中的聚类主要分为:用户,页面或内容,来源。
用户聚类主要体现为用户分群,用户标签法;页面聚类则主要是相似,相关页面分组法;来源聚类主要包括渠道,关键词等。
例如: 在页面分析中,经常存在带?参数的页面。 比如: 资讯详情页面,商品页面等,都属于同一类页面。简单的分析容易造成跳出率,退出率等指标不准确的问题,通过聚类分析可以获取同类页面的准确数据用于分析场景。
06 AB测试
增长黑客的一个主要思想之一,是不要做一个大而全的东西,而是不断做出能够快速验证的小而精的东西。 快速验证,那如何验证呢?主要方法就是AB测试。
比如: 你发现漏斗转化中中间有漏洞,假设一定是商品价格问题导致了流失,你看到了问题-漏斗,也想出了主意-改变定价。但主意是否正确,要看真实的用户反应,于是采用AB测试,一部分用户还是看到老价格,一部分用户看到新价格,若你的主意真的管用,新价格就应该有更好的转化,若真如此,新价格就应该确定下来,如此反复优化。
07 埋点分析
只有采集了足够的基础数据,才能通过各种分析方法得到需要的分析结果。
通过分析用户行为,并细分为:浏览行为,轻度交互,重度交互,交易行为,对于浏览行为和轻度交互行为的点击按钮等事件,因其使用频繁,数据简单,采用无埋点技术实现自助埋点,即可以提高数据分析的实效性,需要的数据可立即提取,又大量减少技术人员的工作量,需要采集更丰富信息的行为。
如: 重度交互(注册,邀请好友等)和交易事件(加购物车,下订单等)则通过SDK批量埋点的方式来实施。
08 来源分析
流量红利消失,我们对获客来源的重视度极高,如何有效的标注用户来源,至关重要。
传统分析工具,渠道分析仅有单一维度,要深入分析不同渠道不同阶段效果,SEM付费搜索等来源渠道和用户所在地区进行交叉分析,得出不同区域的获客详细信息,维度越细,分析结果也越有价值。
09 用户分析
用户分析是互联网运营的核心, 常用的分析方法包括:活跃分析,留存分析,用户分群,用户画像,用户细查等。
可将用户活跃细分为浏览活跃,互动活跃,交易活跃等,通过活跃行为的细分,掌握关键行为指标;通过用户行为事件序列,用户属性进行分群,观察分群用户的访问,浏览,注册,互动,交易等行为,从而真正把握不同用户类型的特点,提供有针对性的产品和服务。
用户画像基于自动标签系统将用户完整的画像描绘清晰,更有力的支撑运营决策。
10 表单分析
填写表单是每个平台与用户交互的必备环节,优秀的表单设计,对转化率的提升起到重要作用。
用户从进入表单页面之时起,就产生了微漏斗,从进入总人数到最终完成并成功提交表单人数,这个过程之中,有多少人开始填写表单,填写表单时,遇到了什么困难导致无法完成表单,都影响最终的转化效果。
以上是常见的数据分析方法,更多应用方法需要根据业务场景灵活应用。
数据分析技术有哪些
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并