- ?
数据方法论|自身产品运营数据分析的5个步骤
孤傲
展开
题图来自 Pexels,基于 CC0 协议
全文共 3306 字,阅读需要 6 分钟
—— BEGIN ——
由于公司内部的发展,团子小白接到了公司安排给我的任务,负责平台数据统计和分析,对此,团子结合自己经历为大家简要的描述一下关于数据分析这一块的流程和内容,同时为大家分享一些常用的数据网站。
对于一家公司来说,数据是反应一个公司近日的发展状态如何,得知近日的发展状态是处于向上、稳定、向下情况,公司目前的动态。
其次可以通过具体的数据分析、得到具体分析结果;例如你的目标用户、用户的行踪、某一块功能是的使用情况、转化率、留存率等等情况。
数据分析一般可以分为着三种:
行业数据分析
竞争品数据分析
自身产品运营数据分析
三种数据分析的用途,也大不一样。
行业数据分析和竞争品数据分析,主要是帮助BRD和MRD的撰写,了解社会行情、竞争对手的情况,得知整个市场的总体情况和未来的发展趋势。
而自身产品运营数据分析,主要是帮助周报和月报的撰写、产品当前情况的发展,了解平台的整体状态。
同时,团子主要描述一下关于自身产品运营数据是怎么分析的、分析什么、分析时,需要哪些关键的指标。
在进行数据分析时,一般会走以下几个步骤:
目的—数据收集—数据的统计与描述—归纳与总结—建议/改进
一、数据分析的目的
何为数据分析的目的?团子认为就是:为什么要对数据分析的原因,你想通过数据获取什么东西来帮你论证什么。
团子有一次部门内,想修改平台对商家激励机制。对此,团子需要通过问卷调查得得到商家对之前的激励机制怎么样、激励程度如何,同时对未来修改的机制,又有如何,他们的需求程度有多少。
——这就是我想通过调研数据得到目的。
当公司安排我每周对平台的数据进行分析时,首先了解撰写周报。团子就会去查看之前负责人,输出的文档进行深度学习。
从中团子通过之前输出的文档总结了几点小技巧:
强调数据的重要性(对重点的数据进行标红)。
从数据分析出来的重要结论,进行标红。
能用数据表明的结论,就用数据来表明结论,数据是最可靠的论据。
分析数据时,要表明数据的来源。好让读者知道,那里来的数据,可行度高嘛?
二、数据收集
在收集数据时,首先我们应该需要了解的是收集哪些关键的数据?收集什么样的数据,需要根据你的目的来定。
例如,团子所在的实习公司是做电商直播,在平日的周报中,需要体现出以下几个指标:
用户留存率
用户平均访问时长
订单数据
商家下单数据
直播相关数据(场均观看人数、直播场次情况、直播间转发情况、各直播类型的数据情况)
用户注册数
用户流失率
在创业型的公司,没有很大的经历建立自己系统的数据库,一般是寻找第三方平台,外包出去。因为如果后台需要建立强大的数据话,需求大量的技术做支撑。
但是有些特殊数据平台自己会自己开发,例如团子所在直播数据、订单数据、用户信息。
对于创业的公司来说,能通过外包降低公司的成本方式,他们会尽可能外白出去,毕竟与当前需求价值挂钩。
三、数据的统计与描述
在进行数据统计与描述之前,首先我们需要了解一些关键数据指标代表内容和如何进行统计的公式。
1. 新增APP下载总量
团子所在的公司主要使用第三方平台数据监控平台(友盟、腾讯云)进行统计。
如果你想得到竞争者的数据情况,团子为你推荐一个免费的平台:ASO100 。
2. 用户留存率
在一段时间内,用户在一次使用此产品的情况。
团子举个例子:7月10日新增1000人,7月11日500人使用,12日400人、13日300人、14日200人、15日100人。因此10日的留存率50%,以此类推,如图。
漏斗图怎么做?问百度哈~
3. 用户平均使用时长
用户在平台逗留的时间,通过平均算法,了解整体使用时长情况,排出异常使用情况。
计算方式=所有用户使用时长之和/总人数。
用户平均使用时长越高,说明用户对平台的重要性越高。
因此,使用时长可以作为划分用户等级的指标之一。
4. 用户注册数
在一定时期内,当前平台新用户注册情况。
5. 用户活跃度
按照某一时间内,例如15天,一个用户在平台的启动了一天,那么它的活跃度为1。如果15天之内启动2次,那么他的活跃度为2。以此类推,如果活跃度越高,说明对平台的贡献越高。
有一次在产品社交群中,有人问如何进行用户划分?团子认为用户的划分,主要是根据用户对平台的贡献程度。
贡献程度可以根据用户使用情况、付费情况两个维度进行计算,计算的权重,根据当前平台情况。
例如平台更多是注重付费,那么付费的比重相对高。
6. 用户流失率
一个观察周期内的活跃用户,如果在下一个观察周期内不活跃,则称为流失用户。
用户流失率=流失用户/总用户
通过流失率了解平台走失的情况。
7. 用户回流
设置三个观察周期,回流用户指第一周期活跃,第二周期流失,在第三周期又活跃(回访)的用户。
了解以上几个大众的指标,通过平台得到相应的数据,然后用excel进行数据整理,作出图表。
在进行数据图表描述时,我们时刻需要提醒自己为什么会有这一数据的出现,什么原因导致这个结果的出现,对于当前的数据情况,我们需要进行什么样的改进,提出什么样的意见。
案例分析
团子以近日小黄车举办过的“全城搜集小黄人”活动为例,通过ASO100获取他们近期的下载情况,进行数据描述一下。
如这是小黄车安卓系统的下载情况,活动时间是7月7日至14日,为了让大家更好的了解这次活动对小黄车新增下载有何影响,将时间周期放置从4日至18日,同时结合其他竞争品(摩拜、小蓝车)情况,进行一同分析。
通过以下几个图表,我们可以得知几点信息:
1. 根据数据的时间周期来看,小黄车正在推出一系列相关的小黄人主题活动,从6月底到7月中旬,就开始持续的做活动。使得用户下载基数很大,因此下载总数是其他竞争品下载总数约3倍。
2. 站在市场整体角度来看以下图表,我们可以观察到一个有趣的现象就是:他们三家的下载波动都十分相似和雷同,虽然小黄车通过活动刺激了他们下载总数的增加,同时也使的同行竞争品的下载幅度也伴随的增加。如果将他们的时间拉长、放远看,他们会呈现出一个固定的模式。这属于市场的波动。
3. 站在用户的角度单独来看小黄车的数据。在活动初期和中旬,用户下载量属于向下的趋势,到后期下载量暴增长。
团子认为,由于本次活动的时间周期为一个星期,在活动前期和中旬,用户正在忙于自我储备小黄人卡片。
当活动延续到后期时(小黄车在产品的设计上面,时刻提醒本次活动即将结束、同时时刻更新获奖的人数),让用户产生了紧迫感和渴求感,使得很多用户由于手中缺少某一张卡片,希望可以通过好友互换获得那张卡,获得7元现金的奖励。因此激励用户分享、进行用户互动,使得活动后期用户下载量大增。
总结:前期相关活动的安排,对本次活动的推广有很大的帮助。
好友互换功能的设置,使得用户与朋友之间的互动大大增加,从而后期用户下载量大大提高。
活动的设计,包括获奖人数、活动时间的提醒,激发了用户的渴求度、紧迫感,使得活动氛围大大增加。
有时候因为数据的不全面性,导致数据分析的结果出现偏差。
团子当时对小黄车这一个活动进行分析时,手中看到了第一张的结果,然后误以为下载量的下降是因为活动的规则导致活动前期和中期,下载量下降。
当团子拿起整体行业的数据图表时,团子才明白下载量下降的原因更多的是来自整体市场波动效应而产生的。
不要做一只井底之蛙,偶尔跳出看看整体,才知道一切都是这样。
四、归纳与总结
对于归纳总结这块,团子个人经验也不很丰富,团子分享一些总结方面的技巧。
在做周报时,你需要花很多心血用在数据整理和描述上面。但是,有很多同事在浏览你的周报时,一般只会认真看总结部分,对于其他部分他们很多都是带过,毕竟制作一份周报,它的篇幅很长,很多同事并没有太多时间来阅读。
因此在写周报时,我们首先应该把总结放入顶端(最显眼的地方);同时对于重要的数据和总结点,一定记得标红,这样才能让你的同事快速获取相应的信息要点。
关于如何总结,团子为大家推荐几本书吧,来弥补这块的不足。《金字塔原理》《学会提问》《麦肯锡工作法》,希望可以帮到你。
五、建议/改进
团子很高兴为大家分享了自己在数据这块的经历和想法,虽然文章整体篇幅干货比较稀少,这也跟团子本人也有很大的关系。
虽然团子在实战经验没有其他作者那么丰富,但是团子还是很努力的想为大家分享自己的点点滴滴,一同成长交流。
接下来为大家分享一些数据网站,希望后期在做数据这块能对你有帮助~
ASO100: https://aso100
百度指数:https://index.baidu
199IT互联网数据:http://199it
IT橘子:https://itjuzi
百度移动统计:https://mtj.baidu/web/welcome/login
中国互联网数据平台:http://cnidp
亿邦电商数据:http://ebrun/data/
浏览器市场份额:http://tongji.baidu/data/browser
中国网络视频数据:http://index.youku
Alexa网站监控数据:http://alexa
易观/艾瑞数据库
百度
希望以上的数据网站,可以帮到你~
—— END ——
- ?
十种常用的数据分析方法
帕特尼安密
展开
道家强调四个字,叫“道、法、术、器”。
层次区别:
“器”是指物品或工具,在数据分析领域指的就是数据分析的产品或工具,“工欲善其事,必先利其器”;
“术”是指操作技术,是技能的高低、效率的高下,如对分析工具使用的技术(比如用Excel进行数据分析的水平);
“法”是指选择的方法,有句话说“选择比努力重要”;
“道”是指方向,是指导思想,是战略。
在数据分析和产品、运营优化方面,数据分析方法是其核心,属于“法”和“术”的层次。
那么如何做好数据分析呢,今天我们来讲讲互联网运营中的十大数据分析方法。
01 细分分析
细分分析是分析的基础,单一维度下的指标数据的信息价值很低。
细分方法可以分为两类, 一类逐步分析, 比如:来北京市的访客可分为朝阳,海淀等区; 另一类是维度交叉, 如:来自付费SEM的新访客。
细分用于解决所有问题。
比如漏斗转化,实际上就是把转化过程按照步骤进行细分,流量渠道的分析和评估也需要大量用到细分的方法。
02 对比分析
对比分析主要是指将两个相互联系的指标数据进行比较,从数量上展示和说明研究对象的规模大小,水平高低,速度快慢等相对数值, 通过相同维度下的指标对比,可以发现,找出业务在不同阶段的问题。
常见的对比方法包括: 时间对比,空间对比,标准对比。
时间对比有三种: 同比,环比,定基比。
例如: 本周和上周进行对比就是环比;本月第一周和上月第一周对比就是同比;所有数据同今年的第一周对比则为定基比。通过三种方式,可以分析业务增长水平,速度等信息。
03 漏斗分析
转化漏斗分析是业务分析的基本模型, 最常见的是把最终的转化设置为某种目的的实现,最典型的就是完成交易。但也可以是其他任何目的的实现,比如一次使用app的时间超过10分钟。
漏斗帮助我们解决两方面的问题:
在一个过程中是否发生泄漏,如果有泄漏,我们能在漏斗中看到,并且能够通过进一步的分析堵住这个泄漏点。
在一个过程中是否出现了其他不应该出现的过程,造成转化主进程收到损害。
04 同期群分析
同期群(cohort)分析在数据运营领域十分重要,互联网运营特别需要仔细洞察留存情况。 通过对性质完全一样的可对比群体的留存情况的比较,来分析哪些因素影响用户的留存。
同期群分析深受欢迎的重要原因是十分简单,但却十分直观。 同期群只用简单的一个图表,直接描述了用户在一段时间周期(甚至是整个LTV)的留存或流失变化情况。
以前留存分析只要用户有回访即定义为留存,这会导致留存指标虚高。
05 聚类分析
聚类分析具有简单,直观的特征, 网站分析中的聚类主要分为:用户,页面或内容,来源。
用户聚类主要体现为用户分群,用户标签法;页面聚类则主要是相似,相关页面分组法;来源聚类主要包括渠道,关键词等。
例如: 在页面分析中,经常存在带?参数的页面。 比如: 资讯详情页面,商品页面等,都属于同一类页面。简单的分析容易造成跳出率,退出率等指标不准确的问题,通过聚类分析可以获取同类页面的准确数据用于分析场景。
06 AB测试
增长黑客的一个主要思想之一,是不要做一个大而全的东西,而是不断做出能够快速验证的小而精的东西。 快速验证,那如何验证呢?主要方法就是AB测试。
比如: 你发现漏斗转化中中间有漏洞,假设一定是商品价格问题导致了流失,你看到了问题-漏斗,也想出了主意-改变定价。但主意是否正确,要看真实的用户反应,于是采用AB测试,一部分用户还是看到老价格,一部分用户看到新价格,若你的主意真的管用,新价格就应该有更好的转化,若真如此,新价格就应该确定下来,如此反复优化。
07 埋点分析
只有采集了足够的基础数据,才能通过各种分析方法得到需要的分析结果。
通过分析用户行为,并细分为:浏览行为,轻度交互,重度交互,交易行为,对于浏览行为和轻度交互行为的点击按钮等事件,因其使用频繁,数据简单,采用无埋点技术实现自助埋点,即可以提高数据分析的实效性,需要的数据可立即提取,又大量减少技术人员的工作量,需要采集更丰富信息的行为。
如: 重度交互(注册,邀请好友等)和交易事件(加购物车,下订单等)则通过SDK批量埋点的方式来实施。
08 来源分析
流量红利消失,我们对获客来源的重视度极高,如何有效的标注用户来源,至关重要。
传统分析工具,渠道分析仅有单一维度,要深入分析不同渠道不同阶段效果,SEM付费搜索等来源渠道和用户所在地区进行交叉分析,得出不同区域的获客详细信息,维度越细,分析结果也越有价值。
09 用户分析
用户分析是互联网运营的核心, 常用的分析方法包括:活跃分析,留存分析,用户分群,用户画像,用户细查等。
可将用户活跃细分为浏览活跃,互动活跃,交易活跃等,通过活跃行为的细分,掌握关键行为指标;通过用户行为事件序列,用户属性进行分群,观察分群用户的访问,浏览,注册,互动,交易等行为,从而真正把握不同用户类型的特点,提供有针对性的产品和服务。
用户画像基于自动标签系统将用户完整的画像描绘清晰,更有力的支撑运营决策。
10 表单分析
填写表单是每个平台与用户交互的必备环节,优秀的表单设计,对转化率的提升起到重要作用。
用户从进入表单页面之时起,就产生了微漏斗,从进入总人数到最终完成并成功提交表单人数,这个过程之中,有多少人开始填写表单,填写表单时,遇到了什么困难导致无法完成表单,都影响最终的转化效果。
以上是常见的数据分析方法,更多应用方法需要根据业务场景灵活应用。
- ?
怎么样Excel做数据分析?这几个步骤帮到你
cwfcwf
展开
每个人都会有机会进行数据展示,为什么别人展示永远获得正视,而我的展示永远只有自己愿意去看,别人在看手机?那怎样做数据图表分析呢请看以下步骤:
如何对表格进行修饰,本次小编带来两个技巧,一是使用“套用表格格式”,和使用“条件格式”。二是带领大家学会养成修饰表格的思维。
第一步是对表格进行粗略的修饰调整,思维:行高、列宽、对齐方式、表格线等;
使用“套用表格格式”、“条件格式”之后看数据不再枯燥无味,而且还更有看头。“条件格式”可以将筛选条件转换为颜色可视化,从而达到一目了然的效果。
第一个技巧,①“套用表格格式”。方法:任一单元格→开始→套用表格格式。
②“条件格式”,方法:选中单元格区域→开始→条件格式。
条件1:高于平均值
条件2:数据条
条件3:色阶
第二个技巧:养成修饰图表的思维。这次举例柱形图的修饰例子,其他希望大家动用类似的方法进行模拟实践。
步骤一:根据销售数据建立柱状图,建立方法可参考。选择数据源→插入→柱状图→选择数据源→编辑坐标
步骤二:添加辅助线。选择数据源→→添加→点击柱体右键,设置数据系列格式→次坐标轴→选中柱体,右键更改图表类型→折线图。
希望回答对你能有所帮助,如果觉得不错就来点个赞或关注吧,感谢各位了!
- ?
数据分析全流程(内附案例)
葛从筠
展开
(图片来源于网络)
作者:苏格兰折耳喵
来源: 运营喵是怎样炼成的 (yymzylc)
(温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )
本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:
1 分析背景
1.1 分析原理---为什么选择分析虎嗅网
在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。
综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:
由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。
鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。
虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。
因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。
1.2 本文的分析目的
笔者在本项目中的分析目的主要有4个:
(1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;
(2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;
(3)展现文本挖掘在数据分析领域的实用价值;
(4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。
1.3 分析方法---分析工具和分析类型
本文中,笔者使用的数据分析工具如下:
Python3.5.2(编程语言)
Gensim(词向量、主题模型)
Scikit-Learn(聚类和分类)
Keras(深度学习框架)
Tensorflow(深度学习框架)
Jieba(分词和关键词提取)
Excel(可视化)
Seaborn(可视化)
新浪微舆情(情绪语义分析)
Bokeh(可视化)
Gephi(网络可视化)
Plotly(可视化)
使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。
2 数据采集和文本预处理
2.1 数据采集
笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:
2.2 数据预处理
数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:
(1) 文本分词
要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:
· 精确模式:试图将句子最精确地切开,适合文本分析;
· 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;
· 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。
现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:
【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用
【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用
【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用
为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。
(2) 去停用词
这里的去停用词包括以下三类:
标点符号:, 。! /、*+-
特殊符号:▲等
无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等
(3) 去掉高频词、稀有词和计算Bigrams
去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。
Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。
3 描述性分析
该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。
3.1 发文数量、评论量和收藏量的变化走势
从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。
此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。
下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。
3.2 发文时间规律分析
笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:
上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。
3.3 相关性分析
笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。
首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。
上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。
接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。
注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。
3.4 城市提及分析
在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。
上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:
将上述结果绘制成如下动态的流向图:
由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:
京津冀城市群
长江三角洲城市群
珠江三角洲城市群
中原城市群
成渝城市群
长江中游城市群
上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。
4 文本挖掘
数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。
本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。
4.1 关键词提取
对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:
它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。
由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。
下面是笔者利用jieba在经预处理...
- ?
4个关键,如何清晰的做好数据分析
廉康
展开
文 | 帆软数据应用研究院 船长
数据分析就近几年看来,越来越有一种像通用技能发展的趋势,从生产、研发、市场、销售到运营,多多少会存在数据分析的需求。
关于数据分析,网络上有不少分析报告案例,但细细读来,好多都缺少辨证,逻辑不严谨,又或者分析得浅尝辄止。恰逢最近读了《大数据分析的道与术》,是一套很完整的理论书籍,结合自己多年的数据从业经验,积累了一些心得,想与大家分享。
作为一个唯物主义者,做事总是爱讲方法论。曾经“农村包围城市,武装夺取政权”作为方法论的代名词,总是挂在嘴边。那么数据分析工作,方法论是什么呢?是“先道后术,以道驭术”,也就是先了解数据分析的核心原则,再掌握数据分析的一些关键技术。
什么是数据分析?
数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,为提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。其实简单理解,数据分析本身就是“数据”和“分析”两块工作。一方面是采集、加工、整理数据,另一方面是结合数据背景分析数据,从中提取出对业务有帮助的结论。
数据分析的成果通常是数据分析报告
。常见的就是带图、表的PPT、PDF文件,也有一些Web版的图表系统(有兴趣的,可以在应用商店搜索“数据分析”,有各类演示系统可以体验)。对于数据分析报告,类似议论文,分析是论点,数据就是论据。
数据分析有什么用呢?这个经常被问到,尤其当一篇花里胡哨的报告在网上发布,就有人说报告没用,顺带着撇一嘴数据分析也没用。
数据分析对企业的巨大价值体现在业务发展的前期(探索期)或阶段性改进期(颠覆期)。当探索和变革业务时,企业需要数据分析去明确业务中的问题、机遇及解决方案。企业最大的成本是决策成本,而数据分析是提高企业决策能力的关键;当业务模式相对成熟时,企业则需要数据建模来提升业务效率,减少运营成本等。
那,数据分析又有哪些普遍又典型的应用场景呢?笔者经验,主要是三个:掌握业务状态、分析业务潜力、评估业务进展。
场景-掌握业务状态
:我们需要通过对核心指标进行监控、解读和分析,掌握业务经营状况。比如某日销量出现异常波动,需要数据分析来定位原因。(产品A本周销量异常上涨10%,是什么原因?怎么分析?)在比如月末、季末部门做关键业务指标总结,并做业务发展趋势分析等。(本季度的关键数据指标如何?各项业务进展如何?都有哪些积极消极因素,具体多大影响,下个月、下个季度业务则呢么发展?)譬如下方用finereport搭建的数据平台,统计监测的业务数据。按照制定的业务分析规则展示,可以清晰地看到哪个环节出错。
销售额分析
销售团队分析
销售指标追踪
场景-分析业务潜力
:产品当前的主要问题是什么?下一步的发展潜力在哪里?从数据中挖掘问题原因并提出对策,指明产品的下一步改进方向。比如商品B近3个月流失了1000个会员,原因是什么(分析原因)?如何减少会员流失(找对策)?
场景-评估业务进展
:新上线的产品策略或新推进的运营活动,带来了多少业绩提升?项目的覆盖面和影响面如何?其中存在怎样的问题,如何进一步优化等等。比如针对部分客户,设计全新的促销策略,在本月执行后,如何评价促销策略带来的业绩提升?是否目标客户群比上个月购买额增长可以作为促销策略的成果?
既然数据分析有如此之多的应用场景和使用价值,那么怎么才能做好数据分析呢?只能说,太难,既需要工具技巧的掌握,又要有能明察秋毫洞若观火的业务经验。但相比而言,个人觉得后者更为重要,就像如果只知道方法论,但没有对业务的理解,如何实行的套路,数据分析只会浮于表面,既不能挖掘问题原因,也不能提供解决方案。
做好数据分析,不谈技术,先认清以下4个关键。
1、业务调研:理解业务是基础,否则分析是无本之木,甚至是个人意淫。
2、创新思考:广阔的知识面和积极的思考,是分析思路的源泉,数据分析的创新思考,实质上就是从更多的思路进行分析,找出最合理的思路。
3、逻辑推理:对数据指标作出正确的归因分析和判断。
4、可行建议:产生对业务切实有效的改进建议和执行方案。
“业务调研”是数据分析的起点,也是获取分析思路的基础,但是需要兼具深度和广度的“创新思考”,才能获取更独到的分析思路。分析思路也可以认为是统计数据的角度,完成数据统计后,需要“逻辑推理”来保证从数据到结论判断的正确性。最后,用“可行建议”来保证分析结论的落地执行,产生可量化的业绩。这就是数据分析从业务中来,回到业务中取得完成过程。
本文是笔者《大数据分析道与术》读书笔记第1篇,浅述了一下。下周将结合自身经验,对业务调研、创新思考、逻辑推理、可行建议逐一做解读分析。
文 |
帆软数据应用研究院
船长
- ?
这才是正确的数据分析步骤
罗亦绿
展开
做好数据分析需要考虑三个问题,数据从哪来,数据到哪去,数据怎么去?今天我们来讲讲数据怎么去的问题,也就是数据分析步骤。
一、定义
“勿忘初心,方得始终”,做数据分析前要想好针对的问题是什么,想通过数据分析解决什么问题,数据分析的结果能帮助你达到什么目的,对现阶段你的产品有何实际的意义。
基于分析目的确定分析范围。比如你想分析用户流失原因,你分析的范围就是流失的用户,你不能去分析新增的用户,再比如电商类产品,你想对高价值用户进行分析,那么什么是高价值用户,那么你可能确定范围:“xx年xx月xx号-xx年xx月xx号,购买次数5次以上,总金额在3000元以上的用户”,这些都是我们在数据分析之前需要确定的,只有范围确定清楚了,分析的数据才具有指导意义。
规划分析的进度和质量。比如说你要做数据的采集,你就需要考虑清楚用什么样的技术手段采集数据,用什么样的方法进行分析,然后这个过程中产生的误差多大范围内是可接受的,或者是自身有了预判,我知道这种数据分析方式会带来什么样的影响,对最后的结论带来多少干扰。
二、测量
测量包含收集获取数据和数据预处理。
收集获取数据。是用问卷的方式定量分析?还是从服务器调取日志进行分析...,这些都是数据的来源
预处理:比如说做调查问卷,对于回收来的问卷我们需要判断哪些数据是有效的,哪些数据是无效的,比如调查问卷共15道题,用户就答了一道题,这个就属于无效问卷,需要剔除出去,这个时候他的数据是不完整的,放进去反而会影响最终的数据结果。同样对数据库的数据也需要预处理,比如说你想统计新增用户,但是来了很多羊毛党用户,这部分用户对你是没有价值的,也需要处理掉。预处理的好坏,直接决定数据分析结果的质量。
三、分析
分析包含对数据的统计描述和针对问题的归纳和总结。
数据的统计描述。统计是对数据的定量分析,描述是对数据的定性分析,就是对你的数据进行定性和定量的客观性描述。
问题的归纳总结。这个是最重要的,也就是拿出我们的结论,数据本身没有价值,数据分析的结果才有价值。
四、改进
改进就是找到问题的解决方案和降低负面影响。
给出解决方案。比如最近产品用户流失比较厉害,你通过调查问卷和用户访谈了解用户流失原因,当得到分析结果以后,你需要给出解决方案。是你的体验没做好,还是竞争对手挖墙脚,亦或是你的商品价格提高了...这些都是原因,找到主要原因,给出专业的解决方案,老板要的是方案,不关心你分析的过程。
降低负面影响。比如电商的购物流程,浏览商品--》加入购物车--》下单--》支付--》完成购买,你通过漏斗模型分析,发现从加入购物车到下单流失很多,你通过数据分析发现流失的原因是设计上的问题,那么就可以重新优化设计方案,降低负面影响。
五、控制
数据分析是一个持续性的过程,所以需要持续的跟踪反馈,比如做数据的日报、周报、月报,它是一个非常持久的工作,而且数据分析的结果发出去以后,不同的人可能会有不同的看法,那么我们产品经理就需要收集不同的观点。
更新迭代。更新迭代是我们产品经理的一份重要的工作内容,不论是功能上的更新迭代,还是数据上的更新迭代。有的人可能说为什么要做数据上的跟踪迭代呢?因为数据具有时效性,我们分析的往往是一个时间段内的数据,数据会随着时间的推移发生变化,根据这些变化,我们需要做一轮新的数据分析。
- ?
新手入门:数据分析的四种形式
默写
展开
在我过去的博客文章中,我们已经介绍了数据分析的一些基本原理和陷阱。在这篇博文中,我们专注于数据科学中会遇到的四种数据分析:描述性分析,诊断性分析,预测性分析和规范性分析。
当我与刚刚进入数据科学世界的年轻分析师相遇时,我经常会问他们 “你认为数据科学家最重要的技能是什么?”。他们的答案是非常多样。
我对他们的回馈是:数据科学家最重要的技能应该是将数据转化为非定量的、清晰的、有意义的见解的能力。瑞典统计学家汉斯·罗斯林(Hans Rosling)为此而闻名。这是一个经常被忽视的技能。
围绕今天主题,非常有必要为大家详细介绍一些帮助个人如何使用分析相关的知识提炼出有价值的见解的工具。其中的一款工具就是四维范式分析。
简单地,可以将数据分析分类成四个主要类型。下面我将会详细介绍里面的细节。
一、描述性分析:发生了什么?
这是所有形式中最常见的。在业务中,它为分析人员提供了业务中关键指标和措施的视图。
例如公司每月的收支表。类似地,分析师可以获得大量客户的数据。了解客户的人口统计信息(例如我们的客户的30%是个体经营者)将被归类为“描述性分析”,利用有效的可视化工具可以增强描述性分析的信息。
二、诊断性分析:为什么发生?
这是数据分析的复杂性的下一步是诊断性分析。在对描述性数据进行评估时,诊断分析工具将使分析师能够深入到细分的数据,从而隔离出问题的根本原因。
精心设计的商业信息(BI)仪表板包含读取时间序列数据(即多个连续时间点的数据),并具有过滤器和钻取能力,可进行此类分析。
三、预测性分析:将发生什么?
预测分析是关于预测的。无论是将来发生事件的可能性,预测可量化的数量还是估计可能发生事件的时间点。这些都是通过预测模型完成的。
预测模型通常利用各种可变数据进行预测。组件数据的变异性将与可能预测的关系(例如,一个较老的人,他们对心脏病发作的敏感程度越高 - 我们会说年龄与心脏病发作风险呈线性相关),然后将这些数据一起编译成分数或预测。
在一个很大的不确定性的世界中,能够预测能够做出更好的决定。预测模型是许多领域中最重要的一些模型。
这是预测中需要避开的坑:http://insights.principa.co.za/the-top-predictive-analytics-pitfalls-to-avoid
四、规范性分析:需要做什么?
在价值和复杂性方面的下一步是规范性模式。规范模型利用对发生的事情的理解,为什么发生了这种情况以及各种“可能发生的”分析,以帮助用户确定采取的最佳行动方案。规定性分析通常不仅仅是一个单独的行动,而且实际上是其他一些行动。
一个很好的例子是一个交通应用程序,帮助您选择最佳路线回家,并考虑每个路线的距离,每个路上可以行驶的速度,以及当前的交通限制。
另一个例子可能是制作考试时间表,使得各个班级的学生没有冲突的时间表。
总结
虽然不同形式的分析可能为企业提供不同数量的价值,但它们都具有自己的位置。
- ?
大数据分析的四个关键环节
Noel
展开
▌ 什么是大数据?
随着大数据时代的到来,AI 概念的火热,人们的认知有所提高。为什么说大数据有价值?这是不是只是一个虚的概念?大家怎么考虑数据驱动问题?为什么掌握更多的数据就会更有效?这些问题很难回答,但是,大数据绝不是大而空洞的。
信息论之父香农曾表示,信息是用来消除不信任的东西,比如预测明天会不会下雨,如果知道了今天的天气、风速、云层、气压等信息,有助于得出更准确的结论。所以大数据是用来消除不确定性的,掌握更多的有效数据,可以驱动企业进行科学客观的决策。
桑文锋对大数据有着自己的理解,数据采集遵循“大”、“全”、“细”、“时”四字法则。
“大”强调宏观的“大”,而非物理的“大”。大数据不是一味追求数据量的“大”。比如每天各地级市的苹果价格数据统计只有 2MB,但基于此研发出一款苹果智能调度系统,就是一个大数据应用,而有些数据虽然很大,却价值有限;
“全”强调多种数据源。大数据采集讲求全量,而不是抽样。除了采集客户端数据,还需采集服务端日志、业务数据库,以及第三方服务等数据,全面覆盖,比如美国大选前的民意调查,希拉里有70%以上胜算,但是川普成为了美国总统,因为采样数据有偏差,支持川普的底层人民不会上网回复。
“细”强调多维度数据采集,即把事件的维度、属性、字段等都进行采集。如电商行业“加入购物车”的事件,除了采集用户的 click 数据,还应采集用户点击的是哪个商品、对应的商户等数据,方便后续交叉分析。
“时”强调数据的时效性。显然,具有时效性的数据才有参考价值。如国家指数,CPI 指数,月初收集到信息和月中拿到信息,价值显然不同,数据需要实时拿到,实时分析。
从另一个视角看待数据的价值,可以分为两点,数据驱动决策,数据驱动产品智能。数据的最大价值是产品智能,有了数据基础,再搭建好策略算法,去回灌产品,提升产品本身的学习能力,可以不断迭代。如今日头条的新闻推荐,百度搜索的搜索引擎优化,都是数据驱动产品智能的体现。
▌ 数据分析四个关键环节
桑文锋把数据分析分为四个环节,数据采集、数据建模、数据分析、指标。他提出了一个观点,要想做好数据分析,一定要有自底向上的理念。很多公司的数据分析自顶向下推动,用业务分析指标来决定收集什么数据,这是需求驱动工程师的模式,不利于公司长久的数据采集。而一个健康的自底向上模式,可以帮助公司真正建立符合自己业务的数据流和数据分析体系。
一、数据采集
想要真正做好大数据分析,首先要把数据基础建好,核心就是“全”和“细”。
搜集数据时不能只通过 APP 或客户端收集数据,服务器的数据、数据库数据都要同时收集打通,收集全量数据,而非抽样数据,同时还要记录相关维度,否则分析业务时可能会发现历史数据不够,所以不要在意数据量过大,磁盘存储的成本相比数据积累的价值,非常廉价。
常见的数据采集方式归结为三类,可视化/全埋点、代码埋点、数据导入工具。
第一种是可视化/全埋点,这种方式不需要工程师做太多配合,产品经理、运营经理想做分析直接在界面点选,系统把数据收集起来,比较灵活。但是也有不好的地方,有许多维度信息会丢失,数据不够精准。
第二种是代码埋点,代码埋点不特指前端埋点,后端服务器数据模块、日志,这些深层次的都可以代码埋点,比如电商行业中交易相关的数据可以在后端采集。代码埋点的优势是,数据更加准确,通过前端去采集数据,常会发现数据对不上,跟自己的实际后台数据差异非常大。可能有三个原因:第一个原因是本身统计口径不一样,一定出现丢失;第二点是流量过大,导致数据丢失异常;第三点是SDK兼容,某些客户的某些设备数据发不出去,导致数据不对称。而代码埋点的后台是公司自己的服务器,自己核心的模拟可以做校准,基本进行更准确的数据采集。
第三种是通过导入辅助工具,将后台生成的日志、数据表、线下数据用实时批量方式灌到里面,这是一个很强的耦合。
数据采集需要采集数据和分析数据的人共同参与进来,分析数据的人明确业务指标,并且对于数据的准确性有敏感的判断力,采集数据的人再结合业务进行系统性的采集。
二、数据建模
很多公司都有业务数据库,里面存放着用户注册信息、交易信息等,然后产品经理、运营人员向技术人员寻求帮助,用业务数据库支持业务上的数据分析。但是这样维护成本很高,且几千万、几亿条数据不能很好地操作。所以,数据分析和正常业务运转有两项分析,数据分析单独建模、单独解决问题。
数据建模有两大标准:易理解和性能好。
数据驱动不是数据分析师、数据库管理员的专利,让公司每一个业务人员都能在工作中运用数据进行数据分析,并能在获得秒级响应,验证自己的新点子新思维,尝试新方法,才是全员数据驱动的健康状态。
多维数据分析模型(OLAP)是用户数据分析中最有效的模型,它把用户的访问数据都归类为维度和指标,城市是维度,操作系统也是维度,销售额、用户量是指标。建立好多维数据分析模型,解决的不是某个业务指标分析的问题,使用者可以灵活组合,满足各种需求。
三、数据分析
数据分析支持产品改进
产品经理在改进产品功能时,往往是拍脑袋灵光一现,再对初级的点子进行再加工,这是不科学的。《精益创业》中讲过一个理念,把数据分析引入产品迭代,对已有的功能进行数据采集和数据分析,得出有用的结论引入下一轮迭代,从而改进产品。在这个过程中大数据分析很关键。
Facebook 的创始人曾经介绍过他的公司如何确定产品改进方向。Facebook 采用了一种机制:每一个员工如果有一个点子,可以抽样几十万用户进行尝试,如果结果不行,就放弃这个点子,如果这个效果非常好,就推广到更大范围。这是把数据分析引入产品迭代的科学方法。
桑文锋在 2007 年加入百度时,也发现了一个现象,他打开邮箱会收到几十封报表,将百度知道的访问量、提问量、回答量等一一介绍。当百度的产品经理提出一个需求时,工程师会从数据的角度提出疑问,这个功能为什么好?有什么数据支撑?这个功能上线时如何评估?有什么预期数据?这也是一种数据驱动产品的体现。
数据驱动运营监控
运营监控通常使用海盗模型,所谓的运营就是五件事:触达是怎么吸引用户过来;然后激活用户,让用户真正变成有效的用户;然后留存,提高用户粘性,让用户能停留在你的产品中不断使用;接下来是引荐,获取用户这么困难,能不能发动已有的用户,让已有用户带来新用户,实现自传播;最后是营收,做产品最终要赚钱。要用数据分析,让运营做的更好。
数据分析方法
互联网常见分析方法有几种,多维分析、漏斗分析、留存分析、用户路径、用户分群、点击分析等等,不同的数据分析方法适用于不同的业务场景,需要自主选择。
举个多维分析的例子,神策数据有一个视频行业的客户叫做开眼,他们的软件有一个下载页面,运营人员曾经发现他们的安卓 APP 下载量远低于 iOS,这是不合理的。他们考虑过是不是 iOS 用户更愿意看视频,随后从多个维度进行了分析,否定了这个结论,当他们发现某些安卓版本的下载量为零,分析到屏幕宽高时,看出这个版本下载按钮显示不出来,所以下载比例非常低。就这样通过多维分析,找出了产品改进点。
举个漏斗分析的例子,神策数据的官网访问量很高,但是注册-登录用户的转化率很低,需要进行改进。所以大家就思考如何把转化漏斗激活地更好,后来神策做了小的改变,在提交申请试用后加了一个查看登录页面,这样用户收到账户名密码后可以随手登录,优化了用户体验,转化率也有了可观的提升。
四、指标
如何定义指标?对于创业公司来说,有两种方法非常有效:第一关键指标法和海盗指标法。
第一关键指标法是《精益数据分析》中提出的理论,任何一个产品在某个阶段,都有一个最需要关注的指标,其他指标都是这个指标的衍生,这个指标决定了公司当前的工作重点,对一个初创公司来说,可能开始关注日活,围绕日活又扩展了一些指标,当公司的产品成熟后,变现就会成为关键,净收入(GMV)会变成第一关键指标。
- ?
数据分析建立六步骤
逗留
展开
一、什么是数据分析?
二、数据分析的分类
数据分析的三大作用:现状分析、原因分析、预测分析。
三、数据分析的六部曲
1.明确目的和思路
首先先明确分析目的,然后梳理分析思路,并搭建分析框架,把分析目的分解成若干个不同的分析要点,即如何具体开展数据分析,需要从哪几个角度进行分析,采用哪些分析指标(各类分析指标需合理搭配使用)。同时,确保分析框架的体系化和逻辑性。
2.数据收集
一般数据来源于四种方式:数据库、第三方数据统计工具、专业的调研机构的统计年鉴或报告、市场调查。
3.数据处理
数据处理主要包括数据清洗、数据转化、数据抽取、数据合并、数据计算等处理方法,将各种原始数据加工成为数据分析所要求的样式。
4.数据分析
常用的数据分析工具,掌握Excel的数据透视表,就能解决大多数的问题。需要的话,可以再有针对性的学习SPSS、R等工具。
数据挖掘是一种高级的数据分析方法,侧重解决四类数据分析问题:分类、聚类、关联和预测,重点在寻找模式与规律。
5.数据展现
一般情况下,数据是通过表格和图形的方式来呈现的。
常用的数据图表包括饼图、柱形图、条形图、折线图、气泡图、散点图、雷达图等。进一步加工整理变成我们需要的图形,如金字塔图、矩阵图、漏斗图、帕雷托图等。
一般能用图说明问题的就不用表格,能用表说明问题的就不用文字。
图表制作的五个步骤:
1、确定要表达主题
2、确定哪种图表最适合
3、选择数据制作图表
4、检查是否真实反映数据
5、检查是否表达观点
常用图表类型和作用:
6.报告撰写
一份好的数据分析报告,首先需要有一个好的分析框架,并且图文并茂,层次明晰,能够让阅读者一目了然。
结构清晰、主次分明可以使阅读者正确理解报告内容;图文并茂,可以令数据更加生动活泼,提高视觉冲击力,有助于阅读者更形象、直观地看清楚问题和结论,从而产生思考。
好的数据分析报告需要有明确的结论、建议或解决方案。
四、数据分析的四大误区
1.分析目的不明确,为了分析而分析,这是菜鸟常常容易出现的问题;
2.缺乏行业、公司业务认知,分析结果偏离实际。数据必须和业务结合才有意义。摸清楚所在产业链的整个结构,对行业的上游和下游的经营情况有大致的了解,再根据业务当前的需要,制定发展计划,归类出需要整理的数据。同时,熟悉业务才能看到数据背后隐藏的信息;
3.为了方法而方法,为了工具而工具,只要能解决问题的方法和工具就是好的方法和工具;
4.数据本身是客观的,但被解读出来的数据是主观的。同样的数据由不同的人分析很可能得出完全相反的结论,所以一定不能提前带着观点去分析。
内容来源:小蚊子数据分析
百家号-【袁帅数据分析运营】运营者:袁帅,互联网数据分析运营实践者。会展业信息化、数字化领域专家。认证数据分析师、网络营销师、SEM搜索引擎营销师、SEO工程师、电子商务职业经理人。
- ?
4个步骤分析运营数据
颤动
展开
数据能真实反映产品运营的效果,了解哪一块做的好,哪方面有待改进,转化率、留存率等核心指标(也可称为KPI)是多少。这里的产品包括实物、虚拟、内容、活动等,可以当做产品来运营的事物。
01-数据分析目的
这是数据分析的起因:为什么要进行数据分析。有了目的,后续开展的相关工作都是围绕这个目的展开。公司上半年会议提出要深度优化产品APP,因此运营部需要通过问卷调查和在官方微信号、微博、APP引导用户反馈使用情况。
了解用户对之前的产品使用体验怎样,有哪些功能妨碍了正常使用,需要增添什么新功能满足新需求,以及其他意见和建议。这些都是通过分析反馈回来的问卷数据来确定的。
02-收集什么数据
有了目的后,就要着手制定执行方案,理清哪些是必要的关键性数据,哪些是辅助性数据,需要多少样本。既然要优化产品APP,那么就要考虑到:
(1)APP相关数据:APP下载总量、打开次数、使用时长,分析竞争对手的APP。
(2)用户留存率:某段时间内,有多少用户下载、使用或卸载。
(3)平均访问时长:每次打开使用多长时间,使用哪部分内容较多,哪部分较少。
(4)订单数据:通过APP产生的消费情况。
所谓的关键性数据,就是涉及到产品活的好不好的真实反馈。
03-数据统计分析
先了解所要收集的数据代表的内容及统计方式,比如“APP下载总量”指在某段时间内APP在各应用平台的总下载量、新增下载量,同时分为安卓端和ISO端。同时使用数据图表描述,能用图表示的就不用文字叙述。
对统计出的大量数据,分析出导致这样的结果的原因具体是什么,涉及到哪些因素,怎么去优化。
04-意见和建议
通过大量数据统计分析得出的结果,是否符合当初设定的目的和指标,或相差甚远。哪一块需要加强,哪方面需要保持,有什么好的建议让下次做的更好。可以开会讨论各抒己见,或单人面对面交流,或提供报告,多渠道收集反馈,详细分析。
通过分析产品运营数据,能了解产品、活动或内容推送整体状态,为运营提供决策,也为周报、月报、季报的撰写及其他项目的规划提供分析素材。
数据分析的四个步骤
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并