中企动力 > 商学院 > 深度数据分析
  • ?

    深度好文:大数据、小数据,究竟谁来改变世界?

    王治郅

    展开

    人人都爱说“大数据”,平时我们开会,不是用大数据分析这个,就是用大数据建构那个。不可否认,大数据分析让我们的判断更理性,不再盲目地拍脑袋决定一件事。但在生活中,与我们关系最密切的是小数据,一种可以教你做对事情,赚到钱的数据。

    什么是小数据?

    小数据就是个体化的数据,相对于大数据分析,小数据更注重的是精确和实用。

    比如我天天都喝一两酒,突然有天喝完酒了胃疼,我就想了,这天和之前有何不同?原来,这天喝的酒是个新牌子,可能就是喝了这个新牌子的酒让我胃疼。

    又比如我的餐馆里准备改进服务和菜品,想知道顾客最爱的是什么口味、什么品类?调查后发现顾客喜欢川湘口味,却不能承受过辣,甜度3分,辣度2分。

    这就是我生活中的“小数据”,它不比大数据那样浩瀚繁杂,却对个体至关重要。

    企业家马化腾曾在内部分享会上特别强调研究用户,多做用户调查,听取用户反馈,并且明确要求腾讯的产品经理每个月做10个用户调查,收集1000个用户体验的反馈。

    可见无论是什么产品,倾听用户的声音,建立产品的小数据库去做分析是十分重要的。

    怎么才能做好小数据分析呢?

    想要通过数据分析去了解用户,那么我们如何收集用户的真实数据,如何分析用户的行为习惯和消费心理,如何更好地满足用户的需求提高成交率……都是需要考虑的。

    在小数据的钻研上,问卷网已经打磨了5年。

    自2013年7月上线以来,从企业定制服务到一个免费专业的在线数据收集平台,已有近500万用户使用问卷网进行创建、发布、管理、收集及分析服务。 其中459,759,311 份数据帮助500万用户记录了每份调研的影响因素,形成了真实可靠的小数据库。

    从大数据得到规律,用小数据去匹配个人。

    5年来问卷网帮助500万用户发布了他们的问卷,4.6亿份数据帮助用户记录了每份调研的影响因素。

    问卷网5周年,我们更加注重用户的声音,用真实可靠的小数据提升效率。

    进入问卷网,领取500元调研券

  • ?

    产品经理职场必备能力(二):数据分析能力

    卢师

    展开

    所谓数据分析能力,指的是能够透过数据现象看到事物本质的能力。外界的表象容易蒙蔽我们的双眼,数据能够帮助我们拨开云雾见青天。

    本次主要介绍如何通过数据分析帮助我们快速了解行业趋势。

    一、通过行业指数,快速了解行业热度

    关于行业指数,每个行业都不同的指数平台,国内的有百度指数和阿里指数,前者属于综合性分析平台,而后者则属于电商平台。

    下面以百度指数为例,谈谈如何通过指数搜索了解宏观趋势和行业热点。

    1、趋势研究,抓住行业动态

    通过趋势研究,我们可以清晰的了解到所关注行业的近期搜索趋势,重点关注异常趋势,深入发掘行业热点事件。

    比如滴滴的搜索趋势在2018年8月26日达到的峰值,原因就是滴滴顺风车事件。

    再比如京东的搜索趋势,在2018年6月18日达到峰值,原因是京东大促,而导致最近搜索趋势上升的原因则是东哥在美国的那些事。

    2、需求图谱,了解行业需求

    通过需求图谱,我们能够抓住所关注行业的核心和周边需求点,开拓研究的视角,全面了解所在行业。

    比如手机的需求图谱,我们可以了解到和手机有关的周边关键字。

    3、资讯关注,查询相关报道

    资讯关注,这也是百度指数的优势所在,展现所关注行业的最新资讯,第一时间查看相关新闻。

    4、人群画像,帮助产品定位

    通过人群画像,能够帮助我们很好的进行人群定位和角色画像,更加有针对性的开展工作。

    二、通过第三方分析报告,深度了解行业数据

    行业分析报告,一般都由专业的团队,经过长期的数据收集和深度的数据分析而生成,比较具有可靠性和专业性。也正是如此,行业报告大都需要付费才能查看。

    现在国内有很多的第三方平台,会不定期发布行业报告,我们可以通过这些报告更加直观的了解行业的相关数据、发展趋势和行业动向。

    目前国内主流的分析报告平台有艾瑞咨询、易观智库、企鹅智酷、talkingdata、友盟等等平台。另外大家也可以善用搜索引擎查找关注的分析报告。

    三、有条件的前提下,自己抓取数据并分析

    这一点说实话我自己都没有做到,这里仅供有能力的人进行参考。我们可以自己去抓取行业数据,只不过这里需要做大量的前期工作。

    首先,我们需要了解到我们需要的是哪些数据,并且确定哪些网站可以提供相关数据。

    确定好数据来源之后,我们需要将这些数据抓取并提炼出来,有能力的同学可以自己抓取,像我这样的,只能寻找别人的帮助或付费抓取;

    最后,数据提炼出来后,我们需要对这些数据进行相关分析,从中寻找我们想要的结果。至此,我们才能够得到一份比较详实的数据分析结果,有能力的同学可以尝试下。

    到此,我们已经掌握了为达成商业目的所需要具备的宏观分析能力。下期开始,我们将开始介绍产品经理为了协调各方资源而必须具备的沟通能力和领导力。

    尾巴:这是一个最好的时代,互联网带给我们丰富的资讯和数据,只要我们善加利用,就可以帮助我们认清整个行业。这是一个最坏的时代,到处都充斥着大量的虚假和垃圾信息,我们忙于筛选有效信息而忙碌奔波。到最后才发现,我们都只是这个时代的弄潮儿,每个人都扮演着各自小丑的角色。我们能够通过各种方法认清这个世界,却始终没法认清我们自己。

  • ?

    资深数据大牛深度解析:大数据底层架构!

    枉少年

    展开

    随着公司业务的增长,大量和业务、流程、规则相关的半结构化数据也爆发式增长。但数据分散在公司的各个系统中,如何将它们汇总并形成统一的企业级数据仓库,使企业灵活,高效的运用成了难题。

    如需将分散的各个底层数据汇总则需建立完整的体系,支撑风控的大数据框架则是重中之重。

    拥有5000万+注册用户;13亿+设备标签;100亿+行为数据;1500万+行业关注名单等海量多维数据的拍拍信则是从这几个方面落实:

    1. 数据采集

    面对来源各异、以结构化/半结构化为主的数据,我们使用linkedin开源的camus来采集消息类数据,使用kettle来采集RMDB的数据。

    2. 数据储存

    将采集到的原始数据存储到hadoop集群的分布式文件系统中。此外,基于hdfs文件系统对小文件并不是很友好的前提下,定期对历史文件进行合并、压缩、归档的操作也很有必要。

    3. 离线处理

    数据的离线处理则是一个非常大的话题,相当多的工作量都在这里,但它的价值却往往不会马上得到体现,从而被企业忽视。不仅仅包含以下这些内容:

    l 构建并不停地丰富数据仓库

    参照传统的ODS,DW,DM将数仓分层,对数据进行加密、去重后分门别类,持续不断的坚持做这件事。

    l 管理元数据

    建立数据字典,统一数据编码,描绘数据血缘等。

    l 检测数据质量

    从众数、少数、中位数、平均值等多维度来检测和把握数据的质量。

    4. 流式处理

    我们使用spark streaming将特征工程、模型结果计算与流式处理相结合,提供秒级的输出。甚至成功的将类似RNN(循环神经网络)这样的深度学习计算添加到整个流式处理的过程中。

    5. 数据可视化

    使用不同的工具以满足不同场景、不同职责的人员对数据的使用。不仅仅包含以下这些内容:

    l 数据的即席查询

    懂SQL、随意组合查询条件,进行自助查询,可以忍受分钟级的耗时。

    l 多维分析

    不懂SQL的情况下,在给定的维度和指标下,随意组合,并在秒级得到查询结果。

    l 静态报表

    只关注关键性指标。

    l 数据分析挖掘

    会使用像python、R这样的语言,结合集群的Spark、hive这样的分布式处理工具,对数据进行更深层次的利用。

    经过处理的底层大数据相对于以往,在实际业务中使源数据种类更丰富,数据量更多, 借助集群的助力,处理速度更快,回溯时间更久远。

    实际运用:

    模型训练:风控模型是互联网金融,传统金融等行业在风控流程中不可或缺的环节。

    模型应用:将模型与流式计算相结合,提供秒级的风控决策。

    数据产品:对数据加工处理,产生像多头、风险名单一类的数据产品。

    常用业务:企业在日常工作中各个环节都涉及到数据如:处理数据,更新数据,数据调用,查询日志等。

    运用大数据架构前后比对:

    在进行大数据框架搭建时还需注意以下几点:

    现在即使在同一细分领域,也有很多开源技术可供选择,请尽量选用相对成熟,社区活跃的;能选用开源的,尽量避免自研;另外代码如果要维护自己分支,请特别要谨慎,避免与社区越走越远;hadoop最初并没有太多的考虑数据安全方面,这点要自己加强;高稳定性和高性能往往一个是鱼,一个是熊掌,请考虑好取舍。

    本期对大数据底层架构的分享就到这里,欢迎大家联系探讨。

    本文为拍拍信原创,未经许可,禁止转载,侵权必究。申请授权,请联系我们。

    感谢您对拍拍信的认可与支持

    我们一直在路上

  • ?

    数据分析全流程(内附案例)

    卖吻

    展开

    (图片来源于网络)

    作者:苏格兰折耳喵

    来源: 运营喵是怎样炼成的 (yymzylc)

    (温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )

    本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:

    1 分析背景

    1.1 分析原理---为什么选择分析虎嗅网

    在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。

    综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:

    由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。

    鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。

    虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。

    因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。

    1.2 本文的分析目的

    笔者在本项目中的分析目的主要有4个:

    (1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;

    (2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;

    (3)展现文本挖掘在数据分析领域的实用价值;

    (4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。

    1.3 分析方法---分析工具和分析类型

    本文中,笔者使用的数据分析工具如下:

    Python3.5.2(编程语言)

    Gensim(词向量、主题模型)

    Scikit-Learn(聚类和分类)

    Keras(深度学习框架)

    Tensorflow(深度学习框架)

    Jieba(分词和关键词提取)

    Excel(可视化)

    Seaborn(可视化)

    新浪微舆情(情绪语义分析)

    Bokeh(可视化)

    Gephi(网络可视化)

    Plotly(可视化)

    使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。

    2 数据采集和文本预处理

    2.1 数据采集

    笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:

    2.2 数据预处理

    数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:

    (1) 文本分词

    要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:

    · 精确模式:试图将句子最精确地切开,适合文本分析;

    · 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;

    · 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。

    现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:

    【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用

    【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用

    【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用

    为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。

    (2) 去停用词

    这里的去停用词包括以下三类:

    标点符号:, 。! /、*+-

    特殊符号:▲等

    无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等

    (3) 去掉高频词、稀有词和计算Bigrams

    去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。

    Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。

    3 描述性分析

    该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。

    3.1 发文数量、评论量和收藏量的变化走势

    从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。

    此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。

    下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。

    3.2 发文时间规律分析

    笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:

    上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。

    3.3 相关性分析

    笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。

    首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。

    上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。

    接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。

    注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。

    3.4 城市提及分析

    在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。

    上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:

    将上述结果绘制成如下动态的流向图:

    由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:

    京津冀城市群

    长江三角洲城市群

    珠江三角洲城市群

    中原城市群

    成渝城市群

    长江中游城市群

    上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。

    4 文本挖掘

    数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。

    本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。

    4.1 关键词提取

    对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:

    它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。

    由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。

    下面是笔者利用jieba在经预处理...

  • ?

    深度解读:大数据与洞察

    雷冷荷

    展开

    洞察与大数据之间是什么关系?大数据解决不了的问题可以用洞察来解决吗?

    大数据与洞察之间不是相互替代关系。前者是后者的原材料,后者是用前者生产出的产品,二者之间并不矛盾。

    大约从2012起,中国兴起了一股大数据热潮。在各方的炒作下,大数据被包装得无所不能,成为解决各种问题的万能良药。于是乎,人们都在谈论大数据,仿佛不懂大数据就会被时代抛弃了一样。很多企业盲目上了大数据系统,有的甚至斥巨资来追赶这股热潮,还有的大幅削减在传统洞察方面的投资,转投到大数据上。2016年以来,热潮迅速退去,人们才发现,号称搞大数据的,大部分是在裸泳,不少甚至在以“黑数据”冒充“大数据”在骗钱。于是,交了学费、尝了苦头的企业,产生了另一种认识,即大数据否定不能解决问题,开始对各种大数据持怀疑和态度了。

    其实这里存在一个认识误区,就是把知识的各个层次混淆了,把数据与洞察混为一谈。严谨一点说,知识有四个层次,即:数据,即产生洞察的原材料;信息,即经过加工和处理,形成的对事物属性的描述;知识,即经过人类大脑的加工,融入人类的价值判断,对事物的优劣、是非的认识;洞察,则是对知识的升华,具有指向性,可以告诉人们如何选择,或者怎样的选择会导致怎样的结果。由于人们在现实生活中通常并不做这种区分,把大数据与大数据应用、大数据洞察,也就不足为怪了。

    无论大数据热潮中炒作者把大数据说得多么神,他们所能做的,基本是停留在数据和信息层的,特别强调数量的大,是对数据的获取、结构化、清洗、描述而已。这样的所谓“大数据”,当然没有多少实际用处,解决不了什么实际决策问题。我们眼里的大数据,则是数量(Volume)、多样性(Variety)、激增性(Velocity)、价值性(Value)的统一,是把各种来源、各种形式的大量且在不断快速增长的数据,经过数据技术的分析挖掘,融入知识、理论模型,从而形成知识和洞察的过程和应用。

    不得不说,现存的大数据产品和服务,尽管在实用价值上有了很大进步,但输出结果普遍存在机械性、内部一致性问题或曰逻辑自洽问题。背后的原因,主要是过度依赖数据可供性和技术,缺少了对数据背后商业意义与商业逻辑的理解,机械地把现象间的共发当作因果,甚至不考虑时间先后。这就是我们强调数据、技术、知识三位一体结合的原因,其中的知识,就是指对数据背后商业意义和商业逻辑的理解,包括决策的理论与模型。

    张文双参加”第四届‘一带一路’园区建设国际合作峰会暨第十五届中国企业发展论坛营商环境峰会”同向与会代表介绍了动因大数据与传统大数据的本质区别,他说:“我们把消费者通过社交媒体、自媒体平台表达意见、态度、价值取向产生大数据的称作表达大数据,其特点是芜杂、不聚焦;把他们在电商、服务平台通过交易、出行、搜索、浏览等操作形成的大数据称作痕迹大数据,这种大数据具有事后性和碎片性;而动因大数据的价值在探究表达、痕迹背后的态度、心理及场景因素,具有强烈的主动性、目的性、预示性,更好地诠释现象背后的深层关系,解读原因,预测未知。他相信,动因大数据将在表达大数据和痕迹大数据基础上,形成大数据的第三极。这三种大数据相互支撑,相互补充,才是大数据的完整图景。(作者:张文双)

    作者简介:

    张文双,云图元睿(上海)科技有限公司董事长,主要创始人。经济学专家,营销管理专家,曾任WPP集团旗下国际研究集团中国区副总裁、董事 ,全球研发机构产品评审委员会(PET)成员、营销科学集团(MSG)中国区负责人,战略管理委员会核心成员。美国营销协会(AMA)会员。2017年与合伙人联合创建云图起势(上海)科技有限公司 及云图元睿(上海)科技有限公司。现任云图元睿(上海)科技有限公司董事长、CEO 。

    主要研究咨询领域:市场细分战略,新产品研发战略,品类管理战略,品牌资产评估与管理,顾客资产评估与管理,人才资产评估与管理,多源数据整合与挖掘,高级统计分析与建模。(源自:百度百科)

  • ?

    深度好文:大数据、小数据,究竟谁来改变世界?

    殇离别

    展开

    人人都爱说“大数据”,平时我们开会,不是用大数据分析这个,就是用大数据建构那个。不可否认,大数据分析让我们的判断更理性,不再盲目地拍脑袋决定一件事。但在生活中,与我们关系最密切的是小数据,一种可以教你做对事情,赚到钱的数据。

    什么是小数据?

    小数据就是个体化的数据,相对于大数据分析,小数据更注重的是精确和实用。

    比如我天天都喝一两酒,突然有天喝完酒了胃疼,我就想了,这天和之前有何不同?原来,这天喝的酒是个新牌子,可能就是喝了这个新牌子的酒让我胃疼。

    又比如我的餐馆里准备改进服务和菜品,想知道顾客最爱的是什么口味、什么品类?调查后发现顾客喜欢川湘口味,却不能承受过辣,甜度3分,辣度2分。

    这就是我生活中的“小数据”,它不比大数据那样浩瀚繁杂,却对个体至关重要。

    企业家马化腾曾在内部分享会上特别强调研究用户,多做用户调查,听取用户反馈,并且明确要求腾讯的产品经理每个月做10个用户调查,收集1000个用户体验的反馈。

    可见无论是什么产品,倾听用户的声音,建立产品的小数据库去做分析是十分重要的。

    怎么才能做好小数据分析呢?

    想要通过数据分析去了解用户,那么我们如何收集用户的真实数据,如何分析用户的行为习惯和消费心理,如何更好地满足用户的需求提高成交率……都是需要考虑的。

    在小数据的钻研上,问卷网已经打磨了5年。

    自2013年7月上线以来,从企业定制服务到一个免费专业的在线数据收集平台,已有近500万用户使用问卷网进行创建、发布、管理、收集及分析服务。 其中459,759,311 份数据帮助500万用户记录了每份调研的影响因素,形成了真实可靠的小数据库。

    从大数据得到规律,用小数据去匹配个人。

    5年来问卷网帮助500万用户发布了他们的问卷,4.6亿份数据帮助用户记录了每份调研的影响因素。

    问卷网5周年,我们更加注重用户的声音,用真实可靠的小数据提升效率。

    进入问卷网,领取500元调研券

  • ?

    干货|关于大数据分析方法的深度思考

    Zenaide

    展开

    本文作者:郭朝晖@蝈蝈创新随笔

    本文是我关于大数据分析方法的几点思考。当初的目的是系统化地看待数据分析。为了这点东西,我花了一个礼拜的时间,思考的结果却是碎片化的。看来,想清楚并不容易。由于时间关系,只能中止。文字描述很不严格、肯定经不起推敲,读者找不毛病是正常的、看不明白更是正常的。不感兴趣的可以当做胡扯。我希望将来有时间时能把问题思考下去。

    从数据中发现信息和知识,是人们多年来的梦想。随着大数据理论的兴起,这个话题变得非常热门。在有些人看来,大数据非常神秘,似乎无所不能。当然,现实不会是这样。我想,研究大数据,首先要破除迷信:大数据需要什么条件、什么问题是大数据无法做到的。

    1、知识和信息,只能从关联关系中得到

    对象(包括过程,如生产过程、购物过程)及其属性、同一对象的属性之间具备关联关系。例如,“张三身高1.8米”就是对象(张三)与属性(身高)的关联;再如,如果我们知道张三体重75公斤,则“1.8米”和“75公斤”之间就因“张三”建立了关联。

    关联的对象可能并不确定:我们看到一张履历表,即便隐去名字、不知道这个人是谁,也知道其中的各种信息是与某人关联的。

    在数字化的世界里,不和其他的符号(数字)关联的符号(数字)是不包含任何信息的。从不包含信息的素材,得不到包含信息的结论。

    有人可能反对这个观点:谷歌曾经用“感冒”的搜索量预报流感啊,这里哪有关联呢?其实,只有搜索“感冒”的数量是根本无法预测流感的。谷歌的做法,是把“感冒”的搜索与搜索的地点、时间联系起来。

    这个观点告诉我们:收集数据的时候,要尽可能地把关联关系建立起来;没有关联关系,数据很容易成为垃圾。这种情况并不少见:有些实验室,把针对同一试样的各项实验结果分别保存起来,而没有建立统一的ID、关联关系丢失。这样的数据,再多也没有用处。

    2、人们要挖掘的知识和信息,就是找映射关系

    知识(或信息)的发现与挖掘,其本质是寻找映射关系:通过已知的、对象的一部分属性,把对象的另外一部分属性或对象本身找出来(或缩小范围)。产生这类问题的原因是:只有一部分属性已知、容易得到、容易识别、容易表述,而另外一部分未知、不容易得到、不容易识别、不容易描述。

    例如,我们可以说:张三就是那个穿红衣服的——这里“穿红衣服”比其他特征容易识别。从衣服识别出张三,就是从张三的衣着特征(属性)找到关联对象(张三)的信息;从一个人的身高预估他的体重,就是从一个根据一类属性估计另外一类属性。

    我习惯于把信息挖掘和知识发现分开。

    在本文中,信息挖掘指的是预测某个特定对象的属性,如上海市的人口是多少;知识发现是确定一类对象的属性之间的关系,如一类人群中身高和体重的关系。当然,这种区分不是绝对的。

    3、映射关系的差别

    正确的识别,最好的办法是找到好的素材(数据)。素材与结果之间的关联强度是不一样的:有的比较强,是因果关系、必然联系;有的比较弱,是相关关系、偶然联系。

    例如,我们可以根据DNA、相貌、衣服来识别一个人。但三者相比,DNA的联系是强的必然性联系、衣服是弱的偶然性联系,相貌是介于两者之间的联系。大数据的一个著名案例,是网站根据客户买的药判断她已怀孕、并推送有关产品:因为这种药只有孕妇才吃,是很强的关联。

    从数据得到的知识和信息,往往不是绝对正确。一般来说,可靠的结论基于可靠的数据和可靠的分析方法。数据量大了以后,滤除干扰的可能性增大,从而可以从原来可靠度低的数据中,得到可靠性相对较高的数据。

    所以,尽量找到好的素材,是做好分析的第一步。

    在很多情况下,我们找不到好的素材。这时,首先要做的尽量提高数据质量。数据质量不仅是精度问题,还包括数据来源的可靠性:为此,需要把数据来源的相关过程要搞清楚,否则很可能会误导人的分析。

    4、相关与因果

    有些相关性的背后,一般会有因果关系存在。两个要素由因果产生关联的机制大概可以分成两类:1、两个要素具有因果的关系:比如刚做父亲的青年人常会买尿布;2、共同原因导致的两个结果之间的关系:比如孩子的父亲会常买啤酒,也常买尿布;于是,啤酒和尿布就可能关联起来。

    有些相关性,看似没有因果,但背后往往有某些特殊的规律或因素其作用(上述第二种情况)。比如,女孩子往往喜欢花衣服,与基因和文化的共性有关。但这种因果关系可能相隔太远,以至于难以考证了。

    当人们需要根据关系作出决策时,需要研究因果的逻辑关系:到底是谁影响了谁。否则,根据分析结构的盲目行为可能适得其反。 “到底谁影响了谁”为什么会成为问题?大概有两类原因:

    第一类原因是:忽视了时间因素。如“统计结果表明,练太极拳的身体差”。现实却是:很多人身体变差(包括衰老)以后,才练太极拳。一般来说,具有因果关系的两个要素之间,时间上有前后关系:原因早前,结果在后。

    第二类原因是:忽视了前导因素。“公鸡一叫,天就亮了”。现实却是,天量之前的迹象被公鸡察觉到了。两者是第二种因果关系,只是看似“原因在后、结果在前”了。

    一般来说,工业大数据分析更重视因果,而商务大数据分析对因果性的要求较弱。

    5、数据分析的先导因素

    从某种意义上说,数据分析的过程,就是寻找强的相关关系(必然性、因果性),或对弱的相关关系进行综合、得到强的相关关系。

    用数据发现信息,需要用到各种知识。例如,把“云南白药是用于治疗外伤的”放入计算机,当某人购买白药的行为判断他或家人可能受伤,从而可以推荐相关产品。但注意到:这种类型的知识很可能是被人事先装入计算机的,而不是靠计算机自动学习得到的。

    所有的学习过程,本质上都是基于这样一种假设:A和B的一部分属性类似,则推测另一部分属性也应该类似。例如,A和B的身高相似,则体重也可能相似。现实中,两个属性确实具有强烈的相关性,但身高相同而体重不同的也大有人在。这时,如果我们还知道他的体型,是瘦弱、偏瘦、正常、偏胖、肥胖型,对体重的估计就可以准确一些。由此可见,用数据发现知识的过程,本质上就是提高相关性、可靠性的过程。

    一般来说,人们在做数据分析之前,一定会有一定的知识积淀, 但认识不清却是一种常态;人们希望通过对数据的分析,来改变这种常态。而改变认识的过程依赖于数据的质量和分析数据的方法。所以,刨除分析方法外,分析过程依赖于两个先导性因素:1、数据质量(包含多方面的含义)如何;人们已有的认识如何。

    注意,这段说法有个潜台词:强调了人类可认识的知识,而不是机器用复杂函数关系表述的、人类难以用逻辑关系认知的知识(如神经元)。的确如此,笔者一直认为:这类方法的作用被学术界有意识地夸大了。

    6、数据分析的过程

    与商业大数据相比,工业大数据更重视可靠性和精确性。在很多情况下,猜出一个结论并不难,难的是论证一个结论。一般来说,凡是可靠的知识,都应该能够被机理和数据双重认证。

    大数据分析的一个重要特征是:传统概率理论的假设往往不成立。例如:大数定理的条件往往不成立、模型的结构往往未知、因果关系不是天然清晰、自变量的误差往往不能忽略、数据分布往往是没有规律的。所以,为了得到可靠的结果,人们工作的重点很可能是验证这些条件、构造这些条件。从某种意义上说,数据分析的过程,主要是排除干扰的过程、特别是排除系统干扰的过程。而且,如果完全依照逻辑、用纯粹数学的办法加以论证,则数据需求量会遭遇“组合爆炸”,永远是不够的。这时,已有的领域知识就是降低数据需求量的一种手段。要记住:求得可靠性是一个过程而不是结果、可能永远没有终点;分析的过程只是不断增加证据而已。这个过程,是修正人的认识的过程;所以,错误或不恰当的认识常常是分析过程中最大的干扰——这个干扰一旦去除,我们可能就发现了真正的知识。

    数据量大的直接好处,是排除随机性干扰。但排除系统性干扰却不那么容易,数据量大是必要条件但不充分,需要深入的方法研究才能解决问题。

    系统性的干扰往往体现在:对主体进行分组,所体现的规律是不同的。比如,身高和体重的统计关系,男女是不同的、不同民族是有差异的、可能与年龄有关。如果不进行分类研究,统计的结果就会与样本的选取有很大关系。但分类研究也会遇到一个困难:遭遇组合爆炸,数据再多都不够用。这时,“领域知识”就会发生作用:

    认定一个结论成立的办法,是确认它的“可重复性”。在许多情况下,“可重复性”指的是在各种分组下都成立的结论:最好能在不同时间分组中也能成立。分组越多、分组的维度越多、结论的可靠性越高。

    但具有“可重复性”的结论,往往只在一定的范围内成立。在很多情况下,“明确结论成立的范围”也是数据分析的重要内容。

    如何分组、如何确定范围、如何构筑逻辑链条、数据结果的解读、数据结果与领域知识的融合,都是重要的能力。事实上,根据领域知识,常常用于构造证据链、进行有效的数据选取和分组。

    在精密论证时,我们就会发现:基础数据的质量很重要。因为许多干扰就来源于数据本身。从某种意义上说,数据的采集方法和环境不同,就是不同的数据。

    在构建数据分析体系的过程中,也会发现,企业经营的数据分析也确实需要一个可展示的平台,实时展示业务,有问题就优化更新。

    FineReport 数据决策系统

    7、关于预测数字

    许多问题分析的目的得到一个数字:如钢的强度、用电量、人口数量、钢产量。这类问题的特点之一是:最终的结果是各种影响因素相加得到的。

    对于这种问题,我的观点是:要想得到可靠的结果,一定要拆成若干子问题来分析。其中,各个子问题要尽可能利用规律性的结果来分析。我认为:把人的认识和数据用到极致的时候,才能得到最好的结果。随便地建立回归模型是不懂数据的表现。

  • ?

    十种常用的数据分析方法

    远望

    展开

    道家强调四个字,叫“道、法、术、器”。

    层次区别:

    “器”是指物品或工具,在数据分析领域指的就是数据分析的产品或工具,“工欲善其事,必先利其器”;

    “术”是指操作技术,是技能的高低、效率的高下,如对分析工具使用的技术(比如用Excel进行数据分析的水平);

    “法”是指选择的方法,有句话说“选择比努力重要”;

    “道”是指方向,是指导思想,是战略。

    在数据分析和产品、运营优化方面,数据分析方法是其核心,属于“法”和“术”的层次。

    那么如何做好数据分析呢,今天我们来讲讲互联网运营中的十大数据分析方法。

    01 细分分析

    细分分析是分析的基础,单一维度下的指标数据的信息价值很低。

    细分方法可以分为两类, 一类逐步分析, 比如:来北京市的访客可分为朝阳,海淀等区; 另一类是维度交叉, 如:来自付费SEM的新访客。

    细分用于解决所有问题。

    比如漏斗转化,实际上就是把转化过程按照步骤进行细分,流量渠道的分析和评估也需要大量用到细分的方法。

    02 对比分析

    对比分析主要是指将两个相互联系的指标数据进行比较,从数量上展示和说明研究对象的规模大小,水平高低,速度快慢等相对数值, 通过相同维度下的指标对比,可以发现,找出业务在不同阶段的问题。

    常见的对比方法包括: 时间对比,空间对比,标准对比。

    时间对比有三种: 同比,环比,定基比。

    例如: 本周和上周进行对比就是环比;本月第一周和上月第一周对比就是同比;所有数据同今年的第一周对比则为定基比。通过三种方式,可以分析业务增长水平,速度等信息。

    03 漏斗分析

    转化漏斗分析是业务分析的基本模型, 最常见的是把最终的转化设置为某种目的的实现,最典型的就是完成交易。但也可以是其他任何目的的实现,比如一次使用app的时间超过10分钟。

    漏斗帮助我们解决两方面的问题:

    在一个过程中是否发生泄漏,如果有泄漏,我们能在漏斗中看到,并且能够通过进一步的分析堵住这个泄漏点。

    在一个过程中是否出现了其他不应该出现的过程,造成转化主进程收到损害。

    04 同期群分析

    同期群(cohort)分析在数据运营领域十分重要,互联网运营特别需要仔细洞察留存情况。 通过对性质完全一样的可对比群体的留存情况的比较,来分析哪些因素影响用户的留存。

    同期群分析深受欢迎的重要原因是十分简单,但却十分直观。 同期群只用简单的一个图表,直接描述了用户在一段时间周期(甚至是整个LTV)的留存或流失变化情况。

    以前留存分析只要用户有回访即定义为留存,这会导致留存指标虚高。

    05 聚类分析

    聚类分析具有简单,直观的特征, 网站分析中的聚类主要分为:用户,页面或内容,来源。

    用户聚类主要体现为用户分群,用户标签法;页面聚类则主要是相似,相关页面分组法;来源聚类主要包括渠道,关键词等。

    例如: 在页面分析中,经常存在带?参数的页面。 比如: 资讯详情页面,商品页面等,都属于同一类页面。简单的分析容易造成跳出率,退出率等指标不准确的问题,通过聚类分析可以获取同类页面的准确数据用于分析场景。

    06 AB测试

    增长黑客的一个主要思想之一,是不要做一个大而全的东西,而是不断做出能够快速验证的小而精的东西。 快速验证,那如何验证呢?主要方法就是AB测试。

    比如: 你发现漏斗转化中中间有漏洞,假设一定是商品价格问题导致了流失,你看到了问题-漏斗,也想出了主意-改变定价。但主意是否正确,要看真实的用户反应,于是采用AB测试,一部分用户还是看到老价格,一部分用户看到新价格,若你的主意真的管用,新价格就应该有更好的转化,若真如此,新价格就应该确定下来,如此反复优化。

    07 埋点分析

    只有采集了足够的基础数据,才能通过各种分析方法得到需要的分析结果。

    通过分析用户行为,并细分为:浏览行为,轻度交互,重度交互,交易行为,对于浏览行为和轻度交互行为的点击按钮等事件,因其使用频繁,数据简单,采用无埋点技术实现自助埋点,即可以提高数据分析的实效性,需要的数据可立即提取,又大量减少技术人员的工作量,需要采集更丰富信息的行为。

    如: 重度交互(注册,邀请好友等)和交易事件(加购物车,下订单等)则通过SDK批量埋点的方式来实施。

    08 来源分析

    流量红利消失,我们对获客来源的重视度极高,如何有效的标注用户来源,至关重要。

    传统分析工具,渠道分析仅有单一维度,要深入分析不同渠道不同阶段效果,SEM付费搜索等来源渠道和用户所在地区进行交叉分析,得出不同区域的获客详细信息,维度越细,分析结果也越有价值。

    09 用户分析

    用户分析是互联网运营的核心, 常用的分析方法包括:活跃分析,留存分析,用户分群,用户画像,用户细查等。

    可将用户活跃细分为浏览活跃,互动活跃,交易活跃等,通过活跃行为的细分,掌握关键行为指标;通过用户行为事件序列,用户属性进行分群,观察分群用户的访问,浏览,注册,互动,交易等行为,从而真正把握不同用户类型的特点,提供有针对性的产品和服务。

    用户画像基于自动标签系统将用户完整的画像描绘清晰,更有力的支撑运营决策。

    10 表单分析

    填写表单是每个平台与用户交互的必备环节,优秀的表单设计,对转化率的提升起到重要作用。

    用户从进入表单页面之时起,就产生了微漏斗,从进入总人数到最终完成并成功提交表单人数,这个过程之中,有多少人开始填写表单,填写表单时,遇到了什么困难导致无法完成表单,都影响最终的转化效果。

    以上是常见的数据分析方法,更多应用方法需要根据业务场景灵活应用。

  • ?

    8000字深度总结:运营必懂的33个数据指标与分析方法!

    阿文

    展开

    2017 年马云在某次年会演讲中提到一件让他惊讶的事情。

    在西湖边上他曾看到乞丐在用支付宝收款码进行乞讨,从界面操作上看该乞丐还能熟练应用支付宝提供的「生意通」功能,研究本周的乞讨收入趋势以及单位小时的乞讨金额,从而为自己制定更加高效的的乞讨策略。

    图片来源于网络

    乞丐都在用数据分析来武装自己了,身为互联网从业者,你还敢落后?为了让你感知到数据分析对工作效率提升价值,我们来看一个真实的运营案例。

    你为什么要学习数据分析

    运营研究社在 2018 年以前,公众号图文的推送时间是不固定的,在早上、中午、下班时间、深夜都有过推送,所以相应的阅读量的波动也非常大。

    在今年年初我提出了一个假设“如果把推送时间固定的话,会不会对图文打开率(阅读量)的提升有促进作用”。

    为了检验这一设想,当时我需要解决的第一个问题是:

    “运营研究社的公众号黄金推送时间在哪?”

    我导出了运营研究社过去 1 年里的图文数据,并拿推送时间、打开率、标题 3 个数据字段来构建散点图。

    运营研究社过去半年图文数据

    从过去 1 年的推送时间和打开率的散点分布图来看,高打开率的图文主要集中在中午 12 点、13 点两个个时间段,于是我把将这两个时间点定义成运营研究社图文推送的黄金时间。

    在实践中也证明了“在固定时间推送内容有利用提升打开率”假设是正确的,从阅读数据上的反馈就是我们的阅读量在 3 个月时间里提升了 200%。

    无论是在生活还是工作,数据分析已是一项必备技能。

    我在招聘网站上研究了近 100 个运营岗位的职责要求,用户运营、内容运营、产品运营、社群运营、渠道运营,它们几乎都会在靠前的位置写上这样一行文字:

    “通过有效的数据分析(点击率,访问,转化率等),研究分析用户的需求制定运营策略”。

    为了让你能够掌握最实用的数据分析技能,本篇文章将带你了解数据分析字段与产品指标、熟知数据驱动运营的底层方法。

    “竟巧妇难为无米之炊”,为了让小伙伴们赢在起跑线,下面将开始系统讲解数据分析里的底层元素——数据字段。

    你的基础数据字段足够全嘛?

    2015 年我在百度贴吧在内容运营,当时的我们核心 KPI 是将次日留存率提升至 45%,于是我就想研究用户首次登入的内容消费量与次日留存的关系,以期通过优化内容推荐系统来提升次日留存。

    想法很好,现实却很悲剧,我在给技术同学提数据分析需求时,他们很佛性的回了句:

    “抱歉,我们没有统计用户的内容消费数据”。

    由于缺乏用户的内容消费数据,我当时只能搁置这套数据分析方案了(在补充统计用户消费字段的 1 个月后才最终落地执行)。

    跟大家分享这个案例,主要是希望大家能够理解,数据分析的底层关键支撑是基础数据字段,没有基础数据字段你的任何数据分析方案都执行不了,没有基础数据字段,你再老司机也无法用数据驱动运营。

    所以,为了能够做好数据分析,你需要尽可能全面的提出你的数据字段需求,具体来说包括如下 2 类基础数据字段:

    1)用户信息数据字段

    它指的是用户的社会信息数据,比如姓名、性别、出生年月、籍贯、婚姻、学历,手机、邮箱等字段

    对于电商和母婴类产品来说,还需要基于「用户行为数据」推导家庭类型、家庭人数、家庭小孩标签、工作岗位、所处行业等高级用户信息数据字段。

    2)用户行为数据字段

    用户行为数据字段在记录时的格式通常是User id(哪个用户)+Active(哪种操作)+Time(何时产生)。

    比如今天上午,我在贴吧客户端首页看了一篇与 China Joy 有关的的贴子,并且还对妹子们的颜值留进行了评轮。那么贴吧官方会将我的看贴行为数据,以如下格式被统计下来。

    用户行为数据字段是每一位用户在产品上操作行为的数据记录,不同产品类型需要的需要记录的用户行为是不一样的。

    阅读内容、点赞、评论、分享是社区产品的关键用户行为字段,点击产品、添加购物车、下单、付费、评价是电商产品的关键用户行为字段……

    相比于用户信息数据而言,用户行为数据是数据分析的重中之重,可以基于用户行为数据的处理加工,分析出每天产品的登入用户总量(DAU)、新用户留存以及评论用户总量等产品数据指标。

    促进数据增长指标都有那些?

    有两位内容运营的同学,有一天领导问他们最近的产品情况怎么样。

    其中一位运营说产品表现很不错,每天都有很多人互动和称赞,另外一位运营回答说产品有问题,用户都不怎么会将内容分享出去。

    如果你作为老板,你应该相信谁?

    我想这两位同学你应该都不会相信,甚至还会很生气,因为你的员工没有一点点的数据分析意识。

    现代管理学之父彼得·德鲁克说过一句很经典的话:

    如果你不能衡量它,那么你就不能有效增长它。

    为了能够让数据驱动业务增长,我们需要制定业务的衡量标准,用统一的衡量标准来定义和评价业务,这个统一的标准在数据分析中叫做指标。

    案例中的两位内容运营如果能够以互动率和点赞率、分享率这 3 个产品数据指标来向领导汇报自己的运营工作的话,或许就能够在领导心中留个好印象了。

    了解和使用指标是数据分析思维的第二步,我们需要基于具体的业务需求设定能够驱动产品增长的指标。(Ps:数据指标是由用户基础数据字段处理加工而成)

    按照比较受大家认可的 AARRR 产品增长模型,我们可以将指标分为五大类:拉新指标、活跃指标、留存指标、转化指标、传播指标。

    5个产品的拉新指标

    运营通过渠道投放让“用户”接触到产品,当“用户”觉得产品不错就会去下载它,打开产品发现里边的内容蛮适合自己,“用户”就会注册产品,最终成为产品真正的用户。

    以上是绝大部分运营都会经历的拉新过程,如果你想监控整个过程,并且评估拉新的执行效果,那么你就需要设置如下数据指标。

    1)浏览量

    俗称曝光量,指的是产品的推广信息在朋友圈、搜索引擎、应用商店等渠道渠道中被多少用户看到。与浏览量相对应的是点击量,它们俩的比例在业内有一个专业词汇 CTR(CTR=点击量/浏览量),很多广告平台会用 CTR 来评估广告质量。

    2)下载量

    指的是 App 的安装次数,是衡量拉新效果的结果指标。不过,App 下载其实是一个中间态,为了让产品从曝光到下载有一个高转化,你需要注意应用大小、介绍文案的打磨。

    比如游戏类 App,为了避免怕漫长的下载时间造成玩家流失,会选择让用户下载后以补丁形式完成全部素材的加载。

    3)新增用户

    下载并不是意味着就是用户,如果某个“用户”只下载了并没有注册,那它就是一个无效的用户。对于用户的界定,每个产品是不一样的,大部分的产品是用户注册了 App,就被定义为用户了,比如知乎、微博、小红书、百度贴吧。

    4)获取成本

    用户获取必然涉及成本,而这是运营新手最容易忽略的。目前常见的成本的计算方式有 CPM(千次曝光成本)、CPC(单次点击成本)、CPA(单次获客成本)。

    5个产品的活跃指标

    相比于下载量和用户量而言,在人口红利消失后,大家开始更关注实实在在的东西了——你到底有多少活跃用户。

    用户活跃作为运营的核心工作,不论移动端、网页端或者微信端,都有相关指标可以衡量。

    1)活跃用户数

    DAU 指的是日活跃用户数量,指的是在 24 小时内活跃用户的总量。把时间周期拉长的还有周活跃 WAU 和月活跃 MAU。(MAU 指的是一个月时间周期里去重后的活跃用户总和)

    Ps:与活跃用户相对应的还有流失用户、忠实用户、回流用户,其中流失用户是长期不活跃,忠诚用户是长期活跃,回流用户是曾经不活跃或流失,后来又再次打开产品的活跃用户。

    2)活跃率

    活跃用户数衡量的是产品的市场体量,活跃率看的则是产品的健康。

    比如说某款产品的 DAU 是 100 万,可能你觉得还不错,但是我跟你说它的总注册用户是 1 亿,活跃率仅为 1%,你的感受可能就是这款产品很不错了。

    3)在线时长

    现在数据分析也越来越注重用户行为了,为了深入研究一款 App 的活跃健康度就需要去研究在线时长(它是视频类网站的核心数据指标)。

    不同产品类型的访问时长不同,社交肯定长于工具类产品,内容平台肯定长于金融理财,如果你是做内容的产品的,发现大部分用户访问时长只有几十秒,那么最好分析一下原因。

    4)启动次数

    它体现的是用户的使用频率,用户的日均启动次数越多,说明用户对产品的依赖性越高,活跃度也就越好。

    社交产品的人均启动次数会在 3-5 次之间,是通互联网中在启动次数指标中数值最高的。

    5)页面浏览量

    PV(PageView)是页面浏览量,UV(Unique Visitor)是一定时间内访问网页的人数,用户在网页的一次访问请求可以看作一个 PV,用户看了十个网页,则 PV 为 10。

    PV 是互联网早期 Web 站点时代的活跃指标,也可以理解为网页版活跃。

    5个产品的留存指标

    如果说活跃数和活跃率是产品的市场大小和健康程度的话,那么用户留存衡量产品是否产品能够可持续发展,如果你是早期产品就更应该关注是留存指标了。

    1)用户留存率

    留存率 = 留存用户 / 当初的总用户量

    用户在某段时间使用产品,过了一段时间后,仍旧继续使用的用户,被称为留存用户。

    假设产品某天在某渠道新增了用户 1000 个,第二天仍旧登入产品的用户有 350 个,第 7 天仍旧登入产品的有 100 人,那么这个渠道获取来的用户次日留存率有 35%,那么称七日留存率为 10%。

    Facebook 有一个著名的 40-20-10 法则,即新用户次日留存率为 40%,七日留存率为 20%,三十日留存率为 10%,有此表现的产品属于数据比较好的。

    2)用户流失率

    用户流失率和留存率恰好相反,如果某产品新用户的次日留存为 30%,那么反过来说明有 70% 的用户流失了。

    流失率在一定程度能预测产品的发展,如果产品某阶段有用户 10 万,月流失率为 20%,简单推测,5 个月后产品将失去所有的用户。

    Ps:这里可以引出一个公式,生命周期 = (1 / 流失率)*流失率的时间维度。比如产品的周流失率为 50%,那么平均用户生命周期为 14 天。

    15个产品的转化指标

    运营而言,拉新和活跃、留存都只是手段,最终衡量你工作业绩的是你手上掌握了多少有价值的用户。

    运营就像用户成长路上的指引者,指引者产品里的用户成为能够产生价值的超级用户,即回归商业的本质。

    交易类产品转化指标

    1)GMV

    它是一个虚荣指标,只要用户下单,生成订单号,便可以算在 GMV 里,不管用户是否真的购买了,京东在双十一对外发布的战报是 GMV。

    2)成交额

    成交金额指的是用户付款的实际流水,是用户购买后的消费金额,天猫在双十一对外发布的战报是成交额。

    3)销售收入

    它指的是成交金额减去退款后剩余的金额,属于内部机密数据了。

    如果把上述的三个指标看作用户支付的动态环节,则能再产生两个新指标。

    成交金额与 GMV 的比率,实际能换算成订单支付率,它体现的支付的流畅度;销售收入和成交金额,也涉及到了退款率,它体现的是产品质量。

    4)付费用户量

    在产品里边产生过交易行为的用户总量,同活跃用户一样,交易用户也可以区分为首单用户(第一次消费),忠诚消费用户(持续购买的用户),流失消费用户(流失后又回来的用户)等。

    同时,为了研究用户的付费潜力,你还可以研究下产品的付费用户比例:

    付费用户比例 = 付费用户 ÷ 总注册用户

    5)ARPU

    在单个促销活动中,它指的是每一笔用户订单的收入,总收入/订单数。而在整个产品生命周期中,我们更关注用户平均付费,总收入/用户数。

    ARPU 可以再一步细分,当普通用户占比太多,往往还会采用每付费用户平均收入:ARPPU = 总收入÷ 收费用户数

    6)复购率

    和新增用户一样,获得一个新付费用户的成本已经高于维护熟客的成本。复购率更多用在整体的重复购买次数统计:单位时间内,消费两次以上的用户数占购买总用户数。

    比如运营研究社的技能训练营在第一季度有 1789 个付费用户,购买次数在两次以上的有 657 人,那么我们季度复购率是 36%。

    社区型产品转化指标

    社区型产品的首要目的是将用户聚集在一起,并且引入用户生成内容,它的核心关键在于培养一个能够生成内容的活跃用户社区。

    1)内容生成者

    参与内容生存的用户...

  • ?

    深度解析数据分析、大数据工程师和数据科学家的区别

    李听兰

    展开

    数据越来越多的影响并塑造着那些我们每天都要交互的系统。不管是你使用Siri,google搜索,还是浏览facebook的好友动态,你都在消费者数据分析的结果。我们赋予了数据如此大的转变的能力,也难怪近几年越来越多的数据相关的角色被创造出来。

    这些角色的职责范围,从预测未来,到发现你周围世界的模式,到建设操作着数百万记录的系统。在这篇文章中。我们将讨论不同的数据相关的角色,他们如何组合在一起,并且帮你找出那些角色是适合你自己的。

    什么是数据分析师?

    数据分析通过谈论数据来像他们的公司传递价值,用数据来回答问题,交流结果来帮助做商业决策。数据分析师的一般工作包括数据清洗,执行分析和数据可视化。

    取决于行业,数据分析师可能有不同的头衔(比如:商业分析师,商业智能分析师,业务/运营分析师,数据分析师)不管头衔是什么,数据分析师是一个能适应不同角色和团队的多面手以帮助别人做出更好的数据驱动的决策。

    深度解析数据分析师

    数据分析师拥有把传统的商业方式转换成数据驱动的商业方式的潜质。虽然数据分析师是数据广泛领域的入门水平,但不是说所有的分析师都是低水平的。数据分析师不仅仅精通技术工具,还是高效的交流者,他们对于那些把技术团队和商业团队隔离的公司是至关重要的。

    他们的核心职责是帮助其他人追踪进展,和优化目标。市场人员如何使用分析的数据取帮助他们安排下一次活动?销售人员如何衡量哪种类型人群能更好的争取?CEO如何更好的理解最最近公司发展背后潜在原因?这些问题就需要数据分析师通过数据分析和呈现结果来给答案。他们从事的这些和数据打交道的复杂工作能够为他们所在的组织贡献价值。

    一个高效的数据分析师能够在商业决策的时候摒弃臆想和猜测,并且帮助整个组织快速成长。数据分析师必须是一个横跨在不同团队中的有效桥梁。通过分析新的数据,综合不同的报告,翻译整体的产出。反过来,这也能帮助组织对于自身的发展时刻保持警觉。

    公司的不同需求决定了数据分析师的技能要求,但是下面这些应该是通用的:

    清洗和组织未加工的数据

    使用描述性统计来得到数据的全局视图

    分析在数据中发现的有趣趋势

    创建数据可视化和仪表盘来帮助公司解读说明和使用数据做决策

    呈现针对商业客户或者内部团队的科学分析的结果

    数据分析师对公司科技和分科技的两面都带来了重大的价值。不管是进行探索性的分析还是解读经营状况的仪表盘。分析师都促进了团队之间更紧密的连接。

    什么是数据科学家?

    数据科学家是使用他们在统计学和建设机器学习模型方面的专业技术去进行关键商业问题预测的专家。

    数据科学家也需要像数据分析师一样去清洗、分析、可视化数据。然而一个数据科学家需要在这些技能上更深入也更专业,他们还可以去训练和优化机器学习的模型。

    深度解析数据科学家

    数据科学家能产生巨大的价值,他们处理更多开放式的问题并且利用他们专业的统计学和算法知识发挥更大杠杆的作用。如果说数据分析师专注于从过去和现在数据层面来理解数据的话,那么数据科学家就是专注于做出对未来更可信的预测。

    数据科学家通过有监督学习(分类、回归)和无监督学习(聚类,神经网络,异常监测?)机器学习模型来揭开隐藏着的规律。本质上来说他们是训练那些能让他们更好的识别模型和产出精确预测效果的数学模型的人。

    下面是数据科学家完成的一些例子:

    评估统计学模型来决定分析有效性

    使用机器学习来建设更好的预测算法

    测试和持续提升模型精确度

    进行数据可视化来概括分析的结论

    数据科学家为预测和理解数据带来了一种完全崭新的方式。虽然数据分析师可能也可以去描述趋势和为商业团队传递这些结果。但是数据科学家能剔除新的问题并且可以去建模来做出对新数据的预测。

    什么是数据工程师?

    数据工程师建设和优化系统。这些系统帮助数据科学家和数据分析师开展他们的工作。每一个公司里面和数据打交道的人都需要依赖于这些数据是准确的和可获取的。数据工程师保证任何数据都是正常可接收的,可转换的,可存储的并且对于使用者来说是可获取的。

    深度解析数据工程师

    数据工程师建立了数据分析师和数据科学家依赖的基础。数据工程师对构造数据管道并且经常需要去使用复杂的工具和技术来管理数据负责。不想前面说的两个事业的路径,数据工程师更多的是朝着软件开发能力上学习和提升。

    在比较大的组织中,数据工程师需要关注不同的方面:比如使用数据的工具,维护数据库,创建和管理数据管道。不管侧重于什么,一个好的数据工程师能够保证数据科学家和数据分析师专注于解决分析方面的问题,而不是一个数据源一个数据源的去移动、操作数据。

    数据工程师往往更加注重建设和优化。下面的任务的示例是数据工程师通常的工作:

    为数据消费开发API

    在现存的数据管道中整合数据集

    在新数据上运用特征转换提供给机器学习模型

    持续不断的监控和测试系统保证性能优化

    你的数据驱动的事业路径:

    现在你已经了解了这三种数据驱动的工作了,但是问题还在,你适合哪一种呢?虽然都是和数据相关,但是这三种工作是截然不同的。

    数据工程师主要工作在后端。持续的提升数据管道来保证数据的精确和可获取。他们一般利用不同的工具来保证数据被正确的处理了,并且当用户要使用数据的时候保证数据是可用的。一个好的的数据工程师会为组织节省很多的时间和精力。

    数据分析师一般用数据工程师提供的现成的接口来抽取新的数据,然后取发现数据中的趋势。同时也要分析异常情况。数据分析师以一种清晰的方式来概括和提出他们的结果来让非技术的团队更好的理解他们现在在做的东西。

    最后,数据科学家更倾向于基于分析的发现和在更多可能性上的调查来获得方向。不管是训练模型还是进行统计分析,数据科学家试图去对未来要发生的可能性提出一个更好的预测。

    不管你的特殊的路径是什么,好奇心都是这三个职业最本质的要求。使用数据来更好的提问和进行精确的实验是数据驱动事业的全部目标。此外,数据科学家领域是不断的进化的,你必须要有强大的能力去持续不断的学习。

    有一句话叫做三人行必有我师,其实做为一个开发者,有一个学习的氛围跟一个交流圈子特别重要这是一个我的大数据交流学习群531629188不管你是小白还是大牛欢迎入驻,正在求职的也可以加入,大家一起交流学习,话糙理不糙,互相学习,共同进步,一起加油吧。

深度数据分析

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP