中企动力 > 商学院 > 数据分析参考值
  • ?

    6大主流轮胎7大测试结果出炉,2019年买轮胎参考这个就行

    钱梦易

    展开

    为了了解主流轮胎产品的真正实力,有车以后联合中汽汽车测试中心的专业测评团队,举办了“2018有车以后轮胎大横评”测试。之前,我们已经公布了这6套轮胎在强度测试、滚阻测试、噪音测试、性能等环节中的成绩,今天我们就针对它们的表现来做一个总结。

    参与本次测试的共有6款轮胎,其中米其林与通伊欧都是主打性能的轮胎,而其余四款轮胎主打舒适性。为了保证测试的公平性,这6套轮胎的规格均为225/50 R17,将它们分成舒适组和性能组,具体分组见下表。

    在本次轮胎排行榜项目中,我们对轮胎各项重要性能指标做了逐一测试。具体的测试数据已经汇总到上面的表格中,下面我们就来回顾一下整个测试过程。

    第一项轮胎强度测试,我们在中国汽车技术研究中心盐城汽车试验场进行,在实验室专业的“轮胎强度试验机”上,对这6条轮胎逐一进行了防刺穿实验。该项实验主要检验轮胎的强度是否合格,最终的结果也是令人满意的,6款轮胎均未被刺穿,强度均符合要求。

    第二项滚动阻力测试,同样是在中国汽车技术研究中心盐城汽车试验场的实验室中进行,在专业的脱圈阻力试验机上,测试了这6款轮胎的滚动阻力。在舒适组中佳通的成绩最为出色,在性能组中通伊欧的成绩最好。我们可以将这项成绩的好坏,简单理解为轮胎省不省油,理想状态下轮胎的滚组越低越省油。

    第三项静音性测试,我们转移到了中国汽车技术研究中心盐城汽车试验场的室外,分别以72km/h、74km/h、76km/h、78km/h、82km/h、84km/h、86km/h、88km/h,8个速度进行6款轮胎的通过噪声测试。舒适组中依旧是佳通的表现更好,性能组中则是米其林的表现更好。

    第四项赛道圈速测试,我们转战到了北京专业的锐思赛道,在同一天由专业车手在赛道上驾驶装有6套不同轮胎的2.0T奥迪A4L轿车跑圈。取三个有效计时圈中最快的一圈来进行数据分析。经过测试,舒适组中固特异的表现最好,性能组中米其林的表现最好。

    第五、六项分别是干地、湿地制动测试,在锐思赛道的长直道上,同样是由专业车手驾驶装有6套不同轮胎的2.0T奥迪A4L轿车,在车速超过100km/h后,在干地和湿地两种不同状态下分别进行紧急制动测试。测得舒适组中干湿地制动距离最短的是固特异,性能组中是米其林。

    第七项轮胎切割测试中,我们对这6套轮胎进行切割,观察它们的内部结构,并逐一分析了它们在各自轮胎中所起到的作用。

    从各项测试成绩中可以看到,不同轮胎在测试中的表现各有千秋,因此针对它们的特性,我们也做了逐一的评奖,首先来看舒适组中的四款轮胎。

    获奖原因:御乘系列一直以来都是固特异品牌中主打的高端产品,从本次测试的成绩中可以看到,御乘II代有着极为出色的干、湿地制动性能,同时在赛道圈速上也有着很好的表现,以1分7秒616的成绩在舒适组中排名第一,而且直逼性能组中的两套轮胎。在滚动阻力测试和静音测试中,虽然它的表现没有那么抢眼,但相比于其它对手,也属于同级别中的出色成绩,因此我们将它评为舒适组中最优秀的轮胎,授予它年度舒适轮胎的奖项。

    获奖原因:佳通的GitiComfort F22是一款全新轮胎,搭载了advanZtech领悦科技并采用了独有的柔声降噪技术,综合响度、尖锐度、粗糙度及起伏度等因素对胎噪进行优化,我们这次也算是做了一场轮胎的抢先实测。作为一款主打舒适性的轮胎,它拥有着极为出色的静音性,在全部参与测试的轮胎中,它的静音成绩最低仅有71dB,同时又具有很低的滚动阻力,在节油方面将有不错的效果,因此获得年度静音轮胎的奖项也绝对算得上是实至名归。

    获奖原因:马牌的UC6系列是一款专门为亚洲路况开发的轮胎,它在滚动阻力测试中的表现十分抢眼,滚动阻力系数仅为7.5,更低的滚动阻力无疑会为车辆带来更低的油耗。同时从它在其它各项测试中的成绩也可以看到,并没有明显的短板,因此它获得了年度环保轮胎。

    获奖原因:邓禄普VEURO系列轮胎一直主打的都是为车辆“提供高端舒适的驾驶感受”,从这次测试中的成绩也可以看到,它在静音性上的表现十分出色。不过比起还未上市的佳通GitiComfort F22还是要略逊一筹,毕竟是老产品与新产品的对比,所以这样的结果也算是情理之中。尽管无缘年度静音轮胎,但在轮胎强度测试和轮胎切割测试中,我们看到这套来自邓禄普的VEURO VE 303轮胎,除了优异的静音性之外,它还拥有着很出色强度以及轮胎结构,因此它获得了年度安全轮胎。

    获奖原因:对于米其林PILOT SPORT 4的运动性能其实无需多言,众多性能车都已经把它作为出厂时的标配,并且如今已经是它的第四代产品,性能也再一次得到提高。全场最快的赛道圈速以及领先第二名近4米的干湿地制动距离,都是它出色性能的最好体现,因此年度性能轮胎的称号非它莫属。

    获奖原因:通伊欧PROXES SPORT在测试中展现了它优异的性能,在赛道上仅落后第一名0.1秒,领先第三名近0.6秒的圈速成绩,就是它实力很好的证明。在干/湿地的制动性能上,它也有着十分出色的表现,同时在滚组测试和静音测试中,也有着不俗的表现。因此我们将年度全能轮胎的奖项授予了它。

    那到此为止“2018有车以后轮胎大横评”项目也就画上了句号,希望我们的评选可以帮助你更好的为爱车选择到一款轮胎,当然如果还是有什么想了解的,可以通过评论区留言给我们,我们会尽力回答。

  • ?

    什么样的人比较适合做数据分析?

    Zang

    展开

    我觉得无论什么工作兴趣最重要,要做数据分析师最基本的就是不讨厌数字,如果你跟他讲那个指标是通过怎么样的乘除加减得到的,他会觉得不耐烦,那么显然他不适合做数据分析;如果对数据较敏感,能够一眼发现异常值,数据分布情况,当然是最好的。

    再则就是逻辑性,可以让他试试爱因斯坦的那道经典的逻辑题,看看能否解出来,需要多久;逻辑思维对数据分析尤其重要,不然会被各种指标的定义规则、与业务的联系纠结死,逻辑思维好的人写SQL等数据处理脚本也会更加高效。

    接着是业务理解能力,最简单的就是让他定义下网站的目标是什么,哪些指标可以作为KPI,用户从进入网站到达成网站目标的整个过程是怎么实现转化的,能否画出业务流程图。(宏观层面,不要深入细节)

    如果偏技术则需要懂一些数据库结构和SQL,如果偏展现需要考验下对图表的掌控能力,什么时候用什么图表合适,甚至如何配色。

    最后就是细心、耐心和交流能力,做数据分析有时会很纠结,细心和耐心是必需的,好的交流能力可以让数据分析师更好地阐述清楚各类问题。

    这些都是比较基础的东西,也是短期难以培养起来的技能。至于另外业务相关的一些知识,可以通过培训获取,问一个未接触过你的网站业务的人一些业务知识其实有些不公平,其实如果具备上面几点,一旦熟悉网站和业务之后,一定会成为优秀的数据分析师。

    ——谷芬芬

    专业内的要求基本就是对数据的意识和一些技能的掌握。下面具体说说从一些非专业内要求的方面出发,有哪些方面能表现这个人更适合数据分析。

    首先是看到数据有兴奋感的人。有兴奋感说明你有兴趣,那说明很会有意愿把数据分析好。

    其次是愿意学习的人。你分析的内容永远不会一尘不变,即使你分析的主题是相对固定,但业务是变化的,你需要不断的学习业务,同不同人沟通,吸收别人的观点。所以分析师一定要报着学习的态度。

    然后是逻辑思维较强的人。数据分析师想要把你的分析好,一定要有结论思维。

    还有就是较强的表达与沟通能力。因为数据分析最终价值的实现,一般来说不会是分析师亲自去制定或者实施。所以你一定很有条理、逻辑清晰向别人表达,让业务方认识到你分析结果的价值,从而影响业务方去愿意使用你从数据中得到的观点。

    ——欧阳帅

    觉得还是应该先看清楚自己的未来的方向吧~

    我有不少朋友 非数学/计算机/统计学 专业毕业的朋友走的是这个方向,数据相关,非技术路线,更偏向于市场方向,对技术的要求只是Excel、PPT,最多要求SPSS,很少要求会写SQL。这条路线看起来比较高大上,可以走外企路线。

    数据分析师方向,很多读数学、统计学、计算机的童鞋会选这个方向,终极目标都是成为数据中心的负责人。中间有2个分叉,一条是从数据分析师到数据产品经理,这个路线最近很流行,主要是结合了数据分析和产品经理的能力。一条是高大上一点的数据挖掘方向,这条路线要求比较高,但薪资也高。当然能走数据挖掘路线是很多数据分析师的梦想,但算法和代码实现能力不是谁都能掌握的。.

    根据你自己想走的路,加上自己的技能点。

    ——张锦华

    想了解更多相关内容,记得持续关注我们哦。

    如果你觉得有点意思,请有秩序的评论、转发、收藏。

  • ?

    数据分析的九种方法

    Les

    展开

    微信公众号发展至今,整体的产业已趋向成熟,市场对其运营框架也有了大致的共识,基本上可分为:内容运营、活动运营、用户运营,以及渠道运营和数据运营等几大模块。每个不同的运营模块,它们各自独立,同时又相互地影响。

    本文侧重于对运营初学者来说,提供一套简易、有效的数据运营方法论。在开展数据运营工作之前,我们首先得了解数据在整个公众号运营工作中,究竟充当着什么样的角色?

    我认为:“数据是运营的基础,就像一条绳索,贯穿整个运营工作。它既是运营KPI考核的直接呈现方式,同时也是运营方向的理论支撑点”

    在新媒体的数据运营中,数据分析是至关重要的步骤,而数据分析有大概九类方法,你们知道吗?今天小天就来带大家了解一下这些干货吧!

    数据分析的九类方法:直接评判法 — 对比分析法 — 结构分析法 — 分组分析法 — 平均分析法 — 矩阵分析法 — 漏斗图分析法 — 雷达图分析法 — 回归分析法

    1.直接评判法

    直接评判法即根据经验直接判断数据的好坏并给予评判,通常用于内部过往运营状况评估,如评估近期阅读量是否过低,评判近期销售量是否异常,评估当日文章推送量是否正常。

    直接评判法有两个必要的条件:一是运营者有一定的新媒体运营经验,能够对跳出率,阅读量等有正确的评估;二是经过加工处理的数据足够直观,可以直接代表某项数据的优缺点。

    2.对比分析法

    对比分析法,是将两个或两个以上的数据进行对比,分析差异进而揭示这些数据所代表的规律。

    对比分析法包括横向比较及纵向比较。横向比较即同一时间下不同总体指标的对比,如今日头条同领域作者文章阅读量对比,粉丝数对比等;纵向比较不同时间条件下同一总体指标的对比,如本月文章阅读量与上月阅读量进行对比,本月粉丝增长数与上月增长数进行对比等。

    通过对比分析,可以直接观察到目前的运营水平,一方面找到当前已经处于优秀水平的方面,后续予以保持;另一方面及时发现当前的薄弱环节,重点突破。

    3.分组分析法

    分组分析法是指通过一定的指标,将对象统计分组并计算和分析,以便于深入了解所要分析对象的不同特征,性质及相互关系的方法。

    分组分析法遵循相互独立,完全穷尽的枚举分析法原则。所谓相互独立,即分组之间不能有交叉,组别之间具有明显的差异性,每个数据只能归属于某一组;所谓完全穷尽,即分组中不要遗漏任何数据,保持完整性,各组的空间足以容纳总体的所有数据。

    4.结构分析法

    结构分析法是在统计分组的基础上,将组内数据与总体数据之间进行对比的分析方法。结构分析法分析各组部分占总体的比例,属于相对指标。

    例如,新媒体运营团队可以统计粉丝所在的地域分布,统计出各个地方粉丝的占比情况,此情景便属于结构分析法。

    5.平均分析法

    例如,在分析今日头条的文章阅读量时,借助Excel导出的数据可以快速找到阅读量大于平均值的文章,接下来可以继续挖掘这些文章的标题,排版,配图等规律,便于后续内容质量的提升。

    6.矩阵分析法

    矩阵分析法是一种定量分析问题的方法,它是指以数据两个重要指标作为分析依据,并将这两个指标作为横,纵坐标轴,构成四个象限,从而找出解决问题的办法,为运营者提供数据参考。

    例如,某餐饮企业的大众点评评价分析,可以借助四个象限“紧急且重要,重要但不紧急,紧急但不重要,不紧急也不重要”进行矩阵分析,并重点处理“紧急且重要”的事项。

    7.漏斗图分析法

    漏斗图分析法因展现形式如漏斗,故而得名。漏斗图可以对文章阅读量,产品购买量等情况进行逐层分析,展示整个关键路径中每步的转化情况。

    重要强调的是,单一的漏斗图难以衡量各个环节的好坏,运营者可以结合本节介绍的“对比分析法”,对同一环节不同时间对比,评估运营效果。

    8.雷达图分析法

    雷达图常用于指数分析,即通过对新媒体账号的内容质量,领域专注等不同维度的计算而得出的客观评分结果。分数越高,代表账号的质量越好。可以利用雷达图进行分析的指数,包括今日头条指数,大鱼号星级指数,百家号指数等。

    9.回归分析法

    回归分析法是通过研究事物发展变化的因果关系来预测事物发展走向,它是研究变量间相互关系的一种定量预测方法,又称回归模型预测法或因果法。

    例如,将今日头条粉丝数据导出到Excel表格,对累计粉丝数进行一元线性分析,就可以尝试预测某个时间的粉丝量。

  • ?

    一个数据分析指标库到底是如何炼成的?

    舍尔沙勒

    展开

    文| 傅一平原文自:与数据同行

    在数据管理领域,我们通常将数据分为:主数据、交易数据、参考数据、元数据和统计分析数据(指标), 指标是BI里面核心的概念,是一个企业数据运营关注的核心数据,一般以KPI和报表的形式体现。

    从实践来看,一个企业要进行数据治理,涉及了架构、安全等诸多层面,但最迫切的是提升数据质量,其中指标质量则是重中之重,一般业务上90%以上关于数据的疑问都从指标的质疑开始,只要你从事数据相关工作,就应深有体会。

    “这个指标好像跟业务发展实际不符,快去查查”,估计这是报表取数人员听到的最多的一句话了。

    笔者就来谈谈如何从根本上去提升指标的数据质量,即实现指标的标准化,作为一个数据管理人员,不管你有多少能力,曾经解决了多少问题,当过多少回救火英雄,都应该从更为长远的角度来思考这个问题。

    指标标准化的核心价值在于实现“书同文,车同轨”,即通过针对指标的一系列管理过程,去提升指标准确性、一致性、敏捷性及开放性,在以前的文章《如何才能做好一张报表》中对此有详细的阐述。

    DAMA将数据治理放到核心地位,指标的标准化就是个典型的数据治理问题,治标是容易的,治本的代价则太高,但如果要实现进阶,还是要站的高一点,多思考一下,想想是否有更好的方法,就从笔者多年前做过的指标标准化项目开始吧,分为组织保障、报表梳理、指标整合、实现方式、功能架构、可视化引擎及管理流程等七个方面。

    1、组织保障

    指标库这类数据管理项目,或称BI项目,一般业务部门参与的力度是不大的,这是大多BI项目实施效果不佳的一个深层次原因。

    DAMA提到要实施数据治理活动,跨部门的数据治理委员会等是关键的组织,的确是这样,指标跟全公司每个单位都相关,对于其进行规范化改造当然应该获得大家的一致同意。

    可惜的是,大多企业没有这个理想条件,也不会有数据治理委员会,在数据还未成为真正的实质性资产前,比如纳入财务部的资产目录,很少有企业会设立这个数据组织,因为效益不明显,因此,哪个企业都不大可能为指标出一个规范并且通令全公司贯彻执行,对于数据管理人员,指标库这个事情也许意义不小,但对于全公司意义则小了,这是现状。

    在没有公司层面的组织保障前,数据管理人员或BI部门大多得靠自己,通过自己来推动事情往前走, 这是应有的态度,你不提,公司也没有任何人会提,毕竟你是最大受益者,实施指标库这个事情非常复杂,谁都没有成功的把握,秉持小步快跑,试点探索的原则是不错的。

    笔者的这个指标库项目获得了分管领导的强力支持,这是项目能进行的现实组织保障,其实这类管理项目设立之初,很难让业务部门和一线人员马上认识到其价值并充分参与进来,这个沟通管理成本太高了,但无论如何,一个数据治理项目能否成功,公司的支持是第一要务,不仅仅是IT部门的事情,DAMA的很早就在《DAMA数据管理知识体系指南》明确了数据治理的组织要点,以下是DAMA的数据治理组织架构图,非常超前:

    当然笔者觉得现实的组织演进也许如下图更合适,但道理是一样的,相关利益方需要对这个事情达成共识:

    2、报表梳理

    指标的主要表现形式是报表,因此第一要务就是报表梳理,公司的报表浩如烟海,因此这个项目设立之初就限制了范围,主要针对一线市场部经理、终端管理、流量管理三类核心角色,共梳理了相关的39个彩信、48份邮件通报及数据集市上的733张报表。(下图是用excel,下载企业大多用帆软、水晶一类的报表工具)

    3、指标整合

    各类报表及相关指标表达各不相同,梳理前应该给出一个描述指标的标准框架,包括指标大类、子类、维度、周期、归属、命名规范等等,曾经由于框架漏了一些要素导致返工现象,这个顶层设计一定要做好,以下是示例:

    命名规范:业务限定词+业务名称+量值限定词+量值描述(量、收、用)

    举例1:两网有效用户到达数

    举例2:自建有线宽带出账用户数

    下图列出了大致的梳理步骤,主要以省公司报表和彩信KPI为基础确定基准指标,各地市指标剔除个性指标后,合并到省公司的基准指标中,形成本次的最终指标范围。

    全省指标共计6841个(未剔重),经过归并整合,得到基础共性指标2306个,如下图所示:

    此项工作耗时巨大,以下是成果的示意:

    4、实现方式

    根据指标性质不同可以分为3类,即基础指标1046个、计算指标652个和通用营销类指标303个。

    5、功能架构

    为了支撑指标快速,标准化实现,通过增强数据管理平台来实现指标的快速开发、部署和管理,主要包括指标信息维护、指标开发、运维管理、指标质量管理等功能。

    比如指标库每月需要新增超过9. 5亿行的数据,存储周期按12+1,即123亿行,以传统关系型数据库的查询能力无法支撑,这里就采用Hbase架构支撑海量指标的快速查询。

    6、可视化引擎

    为了支撑指标组装报表与配置报表的快速开发,使用数据可视化引擎产品,主要包括指标组装、报表开发、报表展现功能,现在的这类产品很多了,但定制化给予一个创新性项目更大的自由度。

    指标组装报表工具是区别传统基于SQL配置报表的灵活度更高的报表配置方式,主要提供基于指标选择组装生成报表。

    7、管理流程

    指标的建设只是走完了数据治理的第一步,为了确保指标库长期可用,必须要有一套针对的指标管理机制和流程,否则建设的结束就是混乱的开始,理想的做法当然是发布一套公司级别的指标管理规范,但这个时候时机往往并不成熟,比如系统可用性到底如何,因此,我们当时就确立了一个简单原则,一条开发铁律:不重复开发,能用指标实现的不允许单独开发报表,当然这非常考验数据管理的艺术,极大依赖于团队的业务和数据能力,但有主见的数据管理团队一定要懂得如何与业务人员进行博弈,记得你才是全公司数据的管理者,而不仅仅是个开发者。

    笔者在关于指标库的实现简要谈完了,但我对于大多企业搞指标库却是持悲观态度的,传统BI部门面对浩海的数据需求时,往往是没有管理原则的,因为公司对你的数据管理授权是不明确的,我们不得不以牺牲长远来满足当前,其实BI每接收一个不规范(比如胡乱的指标命名和定义)的报表需求就要承担由此带来的管理成本,而不仅仅是开发成本,这为后续数据管理的混乱埋下了祸根。

    但存在的又是合理的,因为搞个指标库在开始的时候,无论是管理及运维成本都不低,关键是短期来看效益还不明显,这也许是成功案例不多的一个原因。

    因此,当我们在抱怨业务指标口径一塌糊涂的时候,要记得是企业没有数据管理的原则导致了这个现象,也是你的不作为导致了这个现象,这跟公司的文化、机制及流程是息息相关的,顶层设计没解决,也许只能将就了,或者,你就要付出百倍的努力去改变或优化这个设计吧,这需要巨大的决心和毅力。

    DAMA谈数据治理首当其冲谈组织设置,显然是非常睿智的,奇怪的是在知乎上关于DAMA数据治理的讨论几乎没有,这倒是值得思考的问题。

  • ?

    撰写数据分析报告的常用套路!

    曼文

    展开

    数据分析报告是通过对事物数据全方位的科学分析来评估其环境及发展情况,为决策者提供科学、严谨的依据,降低风险。

    要注意四大原则,规范性-业内专业术语,重要性-选取关键指标,谨慎性-真实完整科学可靠,创新性-新的研究模型和分析方法。

    数据分析报告三大作用,展示分析结果,严重分析质量,提供决策参考。

    数据报告常用套路请看下文:

    一 、基础分析指标

    1 平均数:算术平均数,即一组数据的算数平均值,代表总体一般水平,掩盖总体内各单位差异。

    2 绝对数:客观现象总体在一定时间内,地点条件下的总规模,总水平的综合性指标。

    3 相对数:两个有联系的指标对比计算而得到的数值,用以反映客观现象之间的数量联系程度的综合指标。基本公式= 比较数值(比数)/基础数值(基数)。

    4 百分比:相对数中的一种。

    5 百分点:不同时期以百分数的形式表示的相对指标的变动幅度。1个百分点=1%。

    6 频数:一组数据中个别数据重复出现的次数,是绝对数。

    7 频率:每组类别次数与总次数的比值,代表某类别在总体中出现的频繁程度。,是相对数。

    8 比例:在总体中各部分数值占全部数值的比重,反映总体的构成与结构,是相对数。

    9 比率:不同类别数值的对比,反映一个整体中各部分间的关系,是相对数。

    10 倍数:一般表示增长或上升幅度,不用于减少或下降,是相对数。

    11 番数:指原来数量的2的N次方倍。翻一番是原来的2倍,是相对数。

    12 环比:与前一个统计期比较所得的数值,反映事物逐期发展的情况。

    13 同比:与历史同时期进行比较所得数值,反映事物发展相对情况。

    二、常用表达术语

    1) 现状:

    数据显示。。。

    数据同时表明。。。

    从图表可以看出。。。

    据。。。报告数据显示。。。

    显然。。。不难发现。。。

    基于。。。我们判断。。。

    研究发现

    值得注意的是

    综上所述

    2)对比

    环比、同比增长、下降

    相对较好(高)、较差(低)

    相比明显增长/略微下滑

    数据增幅、降幅达

    进入高速发展期

    月均增长

    与目标的差距主要体现在

    离目标进度还有。。。差距

    排名前三。。。依次为

    对比来看。。。增长不足。。。后期表现乏力

    3)构成

    市场占有率达

    主要集中在

    数据呈。。。分布

    其中。。。主要是。。

    4)趋势

    从上表/图可以看出

    对比数据可得

    趋势平缓、回落

    数据呈上升趋势

    5)原因

    数据上涨/下跌的原因如下:

    主要原因包括:1)2)3)

    主要因。。。引起

    6)预测

    保守预测、估计

    如果按照。。。。的速度发展。。。预计(预估)。。。能完成(完不成)

    7)建议

    有分析得出,需要改善的地方

    未来需要优化/扩大的地方如下:

    后期应着重

    建议一方面。。。另一方面

    建议。。。以期达到。。。目的

    提高。。。改善。。。缓解。。。最终

    三、总结

    只有明确分析的目的,才能写好分析报告,套路常常有,用心才最重要!

    欢迎关注“云途数据”,回复关键词“产业报告”,免费下载《2017大数据产业报告》

  • ?

    什么是数据分析、数据分析本质又是什么?

    齐迎海

    展开

    一般情况下,我们所说的分析是指,使用大量数据、统计和定量分析、解释和预测以及基于事实的管理来推动决策过程与实现价值增生。

    根据分析的方法和目的,分析可以被划分为描述性分析(descri-ptive analytics)、预测性分析(predictive analytics)和规范性分析(prescriptive analytics)。描述性分析包括数据收集、整理、制表、制图以及描述正要研究的食物的特征,这类分析以往被称为“报告”。描述性分析可能非常有用,但它不能解释某种结果出现的原因或者未来可能会发生的事情。

    预测性分析不仅可以对数据特征和变量(可以假定取消范围的因素)之间的关系进行描述,还可以基于过去的数据预测未来。预测性分析首先会确定变量值之间的关联,然后基于这种已知的关联预测另一种现象出现的可能性,比如在看到某个广告后,一位消费者可能会去买产品的可能性。虽然预测性分析中的预测是基于变量之间的关系做出来的,但这不代表预测性分析中都需要明确因果关系。事实上,准确的预测并不一定与需要基于因果关系。

    规范性分析是更高层次的分析,如实验设计和优化等。就像医生会在出处方建议患者采取什么行动一样,实验设计试图通过做实验给出某些事情发生的原因。为了能够在因果关系研究中信心饱满地做出推断,研究人员必须妥善处理一个或多个独立的变量,并有效控制其他的变量。如果处于试验环境下的测试组的表现大大优于照相,决策制定者就应该立即推广这种实验环境。

    优化是规范性分析采用的一种方法,指试图识别出一个特定变量和另一个变量之间理想的关系水平。例如,我们可以能会对识别最有可能让产品实现高收益的价格感兴趣。同样地,优化这种方法能够识别出使了零售企业最大限制避免缺货情况的库存水平。

    根据分析采用的方法以及收集和分析的数据类型,我们可以将分析分为定性分析(qualitative analysis)和定量分析(quantitative analysis)。定性分析的目的是深入了解某种现象的根本原因和诱因。非结构化数据通常是从少数非代表性案例中收集而来,并进行了非统计性分析。定量分析是分析的最初阶段,他通常是探索性分析的有效工具,定量分析是指通过统计、数学或者计算的方式对现象进行系统的实证研究。通常情况下,结构化数据是从大量典型案例中收集而来,并进行统计分析。

    为了服务于研究者的不同研究目的,存在以下几种类型的分析:

    *统计学:收集、整理、分析、说明和呈现数据的学科;

    *预测:根据已有数据,预测一下一些感兴趣的变量在未来某个特定的时间点的情况;

    *数据挖掘:通常使用算法和统计技术,自动或半自动地提取大量数据中未知的有趣模式;

    *文字挖掘:用类似数据挖掘的方式从文本中得模式和趋势的过程;

    *优化:在同时满足约束条件的情况下,按照某些标准利用数学方法来寻找最优的解决方案;

    *实验设计:给各组随机分配被试。然后使用测试组和对照组来推导出特定结果中存在的因果关系。

    虽然此处给出了一些列常用的分析方法,但在使用过程中会不可避免地出现相当大的重叠。例如,回归分析(regression analysis)是预测分析中最常用的方法,与此同时,他也是统计学、预测和数据挖掘中常用的方法。此外,时间序列分析(time seties analysis)是用于分析数据随时间变化的一种具体统计方法、在统计学和预测中经常被用到。

  • ?

    活跃用户数据分析的4项衡量标准

    兰杜拉斯

    展开

    通过1张数据分析表格帮你建立活跃用户的数据统计及分析方法。

    一、你对活跃用户的定义是什么?

    前几天在一个3-5年运营人的群里,突然聊到了活跃用户统计的问题,突然发现很多人对于什么是活跃用户的概念还很模糊,大多数运营数据分析平台上都直接给出了一个活跃用户的数字,那么什么是活跃用户呢?这里我们继续通过虚荣指标和可执行指标这2个指标的差异来区分下对活跃用户的认知。

    虚荣指标:阶段时间内凡有访问行为的用户都可以记为活跃用户;

    可执行指标:阶段时间内用户产生了代表对产品认可程度的高频行为才算活跃用户,如每日多次访问、收藏、留言、点赞、付费等相关行为代表用户对产品的认可程度。

    虚荣指标的定义方式只能看到一个表面繁荣的数字,数字背后并不代表任何用户特征,而通过可执行指标对用户进行筛选,对高访问次数、高访问时长、高留言次数、高购买次数等不同特征的用户进行统计,一方面提升非活跃用户的相关行为,另一方面活跃用户是做裂变活动时的目标种子用户。

    概括来说,增长黑客在衡量“活跃度”时,会通过访问次数、访问时长、收藏指数和相关影响因素几个维度来判断用户的活跃情况,并按连续活跃天数和阶段内任意活跃天数2个时间维度对用户活跃度进行整体分析。

    二、这张活跃用户统计表格要怎么用?

    这张表格横向分为3个活跃度评价因素,分别是访问次数、访问时长、收藏指数,同时对活跃度的影响因素单独计算,这个表格里列出了领红包、打卡、等级、来源渠道4种影响因素,可以根据用户行为特征具体计算。

    1.通过日访问次数评估用户活跃度

    访问次数代表用户每日使用产品的频次,我们需要对所有访问次数大于1次的用户做平均访问次数的计算,或者设定一个固定值,例如连续7天每日用户平均访问次数为3-5次,那么4就可以做为固定值,或者运营者认为每日访问次数大于2次就可以计算为活跃用户,那么2就可以做为固定值。

    基于访问次数的平均值或固定值(A),我们需要对每日大于1次,小于A*50%的用户,每日访问次数大于A*50%并小于A的用户,以及日访问次数大于A的用户进行统计。

    统计的目的在于通过访问次数将用户分层,高于A值的用户是绝对的活跃用户,对于没有达到A指的用户可以通过运营活动重点提升日访问次数。

    其实,无论是访问次数A值还是下面说到的使用时长B值、收藏指数C值,在增长黑客的数据分析中,都代表着用户下一步关键行为指标,例如可以通过分析付费用户的日访问特征、使用时长,或者下单前浏览过几个页面,来确定这个关键行为指标,并以此做为目标。

    当然,这是比较复杂的计算方法,刚接触数据分析的同学可以按照求平均值或设定固定值的方式来确定A值。

    2.通过日访问时长评估用户活跃度

    与通过访问次数计算用户活跃度的方式相同,找出用户使用时长的衡量值B,通过B对用户进行筛选分组。

    3.通过“收藏指数”评估用户活跃度

    所谓收藏指数是指真正体现产品价值的用户使用行为,与产品的北极星指标相关。一般来说,用户产生收藏行为代表着对产品内容的认可,如某篇文章,某件商品,所以诸葛io将其定义为“收藏指数”。

    在实际统计中,“收藏指数”需要根据产品所在行业进行针对性定义,例如社区类产品要统计有过发帖、回帖行为的用户,资讯类产品要统计日浏览文章大于5篇(举例)的用户,电商类产品要统计日浏览商品大于5件(举例)的用户。

    同样,通过对“收藏指数”的定义,计算出相关用户行为的衡量标准,我们称其为C值,在衡量维度上,C值为活跃用户必须满足的条件,继而可以筛选出高出C值50%、100%甚至更多的用户数量。

    4.找出用户活跃度的影响因素

    通过活动、打卡等运营行为,会对用户的活跃度有所影响,在影响因素这项分析上,需要统计不同特征用户的活跃度人数,例如领取红包后1-3天的活跃用户变化情况,与非领取红包用户的活跃度进行对比,再比如连续打卡3天、5天的用户在活跃度上的变现差异。

    以上是4项用户活跃度的衡量方式,在统计时,首先需要筛选出满足条件的用户数量,然后计算满足条件用户在整体用户中的占比。

    除衡量活跃用户外,还需要统计1日、3日、7日、30日活跃用户数据,在按日期的分析上,诸葛io建议通过2种日期统计方式:

    一种是连续1日、2日、3日……30日活跃用户占比,连续活跃用户有发展为种子用户的潜力,需要重点维护;

    另一种是阶段时间内任意天数的活跃情况,例如7日活跃用户中任意1天、2天、3天活跃的用户占比,用于区分同样阶段时间内的不同活跃度指标。

    总结:增长黑客和精细化运营的概念在国内备受推崇,而活跃用户是增长裂变的基础,活跃用户分析的目的在于通过活跃度指标发现优质用户,并对优质用户建立相关用户群组,进行重点维护。

    以收藏指数为例,加入购物车商品的数量越多,用户购买转化的可能性就越大,筛选出加入购物车1件、3件、5件等不同数量的用户,针对不同用户设计营销活动,例如加入购物车5件以上商品,在常见的抽奖活动中就可以设计“购物车商品免单”的活动主题,但购物车商品面单对于加入购物车1件商品的用户吸引力并不大。

    活跃用户统计一方面是查看用户对产品使用的反馈,评估产品的用户健康度,另一方面通过活跃用户统计实现用户分组的精细化运营,为相关运营策略提供参考依据。

    |内容来源: 诸葛io数据教练 版权归其所有 百家号-新社汇and微会动袁帅 转载发布 侵权告知删

    百家号-【袁帅数据分析运营】运营者:袁帅,会展业信息化、数字化领域专家。新社汇平台联合创始人,微会动平台创始人。永洪数据科学研究院MVP。认证PMP项目管理师、数据分析师、网络营销师、SEM搜索引擎营销师、SEO工程师、中国电子商务职业经理人。畅销书《互联网销售宝典》联合出品人。

  • ?

    数据分析师常用的十种数据分析思路,你都知道吗?

    雍采白

    展开

    随着互联网的发展、业务逻辑越来越复杂,数据的分析也就变的越来越重要。对数据的分析可有效避免逻辑的混乱,防止在繁杂的业务理解上逻辑不清、判断错误。

    道家曾强调四个字,叫“道、法、术、器”。

    层次分别为:

    “器”是指物品或工具,在数据分析领域指的就是数据分析的产品或工具,“工欲善其事,必先利其器”;

    “术”是指操作技术,是技能的高低、效率的高下,如对分析工具使用的技术;

    “法”是指选择的方法,有句话说“选择比努力重要”;

    “道”是指方向,是指导思想,是战略。

    在数据分析和产品、运营优化方面,数据分析方法是其核心,属于“法”和“术”的层次。

    那么如何做好数据分析呢,今天咱们来讲讲十大数据分析的方法。

    01 细分分析

    细分分析是数据分析的基础,单一维度下的指标数据信息价值很低。

    细分方法可以分为两类,一类是逐步分析,比如:来北京市的访客可分为朝阳,海淀等区;另一类是维度交叉,如:来自付费SEM的新访客。

    细分用于解决所有问题。比如漏斗转化,实际上就是把转化过程按照步骤进行细分,流量渠道的分析和评估也需要大量的用到细分方法。

    02 对比分析

    对比分析主要是指将两个相互联系的指标数据进行比较,从数量上展示和说明研究对象的规模大小,水平高低,速度快慢等相对数值,通过相同维度下的指标对比,可以发现,找出业务在不同阶段的问题。

    常见的对比方法包括:时间对比,空间对比,标准对比。

    时间对比有三种:同比,环比,定基比。

    例如:本周和上周进行对比就是环比;本月第一周和上月第一周对比就是同比;所有数据同今年的第一周对比则为定基比。通过三种方式,可以分析业务增长水平,速度等信息。

    03 漏斗分析

    转化漏斗分析是业务分析的基本模型,最常见的是把最终的转化设置为某种目的的实现,最典型的就是完成交易。但也可以是其他任何目的的实现,比如一次使用app的时间超过10分钟。

    漏斗帮助我们解决两方面的问题:

    在一个过程中是否发生泄漏,如果有泄漏,我们能在漏斗中看到,并且能够通过进一步的分析堵住这个泄漏点。

    在一个过程中是否出现了其他不应该出现的过程,造成转化主进程收到损害。

    04 同期群分析

    同期群(cohort)分析在数据运营领域十分重要,互联网运营特别需要仔细洞察留存情况。通过对性质完全一样的可对比群体的留存情况的比较,来分析哪些因素影响用户的留存。

    同期群分析深受欢迎的重要原因是十分简单,但却十分直观。同期群只用简单的一个图表,直接描述了用户在一段时间周期(甚至是整个LTV)的留存或流失变化情况。

    以前留存分析只要用户有回访即定义为留存,这会导致留存指标虚高。

    05 聚类分析

    聚类分析具有简单,直观的特征,网站分析中的聚类主要分为:用户,页面或内容,来源。

    用户聚类主要体现为用户分群,用户标签法;页面聚类则主要是相似,相关页面分组法;来源聚类主要包括渠道,关键词等。

    例如:在页面分析中,经常存在带参数的页面。比如:资讯详情页面,商品页面等,都属于同一类页面。简单的分析容易造成跳出率,退出率等指标不准确的问题,通过聚类分析可以获取同类页面的准确数据用于分析场景。

    06 AB测试

    增长黑客的一个主要思想之一,是不要做一个大而全的东西,而是不断做出能够快速验证的小而精的东西。快速验证,那如何验证呢?主要方法就是AB测试。

    比如:你发现漏斗转化中中间有漏洞,假设一定是商品价格问题导致了流失,你看到了问题-漏斗,也想出了主意-改变定价。但主意是否正确,要看真实的用户反应,于是采用AB测试,一部分用户还是看到老价格,一部分用户看到新价格,若你的主意真的管用,新价格就应该有更好的转化,若真如此,新价格就应该确定下来,如此反复优化。

    07 埋点分析

    只有采集了足够的基础数据,才能通过各种分析方法得到需要的分析结果。

    通过分析用户行为,并细分为:浏览行为,轻度交互,重度交互,交易行为,对于浏览行为和轻度交互行为的点击按钮等事件,因其使用频繁,数据简单,采用无埋点技术实现自助埋点,即可以提高数据分析的实效性,需要的数据可立即提取,又大量减少技术人员的工作量,需要采集更丰富信息的行为。

    如:重度交互(注册,邀请好友等)和交易事件(加购物车,下订单等)则通过SDK批量埋点的方式来实施。

    08 来源分析

    流量红利消失,我们对获客来源的重视度极高,如何有效的标注用户来源,至关重要。

    传统分析工具,渠道分析仅有单一维度,要深入分析不同渠道不同阶段效果,SEM付费搜索等来源渠道和用户所在地区进行交叉分析,得出不同区域的获客详细信息,维度越细,分析结果也越有价值。

    09 用户分析

    用户分析是互联网运营的核心,常用的分析方法包括:活跃分析,留存分析,用户分群,用户画像,用户细查等。

    可将用户活跃细分为浏览活跃,互动活跃,交易活跃等,通过活跃行为的细分,掌握关键行为指标;通过用户行为事件序列,用户属性进行分群,观察分群用户的访问,浏览,注册,互动,交易等行为,从而真正把握不同用户类型的特点,提供有针对性的产品和服务。

    用户画像基于自动标签系统将用户完整的画像描绘清晰,更有力的支撑运营决策。

    10 表单分析

    填写表单是每个平台与用户交互的必备环节,优秀的表单设计,对转化率的提升起到重要作用。

    用户从进入表单页面之时起,就产生了微漏斗,从进入总人数到最终完成并成功提交表单人数,这个过程之中,有多少人开始填写表单,填写表单时,遇到了什么困难导致无法完成表单,都影响最终的转化效果。

    以上就是常见的数据分析方法,更多应用方法需要根据业务场景灵活应用。另外,如果您有更好数据分析思路,欢迎在评论区与大家分享。

    分享 IT 技术和行业经验,请关注-技术学派。

  • ?

    5个常见的SEM数据分析报表,你真的懂吗?

    聂天宇

    展开

    如果你作为一名SEMer,每天80%的工作时间是打开后台,监控核心关键词的排名,每天去调整价格,调整移动比例,否定一些垃圾流量的话,那么我会觉得,你与一名优秀的SEMer人员之间,还有很大的提升空间。

    因为一名优秀的SEMer,每天应该有80%的工作时间在做数据分析,20%的工作时间是最后将数据分析出的结果进行后台操作。有人问过我,你认为SEM推广的核心是什么?我以多年的经验总结出两个因素:“行业市场分析”与“数据分析”。

    数据分析基于推广数据的筛选与总结。数据报表也分为两种:一种是 后台数据报表(账户报告、关键词报告、地域数据报告、搜索词数据报告等等),这些报表可以后台直接下载筛选使用;

    还有一种是 基于第三方统计平台与代码标记的数据报表(关键词跟踪报表、url转化报表、各平台流量占比数据报表等等)。接下来我就给大家分享一下如何筛选适合自己推广数据报表以及如何筛选数据有价值信息。

    一、账户报告

    数据分析重要程度:★★★★

    阐述:账户报告是推广数据分析最基本数据报告,账户报告可以清楚显示出账户推广的展现量、点击量、消费量、点击率、平均点击价格。做日报表或周报表可以做出环比数据值,可以清楚分析整体账户推广情况。

    要根据自己账户推广设定限值,当环比数据达到限值得时候,就要重点关注分析。即使环比数据是正向发展,也可以分析出来原因,这样也可以明确效果提升的原因。

    例如:推广账户数据环比展现量限值5%,既展现量环比增长5%还是降低5%都要明确分析,如发现今天账户推广数据环比昨天降低7%,既触发限值,结合实际调整操作可分析得知,昨天核心词有调整匹配方式,有4%的长尾关键词昨日没有置左展现,所以根据数据可以清楚知道账户环比降低原因。

    根据原因作出相应正向调整即可。而且账户报告,每天的PC与移动的消费占比也一定重视,账户的效果波动可能也多数与PC与移动消费占比有关。

    二、搜索词报告

    数据分析重要程度:★★★★★

    阐述:搜索词报告是作为数据分析与sem优化最为重要的数据报告之一。推广流量精准度与否都可以利用这个搜索词报告一目了然。

    但是搜索词报告大部分人都是基于后台搜索词报告直接进行否词操作,而且有很多人都是看见一个不相关的搜索词马上否定掉。最后会发现我们计划否词数或者单元否词数不够用了。

    其实 对于搜索词报告我们一般都是将每天搜索词报告做一份excel透视报表,可以透视清楚哪些搜索词垃圾流量触发点击数最多的,超过2次以上点击垃圾流量进行否定处理。触发一次搜索垃圾流量一周集中累计再集中做出透视数据分析,最后看出那些单次点击一周内累计垃圾流量多次触发的搜索词再进行否定关键词。

    搜索词报告另外一个数据作用,将有检索搜索词有效添加到投放关键词中。这个也是拓展有效关键词最有效的数据支持。

    三、关键词报告

    数据分析重要程度:★★★★★

    阐述:关键词是sem推广投放核心,关键词数据报告也是所有关键词报告数据分析的最重要的参考数据。但是关键词报告一定是要结合其他数据报告一起分析,才能筛选出我们有效的数据,下面就给大家分析几种比较实用的数据报告结合分析组合。

    1)关键词报告与搜索词报告:根据搜索词报告可以 拓展有检索关键词;其次搜索词报告匹配出垃圾流量,不一定要做否定关键词,有部分单次点击垃圾搜索词可以结合关键词报告数据,对于关键词进行匹配方式调整。

    2)关键词报告与咨询转化报表:每天结合咨询平台中有效咨询所触发的关键词报表与搜索词报表进行 核算每个关键词转化成本,这样我们可以集中投放高转化关键词,控制高消费低转化关键词消费。

    3)关键词报告与账户报告:关键词报告与账户报告关系是包含于关系。即账户数据异常要排查到关键词报表中关键词,所以 账户报告要与关键词报告对应查看与分析。

    四、地域报告数据

    数据分析重要程度:★★★

    阐述:地域数据报表主要作用是明确各地域消费占比与各个地域推广数据。如果对于此数据调整,可以结合后端转化数据进行调整。

    调整各个地域消费占比依据:

    1、根据后端转化效果进行地域消费占比调整;

    2、根据业务地域需求度,进行地域消费占比调整。

    五、url跟踪转化代码数据

    数据分析重要程度:★★★★★

    阐述:url跟踪转化代码数据是定制型数据报表,适用于多平台推广及转化统计。

    这类代码与url部署后数据优点:

    1、各个平台转化有区分;

    2、url部署有利于监控着落页表现;

    3、关键词转化id可以直接统计转化词。

    4、如果推广有项目区分,可以另行标记区分。

    这样统计出来数据可以区分:

    1、关键词转化监控

    2、地域转化监控

    3、项目转化监控

    4、平台推广转化

    最后,想说跟大家分享了这些比较常用数据报表与数据的分析方式,只是比较 有代表性与实用性的数据报表。SEM 数据分析还有很多需要大家深入研究与专研的。我个人也给予大家几点 SEM 数据分析注意事项:

    1、所有数据报表要坚持多维度相结合进行分析处理;

    2、数据分析一定要作为日常优化流程,不要账户出现问题才进行数据分析排查问题,日数据异常要积极分析与调整,才能让账户推广效果稳定;

    3、数据筛选是数据分析的基础,大量的数据要筛选出有效的价值,依据有大量数据的分类、筛选、过滤等环节进行数据提炼,这个最好要有良好的Excel技能支撑才会高效的进行。

    数据分析是我们SEM推广调整的支撑,如果你是一名好的数据分析师,那么还会玩转不了SEM推广吗?

    |来源:艾奇学院

    百家号-【袁帅数据分析运营】:袁帅,互联网数据分析运营实践者,会点网事业合伙人,运营负责人。CEAC国家信息化计算机教育认证:网络营销师,SEM搜索引擎营销师,SEO工程师。数据分析师,永洪数据科学研究院MVP。中国电子商务协会认证:中国电子商务职业经理人,畅销书《互联网销售宝典》联合出品人之一。中国国际贸易促进委员会:今日会展会员联盟VIP个人会员,全经联园区委秘书处成员,中国低碳智慧园区联盟理事,周五咖啡媒体人俱乐部发起合伙人。百度VIP认证站长,百度文库认证作者,百度经验签约作者,百家号/一点资讯/大鱼号/搜狐号/头条号/知乎专栏/艾瑞专栏等媒体平台入驻作者,互联网数据官(iCDO)原创作者,互联网营销官CMO原创作者。

  • ?

    数据分析全流程(内附案例)

    安托法加斯塔

    展开

    (图片来源于网络)

    作者:苏格兰折耳喵

    来源: 运营喵是怎样炼成的 (yymzylc)

    (温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )

    本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:

    1 分析背景

    1.1 分析原理---为什么选择分析虎嗅网

    在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。

    综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:

    由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。

    鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。

    虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。

    因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。

    1.2 本文的分析目的

    笔者在本项目中的分析目的主要有4个:

    (1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;

    (2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;

    (3)展现文本挖掘在数据分析领域的实用价值;

    (4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。

    1.3 分析方法---分析工具和分析类型

    本文中,笔者使用的数据分析工具如下:

    Python3.5.2(编程语言)

    Gensim(词向量、主题模型)

    Scikit-Learn(聚类和分类)

    Keras(深度学习框架)

    Tensorflow(深度学习框架)

    Jieba(分词和关键词提取)

    Excel(可视化)

    Seaborn(可视化)

    新浪微舆情(情绪语义分析)

    Bokeh(可视化)

    Gephi(网络可视化)

    Plotly(可视化)

    使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。

    2 数据采集和文本预处理

    2.1 数据采集

    笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:

    2.2 数据预处理

    数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:

    (1) 文本分词

    要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:

    · 精确模式:试图将句子最精确地切开,适合文本分析;

    · 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;

    · 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。

    现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:

    【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用

    【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用

    【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用

    为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。

    (2) 去停用词

    这里的去停用词包括以下三类:

    标点符号:, 。! /、*+-

    特殊符号:▲等

    无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等

    (3) 去掉高频词、稀有词和计算Bigrams

    去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。

    Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。

    3 描述性分析

    该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。

    3.1 发文数量、评论量和收藏量的变化走势

    从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。

    此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。

    下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。

    3.2 发文时间规律分析

    笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:

    上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。

    3.3 相关性分析

    笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。

    首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。

    上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。

    接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。

    注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。

    3.4 城市提及分析

    在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。

    上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:

    将上述结果绘制成如下动态的流向图:

    由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:

    京津冀城市群

    长江三角洲城市群

    珠江三角洲城市群

    中原城市群

    成渝城市群

    长江中游城市群

    上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。

    4 文本挖掘

    数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。

    本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。

    4.1 关键词提取

    对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:

    它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。

    由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。

    下面是笔者利用jieba在经预处理...

数据分析参考值

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP