- ?
干货丨收集最全的数据分析图
亦尘俗
展开
来自:数据观 https://shujuguan
DT时代,我们每天都会收获来自各种渠道的海量数据,它们是对我们上一步行动的反馈,但人脑消化数据的能力却是有限的——如何及时洞察数据中的涵义,就需要数据可视化工具的帮助了。然而,图表的类型非常丰富,如何做出正确的选择,达到“一图胜千言”的效果呢?
[数据的五种关系]
首先,我们需要了解,数据通常包含五种相关关系:构成、比较、趋势、分布及联系。
构成
主要关注每个部分所占整体的百分比,如果你想表达的信息包括:“份额”、“百分比”以及“预计将达到百分之多少”,这时候可以用到饼图。
比较
可以展示事物的排列顺序——是差不多,还是一个比另一个更多或更少呢?“大于”、“小于”或者“大致相当”都是比较相对关系中的关键词,这时候会首选条图。
趋势
是最常见的一种时间序列关系,关心数据如何随着时间变化而变化,每周、每月、每年的变化趋势是增长、减少、上下波动或基本不变,这时候使用线图更好地表现指标随时间呈现的趋势。
分布
是关心各数值范围内各包含了多少项目,典型的信息会包含:“集中”、“频率”与“分布”等,这时候使用柱图;同时,还可以根据地理位置数据,通过地图展示不同分布特征。
联系
主要查看两个变量之间是否表达出我们预期所要证明的模式关系,比如预期销售额可能随着折扣幅度的增长而增长,这时候可以用气泡图来展示,用于表达“与……有关”、“随……而增长”、“随……而不同”变量间的关系。
对信息中包含的5种关系,可以简单归纳如下:
构成:占总体的百分比
比较:项目的排名
趋势:如何随着时间变化
分布:项目的频率情况
联系:变量之间的关系
[图表的具体适用场景]
下面,我们具体来看一下图表特点及适用场景:
以下图表均制作于数据观
条图
条图表达比较关系,按照强调的方式可以排列任何顺序,适用于高亮Top3或Top5数据,如在零售行业中统计畅销品的销售情况就是很好的应用。它是最通用的一种图表,应在所有的图集使用中占到25%。
柱图
柱图用高度反映数据差异,用来展示有多少项目(频率)会落入一个具有一定特征的数据段中,比如分析公司人员构成是否存在老龄化现象,可以通过柱图看到25岁以下的员工有多少,25岁到35岁之间员工有多少等这种年龄的分布情况。同时,柱图还可以用来表示含有较少数据值的趋势变化关系。
分析图形有单指标柱图、多指标柱图以及堆叠柱图类型。
(1)、单指标柱图
(2)、多指标柱图
(3)、堆叠柱图
线图
线图可用来反映随时间变化而变化的关系,尤其是在趋势比单个数据点更重要的场合。
在柱图与线图的选择过程中,可以考虑数据的本质。柱图强调的是数量的级别,它更适合于表现在一小段时间里发生的事件,产量的数据很适合这个领域。线图强调的是角度的运动及图像的变换,因此展示数据的发展趋势时最好使用它,存货量就是一个很好的例子。柱图和线图的使用应占到图集看板的50%左右。
线图类型中可以有单线图,还可以在图中进行多指标趋势性比较。
(1)、单线图
(2)、多指标趋势性比较
饼图
构成比例关系时,最好使用饼图,给人一种整体的形象,可以展示每一部分所占全部的百分比,比如产品A预计销售额占到所有产品销售额的最大份额。
为了使饼图尽量发挥作用,在使用中不宜多于6种成分。人的眼睛比较习惯于按顺时针方向进行观察,所以应该讲最重要的部分放在紧靠12点钟的位置,如果没有哪一个部分比其他部分更加重要,那么就应该考虑让它们从大到小的顺序排列。
数据观除了有标准饼图,还提供中空饼图和环形饼图两种类型。
(1)、标准饼图
(2)、中空饼图
(3)、环形饼图
Attention!不适用饼图的情况
饼图是通过面积呈现数据的变化,当各指标所占比例接近时,无法直观的判断面积的大小,此时选择条图来呈现,规律就更加清晰。饼图是应最少使用的图表,在所有的陈述和报告中其使用率应少于5%。
错误的图表类型:
正确的图表类型:
气泡图
气泡图判断两个变量之间是否存在某种关系,可反映五维数据。每个气泡的不同颜色或标签,以及气泡点大小,都可以反映一个维度。一般使用率为10%。
KPI图
最直接显示结果,适用于高亮关注指标值或者差异,可以通过主要指标和次要指标进行体现。信息量避免过多,越直观越好。
面积图
与折线图较为类似,面积图强调变量随时间而变化的程度,也可用于引起人们对总值趋势的注意。用填充了颜色或图案的面积来显示数据,面积片数不宜超过5片。
漏斗图
漏斗图用来表示逐层分析的过程,从一个总值(最顶端),不断除去不关心的部分,最终得到关心的值的过程。
多用于业务流程比较规范、周期长、环节多的流程分析,通过比较各个环节宽窄大小,能够直观地发现和说明问题所在。常见应用场景:电商网站、营销推广、CRM等。
1)电商网站:通过转化率比较能充分展示用户从进入网站到实现购买的最终转化率。2)营销推广:反映搜索营销的各个环节的转化,从展现、点击、访问、咨询,直到生成订单过程中的客户数量及流失。
3)CRM:销售漏斗图用来展示客户各个阶段转化比较。
金字塔图
金字塔图用于展示类似金字塔的层级结构和数据量。例如某个国家的收入分配,金字塔顶部显示高收入类别,逐渐降低到代表低收入的底部。
雷达图
雷达图可以用来表现一个周期数值的变化,也可以用来表现特定对象主要参数的相对关系。
雷达图多用于在财务分析中,用来分析企业负债能力、运营能力、盈利和发展能力等指标。
地图
地图是信息密度最大的数据可视化方式,人们在日常生活中就使用地图,所以能直观理解地图。
数据观基于不同的视觉化原理提供三种地图:区域地图、散点地图和热力地图。
(1)、区域地图
区域地图是按照国家、省市行政区划分,用来展现地理信息,以及与地理位置有关的信息,指标的多少可以用颜色深浅区分。
(2)、散点地图
散点地图基于高德地图实现,通过定位经纬度,用散点来表示所在位置的信息指标。
(3)、热力地图
热力地图以特殊高亮的形式显示访客所在的地理区域的图示,不同颜色反映不同区域密度的分布。
表格
表格可以通过拖拽所关心的指标,如通过一级、二级分类,了解更加明细的数据,起到数据透视表功能。
综合使用
饼图、柱图、条图、线图、气泡图可以组成可视化报告90%图形,其他视觉化展示可以将图表组合起来综合使用。
以上就是为大家提供的图表基本使用原则,适用于日常工作中大多数的图表制作。
最后,希望大家都可以需要根据自己想要表达的信息选择合适的图表,让数据可视化帮助我们的大脑减负,替我们的数据说话。
- ?
互联网数据分析入门:流量分析
席青筠
展开
当今时代信息化产业飞速发展,各类底层大数据平台百花齐放,亿级数据、秒级响应已经不再是当年的遥不可及的神话。然而对于企业来说,数据计算快仅仅是满足企业进行业务数据分析的硬件基础,如何发掘这些海量的数据产生应用价值,走好数据分析这最后一公里,引导企业进行战略决策却是至关重要的一步。
本文以互联网行业为数据业务分析背景,希望能跟大家交流一些数据分析方面的心得和体验。
——本文使用数据分析工具为FineBI 商业智能工具
数据分析的本质其实是做数据对比分析,没有数据对比,单一的指标统计往往难以发挥数据价值。像我们常见的数据对比分析方法有同比、环比、占比等一系列分析指标,那是不是所有的数据业务场景都可以直接进行套用分析呢?比如我们统计企业2018年1月29日的同比流量,是不是可以直接对比2017年1月29日?表面上看好像2017年1月29日确实就是2018年1月29日时间层面上的同比日期,但是我们仔细对比查看这两个日期会发现2018年1月29日是周一,2017年1月29日确是周日。对于很多行业的企业来说,非工作日和工作日的数据往往是有很大差异的,这个时候单纯从日期层面来进行对比其实是没有什么意义的,选择对比同是周一的2017年1月30日的流量数据进行同比计算可能会更加有价值。
目前互联网行业做搜索引擎的有Google、百度,做综合门户的雅虎、新浪,做即时通讯的主要是腾讯,电子商务方面的主要是阿里、京东、亚马逊等。不论是以上的哪家互联网企业,往往都需要有一套引流、转化、消费、留存方面的运营策略,平台的流量数据分析往往都是非常重要的。
互联网流量数据分析方面,总结主要有如下四种数据常用分析方法:
1.对比分析流量规律,针对时段进行企业服务以及推广活动调整;
2.对比分析结构占比,指导进行定向群体营销推广
3.对比分析异常情况,及时追责并且进行调整;
4.对比追踪活动流量变化,总结活动效果经验以便后续有针对性调整。
如上图所示,我们通过FineBI工具制作出以上的流量数据分析模板,接下来尝试着对数据做一些对比分析。
一、用户浏览量周分布
对于互联网企业来说,流量数据往往都会呈工作周相关。对此,我们可以先宏观地统计出周一到周日中的总的平台流量柱状图数据对比情况。首先我们可以仔细观察工作日和非工作日的数据,发现周末的平台流量较工作日流量要高,这在互联网行业来说都是一个比较普遍的现象。
用户流量的周分布规律之后,我们就大致有一个推广方向,周末休息时间用户群体较大,相较于工作日可以投入更多的和丰富有吸引力推广活动来进行新用户引流和老用户活跃。
接着我们可以进行下一步思考,那工作日和周末我们的活动推广时间如何制定?有的同学们可能会觉得全天活动都可以,不需要关注具体的活动时间。但是对于互联网行业来说,每个时间段的推广费用都是较为昂贵的,我们完全可以分析出工作日和周末的用户流量趋势,进行有针对性的时间段投入推广,通过更小的成本获取到更多的用户流入。
首先是工作日的时间段流量统计分布,我们通过BI工具分时间段作图得到如下所示的流量分布图。可以看出,工作日的流量主要集成在每日的9点(上班时间)、13点(午餐时间)、20点(晚间娱乐休息时间),那么在得到这样的一些用户流量规律之后,便可以在这些用户活跃高峰期时间段有针对性对白领群体多做一些相关商品推广活动,以实现最小时间成本和推广费用最大化用户引流效果。
再来看周末的各时间段流量分布走势,和工作日所不同的是,周末的流量早高峰期延后到了10点,这可能和各位小伙伴们周日作息较晚有关(同学们周末都是几点起床呢),除此之外,晚上的流量高峰退潮期也有延后。针对与周末用户流量分布的特性,互联网企业在周末时可以将活动开始时间和活动结束时间都适当进行延后,这个时候不能再套用工作日制定好的活动时间计划了,因为符合用户群体作息规律的推广促销活动才能达到更好的效果。
二、推广渠道流量分布
对于互联网行业的推广渠道分布主要分为三级渠道:线上渠道、线下渠道、新媒体营销等等。对比分析每个渠道对企业所带来的价值占比差异,以指导制定有针对性营销策略。
如上图所示,由于推广渠道是分多层级的,我们通过BI工具的多层饼图进行数据的分析统计再合适不过了。分析下图的数据我们可以看出,首先是一级渠道的主要战斗力来自于新媒体营销,当今的微信、今日头条等社交媒介社区时代受众广泛,用户群体非常庞大,是公司需要投入主要成本进行推广的。其次线上渠道的效果也不容忽视,对于互联网企业来说,做好百度、Google等SEO搜索引擎关键词推广也是很重要的一部分工作。相较于线上渠道和新媒体营销,线下渠道说所需要的经费和时间、人力成本较大,受众又相对较小,所以此类活动往往针对核心粉丝进行运营即可。
三、各月份指标对比走势
在分析各月份指标对比走势数据之前,先简单介绍下互联网营销常用的几个指标概念:
1.浏览量(pv)
2.访问次数(visits)
3.访客数(uv)
以上三个基础指标常用来衡量流量数据的多少。另外平均访问深度(总浏览量/访问次数)、平均停留时间(总停留时间/总浏览量)、跳失率(跳出次数/访问次数),这三个指标通常可用于衡量流量指标的优劣性。
我们仔细分析上图中的平台流量指标,可以发现10月份是2017全年的流量高峰期,应该跟企业在国庆黄金假期所做的促销引流活动有关。浏览量、跳失次数、访问次数分别为4941、1290、2182,对比计算可得到跳失率为59.12%,明显低于其他时间段的跳失率,说明10月份的活动效果还不错,其经验对以后的营销推广可以起到参考作用。
最后是访问深度用户群体分布分析(跳失率=跳出次数/访问次数),我们通过BI工具将企业的VIP用户、老用户、新用户分别进行分时间段的用户群体访问深度分析统计。总体来说可以发现平台的VIP用户访问深度较老用户以及新用户稍微高些,但是不是太明显,说明平台运营的VIP这部分群体的活跃度还有待提升。同时,平台老用户访问深度和新用户更是相差无几,公司对于用户这方面的活跃运营明显需要加油了,建议将平台的部分忠诚度较高的老用户以VIP用户组建起来,共建平台生态圈,增加整体的用户活跃度。同时可以向老用户以及VIP用户实施一些优惠政策,如定向商品折扣、根据用户画像进行喜好商品特惠推送等。
本次的数据分析经验心得分享暂时先写到这里,后续将继续给大家分享关于互联网数据运营方法的转化、消费、留存等方面的一些经验,欢迎大家一起共同交流探讨互联网运营之道。
- ?
巧用工具,快速入门数据分析
Lyndon
展开
一提到数据分析,很多人可能脑海中可能会浮现出各式各样的数据画面。
比如下图所示,这样的中国式复杂报表在企业中经常被使用,精密的复杂表格样式中蕴含着国人庞大的数据信息量。
再比如这样的数据Dashboard可视化,通常应用于展示KPI业务指标,例如销售额、毛利率、利润率等等,数据的可视化呈现形式清晰直观。
再就是目前火热的不行的可视化大屏,比如下图所示的双11全球天猫狂欢节当日的实时交易统计大屏,除了清晰直观地展示企业核心的KPI指标之外,狂拽炫酷是它至关重要的特征。
大道至简的数据分析方法
但无论是以上的哪一种,无论数据如何变换,所有看似神秘的数据分析过程都可以归纳总结为各种“维度+度量”的组合分析。
维度用于描述事物的属性信息,例如统计各个地区的交易数量时,地区就是维度。
度量(指标)是可以量化统计的数值,例如统计各个地区的交易数量时,交易数量就是度量。但是需要注意的是并不一定所有的数值都是度量,例如学生的学号虽然是数值类型,但是其实它是维度而非度量。
如此一来,我们对数据分析有了从整体上的解释。但是实际应用中,我们并非盲目地去进行各种维度和度量的拼凑组合,而是希望得出的数据分析结果能够指引业务进行决策,终而形成业务闭环效果的。
根据我自身的一些数据分析项目经验,90%以上的基本数据分析问题都可以套用我总结的这七步完成(深入的数据分析需涉及描述性统计分析、相关性分析等专业的统计分析技能):
数据分析必然需要借助工具,Excel、BI或者R和Python语言都可以帮助实现。
这里为了帮大家更快速地理解数据清洗建模和数据差异分析环节的内容,借助比较简单的BI工具FineBI,为大家进行一个销售数据分析实例,加深大家对数据建模和数据分析过程的理解。感兴趣的可以到官网下载,个人完全免费。
一、确定分析目标
这是分析前的第一步,我们需要明确进行数据分析的对象,也就是需要确定分析目标。
通常来说我们会选取最关心的核心KPI指标,例如电商行业的销量、销售额、利润,制造行业的次品率,互联网行业的用户留存率等等。
一般来说,分析目标不要过多,如果实在是需要同时分析多个关键核心业务KPI指标,那么我们便可以将这些核心指标分解给对应业务负责人,例如销售总监负责提升公司销售业绩,运营总监负责降低成本花费。
二、核心目标拆解
确定好分析目标之后,通常来说我们需要再对核心目标进行子目标分解,这也符合企业各团队分工协作的特性。
核心目标拆解的过程中需要遵循MECE原则,也就是“完全穷举,相互独立”。例如下图所示的电子商务数据分析指标体系,就分别从网站运营指标、经营环境指标、销售指标、营销活动指标、客户价值指标几个方面进行了详尽的拆解,然后交由各个团队进行分工达成。
三、数据清洗和业务建模
确立和分解好数据分析目标之后,下一步就可以进入到数据清洗和业务建模环节了。
数据清洗方面,很多人可能会想到国外传统的一些ETL工具,但是这类工具过于庞大和复杂,国内真正成功落地的案例很少。FineBI商业智能工具其实就提供了轻量级的ETL功能可供用户对数据进行计算和处理,鼠标点击和拖拽操作即可完成轻量的ETL数据处理过程。
业务建模方面,FineBI也是提供了根据不同业务主题分类建立业务包的功能,一般来说按照维度表和事实表建立好关联关系即可,这样一来就为前端的数据差异分析准备好了数据模型。
四、数据差异分析
终于到了数据差异分析这一步,这也是离发现问题原因和业务决策最近的一步。
所谓数据差异分析,自然是需要有差异,才能有分析。
例如今年某某企业7月份的销售额是600万,那么大家会觉得对于这个企业来说是好还是坏?如果只有这一个数据,自然是无所谓数据差异分析的。
如果这家企业的6月份的历史销售额是400万,那么7月份600万的销售额自然是非常好的了,可是如果这家企业的6月份历史销售额是800万,7月份600万的销售额明显是有问题的。
a.纵向对比
按照这个基础的数据差异分析逻辑,我们借助FineBI来初步分析一下某家企业今年各月度的销售额统计走势图:
如上图所示,通过纵向对比不难看出该企业在7月份销售额下降严重,环比6月份的企业销售额下降了22.47%,不是个好现象。老板看到这个数据自然会前来问责,说为什么7月份公司销售业绩下滑这么厉害。那么会是什么原因导致企业7月的销售业绩相对6月下滑这么多呢?我们需要更新一步地进行数据分析,以排查出导致产生问题的”真凶“。
b.横向对比
一般来说销售型企业都会在全国划分各个销售区域,那么这样一来我们除了对时间进行纵向对比之外,还可以结合销售大区维度进行横向比较,分析探索看看能不能发现一些问题。
果不其然,如上图所示,通过时间维度结合销售大区进行横向对比发现,企业的东南大区7月份的销售额相对6月份反而是增长的,看来问题主要出在北方区和中西区,特别是北方区7月份的销售业绩下滑更为严重,最终导致企业7月份总的销售额比6月份严重下滑。
数据分析的丰富度一定程度上依赖于分析工具的功能,比如Excel可能需要写VBA,R和Python需要写代码。
由于FineBI是一款商业智能工具,故而这边可以轻松通过其提供的OLAP联动分析功能,以更进一步的观察各个区域7月份的表现情况,直接点击饼图区域即可联动到月度销售额统计,非常方便。这边我们可以看出,中西区7月份销售额环比轻微下降17.86%,北方区下降严重到50.07%,而东南区则提高了6.06%,综合三个大区的总体销售状况,导致最终表现为7月份销售额环比下降了22.47%。
c.综合对比
上面分析了时间、区域维度相关的销售额结果统计,为了避免结论片面,我们尽量采用多维度的综合对比方式来观察数据,甚至可以是友商的销售情况对比进行差异分析(此处不单独举例说明)。
如上图所示,我们通过时间维度结合产品类型来进行销售额分析,观察7月份各个产品线的数据发现各个产品线在7月份销售额环比都是有所下降的,这说明企业7月份销售额下降和产品种类本身是没有关系的。
五、发现问题原因
综合北方区域和中西区域导致7月份销售额环比下降的各种影响因素,最终发现是由于6、7月份北方区域降雨严重,导致物流周转严重滞后,库存商品无法及时供应,最终导致北方区域7月份销售业绩严重下滑了50.07%。而中西区域本身仓库比较小,按照之前各区域商品物流周转的设计,中西区域的本土供应的差额商品主要是由北方区域供应,但是北方区域由于严重的降雨导致物流周转严重滞后,进而导致中西区域7月份销售业绩也同比下滑了17.86%。
六、制定业务决策
通过结合FineBI工具的OLAP多维数据综合分析方法成功定位到问题原因之后,企业及时调整仓库商品物流周转策略,北方区域物流模式调整为水运,同时将东南区域的部分商品通过物流周转到中西区域。
七、评估决策效果
企业领导决策层8月份通过及时调整北方区域和中西区域的物流策略,北方区域物流模式调整为水运,东南区域的部分商品通过物流周转到中西区域,补充了北方区域和中西区域的库存商品周转。最终8月份企业的总体销售额达到了943万,环比7月销售额提高到了37.32%。
后记
随着信息化的飞速发展,大数据产业呈指数式增长。在我们不断地积累着企业的历史数据的同时,如何利用和分析好这些数据,真正利用大数据分析驱动企业的业务增长也成为了一个很重要的难题。希望本文给大家分享的数据分析方法,结合FineBI商业智能分析工具的OLAP多维分析能力,能够让大家下次在面对企业业务数据分析时不再迷惑,做到步步为营,让数据分析真正释放出潜能,驱动业务快速增长,形成数据和业务之间的闭环
- ?
一个完整的数据分析思路是怎么炼成的?
Randolph
展开
做数据分析首先得要有一个完整的思路。《谁说菜鸟不会数据分析》书中举了一个很生动的例子。做数据分析就好比做一件衣服,首先的先有设计图,然后在根据设计图分步骤的去制作成成品。今天我们说的数据分析的完整思路就相当于衣服的设计图,有了完整的思路,才不至于漫无目的的,没有一个清晰的目标去做分析。
那么我们如何才能建立一个完整的数据分析的思路呢呢?《谁说菜鸟不会数据分析》给大家提供了几种数据分析方法论来助力大家形成完整的数据分析思路。主要有PEST分析法,5W2H分析法,逻辑树分析法,4P营销理论(现在用的比较多是4C),用户行为理论。下面呢,我就以5W2h分析方法,给大家详细的说明一下怎么建立完整的数据分析思路。
首先,先介绍一下什么是5W2H。
(1)WHAT——是什么?目的是什么?做什么工作?
(2)WHY——为什么要做?可不可以不做?有没有替代方案?
(3)WHO——谁?由谁来做?
(4)WHEN——何时?什么时间做?什么时机最适宜?
(5)WHERE——何处?在哪里做?
(6)HOW ——怎么做?如何提高效率?如何实施?方法是什么?
(7)HOW MUCH——多少?做到什么程度?数量如何?质量水平如何?费用产出如何?
例如要不要增加一个推广渠道,我们来形成一个完整的分析思路。
WHAT:一个引流的渠道,对这个渠道要有一定认识。
WHY :目前其他的渠道的流量不能满足,做了渠道之后可能会增加多少流量。
WHO:是直接让其他渠道的人来负责,还是重新招一个操作过这个渠道的人。
WHEN:如果要做这个渠道,有没有时间来做,什么时候开始实施。
WHERE:如果是大公司,要考虑是总公司来做,还是分公司来做。
HOW:怎么做,是否有详细的解决方案,是否先参考同行竞争对手。
HOW MUCH:新增加的这个渠道,需要投入多少成本,人力成本,广告成本等等。
对每个环节进行分析,评估,然后综合每个环节,看看这个渠道是否值得开发。
- ?
数据分析全流程(内附案例)
指环王
展开
(图片来源于网络)
作者:苏格兰折耳喵
来源: 运营喵是怎样炼成的 (yymzylc)
(温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )
本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:
1 分析背景
1.1 分析原理---为什么选择分析虎嗅网
在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。
综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:
由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。
鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。
虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。
因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。
1.2 本文的分析目的
笔者在本项目中的分析目的主要有4个:
(1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;
(2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;
(3)展现文本挖掘在数据分析领域的实用价值;
(4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。
1.3 分析方法---分析工具和分析类型
本文中,笔者使用的数据分析工具如下:
Python3.5.2(编程语言)
Gensim(词向量、主题模型)
Scikit-Learn(聚类和分类)
Keras(深度学习框架)
Tensorflow(深度学习框架)
Jieba(分词和关键词提取)
Excel(可视化)
Seaborn(可视化)
新浪微舆情(情绪语义分析)
Bokeh(可视化)
Gephi(网络可视化)
Plotly(可视化)
使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。
2 数据采集和文本预处理
2.1 数据采集
笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:
2.2 数据预处理
数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:
(1) 文本分词
要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:
· 精确模式:试图将句子最精确地切开,适合文本分析;
· 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;
· 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。
现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:
【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用
【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用
【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用
为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。
(2) 去停用词
这里的去停用词包括以下三类:
标点符号:, 。! /、*+-
特殊符号:▲等
无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等
(3) 去掉高频词、稀有词和计算Bigrams
去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。
Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。
3 描述性分析
该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。
3.1 发文数量、评论量和收藏量的变化走势
从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。
此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。
下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。
3.2 发文时间规律分析
笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:
上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。
3.3 相关性分析
笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。
首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。
上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。
接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。
注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。
3.4 城市提及分析
在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。
上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:
将上述结果绘制成如下动态的流向图:
由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:
京津冀城市群
长江三角洲城市群
珠江三角洲城市群
中原城市群
成渝城市群
长江中游城市群
上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。
4 文本挖掘
数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。
本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。
4.1 关键词提取
对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:
它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。
由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。
下面是笔者利用jieba在经预处理...
- ?
空气净化器产品检测数据综合分析
袁幻悲
展开
一场品质检测的风波,让空气净化器陷入了议论之中。国家质监局抽检发现,市场上的空气净化器产品有25%的品牌生产的产品是不合格的,净化效率远远不达标。那么这就给空气净化器行业判了一个“死刑”吗?这显然太对于极端和偏激。其实从整体的市场发展状况来看,出现劣质产品比较多完全是必然的。这主要是因为目前国内的市场的发展正处于初步阶段,生产厂家想要提高技术和产品的质量,那么必须经过一定的累积。而在这过程中,为了满足市场竞争性,就只能铤而走险,生产劣质的产品让企业生存。那么行业中全部是这类劣质产品的生产厂家吗?显然不是,比较抽检中有75%的产品是合格的,这说明绝大多数的生产厂家在产品生产方面,还是做得很不错的。只需要加强对空气净化器市场发展的维护,那么必然能够杜绝劣质产品。
所以说,目前的空气净化器发展还是很不错的,而且有很多国外的品牌也进入国内市场,不仅仅在生产技术方面非常成熟,而且还带来了先进的空气净化器产品。这些品牌的产品净化效率,效果可以搞到99%,就比如以下空气净化器十大排名:
从产品质量方面分析,来自德国瑞肯的空气净化器产品在就非常的不错。瑞肯采用了最新的活性炭滤网技术,并且加强了产品质量的优质和净化效率的提升,让产品能够高效的净化掉室内空气中的有害物质。所以瑞肯的空气净化器产品在国外市场非常的受欢迎,在国内行业的影响力也是非常之巨大的。
瑞肯家用空气净化器作为家用空气净化器行业中的领导者,他在产品质量和生产技术方面也可谓是非常不错的。瑞肯采用了超率活性炭滤网技术,将净化精度提升了不少,所以在市场中,瑞肯空气净化器产品是一个非常值得信赖的品牌。
瑞肯家用空气净化器,目前市场上非常具有影响力的空气净化器品牌,采用了多层净化模式,能够高效的去除空气中的甲醛、二氧化碳、悬浮颗粒等有害物质。所以相对来说,在市场上瑞肯的空气净化器产品也是非常之受消费者喜爱的。
- ?
2018中国生鲜电商行业年度综合分析
史蒂文
展开
2017年,生鲜电商借“新零售”的东风再次被点燃,已经发展了15年并且有万亿市场商机的生鲜电商,线上渗透率仍不足10%。在市场投资收紧并向头部聚拢的环境下,存活下来的生鲜电商发挥自身优势,寻求不同发展路径,巨头企业探索渗透线下市场,新兴厂商精细化运营谋求出路。未来已来,将至已至,面对席卷而来的“零售”新浪潮,生鲜电商将以何种姿态迎接未来?本分析从市场现状、用户分析、典型厂商、发展趋势四个维度对生鲜行业进行了具体分析。
完整报告下载:https://pan.baidu/s/1rauqbm8密码:byw7
- ?
中国移动阅读市场年度综合分析2017分析报告
Vaag
展开
移动阅读是指利用手机、平板电脑、电纸书等移动终端载体进行的所有阅读行为,通过浏览网页以及书城客户端、新闻资讯客户端、期刊杂志客户端、微博、微信公众账号文章等阅读途径,浏览小说、报纸、图书、杂志、动漫、文献等内容的阅读行为。
截至2016年末,中国移动阅读市场规模达到118.6亿元。同时,移动阅读行业发展重点从平台内容积累转移到了原创内容的孵化与作品改编上。本分析从行业发展现状出发,对移动阅读市场的用户和典型厂商做了分析,并对移动阅读未来发展趋势做了展望。
袁帅,互联网数据分析运营实践者,智能一体化会展活动运营服务平台会点网事业合伙人/运营负责人。CEAC国家信息化计算机教育认证:网络营销师,SEM搜索引擎营销师,SEO工程师。中国电子商务协会认证:中国电子商务职业经理人,畅销书《互联网销售宝典》联合出品人之一。中国国际贸易促进委员会:今日会展会员联盟VIP个人会员,全经联园区委秘书处成员,中国低碳智慧园区联盟理事,周五咖啡媒体人俱乐部发起合伙人。互联网数据官(iCDO)原创作者,互联网营销官CMO原创作者,执牛耳媒体特约撰稿人。
- ?
大数据行业分析报告
凡波
展开
一、大数据产业概述
1. 大数据的认识
大数据是新资源、新技术和新理念的混合体。从资源视角来看,大数据是新资源,体现了一种全新的资源观。1990年以来,在摩尔定律的推动下,计算存储和传输数据的能力在以指数速度增长,每GB存储器的价格每年下降40%。
2000年以来,Hadoop为代表的分布式存储和计算技术迅猛发展,极大的提升了互联网企业数据管理能力,互联网企业对“数据废气”(Data Exhaust)的挖掘利用大获成功,引发全社会开始重新审视“数据”的价值,开始把数据当作一种独特的战略资源对待。大数据的所谓3V特征(体量大、结构多样、产生处理速度快)主要是从这个角度描述的。
从技术视角看,大数据代表了新一代数据管理与分析技术。传统的数据管理与分析技术以结构化数据为管理对象、在小数据集上进行分析、以集中式架构为主,成本高昂。
与“贵族化”的数据分析技术相比,源于互联网的,面向多源异构数据、在超大规模数据集(PB量级)上进行分析、以分布式架构为主的新一代数据管理技术,与开源软件潮流叠加,在大幅提高处理效率的同时(数据分析从T+1到T+0甚至实时),成百倍的降低了数据应用成本。
从理念的视角看,大数据打开了一种全新的思维角度。大数据的应用,赋予了“实事求是”新的内涵,其一是“数据驱动”,即经营管理决策可以自下而上地由数据来驱动,甚至像量化股票交易、实时竞价广告等场景中那样,可以由机器根据数据直接决策;
其二是“数据闭环”,观察互联网行业大数据案例,它们往往能够构造起包括数据采集、建模分析、效果评估到反馈修正各个环节在内的完整“数据闭环”,从而能够不断地自我升级,螺旋上升。
目前很多“大数据应用”,要么数据量不够大,要么并非必须使用新一代技术,但体现了数据驱动和数据闭环的思维,改进了生产管理效率,这是大数据思维理念应用的体现。
2.大数据的产业体系
大数据本身既能形成新兴产业,也能推动其他产业发展。当前,国内外缺乏对大数据产业的公认界定。我们认为,大数据产业可以从狭义和广义两个层次界定。
从狭义看,当前全球围绕大数据采集、存储、管理和挖掘,正在逐渐形成了一个“小生态”,即大数据核心产业。大数据核心产业为全社会大数据应用提供数据资源、产品工具和应用服务,支撑各个领域的大数据应用,是大数据在各个领域应用的基石。应该注意到,狭义大数据产业仍然围绕信息的采集加工构建,属于信息产业的一部分。
数据资源部分负责原始数据的供给和交换,根据数据来源的不同,可以细分为数据资源提供者和数据交易平台两种角色。数据基础能力部分负责与数据生产加工相关的基础设施和技术要素供应,根据数据加工和价值提升的生产流程,数据基础能力部分主要包括数据存储、数据处理和数据库(数据管理)等多个角色。
数据分析/可视化部分负责数据隐含价值的挖掘、数据关联分析和可视化展现等,既包括传统意义上的BI、可视化和通用数据分析工具,也包括面向非结构化数据提供的语音、图像等媒体识别服务。
数据应用部分根据数据分析和加工的结果,面向电商、金融、交通、气象、安全等细分行业提供精准营销、信用评估、出行引导、信息防护等企业或公众服务。根据IDC、Wikibon等咨询机构预测,2016年,全球的大数据核心产业规模约为300亿美元。
3.大数据的规模
据中商产业研究院数据,我国大数据行业市场规模增速明显,2015年中国大数据市场规模为115.9亿元,增速达53.10%。
4.大数据产业图谱
二、大数据的行业运用
1.零售业领域
具体来说,在零售企业,大数据分析的应用可以归纳为如下方面:在智慧的客户体验领域的全方位的顾客洞察、提升客户服务、基于位置的营销和服务以及精准营销;在智慧的商品管理和供应联网络领域的供应链优化和商品优化;在智慧的运营领域的财务管理、劳动力管理和防损 / 防偷盗管理。
大数据驱动的快速响应系统是ZARA实现供应链神话的重要原因之一
ZARA有一个全天候开放的“数据处理中心”。每一个零售网点都可以通过该系统追踪销售数据。此外,顾客的反馈也能在系统上反映出来,ZARA能够很快发现哪些款好卖,哪些款滞销。ZARA店内,柜台和店内各角落都装有摄影机,店经理随身带着PDA。
当客人向店员反映诸如“这个衣领图案很漂亮”、“我不喜欢口袋的拉链”等意见时,店员通过ZARA内部全球资讯网络,每天至少两次传递资讯给总部设计人员,由总部汇总信息进行分析并作出决策后立刻传送到生产线,改变产品样式。
微软Dynamics零售分销渠道管解决方案
微软Dynamics零售渠道管理解决方案提供通过系统管理渠道的收发货信息的渠道进销存管理;收集各渠道经营的其他竞争对手产品信息的客户拜访管理;管理会员信息及购买习惯发会员管理;
管理会员促销及积分兑换的促销管理;报表分析,提供数据报表支持,帮助企业分析会员购买行为,对下一步销售策略做预测工作。
新零售解决方案提供商—— 小工蚁科技推出客户大数据平台
小工蚁科技是一家互联网创业公司,专注新零售解决方案。小工蚁推出的客户大数据平台可帮助企业从各给历史遗留系统中将客户相关的数据抽取出来,然后建模分析,使用大数据分析引擎帮助快速将企业客户360°画像、针对客户个性化产品推荐、进行客户群体分析,将数据变成可视化工具平台;
同时小工蚁也提供客户社区,帮助企业和客户建立强连接。帮助传统企业将客户相关数据和信息提炼出规律和价值的平台工具。
2.电信领域
电信行业掌握体量巨大的数据资源,单个运营商其手机用户每天产生的话单记录、信令数据、上网日志等数据就可达到PB级规模。电信行业利用IT技术采集数据改善网络运营、提供客户服务已有数十年的历史,而传统处理技术下运营商实际上只能用到其中百分之一左右的数据。
大数据对于电信运营商而言,首先意味着利用廉价便捷的大数据技术提升其传统的数据处理能力,聚合更多的数据提升洞察能力。比如法国电信、T-Mobile借助大数据加快了诊断网络潜在问题的效率,改善服务水平,为客户提供了更好的体验,获得了更多的客户以及更高的业务增长。
中国移动、德国电信、沃达丰利用大数据技术加大对历史数据的分析,动态优化调整网络资源配置,大幅提高无线网络的运行效率。T-Mobile通过集成数据综合分析客户流失原因,在一个季度内将客户流失率减半。SK电讯成立SK Planet公司专门处理与大数据相关的业务,通过分析客户的使用行为防止客户流失。
中国联通利用大数据技术对其全国3G/4G用户进行精准画像,形成大量有价值的标签数据,为客户服务和市场营销提供了有力支持。中国移动通过对消费、通话、位置、浏览、使用和交往圈等数据的分析,利用各种联系记录发现各种圈子,分析影响力及关键人员,用来进行家庭客户、政企客户和关键客户的识别,以实现主动营销和客户维系。
二是提高数据意识,寻求合适的商业模式,尝试数据价值的外部变现。主要有数据即服务(DaaS)和分析即服务(AaaS)两种模式,数据即服务模式往往通过开放数据或开放API的方式直接向外出售脱敏后的数据;
分析即服务(AaaS)模式往往与第三方公司合作,利用脱敏后的(自身或整合外部)数据资源为政府、企业或行业客户提供通用信息、数据建模、策略分析等多种形式的信息和服务,以创造外部收益,实现数据资源变现。
数据即服务方面,AT&T将客户在WiFi网络中的地理位置、网络浏览历史记录以及使用的应用等数据销售给广告公司可以获取客观收益;AT&T同时还提供Alert业务,当客户距离商家很近时,就有可能收到该商家提供的折扣很大的电子优惠券;
英国电信基于安全数据分析服务Assure Analytics,帮助企业收集、管理和评估大数据集,将这些数据通过可视化的方式呈现给企业,帮助企业改进决策;
德国电信和沃达丰主要尝试通过开放API,向数据挖掘公司等合作方提供部分用户匿名地理位置数据,以掌握人群出行规律,有效的与一些LBS应用服务对接。限于国内对数据交易流通方面缺乏明确规定,国内运营商很少尝试数据即服务(DaaS)模式。
分析即服务方面,西班牙电信成立动态洞察部门Dynamic Insights开展大数据业务,与市场研究机构Gfk进行合作,在英国、巴西推出名为智慧足迹的创新产品,该产品基于完全匿名和聚合的移动网络数据,可对某个时段、某个地点人流量的关键影响因素进行分析,并将洞察结果面向政企客户提供;
Verizon成立精准营销部门Precision Marketing Divisio,提供精准营销洞察、精准营销、移动商务等服务,包括联合第三方机构对其用户群进行大数据分析,再将有价值的信息提供给政府或企业获取额外价值;
中国电信在大数据RTB精准广告业务(根据客户行为和位置分析进行商铺选址和实施营销)、景区流动人口监测业务、基于客户行为的中小微企业通用信用评价等方面均有尝试,且成效显著,借助对不同行业、不同类型企业的行为数据分析,中国电信的“贷 189”平台,一个月吸引中小企业580家,金融机构24家,订单成交3368万元。
中国移动和中国联通也与第三方合作,开展智慧旅游、智能交通、智慧城市等项目,探索数据外部变现的新型商业模式,寻找新的业务增长点。
3.金融领域
消费金融中的运用
天创为消费金融机构提供“数据+风控+场景”的完整解决方案。
可靠的数据渠道保障了数据的真实性、连续性和稳定性。
多角度贷后监控与风险预警
基于大数据的反欺诈服务
4.交通领域
对于驾驶者来说,不想开车的时候,在大数据和人工智能的支持下,车辆可以自动驾驶,并且对于你经常开的线路可以自学习自优化。
谷歌的自动驾驶汽车,为了对周围环境作出预测,每秒钟要收集差不多 1GB的数据,没有大数据的支持,自动驾驶是不可想象的;在和周围车辆过近的时候,会及时提醒车主避让;上下班的时候,会根据实时大数据情况,对于你经常开车的线路予以提醒,绕开拥堵点,帮你选择最合适的线路;
在出现紧急状况的时候,比如爆胎,自动驾驶系统将自动接管,提高安全性(人一辈子可能难以碰到一次爆胎,但人在紧急时的反应往往是灾难性的,只会更糟);到城市中心,寻找车位是一件很麻烦的事情,但未来你可以到了商场门口后,让汽车自己去找停车位,等想要回程的时候,提前通知让汽车自己开过来接。
车辆是城市最大最活跃的移动物体,是拥堵的来源,也是最大的污染来源之一。数字化的车辆、大数据应用将带来很多的改变。红绿灯可以自动优化,根据不同道路的拥堵情况自动进行调整,甚至在很多地方可以取消红绿灯;
城市停车场也可以大幅度优化,根据大数据的情况优化城市停车位的设计,如果配合车辆的自动驾驶功能,停车场可以革命性演变,可以设计专门为自动驾驶车辆的停车楼,地下、地上楼层可以高达几十层,停车楼层可以更矮,只要能高于车高度即可(或者把车竖起来停),这样将对城市规划产生巨大的影响;
在出现紧急情况,如前方塌方的时候,可以第一时间通知周围车辆(尤其是开往塌方道路的车辆);现在的燃油税也可以发生革命性变化,可以真正根据车辆的行驶路程,甚至根据汽车的排污量来收费,排污量少的车甚至可以搞碳交易,卖排放量卖给高油耗的车;政府还可以每年公布各类车型的实际排污量、税款、安全性等指标,鼓励民众买更节能、更安全的车。
三、大数据运用安全实践
1.国内企业的方案
京东大数据安全实践
数据资源已经成为一种基础战略资源,数据的共享和流通会产生巨大价值。然而,数据资源在流通过程中却面临着诸多瓶颈和制约,尤其是当数据一种特殊的数字内容产品时,其权益保护难度远大于传统的大数据,一旦发生侵权问题,举证和追责过程都十分困难。
为了解决这些问题,京东万象数据服务平台(如图B-6所示)利用区块链技术对流通的数据进行确权溯源,数据买家在数据服务平台上购买的每一笔交易信息都会在区块链中存储起来。
数据买家通过获得交易凭证可以看到该笔交易的数字证书以及该笔交易信息在区块链中的存储地址,待买家需要进行数据确权时,登录用户中心进入查询平台,输入交易凭证中的相关信息,查询到存储在区块链中的该笔交易信息,从而完成交易数据的溯源确权。
京东万象数据服务平台主要通过数据交易平台和区块链溯源平台2个核心模块提供服务:
数据交易平台。平台通过数据搜索、数据展示、数据评论等服务,以各种维度展示数据商品,并提供订单和支付系统完成用户数据交易;
区块链溯源平台。用户订单信息、数据标识、交易私钥等交易信息存入区块链集群中,用户获得交易凭证,并可利用该溯源平台查询溯...
- ?
2017年6月份汽车市场数据综合分析报告
Prunella
展开
习惯作为年中销售竞赛终点的农历7月份,也就是所谓的民俗月份,今年的时间点是落在8月22日,也因此年中销售竞赛将由5月起跑,一路厮杀延烧到8月份,而6月份不仅是竞赛时间轴的中间点,也是观察2017年年中买气走势的重要月份。
2017年6月份全月有30天,总共有23个工作天与7个周末假日,属于可领牌工作天数相当完整的月份,也让各车厂经销据点得以专心安排车辆领牌作业。而就销售成绩结算,6月份总市场新车销售数据为40,103辆,取得较5月份成长13.5%的成绩,稳健展现年中销售逐步加温的成绩,但是,相较于2016年6月份仍有6.2 %的衰退,一增一减之间,也让2017年上半年前6月份的累积销售数据为217,162辆,相较于2016年同期落后2.3%,差距幅度由5月份的1.3%更加扩大。
若回顾2016年6月份,有一项特殊因素是要考量进去,那就是国内针对新车标配TPMS胎压侦测器的法规,是在2016年6月底达到落日宽限期,因此,2016年6月份部分新车是赶在法规TPMS宽限期前领牌,这项因新车法规导致领牌加温的特殊因素,则是2017年6月所没有的。
1. 总市场(国产+进口)
2017年6月-厂牌别排行(国产+进口)名
次品牌销售量上月比去年比市占率1和泰丰田Toyota 、Lexus11,864114.4%82.3%29.6%2中华三菱Mitsubishi、CMC4,866127.0%109.7%12.1%3裕隆日产Nissan、Infiniti3,666108.1%88.0%9.1%4
台湾宾士Mercedes-Benz2,584111.9%98.9%6.4%5台湾本田Honda2,46795.9%106.8%6.2%6台湾马自达Mazda2,114110.3%88.8%5.3%
总市场
40,103113.5%93.8%100.0%
2. 国产轿车
2017年06 月-国产轿车TOP 10名
次
车款
销量
销售组成
1
Toyota Corolla Altis 1.83,907
2
Toyota Yaris 1.51,246
3
Nissan Tiida 1.6/1.6T1,003
4
Nissan Livina 1.6942
5
Toyota Vios 1.5865
6
Ford Focus 1.0/1.5/1.6/2.0D678
7
Toyota Camry 2.0/2.5H561
8
Nissan Sentra 1.8467
9
Honda Fit 1.5439
10
Mitsubishi Colt Plus 1.5361
其他车款(以下车款之排序不代表名次)
Ford Fiesta 1.0/1.5171
Honda City 1.5221
Hyundai Verna 1.62
Hyundai Elantra
1.6/1.8/2.0/1.6D349
Kia Morning 1.286
Luxgen S3172
Luxgen S5 Turbo 1.8/2.086
Mitsubishi Grand Lancer 1.8255
Nissan March 1.5231
Nissan Teana 2.0/2.5/3.551销售报告轿车数据,涵盖轿车、掀背车、旅行车、轿跑车与敞篷车等车型。
3. 国产休旅/商用车
2017年06 月-国产休旅车/商用车TOP 10名
次
车款
销量
销售组成
1
Toyota Sienta 1.5/1.81,489
2
CMC Veryca1,306
3
Honda HR-V 1.81,293
4
CMC Zinger 2.4925
5
Mitsubishi Delica894
6
Nissan X-trail718
7
Ford Kuga 1.5/2.0/2.0D661
8
Mitsubishi Outlander 2.4611
9
Hyundai Tucson 2.0 /2.0D45010
Luxgen U6 Turbo439
其他车款(以下车款之排序不代表名次)
Honda CR-V 2.0/2.4280
Hyundai Santa Fe103
Kia Carens152
Luxgen M7 Turbo 2.2285
Luxgen U7 Turbo 2.229
Luxgen V7 Turbo 2.217
4. 进口总市场
2017年06月-厂牌别排行(进口)名
次品牌销售量上月比去年比市占率1Mercedes-Benz2,584111.9%98.9%15.6%2Toyota2,56496.6%79.2%15.5%3Mazda2,114110.3%89.2%12.8%4BMW1,751126.0%91.3%10.6%5Volkswagen1,385124.2%139.2%8.4%6Lexus1,232130.8%89.7%7.4%总市场16,575115.3%97.9%41.3%
5. 进口车
2017 年06 月-进口一般品牌名
次轿车车款销量名
次休旅车款销量
1
Mazda Mazda39281Toyota Rav41,724
2
Volkswagen Golf4722Mazda CX-3396
3
Suzuki Ignis1763Mazda CX-5395
4
Subaru Impreza1704Volkswagen Tiguan284
5
Toyota Prius1675Subaru Forester2846Mazda Mazda61346Honda Odyssey2237koda Fabia1277Suzuki Vitara2138koda Octavia978Mazda CX-92139koda Superb939Volkswagen Touran20810Suzuki Baleno5910Toyota C-HR181其他轿车其他休旅车Subaru Outback49Toyota Previa151Volkswagen Passat46Ford Ranger124Hyundai Ioniq21Volksawgen Transporter119轿车数据涵盖轿车、掀背车、旅行车、轿跑车与敞篷车等车型。
休旅车数据涵盖运动休旅、厢式休旅与货卡车等车型。
2017 年06月-进口豪华品牌名
次轿车车款销量名
次休旅车款销量
1
Mercedes-Benz C-Class5241Mercedes-Benz GLC471
2
BMW 5 Series5062Lexus RX427
3
Mercedes-Benz E-Class4953Lexus NX268
4
Lexus ES2524Mercedes-Benz GLE192
5
BMW 3 Series2295Volvo XC601786Lexus IS1506BMW X11687Mercedes-Benz A-Class1447Porsche Cayenne1308BMW 1 Series1328Porsche Macan1299Audi A41239BMW X39910BMW 2 Series11610BMW X598其他轿车其他休旅车Volvo S60111Audi Q721Infiniti Q30111Land Rover Discovery Sport21BMW 7 Series110Volvo XC9040轿车数据涵盖轿车、掀背车、旅行车、轿跑车与敞篷车等车型。
休旅车数据涵盖运动休旅、厢式休旅与货卡车等车型。
6.特殊稀有车篇
厂牌车款销量Abarth5953Alfa Romeo159 2.21Aston MartinV12 Vantage / Vantage GT81 / 1Vanquish1AudiS11S46RS62TT7BentleyContinental GT V8 / 6.02 / 1Flying Spur V8 / Speed/6.07 / 1 / 1Bentayga3Mulsanne1BMWM221M3 / M48 / 4M54M61M760Li5X5 M2i31ChevlotCorvette1Ferrari488 GTB / Spider5 / 4California T1F121 / 1FordMustang 2.3 / GT35 / 3HondaCivic Type-R6LamborghiniHuracán Coupe1Aventador SV Coupe7MaseratiGhibli13GranTurismo S / Mc stradale5 / 1Levante25Quattroporte 3.0/ Granlus / Granlus GTS / GTS / S Q42 / 1 / 2 / 1 / 10MX-5 / MX-5 RF9 / 18Mercedes-AMGA45/ CLA4511 / 15C 4317E 43 / CLS 6323 / 4GLA 4510GLC 4312GLE 43/6342 / 2GLS 631SLC 432GT S1S 632G 55 / G 633 / 2Mercedes-MaybachS500 / S6002 / 1McLaren570GT1650S Coupe / 650S Spider1 / 1Nissan370Z2PorscheBoxster / Boxster S10 / 391118Rolls-RoyceGhost2Wraith1TeslaModel S 60 / 60D2 / 1Model S 75 / 75D15 / 2Model S 90D3 / 2Model S P100D5Model X 100D42Model X 90D21Model X 75D7Model X P100D11
结论
2017 年6月-累计销售量排行(国产+进口)名
次品牌销售量去年比市占率与领先差1和泰丰田Toyota 、Lexus63,17090.1%29.1%2中华三菱Mitsubishi、CMC25,279101.8%11.6%37,8913裕隆日产Nissan、Infiniti22,22997.4%10.2%40,9414台湾本田Honda15,229108.7%7.0%47,9415台湾宾士Mercedes-Benz14,103111.5%6.5%49,0676台湾马自达Mazda10,22984.5%4.7%52,941总市场217,16297.7%100.0%
2017 年6月-累计销售量排行(进口)名
次品牌销售量去年比市占率与领先差1Toyota15,032117.8%17.3%2Mercedes-Benz14,103111.5%16.2%9293Mazda10,22994.6%11.7%4,8034BMW9,14895.9%10.5%5,8845Volkswagen7,357143.8%8.4%7,6756Lexus6,33386.4%7.3%8,699总市场87,074104.4%40.1%
数据综合分析
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并