中企动力 > 商学院 > 表格数据分析案例
  • ?

    大数据的5大经典案例,挖掘数据背后的价值

    如彤

    展开

    大数据时代的来临,使得企业在业务运作的过程中产生的数据量呈现出了爆发式的增长。各行各业都面临着海量数据的分析和处理问题。如何运用大数据技术从海量数据中挖掘出有价值的信息,将是今后企业发展的一个巨大挑战。我们在迎接挑战的同时,也可以了解、学习国内外大数据应用中的经典案例,希望能对我们有所启示。

    01 塔吉特(Target)百货孕妇营销分析

    最早关于大数据的故事发生在美国第二大超市塔吉特(Target)百货。孕妇对于零售商来说一直是个含金量很高的顾客群体,但是她们一般都会去专门的孕妇商店。人们一提起塔吉特,往往想到的都是日常生活用品,却忽视了塔吉特也有孕妇需要的一切。在美国,出生记录是公开的,等孩子出生了,新生儿母亲就会被铺天盖地的产品优惠广告包围。如果等到孩子出生再行动就晚了,因此零售商必须赶在孕妇怀孕前期就行动起来。

    塔吉特的顾客数据分析部门发现,怀孕的妇女一般会在怀孕第三个月的时候购买很多无香乳液、无添加的化妆品、护肤品等等。几个月后,她们会购买镁、钙、锌等营养补充剂。根据数据分析部门提供的模型,塔吉特制订了全新的广告营销方案,在孕期的每个阶段给客户寄送相应的优惠券。结果,孕期用品销售呈现了爆炸性的增长。2002年到2010年间,塔吉特的销售额从440亿美元增长到了670亿美元。大数据的巨大威力轰动了全美。

    02 谷歌的意图

    如果说有一家科技公司准确定义了“大数据”概念的话,那一定是谷歌。根据搜索研究公司comScore的数据,仅2012年3月一个月的时间,谷歌处理的搜索词条数量就高达122亿条。谷歌的体量和规模,使它拥有比其他大多数企业更多的应用大数据的途径。

    谷歌搜索引擎本身的设计,就旨在让它能够无缝链接成千上万的服务器。如果出现更多的处理或存储需要,抑或某台服务器崩溃,谷歌的工程师们只要再添加更多的服务器就能轻松搞定。将所有这些数据集合在一起所带来的结果是:企业不仅从最好的技术中获益,同样还可以从最好的信息中获益。下面选择谷歌公司的其中三个亮点。

    谷歌意图:谷歌不仅存储了搜索结果中出现的网络连接,还会储存用户搜索关键词的行为,它能够精准地记录下人们进行搜索行为的时间、内容和方式,坐拥人们在谷歌网站进行搜索及经过其网络时所产生的大量机器数据。这些数据能够让谷歌优化广告排序,并将搜索流量转化为盈利模式。谷歌不仅能追踪人们的搜索行为,而且还能够预测出搜索者下一步将要做什么。用户所输入的每一个搜索请求,都会让谷歌知道他在寻找什么,所有人类行为都会在互联网上留下痕迹路径,谷歌占领了一个绝佳的点位来捕捉和分析该路径。换言之,谷歌能在你意识到自己要找什么之前预测出你的意图。这种抓取、存储并对海量人机数据进行分析,然后据此进行预测的能力,就是数据驱动的产品。

    03 沃尔玛的“啤酒加尿布”

    总部位于美国阿肯色州的世界著名商业零售连锁企业沃尔玛拥有世界上最大的数据仓库系统。为了能够准确了解顾客在其门店的购买习惯,沃尔玛对顾客的购物行为进行了“购物篮分析”。沃尔玛数据仓库里集中了其各门店的详细原始交易数据,在这些原始交易数据的基础上,沃尔玛利用NCR数据挖掘工具对这些数据进行分析和挖掘,可以很轻松地知道顾客经常一起购买的商品有哪些。一个意外的发现是:“跟尿布一起购买最多的商品竟是啤酒!”

    这是数据挖掘技术对历史数据进行分析的结果,反映了数据内在的规律。沃尔玛派出市场调查人员和分析师对这一数据挖掘结果进行调查分析。经过大量实际的调查和分析,揭示了隐藏在“尿布与啤酒”背后的美国人的一种行为模式:在美国,一些年轻的父亲下班后经常要到超市去买婴儿尿布,而他们中有30%-40%的人同时也为自己买一些啤酒。产生这一现象的原因是:美国的太太们常叮嘱她们的丈夫下班后为小孩买尿布,而丈夫们在买尿布后又随手带回了他们喜欢的啤酒。

    既然尿布与啤酒一起被购买的机会很多,于是沃尔玛就在其一个个门店将尿布与啤酒摆放在一起,结果是尿布与啤酒的销售量双双增长。

    04 中国移动的数据化运营

    通过大数据分析,中国移动能够对企业运营的全业务进行针对性的监控、预警、跟踪。大数据系统可以在第一时间自动捕捉市场变化,再以最快捷的方式推送给指定负责人,使他在最短时间内获知市场行情。

    客户流失预警:一个客户使用最新款的诺基亚手机,每月准时缴费、平均一年致电客服3次,使用WEP和彩信业务。如果按照传统的数据分析,可能这是一位客户满意度非常高、流失概率非常低的客户。事实上,当搜集了包括微博、社交网络等新型来源的客户数据之后,这位客户的真实情况可能是这样的:客户在国外购买的这款手机,手机中的部分功能在国内无法使用,在某个固定地点手机经常断线,彩信无法使用——他的使用体验极差,正在面临流失风险。这就是中国移动一个大数据分析的应用场景。通过全面获取业务信息,可能颠覆常规分析思路下做出的结论,打破传统数据源的边界,注重社交媒体等新型数据来源,通过各种渠道获取尽可能多的客户反馈信息,并从这些数据中挖掘更多的价值。

    数据增值应用:对运营商来说,数据分析在政府服务市场上前景巨大。运营商也可以在交通、应对突发灾害、维稳等工作中使大数据技术发挥更大的作用。运营商处在一个数据交换中心的地位,在掌握用户行为方面具有先天的优势。作为信息技术的又一次变革,大数据的出现正在给技术进步和社会发展带来全新的方向,而谁掌握了这一方向,谁就可能成功。对于运营商来说,在数据处理分析上,需要转型的不仅是技巧和法律问题,更需要转变思维方式,以商业化角度思考大数据营销。

    05 阿里信用贷款和淘宝数据魔方

    中国最大的电子商务公司阿里巴巴已经在利用大数据技术提供服务:阿里信用贷款与淘宝数据魔方。

    每天有数以万计的交易在淘宝上进行。与此同时相应的交易时间、商品价格、购买数量都会被记录。更重要的是,这些信息可以与买方和卖方的年龄、性别、地址、甚至兴趣爱好等个人特征信息相匹配。各大中小城市的百货大楼做不到这一点,大大小小的超市做不到这一点,而互联网时代的电商可以做到。

    淘宝数据魔方就是淘宝平台上的大数据应用方案。通过这一服务,商家可以了解淘宝平台上的行业宏观情况、自己品牌的市场状况、消费者行为情况等,并可以据此进行生产、库存决策,而与此同时,更多的消费者也能以更优惠的价格买到心仪的宝贝。

    而阿里信用贷款则是阿里巴巴通过其掌握的企业交易数据,借助大数据技术自动分析判定是否给予企业贷款,全程不会出现人工干预。截至目前,阿里巴巴已经放贷300多亿元,坏账率约0.3%左右,大大低于商业银行。

  • ?

    Excel|数据分析和展示数据分析结果的标准格式与制表习惯

    郝嫣然

    展开

    1 用于展示数据分析结果的表格

    以下是同样的数据、不同的格式所展示出的数据可读性:

    很明显,第二份表格更具有可读性,显得一目了然,而不是杂乱无章。

    是怎么做到的呢?

    1.1 行高设为“18”(字体“11”保持默认);

    1.2 数字字体设为Arial;

    1.3 项目下的细项进行了缩排(缩进栏宽设为“1”);

    1.4 数字列调整为相同宽度,其他列视内容调整宽度。且在上、下、左、右都有空白;

    1.5 表格框线:上下粗,其余细或虚,保留横线,去掉竖线,具不显示网格线;

    1.6 文字靠左对齐,数字靠右对齐;

    1.7 善用背景色凸显重点;

    1.8 一列数据尽量不要包括复合的内容,如将“单位”放到单独的列。

    2 内容按手动输入、引用、公式区分字体颜色

    举例

    字体颜色

    手动输入的数字

    50

    黑色

    计算公式的数字

    =A1+A2

    绿色

    引用其它工作表的内容

    =Sheet3!A1

    蓝色

    如:

    3 用于进行数据分析的事务性数据

    具体内容请见《Excel技巧 | 高效的数据分析需要良好的制表习惯》。

  • ?

    做好数据分析必备的5种典型可视化图表|技能卡片No.1

    南来风

    展开

    文/GrowingIO

    发布于2天前

    阅读1524

    评论0

    喜欢0

    标签:

    产品经理

    数据分析

    单图 | 最基础的可视化数据分析工具

    对产品和运营来说,和数据打交道成了日常。总结下来,你的需求具体是什么呢?

    1. 数据监控

    每次听到老板说,今天浏览量掉了很多。你就心头一紧,老板都知道了你还不知道?

    老板:不应该。

    产品和运营一定要对网站每天的 PV、UV 等总体数据有一个直观的把握,包括它们的数值、趋势等。用 GrowingIO 的单图建立图表,能让信息传达更迅速、直观,一旦出现数据过高或过低的情况,就可以马上拆解,及时介入。再也不用等老板来告诉你今天数据又掉了。

    2. 数据分析,拆解问题

    数据掉了,什么原因呢?你又心头一紧,可能是这届用户不行?

    老板:加上「可能」,就是你无能。

    当一个总体数据出现异常,比如浏览量突然降低,原因可能有很多,产品本身问题、运营问题等等。这时候就需要对浏览量这一指标进行不同维度的拆解,比如各个访问来源的变化,各个浏览设备的变化等,GrowingIO 的单图提供多种指标和维度,能让你准确定位问题,迅速解决问题。

    3. 可视化展示

    来,给团队同步一下项目进展。你还是心头一紧,毕竟只有一堆冷冰冰的数字啊。

    老板:hmmm,不是很想看。

    在集体协作中,你需要将分析结果更友好地展示给其他人,比如写周报、项目进展汇报等。而如何更好地呈现你的分析结果呢?来,接下来我们看图说话

    一、趋势图

    趋势分析是最基础的图表分析,包括线图、柱状图、堆积图等多种形式。

    1. 线图

    线图可以观察一个或者多个数据指标连续变化的趋势,也可以根据需要与之前的周期进行同比数据分析。

    2. 柱状图 & 堆积图

    柱状图可以观察某一事件的变化趋势;还可以同时将整体拆分可以做成堆积图,同时观察到部分所占比重及变化趋势。

    产品经理和运营人员通过趋势图分析流量的实时走向,如每日 PV、UV、DAU 等基本数量指标以及停留时长、平均访问页面数等质量指标,可以及时把握产品的变化趋势。一旦趋势周期对比发生异常(异常高和异常低),我们需要及时介入排查原因、解决问题。

    二、频数图

    根据业务需求对指标按照一定维度拆分,对比不同组别的频数,便于分清轻重缓急。

    条形图清晰展示了用户在不同类别上的频数,并且按照数量从大到小排序。上图展示的是某产品用户使用浏览器的频数分布,在资源有限的情况下产品可以先适配 Chrome 和 IE 浏览器以提升绝大部分用户体验。

    上面的双向条形图展示了某 B 端产品的客户平均停留时长极端情况(非常高和非常低),企业 1-5 非常活跃,可以让运营人员促进客户增购、续约,而企业 6-10 活跃度非常低,用户即将流失,需要运营人员立刻介入干预。

    三、比重图

    比重分析主要是用来了解不同部分占总体的比例。横向比较,扇形图、环形图可以满足这类需求;纵向比较,百分比堆积图可以显示不同部分所占比例的趋势变化。

    1. 环形图

    「环形图」显示了某节点访问用户来源渠道比例。

    2. 百分比堆积图

    「百分比堆积图」动态显示了不同渠道比例的变化趋势,市场或者运营人员可以据此动态优化我们的资源投放。

    四、表格

    表格信息密集,可以同时分析多维度、多指标数据,适合对数据敏感的人群使用。虽然表格能看到具体的数值,但是不能直观看到趋势、比重。

    通过表格不难发现,移动端访问用户占了非常大的比例,但是跳出率非常高。这样的表格数据启示我们有必要优化移动端产品,提升整体访问深度。

    五、其他表格

    下面介绍的是气泡图,气泡图用来展示一个事件与多个维度之间的关系,如分析 B 端产品客户成单周期与客户活跃度、登录账号数量之间的关系。

    除了上述常见的图表,还有散点图、箱线图、股价图、雷达图等图表,在此不一一赘述。

    六、写在最后

    不同的图表样式可以满足你不同的分析需求,你可以根据自己的目的来选取最合适的指标、维度和图表样式。工具的作用在于,让上手过程更快更顺畅一些,让更多更高级的需求能够被满足和呈现。

    GrowingIO 的单图功能提供了很低的门槛,以及很高的自由度。数据分析小白可以用单图做各种基础的数据分析,生成各种报表;对数据分析有深刻理解的人,可以将各种维度指标组合,针对业务场景做出极具洞察力的数据报表。

    注:文中所有图表,皆来源于硅谷新一代用户行为数据分析工具 - GrowingIO。

    本文由 @GrowingIO 原创发布于产品壹佰,未经许可,禁止转载。

  • ?

    第5课:Excel数据透视表各种汇总实例!

    塞尔玛

    展开

    “Excel数据透视表有一个灵活的特点,根据你的需求实时变动汇总方式”

    01

    实例分析

    如下所示:是一份销售流水数据,有时间,月份,区域,商品,数量,金额几个字段,如下所示:

    现在针对不同的数据汇总需求,可以制作不同的数据透视表进行汇总分析数据,关键是各个字段需要放置的位置不同,从而得到我们想要的结果

    02

    呈现数据方式案例

    问题1、需要知道各个区域销售的数量和金额情况?

    思考几秒钟,这种需要将“区域”字段拖动至行,将“数量”和“金额”字段拖动至值即可,操作窗口如下所示:

    问题2:需要知道每个区域,各种商品销售的金额,有两种展示方式

    第1种是将区域和商品字段都拖入行,将金额插入值,效果如下:

    第2种是将区域拖入至行,将商品拖入至列,将金额拖入至值,得到的结果如下:

    问题3:需要知道各个区域,各种商品销售的数量和金额情况,也有两种展示方式

    第1种是将区域和商品两个字段拖入行,将数量和金额拖入值,展示效果如下所示:

    第2种是将区域插入至行,将商品拖入至列,将数量和金额拖入至值,展示效果如下所示:

    从中我们总结一个数据透视表的规律,当我们的值标签里面有两个字段时,最好列标签里面不要放内容,要不然表格会很庞大。

    问题4:需要知道每个区域每个商品,每个月销售金额是多少

    当然根据自己的需要,月份,区域,商品,三个字段的位置可以调整,并且行项目里面可以上下级的更换位置,如下是商品和区域调换位置的结果:

    主要看我们分析的侧重点在哪,然后决定字段的位置摆放

    本节完,有什么不懂的可以留言讨论,期待您的转发分享

    欢迎关注,更多精彩内容持续更新中...

    --------------

  • ?

    电商第一步,学会表格数据分析

    巫曼易

    展开

    今天为大家分享一个数据分析的方法,大家可以打开店铺后台,看着步骤来操作。

    很多电商人都知道数据分析的重要性,但是真正做起来却发现无从下手,而且即使是看到数据之后,也不知道怎么分析,往往是看着一个连接“莫名奇妙”的爆了,又“莫名其妙”的死了。

    其实每个链接的起爆和衰落都是有原因的,只要掌握今天的数据分析方法,在以后的操作过程中才能真正看清数据,掌握数据

    首先,打开生意参谋,商品-商品效果-选择日期,在选择日期时,建议大家往前倒推15天的时间,比如今天是30号,那么,就从这个月的15号开始,选择好日期之后,点击下载。

    下载好15号的数据之后,再选择16号,继续下载,把最近15的的数据下载下来以后是这样的。

    这是我们店铺所有链接在过去15天的所有数据,而且非常详细,可以说,过去15天的店铺的起落兴衰内在原因都在这里了,接下来我们开始将这些数据重新组合整理,以便于更直观的看到所有链接的详细数据,从而进行数据对比,分析,得出结论,打开第一个表格是这样的。

    这是所有的链接在10.10日的数据,第一个链接是主打款,是主要分析目标,所以把这一排全部复制下来,放在一个新的表格里。

    然后把10.11之后的所有数据全部复制下来,放在一个表格里,把无关紧要的数据删掉,以免影响我们的专注力。

    ps:在删无关紧要的数据时要注意看数据浮动大不大,比如平均停留时长这一项,如果这一项波动特别大就不要删掉,波动不大的话就删掉,因为它只是次要数据,不是核心数据,最后留下来的核心数据,见下图:

    这个是我已经做好的表格,最后的收藏率和加购率是手动加上去的,因为官方没有提供这两个数据,但是官方提供了收藏人数和访客数,所以我们就可以手动算出来。

    在收藏率下输入公式:‘=收藏人数/访客数’然后回车,就会得到这个链接的收藏率,把这一列拖下来即可得到所有日期的收藏率,加购率也是一样操作即可

    为了方便观察数据,我们把所属终端这一行改成日期,见下图:

    这样是不是一目了然了?哈哈哈,是不是感觉所有原因都自动跳出来了!

    重点看流量暴涨的10.19号--22号这4天数据:

    访客数暴涨的同时,搜索引导的访客数也在暴涨,而且直通车并没有加大投入,所以接下来我们着重看搜索数据,我们知道,现在所有的数据,都是结果,是上一个周期的数据浮动才导致的结果。

    所以接下来我们看上一个周期发生了什么。

    发现什么秘密没有?

    每次流量大涨之前的一天,搜索支付转化率都是超过5%的!记住这个数字。

    10.17号和10.18号,连续两天都超过了5%,然后导致10.19号访客数直接翻翻!

    所以也就是说,在这个类目,这个客单价下,我们的搜索支付转化率不能低于5%,这是一个系统云计算得出的数据,只要能够稳住这个数值,理论上来说,这个链接是必爆无疑的!

    当然,除了数据之外,还有很多其他方面的权重值也很重要,比如客服回复时长,动销率,发货速度,好评率,dsr,等等,我们今天只分析数据,其他方面有空再详解。

    还有一点值得注意的是:

    有些类目权重计算核心并不是支付转化率!

    有些类目权重计算核心并不是支付转化率!

    有些类目权重计算核心并不是支付转化率!

    但是大部分类目都逃不过这个表格里的所有数据,有了这个表格基本都能够计算出来类目权重算法,目前最核心的数据有:支付转化率,uv价值,收藏率,加购率。

    只要能够找出自己类目的核心权重,然后维护好这个数据,在产品没问题的情况下,想不爆,太难了!

    客单价69左右的女裤类目的核心权重是转化率,客单价129左右的天猫女鞋核心权重是uv价值,这一点很难复制,只能用自己的店铺数据去推断,找出这个潜在规律即可。

    免责声明:本文使用图文及视频等作品部分源于网络,我们尊重著作权所有人的合法权益,如涉及版权争议,请著作权人告知我方删除

  • ?

    惊艳全球数据行业的16个数据可视化案例

    邹映波

    展开

    数据是非常强大的。当然,如果你能真正理解它想告诉你的内容,那它的强大之处就更能体现出来了。

    通过观察数字和统计数据的转换以获得清晰的结论并不是一件容易的事。必须用一个合乎逻辑的、易于理解的方式来呈现数据。

    谈谈数据可视化。人类的大脑对视觉信息的处理优于对文本的处理——因此使用图表、图形和设计元素,数据可视化可以帮你更容易的解释趋势和统计数据。

    但是,并非所有的数据可视化是平等的。(点击“为什么大多数人的图表和图形看起来像废话”了解我想表达的意思)

    那么,如何将数据组织起来,使其既有吸引力又易于理解?通过下面的16个有趣的例子获得启发,它们是既注重风格和也注重内容的数据可视化案例。

    什么是数据可视化?

    数据可视化是指将数据以视觉形式来呈现,如图表或地图,以帮助人们了解这些数据的意义。

    文本形式的数据很混乱(更别提有多空洞了),而可视化的数据可以帮助人们快速、轻松地提取数据中的含义。用可视化方式,您可以充分展示数据的模式,趋势和相关性,而这些可能会在其他呈现方式难以被发现。

    数据可视化可以是静态的或交互的。几个世纪以来,人们一直在使用静态数据可视化,如图表和地图。交互式的数据可视化则相对更为先进:人们能够使用电脑和移动设备深入到这些图表和图形的具体细节,然后用交互的方式改变他们看到的数据及数据的处理方式。

    感到兴奋了吗?让我们来看一些不错的交互和静态数据可视化的例子。

    交互数据可视化的实例

    1)为什么会有“巴士群”现象

    这里有一个关于复杂数据集的很好的例子,它看起来感觉像一个游戏。在这个例子里,Setosa网站为我们呈现了“巴士群”现象是如何发生的,即,当一辆巴士被延迟,就会导致多辆巴士在同一时间到站。

    只用数字讲述这个故事是非常困难的,所以取而代之的是,他们把它变成一个互动游戏。当巴士沿着路线旋转时,我们可以点击并按住一个按钮来使巴士延迟。然后,我们所要做的就是观察一个短暂的延迟如何使巴士在一段时间以后聚集起来。

    2)世界上的语言

    这个由DensityDesign设计的互动是个令人印象深刻的成果,它将世界上众多(或者说,我们大多数人)的语言用非语言的方法表现出来。一共有2678种。

    这件作品可以让你浏览使用共同语言的家庭,看看哪些语言是最常用的,并查看语言在世界各地的使用范围。这是一种了不起的视觉叙事方法:将一个有深度的主题用一种易于理解的方式解读。

    3)按年龄段分布的美国人口百分比

    这是如何以令人信服的方式呈现一种单一的数据的好榜样。Pew Research创造了这个GIF动画,显示随着时间推移的人口统计数量的变化。这是一个好方法,它将一个内容较多的故事压缩成了一个小的package。

    此外,这种类型的微内容很容易在社交网络上分享或在博客中嵌入,扩大了内容的传播范围。如果你想自己用Photoshop做GIF,这里有一个详细的教程。

    4)NFL(国家橄榄球联盟)的完整历史

    体育世界有着丰富的数据,但这些数据并不总是能有效地呈现(或者准确的说,对于这个问题)。然而,FiveThirtyEight网站做的特别好。在下面这个交互式可视化评级中,他们计算所谓“等级分” – 根据比赛结果对球队实力进行简单的衡量 – 在国家橄榄球联盟史上的每一场比赛。总共有超过30,000个评级。观众可以通过比较各个队伍的等级来了解每个队伍在数十年间的比赛表现。

    5)Google Flights 上的美国感恩节

    下面是将一段时间内在空中移动的物体进行可视化的好方法。这是由Google Trends驱动的项目,它跟踪感恩节前出发、到达和穿越美国的航班。可视化始于当天很早的时间,随着时间的推移,像播放电影一样显示在全国各地飞行中的航班。不需要显示时间外的任何数字,观众即可以看到当天哪段时间是国际航班、国内航班以及往返于全国各地不同枢纽的航班的热门时间。

    6)是什么真正造成了全球变暖?

    听说过一种建议,“不要只简单地展示数据,讲个故事吧”?这正是彭博商业正在做的可视化 ——用互动讲述故事的来龙去脉。

    此图的关键点是要反驳用自然原因解释全球变暖的理论。首先你会看到从1880年至今观测到的温度上升。当你向下滚动,这个可视化图会让你清楚的了解相较于已被观测到的因素,造成全球变暖的不同因素到底有多少,使故事内容更加丰富。作者希望观众能够得到非常清晰的结论。

    7)在叙利亚,谁和谁在战斗

    许多不同的团体之间的关系可能很难理解 – 尤其是当有11个这样的团体存在的时候,这些团体之间有的结盟,有的敌对,反之亦然。这让人难以理解。但是,Slate网站通过表格的形式和熟悉的视觉效果和色彩,将这些数据简化为一种简单的、易于理解和互动的形式。

    观众可以点击任一张脸来查看双方关系的简要描述。

    8)最有价值的运动队

    这是通过叠加数据来讲述深层故事的一个例子。这个交互由Column Five设计,受福布斯“2014年最具价值的运动队50强”名单得到的启发。但是它不仅将列表可视化,用户还可以通过它看到每支队伍参赛的时间以及夺得总冠军的数量。这为各队的历史和成功提供了更全面的看法。

    9)美国风图

    下面是是个类似感恩节航班的可视化图,除了图中显示的时刻,它还能实时显示美国本土的风速和风向。它是直观设计的一个很好的案例:风速用线条移动的快慢来表示,方向通过线条移动的路径来表示。它会即时显示美国风向的总体趋势,无需任何数字,除非你在地图上点击鼠标。另外,使用时设定最多两个变量会使它更容易操作。

    静态数据可视化实例

    10)政治新闻受众渠道分布图

    据Pew研究中心称,通常,当设计师在信息内容很多又不能删节的时候,他们通常会把信息放到数据表中,以使其更紧凑。但是,他们使用分布图来代替。为什么呢?因为分布图可以让观众在频谱上看到每个媒体的渠道。在分布图上,每个媒体的渠道之间的距离尤为显著。如果这些点仅仅是在表中列出,观众无法看到每个渠道之间的比较。

    11)著名创意人士的日常惯例

    这个数据的可视化图是用奇特的想法描绘一个简单的概念。这个表格利用Mason Currey的《日常惯例》一书中的信息展示了那些著名的创意人士的日程安排,解读其时间和活动安排。这不仅是一个操作数据的例子(因为你可以通过单独的活动来浏览日程安排),也是一个品牌宣传的佳作。

    12)今年发生了哪些新闻?

    最好的数据可视化方式,就是用直观和美丽的方式传达信息。Echelon Insights致力于这一方式,即将2014年Twitter上最受关注的新闻进行可视化。1亿8450万条推文是什么样子?如图所示的艺术品。

    13)问题的深度

    当你想强调规模的时候,静态数据可视化是表达你的观点的极佳方式。下面这张来自《华盛顿邮报》的信息图长得令人难以置信…这是故意的。他们在图中展示了一架飞机可以探测到的深海信号是多么的深,通过比较飞机的探测深度与高层建筑、已知哺乳动物的最大深度、泰坦尼克号沉船的深度等。这是简单的视觉效果和颜色梯度的极佳使用方式。最后,将数据添加到新闻报道(文中为失踪的马航)是提供背景的好方式。

    14)Funding the Final Frontier

    上述图表相对简单,以下是创造设计精致的、传递大量数据的图标方法。秘诀何在?用简单的和干净的格式,便于读者理解数据。这个由GOOD Magazine 和 Column Five制作的图表,解读了NASA的五年预算,显示资金将怎么花、花在哪里。此外,它有主题设计-一个全方位的胜利。

    15)Kontakladen慈善年度报告

    不是所有的数据可视化都需要用动画的形式来表达。当现实世界的数据通过现实生活中的例子进行可视化,结果会令人惊叹。设计师Marion Luttenberger把包含在Kontakladen慈善年报中的数据以一种独特的方法表现出来。该组织为奥地利的吸毒者提供支持,所以Luttenberger的使命就是通过真实的视觉来宣传。例如,这辆购物车形象的表现了受助者每一天可以负担得起多少生活必需品。

    16)Austria Solar 年度报告

    虽然有许多方法使数据视觉化,但是使用信息主题去真实创建数据可视化(注意了)意义重大。这份来自Austria Solar 的年度报告通过页面上的太阳光感墨水用真正的太阳能赋予公司数据以生命。一句话:他们是天才。

    -END-

  • ?

    作为数据分析师,用的最多的竟是Excel表格

    Ramsey

    展开

    【摘要】:结合实际数据分析工作,简要介绍了VLOOKUP函数的基础应用,重点介绍亲测高效有难度的VLOOKUP函数高级应用。最后分享我运用Excel的一点技巧。

    毕业后,第一份工作是在一家互联网公司做数据分析。

    尽管和所学专业没那么匹配,但我还是挺满意。因为向来对数字很敏感,对常用统计软件也都有所了解。

    正式入职,发现面试时说的什么SPSS,Eviews统统都不用,基本就是用Excel。对于研究生毕业,第一份工作,我多少有些落差。既来之则安之,我心想用什么工具最方便,工作中应该可以自己选择。对于word和ppt还算熟练,Excel也就一般。多学点总不会差。

    开始工作,我发现Excel的功能简直太强大,我之前了解的仅是皮毛。尤其在更新到2013版后,操作更智能和快捷,数据量大时计算较费时。对于日常工作影响倒不大,借助Excel我的数据分析工作也很快上手。

    除了宏不太会,工作之余也会多琢磨一些公式和操作。以至于同办公室的同事,甚至外部门的同事都来找我帮忙解决Excel的问题。时间久了,领导特意让我在部门内部定期做教学分享。

    我确实喜欢和数据打交道的感觉,从冗杂的繁琐数据中分析出最终的结果相当有成就感。在简书上也看到了许多实用的Excel操作指南或技巧。

    今天分享一个职场中最常用,功能强大,却少有人掌握的VLOOKUP函数。很多文章都提到过这个函数的基础应用,此外还有一个高级应用,是我在工作中遇到,亲测高效快捷的有力工具。

    VLOOKUP函数---最最最常用的查找函数

    四个必备参数=(要查找的值,要查找的区域,返回数据在查找区域的第几列数,逻辑值)

    注: FALSE或0,则返回精确匹配,如果找不到,则返回错误值 #N/A(首选)

    TRUE或1,则返回近似匹配值,如果找不到,则返回小于第一个参数的最大值。

    VLOOKUP函数的基础应用:一对一的匹配

    理解上述文字很晦涩,用实例来说明。

    例1: 下图中左表为源数据:各类产品在三个城市的日销售数据。

    需求:查询产品B和F在上海的销售额。

    因为提供的数据量很少,人工查找就能完成。但实际工作中数据量很庞大,人工查找费时费力且准确率低。这时用VLOOKUP一秒搞定。

    做法:在G2单元格内,输入公式,见红框内。回车后,出现结果;将公式复制或下拉至G3,同理可得结果。

    参数解释:

    (1)“F2”为我们要查找的参照值,即在源数据第一列查找“产品B”。当公式下拉复制时,自动切换为查找F3。

    (2)“A:C”指我们要在此范围内查找数据。该参数也可写为“$A$2:$C$9”,即绝对引用。这样可保证无论公式如何拖拽复制,数据源始终固定引用该区域。

    (3)参数“3”指在选择的数据源“A列-C列”范围内,要查询的销量在引用的第三列,即C列。

    (4)FALSE,即精确查找。

    这样,通过应用该函数,实现了产品型号和销量一对一的匹配查找。

    应用该公式的硬性条件:

    (1)必须保证需要查找的参照值与源数据格式一致。

    即例1中:F列与A列完全一致,不仅内容相同,尤其保证单元格格式一致,否则只会返回错误值 #N/A。如不一致,查找前需转换成一致的格式。有时较难分辨。

    (2)必须保证源数据表中的第一列没有重复项。

    即A列中没有出现重复的产品类型。假如源数据中出现了多行“产品B”,那么在查找时只能返回第一次“产品B”出现时对应的销量。

    当(2)无法满足时,查找不再是一对一,而是一对多的匹配。需要对VLOOKUP函数进行扩展才得以实现查找功能。

    VLOOKUP函数的高级应用:一对多的匹配

    例2:下图左表为客服中心的每日工作记录,日积月累,这个表数据量庞大且信息冗杂。

    需求:王丹和张鹏岗位变动,需将他们接待过的全部客户汇总转交其他同事维护。

    数据量小手动筛选即可,使用透视表也可完成。这里我借助简单的例子,介绍如何使用VLOOKUP完成。当数据量庞大,这是较便利的方法。

    做法:

    第一步:将A列排序,在A与B列间新插入两列。

    第二步:计数。在B2输入公式=COUNTIF(A$2:A2,A2),回车,下拉即可。

    目的是对A列中同一个名字的出现次数进行计算。如图李珊出现了四次。

    第三步:构建辅助列。在C2输入公式=A2&B2,回车,下拉即可。目的在于将A列B列的内容合并。这时C列即为辅助列。保证了源数据的唯一性,此时已满足VLOOKUP基础应用的第二个硬性条件。

    第四步:进行匹配查找。在H2输入公式=VLOOKUP($G2&H$1,$C$2:$D$18,2,FALSE), 复制公式至其他单元格即可得到结果。

    与基础应用相比,仅参数1有变化,涉及相对引用和绝对引用问题。

    参数1:将“客服姓名&序号“合并作为第一个参数。公式向右向下复制后,“客服姓名”行变列不变,所以锁定列。“序号”列变行不变,所以锁定行。即为:“$G2&H$1”。锁定即绝对引用。(此处较难理解,操作中通过尝试能够理解透)

    参数2:绝对引用C2至D18区域。即为:“$C$2:$D$18”,新数据源。

    参数3:返回所选区域C2至D18中的第2列数据。即为:客户姓名

    参数4:FALSE,即精确查找。

    第五步:将H2中的公式向下向右复制至K3,即得全部结果。可对比源数据表验证是否正确。

    在序号为4的单元格内出现了#N/A值。表明没有找到“王丹4”和“张鹏4”对应的内容,说明这两人接待的客户仅有3人。

    这样,通过其他功能辅助,实现了客服与客户一对多的匹配查找。

    总结:VLOOKUP的高级应用是在基础应用的基础上,借助了COUNTIF和&函数,构建辅助列,使得源数据表中第一列无重复。四个必备参数中仅参数1涉及绝对引用和相对引用,略有难度。

    应用Excel的技巧

    1.填充了公式的单元格,在得到结果后,最好将计算结果转换为“值”。

    两个好处:一是避免源数据的任何变动再次影响公式的计算结果;二是Excel本身计算较费时。如公式一直存在,每次打开该文件,或是刷新时都会重新计算,严重影响Excel运算速度。

    2.Excel的数据承载量相对较小。2013版每个sheet能够填充接近105万行。

    如果涉及较多sheet,数据量可想而知。因此在上一条的基础上,必须及时保存,否则数据量大时Excel难免会出现重启。毕竟多数人用的都是免费版,为了避免做无用功,及时保存很重要。这可是次次抓狂的经验教训。

    3.Excel的功能很丰富,没有哪一本书或是哪一个老师能够完全教会所有功能。

    更实际的是,从点到面去学习。比如说我介绍了VLOOKUP函数的应用,其中涉及到了绝对引用的概念,以及countif函数的应用,这时就引导你去学习新知识。

    任何功能的组合都能起到耳目一新的作用。

    4.Excel做不到死记硬背,多练习才利于掌握。

    比如说,在工作中我给同事教过无数次VLOOKUP函数的应用,当时似懂非懂,勉强会用。想不到的是他们下一次遇到早已忘得一干二净。在我看来是很简单的一个公式而已,仅需掌握四个参数。关键是他们不常用,而我几乎天天用。

    任何技能都是如此。孰能生巧,才能更快掌握更多功能。哪怕是多记几个快捷键,都会为你使用Excel加分不少。

    多学一点技能,就能少求助别人,且让别人来求助于你。普通离优秀,永远差一项技能。

    写出来为分享,也为记录。

    PS:如果没有看懂,或是觉得现在用不到我介绍的公式。没关系,请收藏,因为工作后,无论做什么工作一定一定一定会用到VLOOKUP。

    请尊重原创的辛苦。欢迎分享,欢迎交流。

  • ?

    值得膜拜的三个数据分析案例

    凡人恋

    展开

      今天给大家分享三个数据分析的经典案例,主要是学习其中的思路,当故事看吧,不要拘泥于文中故事的真实性。每个故事我简单的做一个点评吧

      1、数据分析大神 高手在民间

      这天,新上任的邢县长到小吃摊吃早餐,刚找个板凳坐下,就听炸油条的胡老头一边忙活一边唠叨:“大家吃好喝好哦,城管要来撵摊儿了,起码三天你们捞不着吃咱炸的油条了!”

      邢县长心里一惊:省卫生厅领导最近要来视察,昨天下午县里才决定明后两天开展突击整治,这老头儿怎么今天一早就知道了?

      哪料这件事还没弄明白,另一件事儿让县长脑袋里的问号更大了。一天,他照例到胡老头这儿吃油条。没想到,老头居然又在发布消息:“上面马上要来青天大老爷了!谁有什么冤假,就去县府宾馆等着吧!”

      邢县长又是吃惊,又是恼怒。省高院的工作组星期三要来清查积案,这个消息昨天晚上才在常委会上传达,这老儿咋这么快就知道了呢?让他更吃惊的是,这老家伙不但对大领导们的行程了如指掌,就连派出所要突击检查娱乐场所这样的绝密行动,他都知道得清清楚楚。

      一个大字不识的老头儿,居然能知道这么多政府内部消息,毫无疑问,定是某些政府工作人员保密意识太差,嘴巴不紧。于是,他立即召开会议,把那些局长、主任狠批了一通。与会领导个个低着头、不敢出声。

      还是公安局长胆大,忍不住问道:“邢县长,这胡老头儿的事是您亲眼所见,还是道听途说来的?”

      邢县长声色俱厉地一拍桌子:“都是我亲耳听到的!我问你,你们城关派出所今天晚上是不是要清查娱乐城?”

      公安局长一脸尴尬,楞在那里。邢县长气恼地当即下令:“你亲自去查查这老头儿到底什么背景,明天向我汇报!”公安局长赶紧换上便装,立马跑到胡老头那儿进行暗访。没想到,老家伙正在向大伙儿发布新闻:“城关镇的镇长最近要倒霉了。大伙等着瞧,事儿不会小的……”

      公安局长一听,很是诧异。于是,他运了口气,腆着笑脸,装傻卖呆似的问道:“你咋知道的?难道你儿子是纪委书记?”

      胡老头呵呵一笑:“我咋知道的?那孙子以前吃我的油条,都是让司机开专车来买,这两天一反常态,竟然自己步行来吃,还老是一脸愁容。那年他爹死,都没见他那么难受过。能让那孙子比死了爹还难受的事,除了丢官儿,还能是啥?”

      局长听了,暗自吃惊,这老头儿还真有两下子。于是他不动声色继续问道:“那昨天派出所清查娱乐城,你是咋知道的?”

      胡老头又是一笑:“你没见那几家娱乐城一大早就挂出了停业修缮的牌子?人家有眼线,消息比咱灵通!”

      “那卫生厅领导来视察,你是咋知道的?”

      胡老头儿说:“除了上面来人检查,你啥时见洒水车出来过?”。

      最后,局长问了个他最想不通的问题:“上次省高院的工作组来指导工作,你咋那么快就得到消息了呢?”

      胡老头撇了撇嘴说:“那就更简单了。俺邻居家有个案子,法院拖了八年不办。那天,办案的法官突然主动来访,满脸笑容问长问短,还再三保证案子马上解决。这不明摆着上面来了人,怕他们上访嘛!”

      局长佩服得五体投地,连忙一路小跑赶回去,把情况向邢县长汇报。县长听了,大动肝火,马上再次召开会议,做了四个小时的训话:“同志们,一个炸油条的都能从一些简单现象中,看出我们的工作动向,这说明了什么?说明我们存在太多的形式主义。这种恶习不改,怎么能提升政府形象?从今天开始,哪个部门再因为这种原因泄密,让那老头‘未卜先知’,我可就不客气!”

      次日一早,邢县长又来到胡老头儿这儿吃油条,想验证一下开会的效果。没想到胡老头居然又在发布最新消息:“今天,上面要来大领导了,来的还不止一个!”

      邢县长这一惊,真是非同小可。下午,市长要陪同省领导来检查工作,自己昨晚才接到通知,这老头咋又提前知道了?

      邢县长强压怒火,问胡老头:“你说要来大领导,到底有多大呢?”

      胡老头儿头也不抬地回答:“反正比县长还大!”

      邢县长又问:“你说要来的不止一个,能说个准数吗,到底来几个?”

      胡老头儿仰起头想了想,确定地回答:“四个!”

      邢县长目瞪口呆,上级领导还真是要来四个!他心里怦怦直跳,又问:“胡……胡师傅,这些事儿你是怎么知道的?而且知道的这么准确。”

      胡老头儿淡淡一笑:“这还不容易?我早上出摊儿,见县府宾馆的保安都戴上了白手套,一个个如临大敌,肯定是上面来人了。再看看停车场,书记、县长的车都停在了角落里,肯定是来了比他们大的官儿。再仔细看看,书记、县长停的车位是5号、6号,说明上面来了四个领导。你信不信?当官儿的和咱老百姓不一样,上厕所都要讲究个级别、排个先后顺序呢!”

      邢县长听罢,张着塞满油条的大嘴,一动不动,好像僵化了似的…

      (本故事来自于网络)

      启示:

      与其说高手来自于民间,还不如说生活是我们数据分析的基本素材,善于观察、善于整理关联信息才是我们做数据分析人员应该掌握的基本技能。可是啊,很多人忽略了我们身边的生活常识,不去思考,人云亦云,就像网上的这个全国离婚率排行榜数据,很多人首先不是思考数据的准确性,而是感叹世风日下。

      想想吧,在你的生活圈子中,每3对夫妻就有1对离婚的吗?如果答案为“是”,我只能说,贵圈真乱!哈哈哈

      2、林彪的数据挖掘本领

      1948年辽沈战役开始之后,在东北野战军前线指挥所里面,每天深夜都要进行例常的“每日军情汇报”:由值班参谋读出下属各个纵队、师、团用电台报告的当日战况和缴获情况。

      那几乎是重复着千篇一律的枯燥无味的数据:每支部队歼敌多少、俘虏多少;缴获的火炮、车辆多少、枪支、物资多少….

      司令员林彪的要求很细,俘虏要分清军官和士兵,缴获的枪支,要统计出机枪、长枪、短枪;击毁和缴获尚能使用的汽车,也要分出大小和类别。

      经过一天紧张的战斗指挥工作,人们都非常疲劳。整个作战室里面估计只有定下这个规矩的司令员林彪本人、还有那个读电报的倒霉参谋在用心留意。

      1948年10月14日,东北野战军以迅雷不及掩耳之势,仅用了30小时就攻克了对手原以为可以长期坚守的锦州并全歼了守敌十余万之后,不顾疲劳,挥师北上与从沈阳出援的敌精锐廖耀湘基团二十余万在辽西相遇,一时间形成了混战。战局瞬息万变,谁胜谁负实难预料。

      在大战紧急中,林彪无论有多忙,仍然坚持每晚必作的“功课”。一天深夜,值班参谋正在读着下面某师上报的其下属部队的战报。说他们下面的部队碰到了一个不大的遭遇战,歼敌部分、其余逃走。与其它之前所读的战报看上去并无明显异样,值班参谋就这样读着读着,林彪突然叫了一声“停!”他的眼里闪出了光芒,问:“刚才念的在胡家窝棚那个战斗的缴获,你们听到了吗?”

      大家带着睡意的脸上出现了茫然,因为如此战斗每天都有几十起,不都是差不多一模一样的枯燥数字吗?林彪扫视一周,见无人回答,便接连问了三句:

      “为什么那里缴获的短枪与长枪的比例比其它战斗略高”?

      “为什么那里缴获和击毁的小车与大车的比例比其它战斗略高”?

      “为什么在那里俘虏和击毙的军官与士兵的比例比其它战斗略高”?

      人们还没有来得及思索,等不及的林彪司令员大步走向挂满军用地图的墙壁,指着地图上的那个点说:“我猜想,不,我断定!敌人的指挥所就在这里!”

      随后林彪口授命令,追击从胡家窝棚逃走的那部分敌人,并坚决把他们打掉。各部队要采取分割包围的办法,把失去指挥中枢后会变得混乱的几十万敌军切成小块,逐一歼灭。司令员的命令随着无线电波发向了参战的各部队….

      而此时的廖耀湘,正庆幸自己刚刚从偶然的一场遭遇战中安全脱身并与自己的另外一支部队汇合。他来不及休息就急于指令各部队尽快调整部署,为下一阶段作准备。可是好景不长,紧追而来的解放军迅速把他的新指挥部团团围住,拼命攻击,漫山遍野的解放军战士中,不断有人喊着:“矮胖子,白净脸;金丝眼镜湖南腔,不要放走廖耀湘!”

      把对方指挥官的细节特征琢磨到如此细微,并变成如此威力巨大的顺口溜,穿着满身油渍伙夫服装的廖耀湘只好从俘虏群中站出来,无奈的说“我是廖耀湘”,沮丧的举手投降。

      廖耀湘对自己静心隐蔽的精悍野战司令部那么快就被发现、打掉,觉得实在不可思议,认为那是一个偶然事件,输得不甘心。当他得知林彪是如何得出判断之后,这位出身黄埔军校并留学法国著名的圣西尔军校,参加过滇缅战役,在那里把日本鬼子揍得满地乱爬的新六军军长说,“我服了,败在他手下,不丢人。”

      取得这场重要战役胜利的其中一个关键因素,居然出于获胜方的统帅夜半时分,对一份普通遭遇战之后的战报的数据分析,来源于他“从红军带兵时起,身上有个小本子,上面记载着每次战斗的缴获、歼敌数量”的优良军事素养。

      (本故事来源于黄勇-丰沃华的博客)

      启示:

      林彪问的三个问题其实就是根据自己的数据库做的对比、细分、溯源。我们很多人把数据分析完全交给机器了,忘了我们自己的大脑也是一台紧密的数据分析机器。

      数据的积累、数据的挖掘,分析、归纳、整理,是数据分析师所必须俱备的基本素养,没有它,你永远是匹夫之勇。

      3、蛋挞与曼城队

      2011年夏天,曼城队助理教练大卫·普拉特决定利用数据分析来解决球队在表现方面遇到的一个棘手难题。普拉特发现,尽管球队阵容中拥有多名高大强壮的球员,但他们的角球得分情况却不尽如人意。

      在征求了俱乐部内部数据分析师的意见后,该队增加了对内旋角球(球转向守门员方向)的使用。战术转变产生了惊人的效果。在整个赛季中,曼城队依靠角球打入15个进球,成为英超角球得分效率最高的球队,其中2/3的进球采用的是内旋角球。

      这一实践为数据驱动型决策提供了强有力的支撑。但是,还有一个附加因素需要考虑:主教练曼奇尼最初对数据的实际价值持怀疑态度。事实上,早在两年前,曼奇尼曾就球队角球的使用情况咨询过俱乐部的数据分析师。分析师回应,他依靠直觉偏爱采用的战术——外旋角球(球飞向远离守门员的方向)从数据统计上看并不理想。

      曼奇尼选择相信自己的直觉而非数据分析的导向性建议。因为直觉告诉他,球旋向远离门将的方向减小了门将触球的概率,同时增加了进攻队员冲顶时争到头球的概率。但当曼奇尼发现两种变数存在某种联系的时候,直觉却模糊了他对两者关联程度的判断能力。换句话说,外旋角球和进球数可能存在着某种关联,但数据表明,内旋角球和进球数存在着更为直接的因果关系。

      这一案例研究为我们改善商业决策带来哪些启示?一家美国零售商最近发现,两种不同变数之间存在着某种有趣的联系。当天气变冷,肉桂葡式蛋挞的销量上升500%——并非所有的葡式蛋挞,只是肉桂这一个品种。面对这种零星数据,零售商要做出抉择。每当预测天气即将转冷时,应该储备多少肉桂葡式蛋挞?还有一家零售商发现,羊奶干酪打折似乎能促进红酒的销售。希望减小红酒库存的时候,是不是应考虑羊奶干酪打折这种方法?

      这两个问题的答案取决于大数据分析的核心问题:弄清相关性与因果关系之间的区别。人类善于发现事物的相关性——这是进化的特征——但是却在发掘直接相关事物的关系时显得有些笨拙。将相关性误解为因果关系所做出的决策是危险的,可能会遭受惨败,因为你所期待看到的影响可能并不会发生。

      最近的一项研究显示,某国的巧克力销量与诺贝尔奖的人均比例之间呈现明显的相关性。各国是不是都该鼓励公民增加巧克力的消费来提高获得诺贝尔奖的人数呢?

      为有效利用大数据,相关性分析应仅作为一个出发点去考虑。如果两个变量存在关联,我们该如何应对?当然,政府在推行“巧克力替代教育”的政策之前,应当首先考虑一下其他因素。比方说,看看那些获得诺贝尔奖人数较多的国家相对教育水平和研究预算,与巧克力消费相比,这两个变量与获诺奖的因果关系显然更大。

      同样,那些葡式蛋挞和羊奶干酪的零售商们在拥有十足把握以前,需要对他们的假设进行验证。比如说,在确定因果关系存在以前,考察一些商店肉桂葡式蛋挞的“库存积压”情况;或者采取打折销售羊奶干酪的方式,看看红酒销量是否真的增加。

      事物之间可能存在着一些简单的因果关系,但公司需要清楚每种因果关系都可能产生意想不到的结果。肉桂葡式蛋挞销量的增加是否意味着其他产品销量的减少?红酒销量的增加是否也意味着啤酒销量的...

  • ?

    通过基础数据进行数据分析的实例

    士晋

    展开

    国产〇〇柒

    前几天朋友给了一组行业同行表现数据,让帮忙分析一下自己的店铺问题所在和表现如何。今天我通过这个小示例来跟大家简单分享一下一些基础的分析方法。

    (开始之前先跟小伙伴们说明一下,本案例是一个简单的基于一组数据而进行的分析,并通过这个给大家一个相对比较概括的方法介绍,实际分析操作中会遇到更复杂的情况,而且实际分析中的挖掘深度要比本案例要深)

    下边是朋友提供的一组数据:

    图片:基础数据表01.png

    为了保护隐私避免侵权,公司名称这里就以字母替代

    通过上图我们可以看到这是几组非常简单的数据,这些数据我们都可以在自己的店铺采集到,但是我们也可以看到这组数据有一个问题,多数数据缺乏一个时间参数,从表格中我们只能看到最后两项有一个准确的时间界定,其他项数据均没有这个界定。不过这里我们采用对比模糊分析的方法,不用考虑数据是否精确,只需要进行对比即可,所以缺乏时间参数问题也不太大。接下来我们通过以下几个步骤进行分析。

    一,做筛选

    首先我们要对这些数据进行筛选,只留可对比的数据组,剔除无用的数据。方法很简单,这里我们通过公司名称进行检测,进行主营产品类目检查(这里我是以朋友公司产品类目对基础的),通过分析发现C、G、M三个公司的产品与其他不符,这里我们就直接剔除这三家的数据不做参考。

    整理后的数据如图:

    图片:整理后的数据02.png

    (再更复杂的分析中,剔除噪音数据并非这么简单,这里是用这个简单的方式说明一下这个操作步骤,大家在操作中要根据自己实际情况进行数据甄别,甄别的过程是非常复杂和繁琐的,如果这一步出错,做出的分析结果的准确性就很难得到保障)

    二,做归类

    无用的数据剔除之后,接下来我们就是要对现有的数据进行归类处理。

    通过图表数据的阅读,我们可以把里面的数据简单的归为三类:交易数据、回复率、行为数据。交易数据这里主要就是包含前三项,一达通和信保;回复率就是询盘回复率的表现数据;行为数据这里主要是指人的行为,访客和季度、月询盘数。归类后如图:

    图片:归类后的数据03.png

    这三类数据是有区别的,交易数据和回复率我们可以统一称之为“操作数据”或“加权数据”,因为这些数据的控制权基本掌握在我们手里,我们在这部分数据的积累上有较大的主动权。行为数据可以称之为“结果数据”,这部分数据的直接控制权来自于客户行为,我们无法直接去干预,我们只能通过提升“操作数据”的方法去影响这个“结果数据”。我们之前的操作都是为了这个“结果数据”有较好的表现。

    数据归类之后,我们开始分析

    三,做分析

    由于上面拿到的三类数据有两类属于“操作数据”,这两类对“结果数据”只能产生部分影响,这里我们就不关注这两项数据了(在全局分析中,这些局部数据都可以作为一个参数加入到分析的行列)。这里我们只关注结果数据。这里的结果数据中虽然有三组数据,由于其中一项数据缺少时间参数,所以我们可以把三项数据当作两项去分析,季度和月询盘量可以当作一个有效参数,这个时候我们就把数据优化成两类:访客和询盘。当看到这两个数据的时候我们很简单的就会联想到由他们而衍生出来的一个数据:“转化率”,这个数据能够比较真实的反馈平台效果。接下来我们计算出每一组的“转化率”数据如图(按照月度参数计算):

    图片:转化率04.png

    从上图可以看出“转化率”排名如下:

    H > K > P > A = F > B > D = E > I = O > J > L >N

    当然,转化率高并不代表代表一个店铺的表现就是第一名,这个数据只能判断该店铺引流的精准程度(当然如果需要更深入的分析精准度是需要深入到询盘质量和成交转化中去的,这里不做过多介绍)。我们可以观察一下N店铺的转化率,0.43%的数据与其他店铺相比较差距较大,该店铺的访客流量占据第一位,但是反馈数据在该表中与其他几家并列最后一名,该店铺就需要认真的分析访客来源和未转化的原因(这里就牵扯到了其他数据的数据分析,这里不多介绍)。

    当然,从数据组中我们一共可以看到这些数据条件,也可以计算出一个数据进行比较。但是这并不太说明什么太多的问题。接下来我们用加入条件的方法来进一步深入分析。这里我加入的数据是店铺的产品”上架产品数量“这个参数。加入数据到图标(实际操作中我们可以加入更多的可参考数据进行数据分析),如图:

    图片:加入产品数量条件05.png

    从表格中可以看出产品数量过万的有A B J N ,产品数量5000以上的有D I K L O P,产品数量低于5000的有E F H。从阿里规则上来说,店铺产品数量过多,店铺过于臃肿并不太好,但是这并不代表不用去发布产品了,其实我们真正要做到的是产品数量适中,做到全覆盖即可。从以上店铺的产品数量数据表现可以看出来,该行业的产品数量需要大于5000以上,如果低于5000,应该做不到全覆盖,可能会浪费很多流量(这里是从数据表大致得出结论,如要深入分析具体多少产品数量合适,还需要从其他方面进行综合分析)。我们也可以看到低于5000的几个店铺的访客量分别为:4000,7000,9000(里面有P4P引流数据,所以该数据仅作参考,不可作为实际数据参考),这个数据量并不算高,特别是H,访客是最少,产品数量也是最少,但是我们可以发现H的转化率是最高的,我们这里假设,H拥有A的产品数量(覆盖面),保持转化率不变,其他条件随覆盖面递增,这个时候我们可以看到H的数据应该是这样的,如图:

    图片:修改数据后转化询盘06.png

    当然这是一个理想的假设状态,覆盖,访客,转化这些数据都是的动态的,越是大的数据体量对转化率的控制难度越大,但是不可否认的是,如果产品覆盖能够达到一定程度的话,对访客和询盘转化肯定是有益处的,示例中虽然达不到492条的完美状态,但是询盘数量增加2倍应该还是有保障的。从这些数据的表现我们也可以看到覆盖的重要性(其实覆盖是一个很复杂的事情,并不是咱们想象的那种把产品和关键词上传上去就完事儿的事情,有时间可以跟大家深入交流关于覆盖的问题)。其实这些数据中还有很多可以对比解读的地方,我们今天先这里,以覆盖落幕。

  • ?

    数据分析全流程(内附案例)

    傲易

    展开

    (图片来源于网络)

    作者:苏格兰折耳喵

    来源: 运营喵是怎样炼成的 (yymzylc)

    (温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )

    本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:

    1 分析背景

    1.1 分析原理---为什么选择分析虎嗅网

    在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。

    综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:

    由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。

    鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。

    虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。

    因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。

    1.2 本文的分析目的

    笔者在本项目中的分析目的主要有4个:

    (1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;

    (2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;

    (3)展现文本挖掘在数据分析领域的实用价值;

    (4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。

    1.3 分析方法---分析工具和分析类型

    本文中,笔者使用的数据分析工具如下:

    Python3.5.2(编程语言)

    Gensim(词向量、主题模型)

    Scikit-Learn(聚类和分类)

    Keras(深度学习框架)

    Tensorflow(深度学习框架)

    Jieba(分词和关键词提取)

    Excel(可视化)

    Seaborn(可视化)

    新浪微舆情(情绪语义分析)

    Bokeh(可视化)

    Gephi(网络可视化)

    Plotly(可视化)

    使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。

    2 数据采集和文本预处理

    2.1 数据采集

    笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:

    2.2 数据预处理

    数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:

    (1) 文本分词

    要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:

    · 精确模式:试图将句子最精确地切开,适合文本分析;

    · 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;

    · 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。

    现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:

    【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用

    【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用

    【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用

    为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。

    (2) 去停用词

    这里的去停用词包括以下三类:

    标点符号:, 。! /、*+-

    特殊符号:▲等

    无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等

    (3) 去掉高频词、稀有词和计算Bigrams

    去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。

    Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。

    3 描述性分析

    该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。

    3.1 发文数量、评论量和收藏量的变化走势

    从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。

    此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。

    下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。

    3.2 发文时间规律分析

    笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:

    上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。

    3.3 相关性分析

    笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。

    首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。

    上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。

    接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。

    注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。

    3.4 城市提及分析

    在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。

    上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。

    接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:

    将上述结果绘制成如下动态的流向图:

    由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:

    京津冀城市群

    长江三角洲城市群

    珠江三角洲城市群

    中原城市群

    成渝城市群

    长江中游城市群

    上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。

    4 文本挖掘

    数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。

    本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。

    4.1 关键词提取

    对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:

    它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。

    由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。

    下面是笔者利用jieba在经预处理...

表格数据分析案例

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP