- ?
如何用数据分析指导产品迭代案例
奶白色
展开
引子
通常情况下,我们可以通过用户访谈的方法了解用户需求,其实设计师还可以通过分析用户问卷调查数据以及网站页面数据等方式,了解用户需求以及用户在使用产品时遇到的问题。
而且,直接通过接触用户了解到的需求有可能只是个案,为了增强客观性,通常都会通过大样本调查,从数据实证的角度,进一步更准确和客观地找到用户的普遍需求。
此外,通过对数据分析结果与用户访谈所得到的定性分析结论,进行比较和综合分析,设计师也能够从不同的角度了解用户的真实需求。
从用研的角度来看,交互设计包括新产品设计以及已有产品的改版设计两大类业务,笔者将分两次分别叙述在这两大类业务中,可以如何利用数据了解用户需求。本文重点讨论数据在现有产品改版设计中的应用。
因考虑到商业信息保密,本文案例采用了2011年的项目,互联网产品迭代频繁,文中提到的产品页面截至目前已经有多次改版,大家只需要了解整个文章的思路即可。
实际案例
商家服务平台上线后,平稳发展了一段时期,但随着平台各种信息的激增,用户开始抱怨原页面无法快速查找到适合自己的内容。这时候就要求交互设计师对页面进行设计重构,帮助用户更便捷地找到真正所需的信息和服务。
在改版设计中,研究者结合了多个来源的数据进行研究,提供给设计师更加全面的数据结果,包括页面数据、页面反馈问卷调研数据、EDM问卷调研数据等数据的分析结果。
1.通过监测页面获得数据
其实与交互设计更相关的是页面各模块的的程度,也能够计算出页面的点击热图,进而考察各模块的转化率。
与眼动实验的热图考察用户短期的重点注视区域不同,点击热图考察的则是用户长期累积的重点应用区域,从另一方面看,也衡量了交互设计是否与产品的规划初衷相一致,能够让重要的内容被顺畅地发现并有效点击。
本案例中,商家服务平台上线后,就做了页面埋点,方便长期监控页面数据,如PV、UV、点击数等。
2.页面数据如何分析?
分析页面数据的方法看似简单,但若要分析得透彻,并非易事。首先,如果想要做到精确,就要对后台数据做清洗、整理,考察极端值、无法解释的数据具体是什么原因造成的。当然很多时候为了节省时间,也直接应用后台数据,近似地看成真实情况的反映。此外,有了干净的数据,还可以从基础数据衍生出各种指标,评估和指导交互设计。
对于后台数据,通常有四类分析方法:聚合度量、基于操作的统计、基于用户的统计、路径分析。
——聚合度量
后台行为数据的优势在于大量用户使用情况的聚合,可考察的指标有:
一段时间内的页面浏览量。
特定时间内页面浏览的分布情况。
整个网站的页面浏览分布情况。
这些都是原始数据的度量,不能只看数字,要分析产生数据的原因。
其他聚合度量指标还包括:
操作系统和浏览器的比例。
客户端类型。
新用户/重复用户。
——基于操作的统计
最有用的指标可能是操作信息相关的指标,这些指标能发现出更丰富的用户行为,而不是简单地统计大量数字。
一些最有用的指标如下:
每次操作的平均访问页面数量。
平均操作的持续时长。
访问的第一页和最后一页。
——基于用户的统计
通过cookie或登录信息判断出的用户背景信息,能进一步聚合单个用户的行为信息,汇总不同用户的行为信息,统计出一些指标,对理解用户会起到非常重要的作用。这些指标包括:
访问次数。
访问频率。
网站总停留时间。
保留率。
转换率。
——路径分析
除了一般指标之外,还有其他度量方法能了解用户体验。当然,和所有间接用户研究一样,这些方法都不能揭示用户“为什么”以某种方式发生的行为,但这些方法肯定可以帮助研究员缩小用户如何使用的可能性。
这些综合方法中,最有用的方法是路径分析。路径分析是指分析用户在网站上如何浏览,从而发现他们浏览的共同方式。路径分析可以产生如下结果:
一般浏览路径。
“下一步”页面。
对于电子商务网站还能有更专业的结果,如:
购买路径
购物车使用路径
从用户的角度阅读。
关注事实。
不急于下结论。
不要把常见问题清单当成必改清单。
不要完全相信反馈意见。
出于分析考虑,研究者可以问问自己以下四个问题,从而更好的跟踪用户体验。
用户是谁?
他们想做什么?
他们如何处理问题?
他们碰到了什么问题?
本案例中,商家服务平台在改版阶段,事先设置反馈问卷的目的就是为了收集用户对目前产品的使用痛点和改进需求,以致于更有针对性地改版。问卷设计好后,问卷链接采用右侧浮动条的方式展现在商家服务平台页面。
反馈问卷挂出一个月后,研究员对其中的开放题进行了总结,整理分析报告节选如下:
由于业务调整,商家服务平台改版后,会突出第三方的服务,调研的研究目的一方面需要了解卖家对第三方服务的态度和行为,另一方面需要了解卖家选择服务时,对页面布局的偏好、选择心理和行为习惯,从而指导页面改版。
考虑到项目执行周期的问题,采用了正式问卷调研的方式研究导航的布局方式、服务的分类等,其实研究这类问题,可以采用定性研究方法,如A/B test、参与式设计、卡片分类等,但为了节约研究成本,尝试用问卷的方式解决关键问题。作为案例,只是一种抛砖引玉的介绍,以此来说明,改版中也可以应用调研的方式,利用数据指导交互设计。
我们可以来看看问卷的重点部分:
特别说明:此题采用了类比的方法,设置了另外一种类似的使用场景,来考察用户的使用偏好。
特别说明:网络调研问卷能够设置选项随机,这在一定程度上避免了由于选项固定排序导致的选择。
最终分析数据时,发现卖家对排版布局的倾向性比较明显,接近半数用户最喜欢A样式。
卖家更倾向从功能的角度对服务进行分类,如下图:
对于数据驱动的游戏运营而言,有意义的数据指标一定是可以明确绑定游戏问题的标准,而这些游戏问题也一定是可以通过研发、设计、运营来解决问题的。
不过,最后还要说一点的是,虽然我们需要成功的标准来帮助我们去改进产品,做好运营,不过再成功的标准也只是一个一个孤立的数据指标点,这样的结果,就容易造成我们看不到问题的全貌,而造成错误的分析结论,因此,切记,必要的时候要记得退一步。
4.数据指导设计
——优化首页导航布局,更贴近卖家经营店铺中的需求
上文问卷调研中的数据显示,卖家更倾向用功能对服务和工具进行划分,因此新首页按照功能进行布局,将原首页上的工具或服务,根据调研数据显示的卖家分类偏好,归类到各个类目。
功能类目放置在页面的第一屏左侧,而且各类功能的命名、排序都参考了调研结果;同时,每一种功能内的展示,服务和工具尽量分开显示,也应用了调研数据。
——首页新增卖家工具订购排行榜和最新服务模块,新增卖家资讯、卖家经验和成功案例模块
通过分析产品反馈问卷可知,卖家需要及时掌握目前使用最多和最新上架的服务,作为选择服务的重要参考指标;他们也需要淘宝官方根据经验总结,打包一些服务,直接推送;同时也希望服务平台能够成为经验交流、资讯集合的平台。
调研问卷设计了相应的题目进行考察,数据结果显示这些都是需求旺盛的模块。因此,在改版设计时,均在第一屏呈现出来,更方便卖家选择。
——优化了页尾的服务归类
通过对比能够发现,页尾的店铺管理和营销推广所包含的内容,命名更加清晰、归类更加合理,也体现了数据的作用。
写在最后
对于产品的调研,不论是定量的还是定性的,最终结论只要可靠有效,都会成为指导交互设计师工作的有力依据。一般而言,定性结论用于理解用户和产品、提供设计思路,定量结论则帮助交互设计师明确设计重点和方向。
定量与定性研究方法相结合,能产生有效互补,以便更深入地挖掘用户需求,产出更科学、更有价值的研究结论。
- ?
大数据五项相关技术与数据分析应用案例
沃伦
展开
大数据技术指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
1、Avro与Protobuf
Avro与Protobuf均是数据序列化系统,可以提供丰富的数据结构类型,十分适合做数据存储,还可进行不同语言之间相互通信的数据交换格式,学习大数据,需掌握其具体用法。
2、Cassandra
Apache Cassandra是一个高性能,可扩展性和高线性可用的数据库,可以运行在服务器或云基础设施上,为关键任务数据提供完美的平台,。 Cassandra支持多个数据中心之间复制是同类产品中最好,为用户提供更低的延迟,甚至不惧怕停电。 Cassandra的数据模型提供了便利的列索引,高性能试图和强大的内置缓存。
3、Kafka
Kafka是一种高吞吐量的分布式发布订阅消息系统,其在大数据开发应用上的目的是通过Hadoop的并行加载机制来统一线上和离线的消息处理,也是为了通过集群来提供实时的消息。大数据开发需掌握Kafka架构原理及各组件的作用和使用方法及相关功能的实现!
4、Chukwa
是一个开源大型分布式系统的数据采集监视系统。它是建立在Hadoop分布式文件系统(HDFS)和Map/ Reduce框架之上,并继承了Hadoop的可伸缩性和健壮性。 Chukwa还包括一个灵活而强大的工具包,用于显示,监测和分析结果,以便做出最佳地使用所收集的数据。
5、Flume
Flume是一款高可用、高可靠、分布式的海量日志采集、聚合和传输的系统,Flume支持在日志系统中定制各类数据发送方,用于收集数据;同时,Flume提供对数据进行简单处理,并写到各种数据接受方(可定制)的能力。大数据开发需掌握其安装、配置以及相关使用方法。返回搜狐,查看更多
石油公司壳牌通过分析数据以预测机器故障
很少有行业能比能源行业产生更多的数据了。但多年来,石油巨头壳牌甚至不知道其在世界各地的各种设施中的零件都位于哪里;它不知道什么时候需要再进货;直到部件开始出现故障,它才知道什么时候出现了维护问题。由于机器停机每天给公司造成了数百万美元的损失,于是壳牌决定收集数据以避免这些问题。
壳牌卓越数据科学中心的总经理Daniel Jeavons表示,壳牌基于多家供应商的软件建立了一个分析平台,运行预测模型,以预测3000多种不同的石油钻井机的部件何时会出现故障。
其中一个名为Databricks的工具通过Apache Spark来捕获流数据。壳牌使用这个工具来更好地计划什么时候购买机器部件,保存多长时间,以及在哪里存放库存物品。
该工具托管在微软Azure的云中,帮助壳牌将库存分析从超过48小时减少到不到45分钟,每年减少数百万美元的库存转移和重新分配成本。
经验总结:避免机器故障需要很多工具。Jeavons表示,壳牌的平台包括了来自Databricks、Alteryx、C3、SAP和其他供应商的软件,所有的这些软件共同帮助了他的数据科学家来产生商业见解。最终,首席信息官必须正确评估这些工具,并在进行大额购买之前了解哪些才是有效的。
ARC启用了新的数据管理工具
数据是航空报告公司( ARC )的生命线,该公司每年结算航空公司之间价值超过880亿美元的机票交易,包括德尔塔航空公司、美国航空公司、英国航空公司、阿拉斯加航空公司以及Expedia等旅行社。航空公司付费获取ARC在这些交易中收集的数据,以了解更多的关于旅行者的目的地、旅行时间以及在此过程中每年为超过22亿次航班支付的费用的信息。
ARC捕获数据,将其输入分析引擎,对其进行细化,并为其客户构建定制的报告。ARC 的CIO Dickie Oliver表示,该公司正从Teradata的数据仓库迁移到Snowflake的云软件中,这将帮助ARC更快地将数据产品推向市场,并提供更大的可伸缩性和性能,这得益于其在AWS上的业务。Oliver表示,Snowflake是为了将计算资源与数据存储分开而设计的,它使ARC能够为客户快速构建新的定制报告。Oliver补充说,多亏了这个项目,ARC将能够为考虑新数据形式的客户量身定制新的产品。
经验总结:迁移到一个新的数据平台通常是令人畏惧的,不仅仅是因为技术的转变;变更管理是其中真正的麻烦所在。Oliver说,让人们“从一开始就专注于改变,并让他们经历改变过程是这个过程中最具挑战性的部分”,他补充说,他正全力培训员工,包括让他们通过认证,并引进顾问,如让Slalom来帮助我们进行变更管理。
TD银行在数据湖方面的天赋
TD银行的数据分析团队花了几年时间来更新数据基础设施,以满足当前和未来的需求,并创建了一个企业Hadoop数据湖。
TD银行企业信息高级副总裁Joe DosSantos表示,我们使用了基于Cloudera的数据湖用来培养对客户的洞察力,包括从跟踪员工的流失率,到为客户提供合适的产品。
TD 银行的一个核心关注点包括让业务分析师能够从数据湖中提取数据,可用且可操作的能力,而无需数据科学家来亲自操控。 DosSantos表示:“我们正在让人们广泛使用这些数据集。”他补充道,TD Bank还尝试使用其分析平台来检测欺诈和其他渎职行为。
经验总结:过去几年来,TD Bank一直在重新构想其企业数据平台,筛选数十年来的客户交易和其他数据。TD银行没有过度依赖Hadoop,而是使用了Talend的软件来提取、转换原始数据并将其加载到可用于可操作商业智能的信息中。
DosSantos解释道:“Hadoop对于理解如何从A点到B点获取数据方面并不是很好。而Talend有一个元数据管理器和一个中央存储库来跟踪数据湖中的数据移动和转换。”
嘉吉公司正为虾农提供数据分析
嘉吉公司(Cargill)的动物营养部门开发了一款名为iQuatic的移动数据跟踪应用,帮助养虾人降低产量的死亡率。
嘉吉动物营养公司的CIO Tiffany说,该应用程序能够基于环境因素(如温度、pH值和营养)来预测虾池中的生物量,并与嘉吉公司的iQuatic自动喂虾系统协同工作。Snyder在8月的CIO 100研讨会上介绍了iQuatic系统。
只要农民将应用程序中的数据保存到云中,然后访问实时的操作仪表盘,便能够直观显示池塘的性能,提供关键的测量和预测分析,帮助他们更好地管理虾健康并提高产量。以前,农民是用传统的方式——用笔和纸来收集的这些数据。
经验总结:为了构建这个应用程序,嘉吉公司派遣了工程师和企业高管去厄瓜多尔的一个养虾场,了解农民是如何从池塘中获取数据的。“我们让农民成为了我们团队的一部分,”Snyder说。通过在敏捷、two-pizza的团队中快速工作,为在5个月内成功进行试点铺平了道路,并最终实现了产品发布。
让数据分析在默克公司发挥作用
全球医疗保健公司默克希望利用在ERP和核心系统中收集到的数据来进行生产执行和库存控制,以获得更多的商业见解。但是,由于它的工程师花费了60%到80%的精力去寻找、访问和获取每个项目的数据,以至于许多商业目标没有得到实现。默克公司的IT制造首席信息官Michelle D’alessandro表示:“我们没有把数据视为一种可行的、永久的、有价值的资产。我们希望建立一种文化,在这种文化中,我们可以尽量在移动和报告数据上少花时间,从而将更多的时间花在使用数据来实现有意义的业务成果上。”
默克公司创建了MANTIS(制造和分析智能)系统,这是一个über数据仓库系统,包括了内存数据库和开源工具,可以处理在结构化和非结构化系统中的数据,包括文本、视频和社交媒体。重要的是,该系统能够允许非技术业务分析师在可视化的软件中轻松的查看数据。而数据科学家可以通过复杂的模拟和建模工具访问信息。MANTIS系统已经使公司整体IT分析项目总业务量的时间和成本降低了45%。有形的业务成果包括平均提前期减少了30%,平均库存持有成本减少了50%。
经验总结:D'Alessandro表示,她成功的关键是在亚太地区的一家工厂中设立了一个“标杆”分析项目,默克将在那里获得最大的回报。而在那里展示了MANTIS的成功之后,它就为其他网站树立了榜样。她还学会了如何步步为营。D 'Alessandro说,她在一个早期的实验中使用了人工智能和机器学习来分析默克制造过程的成本,但她“做得过头了”。她说:“这并不是因为缺乏赞助或缺乏远见,我们只是无法让它发挥作用。
- ?
你值5K还是15K?实战案例,测测你的数据分析功力
DZ
展开
本文源自陈老师遇到的真实案例。
老板说:“我们今年准备参加展会,做一年。以前我没参加过,没关系,这里有一份展会数据,你回去分析下哪些有价值,后边组织的时候有个指导”。现在你收到任务了,咋办?
一
屏
幕
思
考
时
间
第一步:拿到问题,先干什么?
5K表哥:“好嘞,我回去研究一下数据”
15K分析师:老板,我们做展会的目标是什么啊?是准备促业绩,还是做推广?促业绩我们考核意向成单还是实际成单?做推广,我们如何考核推广效果?是微信关注人数、还是获得销售线索数,还是……?如果两个都有,哪个更重要?如果一定要丢一个会丢哪个?
第二步:看到数据,思考什么
5K表哥:“恩,我是用层次分析法评价呢,还是建一个模型呢?要用什么模型呢?有没有模板可以参考呢?哪里有模板呢?”
15K分析师:“这个数据是从哪里来的?谁统计的?预计参与人数怎么预计?”
第三步:数据不够,要怎么办?
5K表哥:“回到眼前,这数据也太少了吧,手头的表格只有展会名称,举办方,参展预计人数,展会级别,展会主题等几个字段,好像也分析不出什么来”
15K分析师:“经查,数据是可信的,还可以用。看起来这里还有些字段可以做处理,比如展会参展人数,找一些参加过展会的人了解,1万人以上就算大型了,5千左右算中型,那可以先分个大中小。组织者级别可以分成高级,中级,初级。恩恩,还有其他一些字段,处理完再说。”
第四步:抓着数据,怎么分析?
5K表哥:“额,不知道咋分析,拍脑袋好了”
15K分析师:“依据现有的信息,可以列举三个假设:”
假设1:展会人数多的,成单量会高
假设2:展会级别高的,成单量会高
假设3:展会组织者专业度高的,成单量会高
依据这三个假设,可以先建议ABC三场会议参加,预计A的成单量最好,未来以A为成单参照。现场参与人员,需协助收集XXX信息,以辅助事后分析。
第五步:事后总结怎么做
虽然目前还没有真实开展,但是可以预计到,未来的总结会这么做
5K表哥:“额,谁有展会活动的总结模板啊,求一个模板”
5K表哥:“老板又说我考虑的不周全,可是数据就这么多啊!怎么周全”
5K表哥:“老板又让我修改,我快崩溃了,改了16版了”
15K分析师:“针对预期成单目标,本次达成率为x%,达成目标”
15K分析师:“对比两次活动,可见XX假设是不成立了,展会专业度比人数更有利于成单”
15K分析师:“未来可集中向专业度高的行业性展会,预计节省参展成本X万元,增加成单XXX万元”
——全文当然还没有完——
所以差别在哪里?差别就是等靠要和主动性的区别
差别是优秀的数据分析师不但有良好的职业知识,更有优异的职业素养
这种职业素养体现在九个方面:
收到任务时
目标明确:凡事必有一个目标,不能含糊,不能一锅炖,不能高大全。目标不清是万恶之源。
目标清晰:可量化,可追踪,可对比。可量化才能分析,不可量化是扯皮之源。
目标聚焦:有先后,有重点。如果有两个目标,那么两个之间要排先和顺序,如果有三个,三个必须要有重点。越多的目标,意味着事情本身越难达成,也意味着分析时候会越混乱。
数据处理时
清晰含义:清晰名称-来源-计算方式。避免歧义,防止错误是一切分析的基础。
重视收集:尽可能收集数据,提高质量。没有数据确实很难分析,优质的数据能极大的帮助分析,不加管理的垃圾数据只会把分析带沟里去。
解读含义:分类解读,找到数据后业务含义。很多分析师被业务部门嫌弃,就是因为只知道出数字,不懂得解读数据背后的含义。月消费10000和高消费群体,对业务部门是完全不同的两个概念,只有多多找含义,才能更好地找到数据的价值。
输出报告时
树立标杆:树立明确的评价标准。凡是涉及到“好”“坏”“高”“低”的,一定要有参照物,一定要有标杆,因为本身这些词语都是相对比较的词,而且很大几率和领导的个人看法有关系。如果不设标杆,在事后总结评估的时候就会陷入无休无止的口水战和扯皮里边去。
明确假设:设计待数据验证的假设。有了假设,分析的时候才容易总结,才容易看出来哪些路子是容易走通的,哪些是可能有坑的,才能在多次实验中沉淀下经验。
逐步迭代:每次分析,不断验证假设,沉淀经验。经验是越积累越多,越积累越丰富的。好的分析师知道把每一次经验总结起来,让自己的判断越来越准。
数据分析师的本质就是:用数据和逻辑代替拍脑袋,用系统和科学取代神秘主义,因此9条要点中有7条都和清晰明确有关。
数据分析师的价值在于:以数据指导工作,从数据找到方法。因此不能仅仅就数论数,而是要看清楚数据背后的含义,找到业务部门思考的脉络,这样才能让分析更接近业务部门的需求,让建议更贴合实际情况。
数据分析师的要求是专业,专业不仅体现在懂计算,懂代码,懂操作,更体现在深入全面的考虑问题,循循善诱的解答问题,因此面对业务部门的咨询的时候,保持头脑冷静,保持耐心,抽丝剥茧的问话,本身就是专业性的体现。
与大家共勉。
- ?
向大牛学习6个大数据分析成功案例,内部分享资料,速度搜藏!
Orenda
展开
CIO正在采用数据分析来提高效率,但并不是每一次努力都有成果,一下是知名公司领先CIO如何成功地利用数据分析和机器学习来提高收入或降低成本的成功案例。
降低成本或提高收入的Hyperaware可以帮助他们在C套房和董事会的眼中闪耀,CIO比以往任何时候都更加支持支持数据科学的技术。据IDC统计,2017年全球大数据和业务分析的收入将达到1580亿美元,比2016年上涨了12.4%。旨在支持大数据和分析的硬件,软件和服务的商业购买预计将超过2100亿美元。IDC分析师Dan Vesset指出,大数据分析解决方案已经成为在全球各行业和业务流程中实现数字转型工作的关键支柱。
但是,这种令人沮丧的支出有一个黑暗的一面:大多数数据分析项目无法产生可衡量的价值。遗留系统和商业机构官僚机构已经产生了数据仓库,并使数据质量不佳。而CIO们仍然在努力填补操纵数据所需的人才差距。人才战争激烈,大学分析课程的兴起并不能够足够快地培养合格人选。
然而,数据分析的成功案例在本月初的CIO100研讨会上比较丰富,几个IT领导者透露了他们的努力。首席信息官还分享了对同行进行类似努力的经验教训和建议。
数据分析
已经发展成为全球140多个市场的400亿美元全球医疗保健公司的默克公司力图利用ERP和核心系统收集的数据进行制造执行和库存控制,以获得更多的业务见解。但默克公司的工程师花费了60%到80%的努力来寻找,访问和摄取每个项目的数据,业务目标已经过去了。默克制造IT部门的首席信息官Michelle A'lessandro表示:我们并没有将数据视为可行的,永久的和有价值的资产。我们希望建立一种文化,我们花费更少的时间移动和报告数据,并将更多的时间用于有意义的业务成果的数据。
默克创建了MANTIS(制造和分析智能),这是一个über数据仓库系统,包括内存数据库和开放源码工具,可以压缩包含文本,视频和社交媒体在内的结构化和非结构化系统中的数据。重要的是,该系统旨在让非技术业务分析人员轻松查看可视化软件中的数据。相反,数据科学家可以通过复杂的模拟和建模工具访问信息。MANTIS已经将公司整体IT分析项目组合的时间和成本降低了45%。有形的业务成果包括平均交货时间减少30%,平均库存支出成本减少50%。
经验教训: A'lessandro表示,她成功的关键是在亚太工厂确定了一个灯塔”分析项目,默克公司将获得最大的回报。在MANTIS展示成功之后,它成为了对其他网站的呼吁。她也学会了不要咬伤多于她可以咀嚼。A'andandro表示,她在早期的实验中,过度”地使用人工智能和机器学习来分析默克制造过程的成本。A'andandro说:不是因为缺乏赞助或缺乏愿景,我们不能让它上班。
机器学习
多年来,Pepper Snapple集团的销售路线人员抓住了一个含有客户数据,销售和促销记录的肥皂,并打入沃尔玛和Target等零售客户的道路。今天,销售人员不是使用绑定器,而是配备iPad,告诉他们他们需要访问什么商店,为零售商提供什么,以及其他关键指标。Pepper Snapple集团的首席信息官Tom Farrah表示:他们是荣耀的接班人,现在他们正在成为聪明的销售人员,配备信息来帮助实现他们的目标。
该平台MyDPS配有机器学习和其他分析工具,可在推送应用程序时向工作人员推荐建议和日常操作记分卡。显示员工如何按照预期的预测执行的算法,包括他们是否符合自己的计划,这些算法都会落在下面,以及他们如何正确地解决问题的见解。Farrah说:如果我要让某人取得成功,我必须确保他们有什么信息具有内容相关性。”
经验教训:为了测试MyDPS的概念证明,Farrah将该软件分给了四个分支机构,并让业务总裁去拜访他们。他们透露,使用MyDPS后,上个月的执行销售额已经提高了50%,说服他对项目进行了绿化。Farrah说:他得到了结果,这就是销售所需要的,”这不仅仅是为了项目的业务赞助,而且希望得到结果,这一点非常重要。
预测分析
皮特俄亥俄州首席信息官Scott Sullivan表示,货运业正在遭受所谓的;亚马逊影响”的打击。皮特·俄亥俄州,一家7亿美元的货运公司,已经习惯于收取运费,并在第二天交付给客户。但是,要感谢亚马逊,客户越来越期待当天的交货。他们期待有关他们的包的更多信息。
沙利文说:客户现在不仅要知道什么时候会被拿起来,而且要知道如何交付,以便他们能够计划工作量。” 利用历史数据,预测分析和算法实时计算各种货物重量,行驶距离和其他因素,Pitt Ohio可以估计驾驶员以99%的准确率到达运送目的地的时间。该公司估计,通过重复订单增加了收入(估计每年为5万美元),并降低了客户损失的风险(估计为每年6万美元)。
经验教训:沙利文说,这是涉及市场研究,销售业务和信息技术的跨部门事务,他们都检查并重新检查结果,以确保其实现目标。Sullivan表示:四面墙内有很多数据,是创新的,寻找有挑战性的方法来使用它。
如果数据是新的石油,那么知道如何将其改进为可操作的智能是利用其潜力的关键。为此,CIO正在使用预测分析工具,制定机器学习算法和战斗测试其他解决方案,以追求企业的效率和新的服务方式。想获得更多大数据分析成功案例,加学习交流8群640193172,和大数据大数据资深交流经验.
- ?
几个大数据应用典型案例——大数据故事
木眼
展开
大数据应用案例之电视媒体
对于体育爱好者,追踪电视播放的最新运动赛事几乎是一件不可能的事情,因为有超过上百个赛事在8000多个电视频道播出。
而现在市面上开发了一个可追踪所有运动赛事的应用程序RUWT,它已经可以在iOS和Android设备,以及在Web浏览器上使用,它不断地分析运动数据流来让球迷知道他们应该转换成哪个台看到想看的节目,在电视的哪个频道上找到,并让他们在比赛中进行投票。对于谷歌电视和TiVo用户来说,实际上 RUWT就是让他们改变频道调到一个比赛中。
该程序能基于赛事的紧张激烈程度对比赛进行评分排名,用户可通过该应用程序找到值得收看的频道和赛事。
大数据应用案例之社交网络
数据基础设施工程部高级主管Ghosh描绘的LinkedIn数据构建图,其中就包括Hadoop战略部署。
五年前,LinkedIn只是一家普通的科技公司。而现在,其俨然成为一个工程强国。 LinkedIn建成的一个最重要的数据库是Espresso。不像Voldemort,这是继亚马逊Dynamo数据库之后的一个最终一致性关键值存储,用于高速存储某些确定数据,Espresso作为一个事务一致性文件存储,通过对整个公司的网络操作将取代遗留的Oracle数据库。它最初的设计就是为了提供LinkedIn InMail消息服务的可用性,该公司计划今年晚些时候将推出开源Espresso。
大数据应用案例之医疗行业
Seton Healthcare是采用IBM最新沃森技术医疗保健内容分析预测的首个客户。该技术允许企业找到大量病人相关的临床医疗信息,通过大数据处理,更好地分析病人的信息。
在加拿大多伦多的一家医院,针对早产婴儿,每秒钟有超过3000次的数据读取。通过这些数据分析,医院能够提前知道哪些早产儿出现问题并且有针对性地采取措施,避免早产婴儿夭折。
它让更多的创业者更方便地开发产品,比如通过社交网络来收集数据的健康类App。也许未来数年后,它们搜集的数据能让医生给你的诊断变得更为精确,比方说不是通用的成人每日三次一次一片,而是检测到你的血液中药剂已经代谢完成会自动提醒你再次服药。
Express Scripts就是这么一家处方药管理服务公司,目前它正在通过一些复杂模型来检测虚假药品,这些模型还能及时提醒人们何时应该停止用药。 Express Scripts能够解决该问题的原因在于所有有关数据。因为它每年管理着1.4亿处方,覆盖了一亿美国人和65,000家药店,虽然该公司是能够识别潜在问题的信号模式,但它也使用数据来尝试解决某些情况下之前曾经发现的问题。
同时,Express Scripts还着眼于一些事情,如他们所开处方的药物种类,甚至有人在网上谈论医生。如果一个医生的行为被标记为红色的旗帜,那么他在网络上是个好人的形象,更是你所需要的医生。
大数据应用案例之保险行业
保险行业并非技术创新的指示灯,然而MetLife保险公司已经投资3亿美金建立一个新式系统, 其中的第一款产品是一个基于MongoDB的应用程序,它将所有客户信息放在同一个地方。
MongoDB汇聚了来自70多个遗留系统的数据,并将它合并成一个单一的记录。它运行在两个数据中心的6个服务器上,目前存储了24TB的数据。这包括MetLife的全部美国客户,尽管它的目标是扩大它的国际客户和多种语言,同时也可能创建一个面向客户的版本。它的更新几乎是实时的,当新客户的数据输入时,就好像Facebook墙一样。
大多数疾病可以通过药物来达到治疗效果,但如何让医生和病人能够专注参加一两个可以真正改善病人健康状况的干预项目却极具挑战。安泰保险目前正尝试通过大数据达到此目的。
安泰保险为了帮助改善代谢综合征患者的预测,从千名患者中选择102个完成实验。在一个独立的实验室工作内,通过患者的一系列代谢综合症的检测试验结果,在连续三年内,扫描600,000个化验结果和18万索赔事件。将最后的结果组成一个高度个性化的治疗方案,以评估患者的危险因素和重点治疗方案。这样,医生可以通过食用他汀类药物及减重5磅等建议而减少未来10年内50%的发病率。或者通过你目前体内高于20%的含糖量,而建议你降低体内甘油三酯总量。
- ?
数据分析全流程(内附案例)
夏槐
展开
(图片来源于网络)
作者:苏格兰折耳喵
来源: 运营喵是怎样炼成的 (yymzylc)
(温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )
本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:
1 分析背景
1.1 分析原理---为什么选择分析虎嗅网
在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。
综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:
由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。
鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。
虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。
因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。
1.2 本文的分析目的
笔者在本项目中的分析目的主要有4个:
(1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;
(2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;
(3)展现文本挖掘在数据分析领域的实用价值;
(4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。
1.3 分析方法---分析工具和分析类型
本文中,笔者使用的数据分析工具如下:
Python3.5.2(编程语言)
Gensim(词向量、主题模型)
Scikit-Learn(聚类和分类)
Keras(深度学习框架)
Tensorflow(深度学习框架)
Jieba(分词和关键词提取)
Excel(可视化)
Seaborn(可视化)
新浪微舆情(情绪语义分析)
Bokeh(可视化)
Gephi(网络可视化)
Plotly(可视化)
使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。
2 数据采集和文本预处理
2.1 数据采集
笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:
2.2 数据预处理
数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:
(1) 文本分词
要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:
· 精确模式:试图将句子最精确地切开,适合文本分析;
· 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;
· 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。
现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:
【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用
【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用
【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用
为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。
(2) 去停用词
这里的去停用词包括以下三类:
标点符号:, 。! /、*+-
特殊符号:▲等
无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等
(3) 去掉高频词、稀有词和计算Bigrams
去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。
Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。
3 描述性分析
该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。
3.1 发文数量、评论量和收藏量的变化走势
从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。
此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。
下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。
3.2 发文时间规律分析
笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:
上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。
3.3 相关性分析
笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。
首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。
上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。
接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。
注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。
3.4 城市提及分析
在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。
上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:
将上述结果绘制成如下动态的流向图:
由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:
京津冀城市群
长江三角洲城市群
珠江三角洲城市群
中原城市群
成渝城市群
长江中游城市群
上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。
4 文本挖掘
数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。
本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。
4.1 关键词提取
对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:
它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。
由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。
下面是笔者利用jieba在经预处理...
- ?
值得膜拜的三个数据分析案例
单迎夏
展开
今天给大家分享三个数据分析的经典案例,主要是学习其中的思路,当故事看吧,不要拘泥于文中故事的真实性。每个故事我简单的做一个点评吧
1、数据分析大神 高手在民间
这天,新上任的邢县长到小吃摊吃早餐,刚找个板凳坐下,就听炸油条的胡老头一边忙活一边唠叨:“大家吃好喝好哦,城管要来撵摊儿了,起码三天你们捞不着吃咱炸的油条了!”
邢县长心里一惊:省卫生厅领导最近要来视察,昨天下午县里才决定明后两天开展突击整治,这老头儿怎么今天一早就知道了?
哪料这件事还没弄明白,另一件事儿让县长脑袋里的问号更大了。一天,他照例到胡老头这儿吃油条。没想到,老头居然又在发布消息:“上面马上要来青天大老爷了!谁有什么冤假,就去县府宾馆等着吧!”
邢县长又是吃惊,又是恼怒。省高院的工作组星期三要来清查积案,这个消息昨天晚上才在常委会上传达,这老儿咋这么快就知道了呢?让他更吃惊的是,这老家伙不但对大领导们的行程了如指掌,就连派出所要突击检查娱乐场所这样的绝密行动,他都知道得清清楚楚。
一个大字不识的老头儿,居然能知道这么多政府内部消息,毫无疑问,定是某些政府工作人员保密意识太差,嘴巴不紧。于是,他立即召开会议,把那些局长、主任狠批了一通。与会领导个个低着头、不敢出声。
还是公安局长胆大,忍不住问道:“邢县长,这胡老头儿的事是您亲眼所见,还是道听途说来的?”
邢县长声色俱厉地一拍桌子:“都是我亲耳听到的!我问你,你们城关派出所今天晚上是不是要清查娱乐城?”
公安局长一脸尴尬,楞在那里。邢县长气恼地当即下令:“你亲自去查查这老头儿到底什么背景,明天向我汇报!”公安局长赶紧换上便装,立马跑到胡老头那儿进行暗访。没想到,老家伙正在向大伙儿发布新闻:“城关镇的镇长最近要倒霉了。大伙等着瞧,事儿不会小的……”
公安局长一听,很是诧异。于是,他运了口气,腆着笑脸,装傻卖呆似的问道:“你咋知道的?难道你儿子是纪委书记?”
胡老头呵呵一笑:“我咋知道的?那孙子以前吃我的油条,都是让司机开专车来买,这两天一反常态,竟然自己步行来吃,还老是一脸愁容。那年他爹死,都没见他那么难受过。能让那孙子比死了爹还难受的事,除了丢官儿,还能是啥?”
局长听了,暗自吃惊,这老头儿还真有两下子。于是他不动声色继续问道:“那昨天派出所清查娱乐城,你是咋知道的?”
胡老头又是一笑:“你没见那几家娱乐城一大早就挂出了停业修缮的牌子?人家有眼线,消息比咱灵通!”
“那卫生厅领导来视察,你是咋知道的?”
胡老头儿说:“除了上面来人检查,你啥时见洒水车出来过?”。
最后,局长问了个他最想不通的问题:“上次省高院的工作组来指导工作,你咋那么快就得到消息了呢?”
胡老头撇了撇嘴说:“那就更简单了。俺邻居家有个案子,法院拖了八年不办。那天,办案的法官突然主动来访,满脸笑容问长问短,还再三保证案子马上解决。这不明摆着上面来了人,怕他们上访嘛!”
局长佩服得五体投地,连忙一路小跑赶回去,把情况向邢县长汇报。县长听了,大动肝火,马上再次召开会议,做了四个小时的训话:“同志们,一个炸油条的都能从一些简单现象中,看出我们的工作动向,这说明了什么?说明我们存在太多的形式主义。这种恶习不改,怎么能提升政府形象?从今天开始,哪个部门再因为这种原因泄密,让那老头‘未卜先知’,我可就不客气!”
次日一早,邢县长又来到胡老头儿这儿吃油条,想验证一下开会的效果。没想到胡老头居然又在发布最新消息:“今天,上面要来大领导了,来的还不止一个!”
邢县长这一惊,真是非同小可。下午,市长要陪同省领导来检查工作,自己昨晚才接到通知,这老头咋又提前知道了?
邢县长强压怒火,问胡老头:“你说要来大领导,到底有多大呢?”
胡老头儿头也不抬地回答:“反正比县长还大!”
邢县长又问:“你说要来的不止一个,能说个准数吗,到底来几个?”
胡老头儿仰起头想了想,确定地回答:“四个!”
邢县长目瞪口呆,上级领导还真是要来四个!他心里怦怦直跳,又问:“胡……胡师傅,这些事儿你是怎么知道的?而且知道的这么准确。”
胡老头儿淡淡一笑:“这还不容易?我早上出摊儿,见县府宾馆的保安都戴上了白手套,一个个如临大敌,肯定是上面来人了。再看看停车场,书记、县长的车都停在了角落里,肯定是来了比他们大的官儿。再仔细看看,书记、县长停的车位是5号、6号,说明上面来了四个领导。你信不信?当官儿的和咱老百姓不一样,上厕所都要讲究个级别、排个先后顺序呢!”
邢县长听罢,张着塞满油条的大嘴,一动不动,好像僵化了似的…
(本故事来自于网络)
启示:
与其说高手来自于民间,还不如说生活是我们数据分析的基本素材,善于观察、善于整理关联信息才是我们做数据分析人员应该掌握的基本技能。可是啊,很多人忽略了我们身边的生活常识,不去思考,人云亦云,就像网上的这个全国离婚率排行榜数据,很多人首先不是思考数据的准确性,而是感叹世风日下。
想想吧,在你的生活圈子中,每3对夫妻就有1对离婚的吗?如果答案为“是”,我只能说,贵圈真乱!哈哈哈
2、林彪的数据挖掘本领
1948年辽沈战役开始之后,在东北野战军前线指挥所里面,每天深夜都要进行例常的“每日军情汇报”:由值班参谋读出下属各个纵队、师、团用电台报告的当日战况和缴获情况。
那几乎是重复着千篇一律的枯燥无味的数据:每支部队歼敌多少、俘虏多少;缴获的火炮、车辆多少、枪支、物资多少….
司令员林彪的要求很细,俘虏要分清军官和士兵,缴获的枪支,要统计出机枪、长枪、短枪;击毁和缴获尚能使用的汽车,也要分出大小和类别。
经过一天紧张的战斗指挥工作,人们都非常疲劳。整个作战室里面估计只有定下这个规矩的司令员林彪本人、还有那个读电报的倒霉参谋在用心留意。
1948年10月14日,东北野战军以迅雷不及掩耳之势,仅用了30小时就攻克了对手原以为可以长期坚守的锦州并全歼了守敌十余万之后,不顾疲劳,挥师北上与从沈阳出援的敌精锐廖耀湘基团二十余万在辽西相遇,一时间形成了混战。战局瞬息万变,谁胜谁负实难预料。
在大战紧急中,林彪无论有多忙,仍然坚持每晚必作的“功课”。一天深夜,值班参谋正在读着下面某师上报的其下属部队的战报。说他们下面的部队碰到了一个不大的遭遇战,歼敌部分、其余逃走。与其它之前所读的战报看上去并无明显异样,值班参谋就这样读着读着,林彪突然叫了一声“停!”他的眼里闪出了光芒,问:“刚才念的在胡家窝棚那个战斗的缴获,你们听到了吗?”
大家带着睡意的脸上出现了茫然,因为如此战斗每天都有几十起,不都是差不多一模一样的枯燥数字吗?林彪扫视一周,见无人回答,便接连问了三句:
“为什么那里缴获的短枪与长枪的比例比其它战斗略高”?
“为什么那里缴获和击毁的小车与大车的比例比其它战斗略高”?
“为什么在那里俘虏和击毙的军官与士兵的比例比其它战斗略高”?
人们还没有来得及思索,等不及的林彪司令员大步走向挂满军用地图的墙壁,指着地图上的那个点说:“我猜想,不,我断定!敌人的指挥所就在这里!”
随后林彪口授命令,追击从胡家窝棚逃走的那部分敌人,并坚决把他们打掉。各部队要采取分割包围的办法,把失去指挥中枢后会变得混乱的几十万敌军切成小块,逐一歼灭。司令员的命令随着无线电波发向了参战的各部队….
而此时的廖耀湘,正庆幸自己刚刚从偶然的一场遭遇战中安全脱身并与自己的另外一支部队汇合。他来不及休息就急于指令各部队尽快调整部署,为下一阶段作准备。可是好景不长,紧追而来的解放军迅速把他的新指挥部团团围住,拼命攻击,漫山遍野的解放军战士中,不断有人喊着:“矮胖子,白净脸;金丝眼镜湖南腔,不要放走廖耀湘!”
把对方指挥官的细节特征琢磨到如此细微,并变成如此威力巨大的顺口溜,穿着满身油渍伙夫服装的廖耀湘只好从俘虏群中站出来,无奈的说“我是廖耀湘”,沮丧的举手投降。
廖耀湘对自己静心隐蔽的精悍野战司令部那么快就被发现、打掉,觉得实在不可思议,认为那是一个偶然事件,输得不甘心。当他得知林彪是如何得出判断之后,这位出身黄埔军校并留学法国著名的圣西尔军校,参加过滇缅战役,在那里把日本鬼子揍得满地乱爬的新六军军长说,“我服了,败在他手下,不丢人。”
取得这场重要战役胜利的其中一个关键因素,居然出于获胜方的统帅夜半时分,对一份普通遭遇战之后的战报的数据分析,来源于他“从红军带兵时起,身上有个小本子,上面记载着每次战斗的缴获、歼敌数量”的优良军事素养。
(本故事来源于黄勇-丰沃华的博客)
启示:
林彪问的三个问题其实就是根据自己的数据库做的对比、细分、溯源。我们很多人把数据分析完全交给机器了,忘了我们自己的大脑也是一台紧密的数据分析机器。
数据的积累、数据的挖掘,分析、归纳、整理,是数据分析师所必须俱备的基本素养,没有它,你永远是匹夫之勇。
3、蛋挞与曼城队
2011年夏天,曼城队助理教练大卫·普拉特决定利用数据分析来解决球队在表现方面遇到的一个棘手难题。普拉特发现,尽管球队阵容中拥有多名高大强壮的球员,但他们的角球得分情况却不尽如人意。
在征求了俱乐部内部数据分析师的意见后,该队增加了对内旋角球(球转向守门员方向)的使用。战术转变产生了惊人的效果。在整个赛季中,曼城队依靠角球打入15个进球,成为英超角球得分效率最高的球队,其中2/3的进球采用的是内旋角球。
这一实践为数据驱动型决策提供了强有力的支撑。但是,还有一个附加因素需要考虑:主教练曼奇尼最初对数据的实际价值持怀疑态度。事实上,早在两年前,曼奇尼曾就球队角球的使用情况咨询过俱乐部的数据分析师。分析师回应,他依靠直觉偏爱采用的战术——外旋角球(球飞向远离守门员的方向)从数据统计上看并不理想。
曼奇尼选择相信自己的直觉而非数据分析的导向性建议。因为直觉告诉他,球旋向远离门将的方向减小了门将触球的概率,同时增加了进攻队员冲顶时争到头球的概率。但当曼奇尼发现两种变数存在某种联系的时候,直觉却模糊了他对两者关联程度的判断能力。换句话说,外旋角球和进球数可能存在着某种关联,但数据表明,内旋角球和进球数存在着更为直接的因果关系。
这一案例研究为我们改善商业决策带来哪些启示?一家美国零售商最近发现,两种不同变数之间存在着某种有趣的联系。当天气变冷,肉桂葡式蛋挞的销量上升500%——并非所有的葡式蛋挞,只是肉桂这一个品种。面对这种零星数据,零售商要做出抉择。每当预测天气即将转冷时,应该储备多少肉桂葡式蛋挞?还有一家零售商发现,羊奶干酪打折似乎能促进红酒的销售。希望减小红酒库存的时候,是不是应考虑羊奶干酪打折这种方法?
这两个问题的答案取决于大数据分析的核心问题:弄清相关性与因果关系之间的区别。人类善于发现事物的相关性——这是进化的特征——但是却在发掘直接相关事物的关系时显得有些笨拙。将相关性误解为因果关系所做出的决策是危险的,可能会遭受惨败,因为你所期待看到的影响可能并不会发生。
最近的一项研究显示,某国的巧克力销量与诺贝尔奖的人均比例之间呈现明显的相关性。各国是不是都该鼓励公民增加巧克力的消费来提高获得诺贝尔奖的人数呢?
为有效利用大数据,相关性分析应仅作为一个出发点去考虑。如果两个变量存在关联,我们该如何应对?当然,政府在推行“巧克力替代教育”的政策之前,应当首先考虑一下其他因素。比方说,看看那些获得诺贝尔奖人数较多的国家相对教育水平和研究预算,与巧克力消费相比,这两个变量与获诺奖的因果关系显然更大。
同样,那些葡式蛋挞和羊奶干酪的零售商们在拥有十足把握以前,需要对他们的假设进行验证。比如说,在确定因果关系存在以前,考察一些商店肉桂葡式蛋挞的“库存积压”情况;或者采取打折销售羊奶干酪的方式,看看红酒销量是否真的增加。
事物之间可能存在着一些简单的因果关系,但公司需要清楚每种因果关系都可能产生意想不到的结果。肉桂葡式蛋挞销量的增加是否意味着其他产品销量的减少?红酒销量的增加是否也意味着啤酒销量的...
- ?
五个大数据分析成功案例分享
万人迷
展开
首席信息官正在利用数据分析来提高效率和促进增长,但并不是每一次努力都会产生结果。以下讲述了优秀的首席信息官是如何成功地利用数据分析和机器学习技术来增加收益或降低成本的。
如果把数据比作新的石油,那么掌握如何将其提炼为可使用的情报就是发挥其潜力的关键。为此,首席信息官正在使用预测分析工具,设计机器学习算法和对其他解决方案进行测试,以追求企业的效率和以新的方式为客户服务。
胡椒博士集团(Dr.PepperSnappleGroup)将机器学习技术用于语境相关性工作中
多年来,胡椒博士集团的销售路线员工一直是抓着一本厚厚的活页夹,里面装满了客户数据、销售和促销说明,然后去吸引一些零售客户,如沃尔玛和塔吉特百货公司(Target)等。今天,销售人员不再使用这种活页夹,而是配备了能告诉他们需要拜访哪家商店的iPad,而且还会告诉销售人员该为这些零售商提供何种优惠,以及其他关键指标。胡椒博士集团的首席信息官汤姆·法拉(TomFarrah)表示:“他们都是接订单的销售人员,为此他们感到很骄傲。现在他们配备了信息资料来帮助其实现目标,使他们成为智能的销售人员。”
该MyDPS平台配有机器学习和其他分析工具,可在工作人员加载应用程序时向其提供建议和日常操作记分卡。这些算法向员工显示他们是如何按照预期计划进行工作的,包括他们是否按照自己的计划工作,或是落后于计划,以及给他们提供见解,让他们清楚如何纠正他们的工作。法拉说:“如果我要让某人获得成功,我必须确保他们拥有哪些信息是与工作内容相关的。”
经验教训:为了测试验证MyDPS平台的概念,法拉将该软件分给了一个分公司的四个人,并让业务总裁去拜访他们。他们透露,自从上个月使用MyDPS之后,执行销售额已经提高了50%,这一表现让他批准了该项目。法拉说:“他获得了结果,这就是销售所需要的,这不仅仅是为了项目的商业赞助,而且这也是他们希望得到的结果,这一点非常重要。”
凭借机器学习技术,RRD公司走上新业务之路
营销传播公司R.H.Donnelley公司为RRD公司的前身,几年前,RRD公司设立了物流部门,向消费者和企业配送它的印刷材料。为了支持这项业务,公司自己管理运营,并代表其合作伙伴配送各种物品,包括洗衣机、狗粮等等,最终成长为价值10亿美元的一个企业。这是一个挑战吗?在联邦快递和UPS成为无可争议的霸主的天下,找到一个最优的运费。
诸如天气、地域、司机和政治局面等因素都是业务上的成本。RRD公司的首席信息官肯奥布莱恩(KenO'Brien)表示,随着迫切需要对费率变量进行预测,RRD公司转向了机器学习和数据分析。公司聘请员工和与大学合作来帮助编写算法,在700条路线上测试数千个场景,直到能够以99%的准确率提前7天实时预计运费。奥布莱恩说:“该项目在不到一年的时间就完成了,我们现在仍然看到业务的增长与运费有关。”该公司预计,在2017年,其卡车货运代理业务将从400万美元增长到1600万美元,营收将增长1200万美元,业务规模达6亿美元。
经验教训:新企业需要高水平的全心投入,尽管奥布莱恩承认,他的一些业务同行已准备好在业务的不同环节上认输。该业务并不相信那些通常以感觉和猜测来完成一个流程的技术。RRD公司建立了一个协作环境,业务和IT共同合作来推进结果。“你会遇到困难,你会遇到挑战,但要耐心,”奥布莱恩说。
孟山都公司(Monsanto)利用机器学习技术,实现最佳种植计划
农民永远为要种植何种作物,种植面积,在哪里种植及何时种植而苦恼。种子行业巨人孟山都公司正在研究这项工作,利用数据科学为农业种植提供规范性建议。数学和统计学模型会绘制出雄性作物和雌性作物的最佳种植时间,以及在何处种植,在理想状态下,这就最大限度地提高产量并减少土地使用。孟山都公司全球IT分析主管艾德里安·卡地亚(AdrianCartier)表示,其机器学习算法在数天内完成了超过900亿的数据点,而不是几周或几个月。这是商业利益吗?在2016年,孟山都公司节省了600万美元,其供应链足迹减少了4%。卡地亚说:“北美地区的土地利用率下降了4%,相当于不去使用大面积的土地,这节省了大量资金。”
经验教训:孟山都公司成功的关键是在信息技术与供应链业务之间建立了一个“自始至终”的合作。卡地亚说:“他们具有农业和供应链角度的专业知识,而我们具有数学和统计领域的专业知识,两者结合起来,就创造了我们能够提供的价值。”卡地亚说道,他还寻求在供应链业务中“改变领导者和倡导者”,以形成对反对者一种健康的平衡。
柏克德公司(Bechtel)以卓越的大数据中心来颠覆自己
一个鲜为人知的事实:柏克德公司首席信息官CarolZierhoffer说,与建筑有关的支出占GDP的13%,但整个行业在过去二十年中只有1%的生产率增长。专家表示,通过重新制定合同、提高工人技能以及改进现场执行工作等方式,该行业可以提高50%至60%的生产率。柏克德公司建造了胡佛水坝、英吉利海峡隧道和其他大型设施,已经开始在业务各个环节的数据中挖掘洞察力。
Zierhoffer在沃尔玛、波音和洛克希德马丁公司会见了业内同行,以获得有关如何向前发展的见解。柏克德公司建立了一个先进的大型数据中心,其中包含5千万亿字节数据的数据湖,并开始了概念验证。该数据中心使用照片识别技术,并代表客户来检查和标记各个地点的照片,这节省了200万美元。自然语言处理(NLP)工具可解析索赔、提案请求(RFP)和合同。过去需要几天和几周的评估和计划工作现在只需要数小时。柏克德公司还扩大了分析工作范围,以了解员工的流失率情况,包括试图预测员工将何时离职。Zierhoffer说:“我们相信我们正在敲开解决生产率难题的大门。”
经验教训:数据仓库和质量是支柱。尽管柏克德公司可以分析大量的数据,但在整个业务各环节的数据质量必须提高。“我们不得不颠覆自己,了解我们是如何工作的,并且将数据仓库进行连接。”
数据分析帮助辛辛那提动物园提高客户满意度
辛辛那提动植物园成立于1873年,是世界上著名的动植物园之一,以其物种保护和保存以及高成活率繁殖饲养计划享有极高声誉。它占地面积71英亩,园内有500种动物和3000多种植物,是国内游客人数最多的动植物园之一,曾荣获Zagat十佳动物园,并被《父母》(Parent)杂志评为最受儿童喜欢的动物园,每年接待游客130多万人。
辛辛那提动植物园是一个非营利性组织,是俄亥州同时也是美国国内享受公共补贴最低的动植物园,除去政府补贴,2600万美元年度预算中,自筹资金部分达到三分之二以上。为此,需要不断地寻求增加收入。而要做到这一点,最好办法是为工作人员和游客提供更好的服务,提高游览率。从而实现动植物园与客户和纳税人的双赢。
借助于该方案强大的收集和处理能力、互联能力、分析能力以及随之带来的洞察力,在部署后,企业实现了以下各方面的受益:
-帮助动植物园了解每个客户浏览、使用和消费模式,根据时间和地理分布情况采取相应的措施改善游客体验,同时实现营业收入最大化。
- ?
通过基础数据进行数据分析的实例
仲安柏
展开
国产〇〇柒
前几天朋友给了一组行业同行表现数据,让帮忙分析一下自己的店铺问题所在和表现如何。今天我通过这个小示例来跟大家简单分享一下一些基础的分析方法。
(开始之前先跟小伙伴们说明一下,本案例是一个简单的基于一组数据而进行的分析,并通过这个给大家一个相对比较概括的方法介绍,实际分析操作中会遇到更复杂的情况,而且实际分析中的挖掘深度要比本案例要深)
下边是朋友提供的一组数据:
图片:基础数据表01.png
为了保护隐私避免侵权,公司名称这里就以字母替代
通过上图我们可以看到这是几组非常简单的数据,这些数据我们都可以在自己的店铺采集到,但是我们也可以看到这组数据有一个问题,多数数据缺乏一个时间参数,从表格中我们只能看到最后两项有一个准确的时间界定,其他项数据均没有这个界定。不过这里我们采用对比模糊分析的方法,不用考虑数据是否精确,只需要进行对比即可,所以缺乏时间参数问题也不太大。接下来我们通过以下几个步骤进行分析。
一,做筛选
首先我们要对这些数据进行筛选,只留可对比的数据组,剔除无用的数据。方法很简单,这里我们通过公司名称进行检测,进行主营产品类目检查(这里我是以朋友公司产品类目对基础的),通过分析发现C、G、M三个公司的产品与其他不符,这里我们就直接剔除这三家的数据不做参考。
整理后的数据如图:
图片:整理后的数据02.png
(再更复杂的分析中,剔除噪音数据并非这么简单,这里是用这个简单的方式说明一下这个操作步骤,大家在操作中要根据自己实际情况进行数据甄别,甄别的过程是非常复杂和繁琐的,如果这一步出错,做出的分析结果的准确性就很难得到保障)
二,做归类
无用的数据剔除之后,接下来我们就是要对现有的数据进行归类处理。
通过图表数据的阅读,我们可以把里面的数据简单的归为三类:交易数据、回复率、行为数据。交易数据这里主要就是包含前三项,一达通和信保;回复率就是询盘回复率的表现数据;行为数据这里主要是指人的行为,访客和季度、月询盘数。归类后如图:
图片:归类后的数据03.png
这三类数据是有区别的,交易数据和回复率我们可以统一称之为“操作数据”或“加权数据”,因为这些数据的控制权基本掌握在我们手里,我们在这部分数据的积累上有较大的主动权。行为数据可以称之为“结果数据”,这部分数据的直接控制权来自于客户行为,我们无法直接去干预,我们只能通过提升“操作数据”的方法去影响这个“结果数据”。我们之前的操作都是为了这个“结果数据”有较好的表现。
数据归类之后,我们开始分析
三,做分析
由于上面拿到的三类数据有两类属于“操作数据”,这两类对“结果数据”只能产生部分影响,这里我们就不关注这两项数据了(在全局分析中,这些局部数据都可以作为一个参数加入到分析的行列)。这里我们只关注结果数据。这里的结果数据中虽然有三组数据,由于其中一项数据缺少时间参数,所以我们可以把三项数据当作两项去分析,季度和月询盘量可以当作一个有效参数,这个时候我们就把数据优化成两类:访客和询盘。当看到这两个数据的时候我们很简单的就会联想到由他们而衍生出来的一个数据:“转化率”,这个数据能够比较真实的反馈平台效果。接下来我们计算出每一组的“转化率”数据如图(按照月度参数计算):
图片:转化率04.png
从上图可以看出“转化率”排名如下:
H > K > P > A = F > B > D = E > I = O > J > L >N
当然,转化率高并不代表代表一个店铺的表现就是第一名,这个数据只能判断该店铺引流的精准程度(当然如果需要更深入的分析精准度是需要深入到询盘质量和成交转化中去的,这里不做过多介绍)。我们可以观察一下N店铺的转化率,0.43%的数据与其他店铺相比较差距较大,该店铺的访客流量占据第一位,但是反馈数据在该表中与其他几家并列最后一名,该店铺就需要认真的分析访客来源和未转化的原因(这里就牵扯到了其他数据的数据分析,这里不多介绍)。
当然,从数据组中我们一共可以看到这些数据条件,也可以计算出一个数据进行比较。但是这并不太说明什么太多的问题。接下来我们用加入条件的方法来进一步深入分析。这里我加入的数据是店铺的产品”上架产品数量“这个参数。加入数据到图标(实际操作中我们可以加入更多的可参考数据进行数据分析),如图:
图片:加入产品数量条件05.png
从表格中可以看出产品数量过万的有A B J N ,产品数量5000以上的有D I K L O P,产品数量低于5000的有E F H。从阿里规则上来说,店铺产品数量过多,店铺过于臃肿并不太好,但是这并不代表不用去发布产品了,其实我们真正要做到的是产品数量适中,做到全覆盖即可。从以上店铺的产品数量数据表现可以看出来,该行业的产品数量需要大于5000以上,如果低于5000,应该做不到全覆盖,可能会浪费很多流量(这里是从数据表大致得出结论,如要深入分析具体多少产品数量合适,还需要从其他方面进行综合分析)。我们也可以看到低于5000的几个店铺的访客量分别为:4000,7000,9000(里面有P4P引流数据,所以该数据仅作参考,不可作为实际数据参考),这个数据量并不算高,特别是H,访客是最少,产品数量也是最少,但是我们可以发现H的转化率是最高的,我们这里假设,H拥有A的产品数量(覆盖面),保持转化率不变,其他条件随覆盖面递增,这个时候我们可以看到H的数据应该是这样的,如图:
图片:修改数据后转化询盘06.png
当然这是一个理想的假设状态,覆盖,访客,转化这些数据都是的动态的,越是大的数据体量对转化率的控制难度越大,但是不可否认的是,如果产品覆盖能够达到一定程度的话,对访客和询盘转化肯定是有益处的,示例中虽然达不到492条的完美状态,但是询盘数量增加2倍应该还是有保障的。从这些数据的表现我们也可以看到覆盖的重要性(其实覆盖是一个很复杂的事情,并不是咱们想象的那种把产品和关键词上传上去就完事儿的事情,有时间可以跟大家深入交流关于覆盖的问题)。其实这些数据中还有很多可以对比解读的地方,我们今天先这里,以覆盖落幕。
数据分析实例有哪些
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并