- ?
手把手教你Tableau高级数据分析功能
Denny
展开
原文标题:A Step-by-Step Guide to learn Advanced Tableau – for Data Science and Business Intelligence Professionals
作者:Pavleen Kaur ; 翻译:李清扬 ; 校对:卢苗苗;
本文共 4000字 ,建议阅读 8分钟 。 本文借助高级图表创建计算深入研究数据以提取对数据的分析,并了解R如何与Tableau相互集成和使用。
简介
“查看数据。 显示图表。 讲故事。 吸引观众。”
Tableau是当今数据科学和商业智能专业人员使用的最流行的数据可视化工具之一。 它使您能够以交互和多彩的方式创建具有洞察力和影响力的可视化效果图。
它的用途不仅仅是创建传统的图表和图表。 您可以使用它来挖掘可操作的数据解析,这要归功于它提供的大量功能和自定义。
以其易用性和简单的功能而闻名,制作如下所示的富有洞察力的仪表盘只需点击几下鼠标:
在本文中,我们将看到一些超越拖放功能的高级图表。 我们将创建计算以深入研究数据以提取对数据的分析。 我们还将看看R如何与Tableau相互集成和使用。
本文假定您掌握丰富的使用Tableau的知识,例如基本图表形成,计算,参数等。如果您不这样做,我会建议先参考以下文章,然后再返回此处:
Tableau for Beginners - 简化数据可视化
中级Tableau指南 - 适用于数据科学和商业智能专业人员
目录
1. 高级图形 - 可视化超越“显示我”
运动图
凹凸图
甜甜圈图表
瀑布图
帕累托图
2. 在Tableau中引入R编程
1. 高级图形 - 可视化超越'Show Me'
几乎所有的Tableau用户都知道各种基本图形,例如介绍仪表板中显示的那些图形。 这些图表可以使用Tableau的“Show Me”功能轻松完成。 但由于这是一篇面向高级用户的文章,因此我们将超越“Show Me”并探索需要额外计算的图表。
首先,让我们快速浏览一下我们将在接下来的几节中做什么。 以下是我们超市的销售额和利润的一些基本分析。 简单的图表可以达到与主板中的相同的目的,但我认为您会对这些图表的宏伟感到兴奋和激动。
1.1动态图表
在开始之前,先看看Hans Rosling的世界经济图表展示 #_chart-type=bubbles) 。 点击播放键,看到魔法在你面前展开。
有兴趣自己做一个类似的图表展示吗? 不要担心如何做这些动画!你所看到的被称为动态图表。 使用此功能,您可以实时查看数据中的变化。
因此,我们首先下载可在此处找到的Superstore数据集 。
现在让趋势线如下图所示对你来说应该很容易:
但是本节我们首先要学习的是如何使下面的趋势线运动(gif动图):
https://s3-ap-south-1.amazonaws/av-blog-media/wp-content/uploads/2017/08/23131759/2.gif
所以让我们开始吧!
导入您的数据集,并创建上述趋势图。 我们的X轴是订单日期(月份格式),销售额和利润是度量值。
您只需将“订单日期”拖到“页面”功能区,然后再次更改格式以与X轴匹配。
将标记类型从自动更改变更为圆形。
转到“显示历史记录”,然后选择“追踪”以查看趋势变化。 瞧! 您的动态图表已准备好启动。
按箭头按钮查看动作,更改“显示历史”定制项,速度项等:
1.2凹凸图
假设你想探索Superstore各个部门的销售额(整整一年)。 其中一种方法是:
然而备选方案如下:
虽然折线图能够显示每个细分部门之间的销售差异,但凹凸图(上图)给出了更清晰和简明的相同结果图。
这些图表通常用于了解多年来特定产品的受欢迎程度如何变化。
现在让我们尝试自己创建一个:
1)首先,我们需要考虑度量单位,根据这些度量单位我们对我们的测量维度进行排名。 这里我们采取的度量单位是销售量,测量维度是部门。
2)您需要计算模块的帮助才能制作凹凸图表。 所以快速创建一个如下所示的计算。 我们将对每个细分部门的销售总额进行排名:
3)现在将“订单日期”拖到列中并将格式更改为月。 在标记窗格中将“Segment”拖动到Marks Pane里的颜色。 最后将“Rank”拖到行。
4)在你现在可以看到的图表中,排名是根据月份数量分配的。但是,我们需要他们在细分部门的基础上。 因此,右键单击行中的排名,然后转到编辑表格计算。
5)由于我们希望使用细分部门计算,请将配置更改为:
您将获得的图表看起来不像仪表板中的图表,因为它缺少标签。 让我们在双轴(Dual Axis)的帮助下快速修复:
6)再次将排名拖到行上并重复步骤4)和5)以得到:
您在Marks Pane中看到了Rank和Rank(2)吗?我们将使用这些来创建带圆圈的标签。
7)要将上述内容转换为双轴图表,请右键单击第二个图表的Rank轴并选择双轴。
8)在Marks Pane中,Rank或Rank(2),然后将标记类型更改为圆形而不是自动。
9)这里的排名按降序排列。 要将其更改为升序,请右键单击左侧的Rank轴 - >编辑轴 - >反向比例。 对右边的Rank轴重复同样的操作。
10)最后,将“销售额”拖放到标签 - >快速表计算 - >总计百分比上,以获得我们期望的凹凸图。
1.3甜甜圈图
圆环图是初级图的另一种表现形式。 坦率地说,它是一个中间有一个洞的饼图,但它有助于更加强调各个细分市场,如下所示:
让我们了解这个区别的不同之处。
1)我们将从一个简单的饼图开始描绘每个细分部门的利润:
2)要创建饼图的双轴,将measure的number of records拖动到rows两次。 通过右键点击它们并选择最小值代替默认总和来更改每个绿色药丸的度量:
3)选择Marks Pane中的第二个饼图,并将其中的每个度量/维度拖出。 减小图表的大小,并将颜色更改为白色(尽管此处未显示):
4)要创建双轴,右键单击第二个饼图的Y轴,然后选择双轴,以获得图表。
现在你必须明白,以上所有图表虽然在最终外观上都不相同,但都是从“显示我”功能的核心图表中获得的。 但是等一下,它还没有结束。 我有更多要展示给你。
1.4瀑布图
瀑布图的名称来自于其类似的方向和流动。在这里,我们绘制了Superstore多年来的运行销售情况,您可以在2013年中和2014年初看到两个小红色区域,表明销售额实际下降了,并且还有多少。
这意味着这些图表被用来分析一个度量的累积效应,并且看它是如何作为一个整体增加和减少的。 为了更好地理解这一点,让我们想象它。
瀑布图是折线图的衍生物,因此我们将从该图开始:
注意:这里的X轴是订单日期(以月 - 年格式并转换为离散型), Y轴是利润
1)右键单击绿色的Profit Pill,然后选择Quick Table Calculation - > Running Total。
2)将标记类型从自动更改为甘特条:
3)创建一个名为'NegProfit'的计算字段:
4)将这个NegProfit拖到Marks框架中的Size上,得到:
计算的字段用于填写甘特图中的空间。 利润中的负值将向下延伸,而正值则会向上延伸。
图表中每个小条的长度表示利润从一个月到下一个月的变化量。
5)最后,将利润拖到颜色:
6)您可以继续前进,将颜色更改为两步变化,并清楚地查看上升和下降:
您将获得的图表也可以非常容易地以条形图的形式表示。 请注意,我在这里将颜色分置,以使其凸显出来:
但我相信你会同意使用瀑布图是一种更直观的表示数据的方式,特别是看看多年来度量的变化,例如销售和利润。
1.5帕累托图
下面我已经将一个流行的80-20数据分析原理可视化出来。 如果你还没有听说过它,让我试着用例子来解释它。我们会经常观察到超市的大部分销售来自少数几种产品。
人们不能指望面包和鸡蛋与蛋糕有相同的销售数字,对吧? 这正式被称为80-20原则,这意味着80%的销售额来自20%的产品。 在我们的超市里,这个原则可以在下面的图表中看到,其中大部分销售是由电话和椅子生成的:
这是一种相当流行的可视化,帕累托图通常用于风险管理,以确定对项目造成最大负面影响的最常见问题; 但正如我们将看到的,它也可以有其他应用程序。
让我们看看它是如何完成的:
1)我们将从下面的图表开始。 这具有作为X轴的子类别和作为Y轴的销售。 图表按降序排列:
2)接下来,将销售额拖放到图表上,直到您看到绿色突出显示的条形和最右边的虚线轴:
3)在此处下降销售以创建双轴。 将第一个图表的标记类型更改为条形图,将第二个图表更改为直线,最终得到:
4)右键单击第二个绿色销售药丸,并为其添加运行总计算:
5)剩下的只是改变配色方案,并且您的帕累托图表已准备就绪!
2.在Tableau中引入R编程
我喜欢Tableau的一个原因是,它不仅仅是一个工具,而且意味着只需拖放操作即可创建漂亮的图形。随着2013年Tableau 8.1的发布,出现了许多新的功能。
R编程的引入使得更丰富和动态的可视化得以实现,这是主要特征之一。 R编程可与Tableau一起用于聚类、预测等技术。
我想通过Clustering开始对R和Tableau的探索,所以我使用了超流行的Iris Dataset 。 它包含不同的功能来区分3种类型的flowers,即Virginica,Setosa和Versicolor。 正如你在下面的图片中看到的那样,R编程整合很容易创建这三种物种的集群:
如果你有兴趣,可进行一下操作。首先,深入了解基础知识和安装过程,然后深入研究可视化问题!
以下描述了Tableau和R之间的控制流程,以实现此集成:
R脚本作为表计算写入Tableau,并发送到R的R服务包。在此模块执行必要的计算并将结果返回给Tableau。
注意:为了正确理解并使用此功能,您必须具备R及其各种语法的一些知识。 对于相同的你可以参考以下教程:
Learn Data Science in R from scratch:
现在让我们看看这个集成的步骤:
1)安装R -project.org)
2)安装Rserve软件包
在R命令行中运行以下命令:
3)配置Tableau以在R中运行
打开Tableau - >帮助 - >设置和性能 - >管理R /外部连接。 使用以下默认信息填写字段并选择测试连接:
所以,现在你已经准备好了适当的配料,让我们开始吧!
如上图所示,您可以使用Tableau的表计算与R进行通信:
如果您向下滚动功能列表,您将遇到以下四种情况:
当计算区域中包含这些函数时,Tableau会自动理解该脚本适用于R.
我希望你最初兴奋的制作集群仍然存在! 我们继续。
1)从这里下载Iris数据集。
2)在Tableau中导入数据集,并制作下图:
3)在这里,您可以通过不同的度量获得总和。要获得离散值,请转至分析,并取消选中聚合度量,以获取:
4)最后,要形成群集,请在标记窗格中将类维度拖到颜色上:
我们上面有一个散点图,它显示了分为3个不同群集的数据点群集。
现在让我们尝试与R一样,并比较我们将得到的两个可视化。 我们将使用最常见的聚类算法K-Means:
1)从与上面第2点相同的散点图开始。
2)创建一个新的计算字段并填写以下内容:
为了清楚起见,上述计算是:
3)最后,将新形成的Field Cluster拖放到Marks Pane中的Color,以使您的集群准备就绪!
虽然有一些重叠,但这两个可视化确实看起来相当准确。
这是将R与Tableau集成的潜力的一个小要点。 它的应用程序是无限的,我相信你一定已经开始考虑可以与之交互的不同方式。
结束笔记
如果我说这就是Tableau的全部,这可能稍显幼稚。随着新版本的推出,新功能也将随之推出。
不仅如此,人们总是在试验和探索Tableau,并提出新的视觉效果。在很多博客里,人们也发布了其数据实验。可以搜索一下。
您还可以在Tableau官方图库页面上查找每周更新的可视化图像 。 建议你继续参考这些帖子,创建自己的视觉效果,并与社区分享。
作为一名数据探索者,保持创意并保持最佳状态!
原文链接:
译者简介:李清扬 , 清华大学工商管理研究生在读,主修管理学。对大数据、人工智能在经济金融领域的应用感兴趣。希望能在数据派平台获得大数据前沿知识,找到志同道合的朋友,一起研究和应用数据分析工具于企业管理实践当中。
END
版权声明:本号内容部分来自互联网,转载请注明原文链接和作者,如有侵权或出处有误请和我们联系。
关联阅读:
原创系列文章:
1:从0开始搭建自己的数据运营指标体系 (概括篇)
2 :从0开始搭建自己的数据运营指标体系(定位篇)
3 :从0开始搭建自己的数据运营体系(业务理解篇)
4 :数据指标的构建流程与逻辑
5 : 系列 :从数据指标到数据运营指标体系
6: 实战 :为自己的公号搭建一个数据运营指标体系
7: 从0开始搭建自己的数据运营指标体系(运营活动分析)
数据运营 关联文章阅读:
运营入门,从0到1搭建数据分析知识体系
推荐 :数据分析师与运营协作的9个好习惯
干货 :手把手教你搭建数据化用户运营体系
推荐 :最用心的运营数据指标解读
干货 : 如何构建数据运营指标体系
从零开始,构建数据化运营体系
干货 :解读产品、运营和数据三个基友关系
干货 :从0...
- ?
数据分析师的就业方向,一位过来人的职业规划告诉你!
滕寻桃
展开
随着大数据时代的到来,各个行业对数据价值越来越重视,他别是近两年,数据分析师岗位的需求激增,数据分析师已成为当今最具发展潜力的职业,人才缺口达到150万,在生活中很多想转行数据分析师培训的从业人员纷纷报名数据分析师培训机构,来增强自己的技能因此转行高薪行业。那么数据分析师的就业方向是什么,一位过来人的职业规划之路告诉你!
大数据时代数据分析师作为一个出现时间不长的工种,大数据时代下,成为螺丝钉还是成为龙头,需要尝试新的可能。
数据分析师的职业规划
数据分析师手中拥有一座宝藏。作为滴滴出行数据分析团队的负责人,刘普成发现了数据分析师通往卓越的秘诀:视野。数据分析提供了这样一种可能:它不是简单的技术工种,它是最具有潜力的一项工作,背后蕴藏着相当多的机会。刘普成是中国最懂互联网数据分析的人之一。北大ccer硕士出身,做过公务员,这位业界资深的大牛,曾先后任职于百度、豆瓣、豌豆荚,对产品、设计、运营等互联网业务有着深刻的理解。现在,他担任滴滴出行数据分析团队的负责人,统筹这家体量巨大的公司随时产生的海量数据。作为一个成长经历颇为不同的资深大牛,他认为,推动一个人进步的本质原因是开放的心态和兴趣。硕士毕业后,他没有像大多数同学那样出国读博,或顺理成章进入金融业,而是选择在中国互联网界进行数据方面的探索,寻找一些“新”的东西。随着专业能力的提升,又开始深入学习互联网行业的其他技能,拓展自己的知识领域。
在八年时间,从一名普通的数据分析师,成长为精通技术和业务的数据科学家,刘普成发现,数据分析师在不同阶段需要掌握不同的能力,本质上,是让自己的视野更开阔。
数据分析师数据分析师不能只成为一个技术专家,要成为可以影响公司运作的人。结合自身经历,刘普成认为数据分析师在进阶的道路上有如下选择:
1、成为数据技能超强的产品经理
2、成为数据指导业务的运营VP
3、成为管理或战略
4、成为博学广识的数据科学家
而关于数据分析师的职业规划,小编认为主要是从两个方面表现,一个方向是偏文一些(即运营分析),另一个方向则偏理一些(即挖掘分析)。不管是文的还是理的,可能你都需要掌握一些入行的行规,例如Excel技能、数据库操作(MySQL/SQL Server/Oracal/Hive等)、Tableau可视化、R或Python的编程能力等。这些都是用人单位在招聘数据分析师时提到最多的“任职资格”,其实这也都是技能门槛。如果这些你还没有接触过,可以在准备入行前花3~6个月去充充电,可以选择闭关修炼、或观看学习视频、甚至可以挑选口碑比较好的数据分析师培训班。而不管是数据运营分析师和数据挖掘工程师,它们在企业中都属于技术岗。根据工作人员的能力,会匹配相应的段位,一般来说,较高的技术段位,也可以对标到相应的管理岗。最后,就看你希望往哪个方向去发展,然后在这个方向上去努力,如果顺利的话你可以成为高级总监。
以上有关数据分析师的就业方向,一位过来人的职业规划之路告诉你的内容介绍,到这里就结束了,更多数据分析师相关信息可关注容大教育。
- ?
数据分析全流程(内附案例)
浑诗蕾
展开
(图片来源于网络)
作者:苏格兰折耳喵
来源: 运营喵是怎样炼成的 (yymzylc)
(温馨提示:图片显示毛糙和不清楚,是分辨率过高的缘故,点击图片,即可看到高清大图。 )
本文将对一个案例进行从数据采集、数据清洗、数据分析再到数据可视化的全流程分析,力求条理清晰的展现外部数据分析的强大威力。以下是本文的写作框架:
1 分析背景
1.1 分析原理---为什么选择分析虎嗅网
在现今数据爆炸、信息质量良莠不齐的互联网时代,我们无时无刻不身处在互联网社会化媒体的“信息洪流”之中,因而无可避免的被它上面泛滥的信息所“裹挟”,也就是说,社会化媒体上的信息对现实世界中的每个人都有重大影响,社会化媒体是我们间接了解现实客观世界和主观世界的一面窗户,我们每时每刻都在受到它的影响。
综合上述两类情形,可以得出这样的结论,透过社会化媒体,我们可以观察现实世界:
由此, 社会化媒体是现实主客观世界的一面镜子,而它也会进一步影响人们的行为,如果我们对该领域中的优质媒体所发布的信息进行分析,除了可以了解该领域的发展进程和现状,还可以对该领域的人群行为进行一定程度的预判。
鉴于此种情况,作为互联网从业者的笔者想分析一下互联网行业的一些现状,于是想到了虎嗅网。
虎嗅网创办于2012年5月,是一个聚合优质创新信息与人群的新媒体平台。该平台专注于贡献原创、深度、犀利优质的商业资讯,围绕创新创业的观点进行剖析与交流。虎嗅网 的核心,是关注互联网及传统产业的融合、一系列明星公司(包括公众公司与创业型企业)的起落轨迹、产业潮汐的动力与趋势。
因此,对该平台上的发布内容进行分析,对于研究互联网的发展进程和现状有一定的实际价值。
1.2 本文的分析目的
笔者在本项目中的分析目的主要有4个:
(1)对虎嗅网内容运营方面的若干分析,主要是对发文量、收藏量、评论量等方面的描述性分析;
(2)通过文本分析,对互联网行业的一些人、企业和细分领域进行趣味性的分析;
(3)展现文本挖掘在数据分析领域的实用价值;
(4)将杂芜无序的结构化数据和非结构化数据进行可视化,展现数据之美。
1.3 分析方法---分析工具和分析类型
本文中,笔者使用的数据分析工具如下:
Python3.5.2(编程语言)
Gensim(词向量、主题模型)
Scikit-Learn(聚类和分类)
Keras(深度学习框架)
Tensorflow(深度学习框架)
Jieba(分词和关键词提取)
Excel(可视化)
Seaborn(可视化)
新浪微舆情(情绪语义分析)
Bokeh(可视化)
Gephi(网络可视化)
Plotly(可视化)
使用上述数据分析工具,笔者将进行2类数据分析:第一类是较为传统的、针对数值型数据的描述下统计分析,如阅读量、收藏量等在时间维度上的分布;另一类是本文的重头戏---深层次的文本挖掘,包括关键词提取、文章内容LDA主题模型分析、词向量/关联词分析、DTM模型、ATM模型、词汇分散图和词聚类分析。
2 数据采集和文本预处理
2.1 数据采集
笔者使用爬虫采集了来自虎嗅网主页的文章(并不是全部的文章,但展示在主页的信息是主编精挑细选的,很具代表性),数据采集的时间区间为2012.05~2017.11,共计41,121篇。采集的字段为文章标题、发布时间、收藏量、评论量、正文内容、作者名称、作者自我简介、作者发文量,然后笔者人工提取4个特征,主要是 时间特征 (时点和周几)和 内容长度特征 (标题字数和文章字数),最终得到的数据如下图所示:
2.2 数据预处理
数据分析/挖掘领域有一条金科玉律:“Garbage in, Garbage out”,做好数据预处理,对于取得理想的分析结果来说是至关重要的。本文的数据规整主要是对文本数据进行清洗,处理的条目如下:
(1) 文本分词
要进行文本挖掘,分词是最为关键的一步,它直接影响后续的分析结果。笔者使用jieba来对文本进行分词处理,它有3类分词模式,即全模式、精确模式、搜索引擎模式:
· 精确模式:试图将句子最精确地切开,适合文本分析;
· 全模式:把句子中所有的可以成词的词语都扫描出来, 速度非常快,但是不能解决歧义;
· 搜索引擎模式:在精确模式的基础上,对长词再次切分,提高召回率,适合用于搜索引擎分词。
现以“新浪微舆情专注于社会化大数据的场景化应用”为例,3种分词模式的结果如下:
【全模式】: 新浪/ 微舆情/ 新浪微舆情/ 专注/于/ 社会化/ 大数据/ 社会化大数据/ 的/ 场景化/ 应用
【精确模式】: 新浪微舆情/ 专注/于/ 社会化大数据/ 的/ 场景化/ 应用
【搜索引擎模式】:新浪,微舆情,新浪微舆情,专注,于,社会化,大数据,社会化大数据,的,场景化,应用
为了避免歧义和切出符合预期效果的词汇,笔者采取的是精确(分词)模式。
(2) 去停用词
这里的去停用词包括以下三类:
标点符号:, 。! /、*+-
特殊符号:▲等
无意义的虚词: “the”、“a”、“an”、“that”、“你”、“我”、“他们”、“想要”、“打开”、“可以”等
(3) 去掉高频词、稀有词和计算Bigrams
去掉高频词、稀有词是针对后续的主题模型(LDA、ATM)时使用的,主要是为了排除对区隔主题意义不大的词汇,最终得到类似于停用词的效果。
Bigrams是为了自动探测出文本中的新词,基于词汇之间的共现关系---如果两个词经常一起毗邻出现,那么这两个词可以结合成一个新词,比如“数据”、“产品经理”经常一起出现在不同的段落里,那么,“数据_产品经理”则是二者合成出来的新词,只不过二者之间包含着下划线。
3 描述性分析
该部分中,笔者主要对数值型数据进行描述性的统计分析,它属于较为常规的数据分析,能揭示出一些问题,做到知其然。
3.1 发文数量、评论量和收藏量的变化走势
从下图可以看出,在2012.05~2017.11期间,以季度为单位,主页的发文数量起伏波动不大,在均值1800上下波动,进入2016年后,发文数量有明显提升。
此外,一头(2012年第二季)一尾(2017年第四季)因为没有统计完全,所以发文数量较小。
下图则是该时间段内收藏量和评论量的变化情况,评论量的变化不愠不火,起伏不大,但收藏量一直在攀升中,尤其是在2017年的第二季达到峰值。收藏量在一定程度上反映了文章的干货程度和价值性,读者认为有价值的文章才会去保留和收藏,反复阅读,含英咀华,这说明虎嗅的文章质量在不断提高,或读者的数量在增长。
3.2 发文时间规律分析
笔者从时间维度里提取出“周”和“时段”的信息,也就是开题提到的“人工特征”的提取,现在做文章分布数量的在“周”和“时”上的交叉分析,得到下图:
上图是一个热力图,色块颜色上的由暖到冷表征数值的由大变小。很明显的可以看到,中间有一个颜色很明显的区域,即由“6时~19时”和“周一~周五”围成的矩形,也就是说,发文时间主要集中在工作日的白天。另外,周一到周五期间,6时~7时这个时间段是发文的高峰,说明虎嗅的内容运营人员倾向于在工作日的清晨发布文章,这也符合它的人群定位---TMT领域从业、创业者、投资人,他们中的许多人有晨读的习惯,喜欢在赶地铁、坐公交的过程中阅读虎嗅讯息。发文高峰还有9时-11时这个高峰,是为了提前应对读者午休时间的阅读,还有17时~18时,提前应对读者下班时间的阅读。
3.3 相关性分析
笔者一直很好奇,文章的评论量、收藏量和标题字数、文章字数是否存在统计学意义上的相关性关系。基于此,笔者绘制出能反映上述变量关系的两张图。
首先,笔者做出了标题字数、文章字数和评论量之间的 气泡图 (圆形的气泡被六角星替代,但本质上还是气泡图)。
上图中,横轴是文章字数,纵轴是标题字数,评论数大小由六角星的大小和颜色所反映,颜色越暖,数值越大,五角星越大,数值越大。从这张图可以看出,文章评论量较大的文章,绝大部分分布于由文章字数6000字、标题字数20字所构成的区域内。虎嗅网上的商业资讯文章大都具有原创、深度的特点,文章篇幅中长,意味着能把事情背后的来龙去脉论述清楚,而且标题要能够吸引人,引发读者的大量阅读,合适长度标题和正文篇幅才能做到这一点。
接下来,笔者将收藏量、评论量和标题字数、文章字数绘制成一张3D立体图,X轴和Y轴分别为标题字数和正文字数,Z轴为收藏量和评论量所构成的 平面 ,通过旋转这个3维的Surface图,我们可以发现收藏量、评论量和标题字数、文章字数之间的相关关系。
注意,上图的数值表示和前面几张图一样,颜色上的由暖到冷表示数值的由大到小,通过旋转各维度的截面,可以看到在正文字数5000字以内、标题字数15字左右的收藏量和评论量形成的截面出现“华山式”陡峰,因而这里的收藏量和评论量最大。
3.4 城市提及分析
在这里,笔者通过构建一个包含全国1~5线城市的词表,提取出经过预处理后的文本中的城市名称,根据提及频次的大小,绘制出 一张反映城市提及频次的地理分布地图 , 进而间接地了解各个城市互联网的发展状况(一般城市的提及跟互联网产业、产品和职位信息挂钩,能在一定程度上反映该城市互联网行业的发展态势)。
上图反映的结果比较符合常识,北上深广杭这些一线城市的提及次数最多,它们是互联网行业发展的重镇。值得注意的是,长三角地区的大块区域(长江三角洲城市群,它包含 上海 , 江苏省 的 南京 、 无锡 、 常州 、 苏州 、 南通 、 盐城 、 扬州 、 镇江 、 泰州 , 浙江省 的 杭州 、 宁波 、 嘉兴 、 湖州 、 绍兴 、 金华 、 舟山 、 台州 , 安徽省 的 合肥 、 芜湖 、 马鞍山 、 铜陵 、 安庆 、 滁州 、 池州 、 宣城 )呈现出较高的热度值,直接说明这些城市在虎嗅网各类资讯文章中的提及次数较多,结合国家政策和地区因素,可以这样理解地图中反映的这个事实:
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
长三角城市群是“一带一路”与长江经济带的重要交汇地带,在中国国家现代化建设大局和全方位开放格局中具有举足轻重的战略地位。中国参与国际竞争的重要平台、经济社会发展的重要引擎,是长江经济带的引领发展区,是中国城镇化基础最好的地区之一。
接下来,笔者将抽取文本中城市之间的 共现关系 ,也就是城市之间两两同时出现的频率,在一定程度上反映出城市间经济、文化、政策等方面的相关关系,共现频次越高,说明二者之间的联系紧密程度越高,抽取出的结果如下表所示:
将上述结果绘制成如下动态的流向图:
由于虎嗅网上的文章大多涉及创业、政策、商业方面的内容,因而这种城市之间的共现关系反映出城际间在资源、人员或者行业方面的关联关系,本动态图中,主要反映的是北上广深杭(网络中的枢纽节点)之间的相互流动关系和这几个一线城市向中西部城市的单向流动情形。流动量大、交错密集的区域无疑是中国最发达的3个城市群和其他几个新兴的城市群:
京津冀城市群
长江三角洲城市群
珠江三角洲城市群
中原城市群
成渝城市群
长江中游城市群
上面的数据分析是基于数值型数据的描述性分析,接下来,笔者将进行更为深入的文本挖掘。
4 文本挖掘
数据挖掘是从有结构的数据库中鉴别出有效的、新颖的、可能有用的并最终可理解的模式;而文本挖掘(在文本数据库也称为文本数据挖掘或者知识发现)是从大量非结构的数据中提炼出模式,也就是有用的信息或知识的半自动化过程。
本文的文本挖掘部分主要涉及高频词统计/关键词提取/关键词云、文章标题聚类、文章内容聚类、文章内容LDA主题模型分析、词向量/关联词分析、ATM模型、词汇分散图和词聚类分析。
4.1 关键词提取
对于关键词提取,笔者没有采取词频统计的方法,因为词频统计的逻辑是:一个词在文章中出现的次数越多,则它就越重要。因而,笔者采用的是 TF-IDF (termfrequency–inverse document frequency)的关键词提取方法:
它用以评估一字/词对于一个文件集或一个语料库中的其中一份文件的重要程度,字/词的重要性会随着它在文件中出现的次数成正比增加,但同时会随着它在语料库中出现的频率成反比下降。
由此可见,在提取某段文本的关键信息时,关键词提取较词频统计更为可取,能提取出对某段文本具有重要意义的关键词。
下面是笔者利用jieba在经预处理...
- ?
资深网络推广运营专家仲泓韦谈数据分析体系+算账体系
小秋
展开
这是一个热闹的时代,以前我们要是发现哪个地方发生了重大事件、让人们谈论一个月,但是现在再大的事故也不会在人们的脑海中超过一个星期,这是一件可怕的事实,人人都喜欢猎奇,注意力极度涣散,以后最大的营销成本就是让别人注意到你,能够让人谈论。
互联网时代,有些产品互联网营销的效果很好,而有些产品用了互联网营销却并没有得到什么效果,这背后到底有什么奥秘?
通过互联网极大的缩短了空间和时间上的距离,从而能够在互联网上的一个节点能够以很低的成本把商品卖到全国各地甚至是全世界各地,二不需要像传统商业业态那样为了把商品尽可能的卖到更多的地方而形成一级级的经销商,典型的例子是淘宝、京东、亚马逊。但这只是网店,主要是卖商品,实际上,有很推广信息(也包括卖东西)的网站(网店其实也就是个网站),于是就产生了SEO(搜索引擎优化),百度SEO,淘宝SEO,谷歌SEO等等
他从点滴做起,让网络营销真正的落地服务,七年的网络账户管理经验,研发出竞价推广独有的“数据分 析体系”+算账体系。辅导过近两百家中小企业,两家上市公司。一手打造“甲虎网”网络营销运营体系,从企业转型定位到团队独立运营,从零起步,短短半年时间组建一支11人运营团队,梳流程,定标准,从而完成了“网络小白”到“网络专家”的蜕变,真正的实现了“互联网+”红利,并因此受邀参加了CCTV《对话星品牌》栏目。
雄关漫道真如铁,而今迈步从头越。互联网人不仅要有创新精神,更要有服务中小企业的济世情怀。通过我们的努力让更多的中小企业能站起来 富起来强起来,为中国梦的实现助力,为中华民族伟大复兴添砖加瓦!
- ?
《游戏数据分析实战》:盛大游戏数据分析专家16年的实战经验分享
凝莲
展开
来源:数据猿 作者:abby
从游戏产业诞生开始,数据分析就一直伴随游戏的研发和运营的全过程。 2001 年,盛大网络通过《热血传奇》开启了中国网络游戏产业。网络游戏的 24 小时在线和高度的用户互动,为游戏数据分析提供了前提条件;通过数据分析输出的结果,及时有效地反馈到游戏的研发设定和线上社区,形成了良性和有效的循环。
早在2003年,盛大网络向行业输出了 PRAPA 分析模型,针对游戏的用户推广(Promotion)、注册用户(Register)、活跃(Active)、付费(Pay)、平均用户收益(ARPU)进行有效的分析指导,为游戏行业的成熟提供了标杆。在当时的盛大内部,我们针对游戏的用户体验瓶颈环节,设立“卡外掉充安”(卡机、外挂、掉线、充值、安全)专项,通过数据分析不断进行验证和调整,使得用户体验满意度持续行业领先。
同时,游戏数据分析还指导着产业变革。在2005年,盛大率先变革游戏商业模式,从之前的时长计费变为道具收费,这意味着之前的逾10亿元年收入归零后重新开始。在此之前,公司内部已进行了超过半年的数据分析和业务试点,最终全面施行,深刻影响了游戏产业。伴随数据分析技术的发展、游戏形态从端游到手游的进化、渠道与社交网络的演进,基于大数据的用户画像和数据多维交叉分析,为游戏的精细化运营提供了新的契机和动力。
而《游戏数据分析实战》的作者黎湘艳就是盛大游戏数据分析专家,从事游戏行业16年,历经多种岗位,亲历了中国游戏行业从萌芽到蓬勃发展的历程。她在本书中集结了她完整的数据分析思想及50多个游戏项目数据支持的积累提炼。
《游戏数据分析实战》贯穿整个游戏生命周期,提供了丰富的数据分析案例,从预热到封测,再到公测, 均为作者在实际工作中经历的真实案例。案例分析包含数据来源、分析方法、分析过程、分析结论及小结。通过学习本书不但能较深入地学习数据分析方法,还能了解到运营和市场的相关知识。
该书主要分为三部分:
第一部分:主要介绍游戏数据分析相关指标体系,通过这套体系,可以初步监控游戏整体运营情况;
第二部分:主要介绍游戏正式发行前期的市场调研、渠道用户质量分析、竞品分析及投资收益预测,对游戏品质进行定位,评估正式上线后的效果;
第三部分:主要对游戏正式发行后的用户流失、活跃用户分类、付费习惯、版本迭代效果、区服合并等主要问题进行深入探讨,实现游戏的精益化运营。
该书的特色是以详细案例为主,通过SPSS、Excel 等工具逐步展示实施步骤,用手把手的方式让读者快速掌握游戏数据分析方法。
适读人群:
黎湘艳,盛大游戏数据分析专家,从2008年开始在盛大游戏从事数据分析工作,先后主持或参与50多款游戏的数据分析工作,主要产品有:《热血传奇》《传奇世界》《龙之谷》《永恒之塔》《最终幻想14》《血族》《超级地城之光》《Love Live》《城与龙》等。
叶洋,游卡桌游资深数据分析师,具有7年游戏行业数据分析、数据挖掘工作经验。
购买链接:https://item.jd/12248029.html
- ?
资深数据大牛深度解析:大数据底层架构!
青草
展开
随着公司业务的增长,大量和业务、流程、规则相关的半结构化数据也爆发式增长。但数据分散在公司的各个系统中,如何将它们汇总并形成统一的企业级数据仓库,使企业灵活,高效的运用成了难题。
如需将分散的各个底层数据汇总则需建立完整的体系,支撑风控的大数据框架则是重中之重。
拥有5000万+注册用户;13亿+设备标签;100亿+行为数据;1500万+行业关注名单等海量多维数据的拍拍信则是从这几个方面落实:
1. 数据采集
面对来源各异、以结构化/半结构化为主的数据,我们使用linkedin开源的camus来采集消息类数据,使用kettle来采集RMDB的数据。
2. 数据储存
将采集到的原始数据存储到hadoop集群的分布式文件系统中。此外,基于hdfs文件系统对小文件并不是很友好的前提下,定期对历史文件进行合并、压缩、归档的操作也很有必要。
3. 离线处理
数据的离线处理则是一个非常大的话题,相当多的工作量都在这里,但它的价值却往往不会马上得到体现,从而被企业忽视。不仅仅包含以下这些内容:
l 构建并不停地丰富数据仓库
参照传统的ODS,DW,DM将数仓分层,对数据进行加密、去重后分门别类,持续不断的坚持做这件事。
l 管理元数据
建立数据字典,统一数据编码,描绘数据血缘等。
l 检测数据质量
从众数、少数、中位数、平均值等多维度来检测和把握数据的质量。
4. 流式处理
我们使用spark streaming将特征工程、模型结果计算与流式处理相结合,提供秒级的输出。甚至成功的将类似RNN(循环神经网络)这样的深度学习计算添加到整个流式处理的过程中。
5. 数据可视化
使用不同的工具以满足不同场景、不同职责的人员对数据的使用。不仅仅包含以下这些内容:
l 数据的即席查询
懂SQL、随意组合查询条件,进行自助查询,可以忍受分钟级的耗时。
l 多维分析
不懂SQL的情况下,在给定的维度和指标下,随意组合,并在秒级得到查询结果。
l 静态报表
只关注关键性指标。
l 数据分析挖掘
会使用像python、R这样的语言,结合集群的Spark、hive这样的分布式处理工具,对数据进行更深层次的利用。
经过处理的底层大数据相对于以往,在实际业务中使源数据种类更丰富,数据量更多, 借助集群的助力,处理速度更快,回溯时间更久远。
实际运用:
模型训练:风控模型是互联网金融,传统金融等行业在风控流程中不可或缺的环节。
模型应用:将模型与流式计算相结合,提供秒级的风控决策。
数据产品:对数据加工处理,产生像多头、风险名单一类的数据产品。
常用业务:企业在日常工作中各个环节都涉及到数据如:处理数据,更新数据,数据调用,查询日志等。
运用大数据架构前后比对:
在进行大数据框架搭建时还需注意以下几点:
现在即使在同一细分领域,也有很多开源技术可供选择,请尽量选用相对成熟,社区活跃的;能选用开源的,尽量避免自研;另外代码如果要维护自己分支,请特别要谨慎,避免与社区越走越远;hadoop最初并没有太多的考虑数据安全方面,这点要自己加强;高稳定性和高性能往往一个是鱼,一个是熊掌,请考虑好取舍。
本期对大数据底层架构的分享就到这里,欢迎大家联系探讨。
本文为拍拍信原创,未经许可,禁止转载,侵权必究。申请授权,请联系我们。
感谢您对拍拍信的认可与支持
我们一直在路上
- ?
麦肯锡| 如何让数据分析为你所用
烟灰
展开
来自:纽约数据科学 id:NYCDataScience
原文作者:Helen Mayhew, TamimSaleh, and Simon Williams
翻译:Peiwen Lin , Youjun Zhai
校对/编辑:Youjun Zhai
你的数据有目的吗?如果没有,那么你正在原地踏步。下面是一个如何发现目标,并将其转换为行动的方法。
数据分析革命
目前正在进行的数据分析革命具有可以改变公司如何去组织、经营、管理人才和创造价值的潜力。一些公司之中,特别是那些从数据中获得主要回报的企业,正在发生这种变革,但尚未成为主流。
原因很简单:作为唯一能够推动更广泛的业务变革、充分利用高级数据分析的关键人物,CEO和其他高层管理人员,对于数据分析这种他们看来深奥又有很多门道的新事物,保持着敬而远之的心态。
在某个层面上考虑,这是可以理解的。数据分析方法的复杂性、机器学习的日益重要性以及数据集的庞大规模,使得管理层更倾向于“把它留给专家们”。
同时这也是错误的。高级数据分析是一个重要的业务问题。这就意味着CEO和其他高管必须能够清楚地明白这些数据的目的,并将其转化为行动。他们必须要明白,数据分析不单单是数据分析部门的工作,其结果更是能为整个公司都带来洞察力和灵感。
本文介绍了8个理清数据分析目标和提升行动能力的关键要素。我们确信,充分意识到这两个其重要性的领导者们,不仅能借助数据分析解决一些基本问题,还能够更好地解决他们所面临的许多关键和重要的高级管理方面的挑战:传统商业原则下将分析愿景转化为切实结果的需求,部署一系列生产工具和雇用适当人员的重要性,以及应用严格指标和提出难题的必要性。从而提升使用数据分析提高企业绩效的可能性。
第一部分 | “目的导向”的数据
对于不同的公司,“更好的性能”意味着不同的东西。这也意味着应该根据具体案例情况来分离,聚合和分析不同类型的数据。有时,数据点(data point)很难找到,当然,并非所有数据点都是一样的。但是,正是这些能助你达到特定目的的数据点,才是最具价值的。
1. 提出正确的问题 | Ask the right questions
你的机构应该问的确切问题取决于你的最优先事项。问题清晰是至关重要的。例如,好的提问包括“我们如何减少开销?”或者“我们如何增加收入?”,甚至更好的是进一步挖掘问题:“我们如何提高团队中每个成员的生产力?”、“我们如何为患者带来高质量的服务?”、“我们如何从根本上加快产品从研发到上市的时间?”
我们需要考虑如何将重要的功能和领域与最重要的版块结合起来,通过实际的业务示例来,指向真正价值之所在。在对资金和时间有着严格限制的现实世界中,数据分析很难为含糊不清的问题给出答案,例如“数据点显示了什么样的模式?”
一家大型金融公司也因这种开放性的尝试而遭遇了失败:它试图收集尽可能多的数据,想看看大量的数据背后显示了什么。当公司发行这种开放性的尝试结果,有趣但却对提升企业利益没有任何帮助的时候,他们才重新调整了团队。
有了来自管理层的强大支持,这家公司首先清晰了自己使用数据分析想要达到的目标:减少产品开发时间,然后使用客户采纳度,作为衡量此目的的指标。提高数据分析的针对性帮助公司为两个细分市场推出成功的产品。
无独有偶,我们知道的另一个组织也是通过首先创建“数据湖”(data lake)而陷入漫无目的的数据分析中。它花费了过多的时间(实际上是数年的时间)收集和处理原始数据,但几乎没有投入任何精力来思考数据分析的目的以及想要解决的问题到底是什么。管理层之后才意识到那些是急待解决的问题,却已经失去了先机。
如果这些企业先明确了想要解决的问题,再以此为引导来收集数据,那么他们肯定会更快地取得成效,哪怕只有一部分数据可用作分析。
例如,一家著名的汽车公司在一开始就着眼于如何提高利润这一基本问题。随后认识到解决此问题最大的机会是减少在匹配产品设计和工程功能时耗费的开发时间(以及成本)。
一旦公司意识到关键所在,即结合其十年的研发经验教训进行改革,并显著的缩短了开发周期,提升了公司利润。
2. 看起来微不足道的事物,作用却很大 | Think really small... and very big
细节可能决定成败。让我们关注下面这张拍摄于1896年奥运会,100米决赛起跑线上的照片。照片中,参赛运动员们的起跑姿势可谓千姿百态,有直立的,有弯着腰的,也有双手摊开的,只有美国田径运动员ThomasBurke一人采用了现在的标准蹲踞式起跑方法。也正是这种蹲踞式起跑,帮助Burke节省了加速时间从而助他在那一届奥运会上,以12秒的成绩夺得100米跑的金牌。Burke的成功使田径界在短跑比赛中开始普及蹲踞式起跑方式,如今,短跑运动员在比赛中都采用了这种准备姿势。
当然,这个案例可以很好地类比到商业界,那就是当竞争对手迅速采取了同样的最佳方案之后,你的竞争优势就难以维持。
好消息是,聪明的一方仍然可以不断的提升他们的表现,取得突破并回到领先位置。轻松地保持优势是不可能的,但是公司可以找出微小的差异,然后放大并利用它。
“大数据”分析的成果通常表现为数千甚至更多的细微改进。如果一个组织可以将单个任务细化为数个细小的组成部分,并在可能的情况下一一对其进行提升改进,那么由此带来的回报是相当可观的。如果一个组织能够将这些小的改进,系统化的合并到整个连续的流程之中,其带来的回报更是呈指数增长的。
企业所做的一切事情几乎都可以被分解成小的组成模块。
GE(通用电气)公司在飞机发动机中嵌入传感器,以实时跟踪其各部分的性能,从而实现更快的调整,大大减少停机维护的时间。
如果这听起来像是最前沿的高科技(实际上确实如此),那么我们可以看一看更接地气的消费品是怎么做的。一家领先的CPG公司试图增加旗下某知名早餐品牌的利润率。它将整个产品制造过程分解为几个大的步骤,然后通过高级分析,仔细检查每个制造过程,以寻求其中是否有可以提高利润的机会。在这个案例中,公司在烤箱里发现了答案:稍微的调整了烘烤温度之后,不仅产品的味道更好,而且还减少了生产成本。证据就是,优秀的试吃的结果,以及同样优秀的财务报表。
当一系列的流程可以在比原子结构更为复杂的系统中被分解,分析,又被重新组合在一起时,产生的结果可以比原子弹更具威力。一家大型钢铁制造商使用各种分析技术来研究其商业模式的关键阶段,包括需求规划,预测,采购和库存管理。它单独对每个阶段中关键的价值驱动版块进行研究,并缩减或消除效率缺陷,从而节约5%至10%成本。
当制造商将改进后的流程再重组在一起,并将实时信息在每个阶段之间传送时,这些数据分析所带来的,数以百计的微小改进及其所节约的成本,带来了前所未有的收益激增。
通过合理化的端到端系统,将需求计划,预测,采购和库存管理连在一起,制造商实现了近50%的成本节约,节约了相当于几亿美元的成本。
3. 拥抱禁忌 | Embrace the taboo
谨防废进废出(garbage in, garbage out:要保证数据可靠有用,才能保证分析结果的可靠有用),这个咒语已深入到了商业思维中,有时会阻碍我们的思维和洞察力。
实际上,有用的数据点在不同的案例中有着不同的形式和规模,通常以自由文本维护报告或者PPT演示文档等形式隐藏在企业之中。然而,不少团队经常会忽视这些数据,因为这些数据质量不一、缺乏一致性、过时或者因为看起来并不像是我们定义中的“数据”而被过滤等。
但是如果我们能“废物再利用”,正确的使用这些隐藏着的信息,也许将能得到更清晰有力的结论。在日常生活中,在跳出Excel表格进行信息创建,读取或回应的非二进制世界里,即使是最精英的“金融工程师”(“quant”)处理大量定性的信息,其中大部分都是无法量化信息并且不适合用做数据分析。我们知道,生活中很少有确定的事情,通常我们去衡量概率,考虑各方优势并且记录细微的提示信息。
想一想去超市购物的时候,你总是去4号台结账吗?或者你有没有注意到,今天某个柜台的员工似乎工作效率更高,某个柜台有个顾客拿着现金买单而不是信用卡,某个柜台的收银员没有助手去帮助他打包商品,而在某条队伍排队的顾客的购物车里面有些货物还未称重并且需要分开装?所有这些都是无法量化却可以处理的信息,并且有些数据比其他数据更有价值。但你可能会逐个地去考虑他们,而且当你决定购物车将往哪儿推时会考虑地更多。只是因为4号结账台在你最近几次购物经历中结账速度最快,但这并不意味着在今天也会是最快的。
事实上,虽然原生数据点和历史数据点是有价值的,但它们有其局限性。有一家公司在建立强大的投资审批流程后遇到了这些问题。公司为减少资本资源的浪费,在没有历史数据,以及可靠的信息支持投资回报率预测的情况下,管理层将不予通过新产品。不幸的是,这种严格的制度导致了公司产品上市周期过长,从而使公司不断错过市场。只有放松数据约束,将诸如行业预测、产品专家预测和社交媒体评论等软数据也纳入考虑之中,公司才能更准确地了解当前市场环境和推出新产品的绝佳时机。
当然,Twitter信息与远程信息处理并不一样。但是不能仅因为数据不完整或基于设伦,或是存在偏差,就把这些数据当作“垃圾”来对待。软信息确实有它的价值。特别是当人们尝试将获取更精准的数据与更好的推测未来形势时,这些软数据甚至会起到关键作用。
为了以智能而细致的方式优化可用信息,公司应努力构建一个强大的数据世系模型(data provenance model),以识别信息来源源,并实时评估其可靠性(可能随时间而提升或降低)。记录数据的质量,以及确定数据之类的方法,这不仅是数据透明度问题,同时也是一种风险管理的形式。所有的公司都在一个不确定性下竞争,有时一个关键的决定性数据的确定性不一定能满足人们的期待。一个构架完善的世系模型可以使用负荷测试检查对行/不行决策的可行度,从而帮助管理者决定投资去改善关键数据集的合适的时机。
4. 连点成线 | Connect the dots
在边界上往往能产生新见解,就像考虑软数据一样能够带来新见解一样,结合信息来源来全盘考虑,可以使这些见解更加清晰。
一些企业往往在一项独立的数据集上进行深入挖掘,却没有考虑到各种不同数据集结合在一起时所传达的信息。例如,人力资源部可能有完整的员工绩效数据,营运部门有特定资产的综合信息,而财务部的投资回报率的备份财务报表。仔细审查每一份信息肯定是有用的,但是互相独立的信息数据集之间也许存在着更多尚待未开发的价值。
有家工业公司提供了一个具有启发性的实例。公司核心业务使用了最先进的机器,它可以同时负载多个任务。机器的每一个部件都价值上百万美元,而公司采购了数百个单元,总共投资了数十亿美元。这些机器可提供了优秀的运行性能数据,该公司据此评估了机器的每个部件一直以来的运行情况。毫不夸张地说,让机器保持持续运作是公司成功的关键。
尽管如此,这些机器实际上花费了比管理人员预期更长的维护时间和更昂贵的维护费用,停机维修的每一个小时都对公司有着极大的影响。虽然公司派出了强大的分析团队去仔细筛选分析机器的运行性能数据,但还是没有找出确切的故障原因。
然后,当公司将人力资源部提供的信息也纳入分析考虑中时,产生次级输出的原因变得很清楚:因为负责人在关键时刻未在场,导致机器缺少定期维护检查。
奖励机制,而非器械性能,才是这个问题的本质原因。最终,一个简单的政策调整就能解决这个问题,但只有当将不同的信息数据集结合起来审查时才能发现问题本质之所在。
第二部分 | 从分析结果到实际行动
在前面的工业公司的案例中,在视觉上就像Venn图一样(维恩图,用于显示元素集合重叠区域的图示。):当将两个数据集放在一起观察研究时,数据集重叠的部分往往显示了问题所在。当你同时分析50个数据集时,其呈现信息的能力则更为强大-前提是繁杂的数据没有造成过度的复杂,从而减弱了数据分析的作用。为了避免这个问题,领导者应该鼓励他们的企业,从多方面入手,来分析数据。如果数据分析工作在孤立的环境中进行而不考虑全局的其他影响,如果数据分析结果在实际情况中没有起到作用,更糟糕的是,如果数据分析得到了正确的结论,可企业并未采纳和依次采取对应的实际行动;那么,这个分析工作就是失败的,没有成功的。
5. 采用迭代循环而不是单向流程 | Run loops, not line...
- ?
从选题到数据分析,资深运营需要怎样的行业素养
Kelli
展开
本文结合自身经验及行业特点,谈谈一个资深内容运营需要具备的行业素养。
很多初级运营可能都遇到过如下问题:
刚入行如何做内容,没人带如何提升?内容运营除了码字外,到底还有没有出路?随着年龄增长越来越把握不准用户兴趣点怎么办?
问题总结起来一句话:“如何突破自我,不做文字搬运工,做更有深度的内容运营”。
内容运营,是一个入行门槛低、杂事多、综合提升较“慢”的岗位。它不像产品或技术岗有较为清晰的量化标准和进阶路径。
内容运营需要你对一篇篇内容从选题,到文章布局进行精心思考。需要你具备数据分析的能力,更需要你在数据分析的过程中不断优化内容,从而突破初级内容运营的枷锁。
如果我们有意识的想去提升自己在容运营方面的能力,朱朱建议我们从以下四点入手。
具备扎实的文案功底,hold 多种文案形式对于热点有天然的好奇心,对于用户行为有自然的自觉能力熟悉不同传播渠道的传播规律具备数据分析能力,掌握“四率”法则
以下我们对每一点展开来阐述。
一、具备扎实的文案功底,hold住多种文案形式
文案功底是一个运营者需要具备的最基础的能力。这就如同设计师需要了解配色规律,技术开发人员需要熟悉开发语言一样。想要具备这种能力,需要多写多练。尤其是针对不同文案的特点,有针对性的练习,能够迅速掌握写作要领。
朱朱总结了几种主要的文案形式,练好它们你就拥有了运营的基础本领。
起步传统新闻稿,掌握正规文案写作基础
新闻稿,大多发布于企业官网、官微、产品手册、产品推介会等这些相对官方的传播渠道。因为其代表官方的态度,所以力求文案工整,严密,准确。
新闻稿大致分为两类,狭义新闻稿和广义的新闻稿。
狭义的新闻稿就是消息,篇幅较短。它的写作的套路通常是“导语+主体”。这种形式多加练习即可掌握。打开门户网站,大多呈现的就是“消息”。广义的新闻稿包括通讯、专访、深度报道等。它们可以理解为加长版消息。形式没有那么固定,只要能用书面语言说清楚内容即可。
为什么朱朱会说把新闻稿写好了,就能hold住多种正式文案呢?那是因为新闻稿具备的以下特点。
通俗易懂、凝练简洁的遣词造句形式,符合当前网络阅读习惯
由于大众传媒的特殊属性,决定了新闻语言必须要通俗易懂、高度凝练。以互联网阅读方式。
能用最少的文字,让用户在最短的时间内明白你想要表达的意思,这需要你有高度凝练的文字概括能力和通俗易懂的文字呈现方式。
严谨缜密的逻辑结构、简单清晰说明问题本质
新闻稿大体讲究“What-Why-How”,即“是什么-为什么-怎么做”的逻辑思维,这种模式能够层层深入、由表及里地探寻问题。
这种想要在最短的时间内说明问题,展示“主题思想”的行文逻辑结构,也是营销软文、产品活动帖、策划方案、行业深度文章等其他文案形式所要达到的目的。
那么,如何去有意识的去练习这种写作语言呢?
动笔之前,先画图,想好结构再去写
小学老师都教过我们,写作文之前一定要先写提纲,有了提纲文章结构就不会乱,行文就有了章法。
朱朱写文章喜欢先用Xmind等脑图工具画出文章结构,然后再以此填充各个部分内容。最终使文章各得其法,相映成章。
注意段落句式,切勿短话长说,一逗到底
说起此事,朱朱不由得伤感起来,以前一位朋友让我帮忙给他改一改文案,那是一份产品宣传册。
当我拿起仅仅只有3000字左右的文案时,我的尴尬症就犯了。因为,一段200字左右的话居然一逗到底。而且,这一大段话还犯了偷换主语,句式杂糅、搭配不当的语法问题。整个宣传册文案都是如此。由于句法不明,再加上行业术语的晦涩难懂,导致阅读体验非常差。
后来,我用了整整两天的时间去修改文案。首先,找到作者搞清楚他每句话想要表达的意思,然后再把每一个长句一点点拆分为一个个的短句子,就这样完成了整篇文案的修改工作。让原本晦涩难懂的文字变得通俗易懂,层次明确起来。
讲这个小技巧之前,我刚刚又修改了前一段话:
原文案:当时我拿着3000字左右的宣传册初版文案,只看了一段话,我的尴尬症就犯了,一段200字左右的句子,全部一逗到底地用一句话写完且句中多次偷换主语,再不说有句式杂糅、搭配不当的典型语法问题。修改后:当我拿起仅仅只有3000字左右的文案时,我的尴尬症就犯了。因为,一段200字左右的话居然一逗到底。而且,这一大段话还犯了偷换主语,句式杂糅、搭配不当的语法问题。
对比以上两段文案,我主要做了以下两点修改:
首先,将修改前的一句话,拆分为主谓宾明确的三小句话,让每一句都表达一个完整的意思。
其次,增加了递进关联词,让整段话的逻辑层级更加明确合理。
写完多读几遍,达到自测的目的
最后一点,也是很重要的一点,写完后通读自测。如果你发现,一句话读着不通,很别扭,那么十有八九也是有问题的。这种方式,也是朱朱当年在传统媒体写新闻稿后的心得体会,可以试一试很管用的。
上面五点是关于新闻稿的写作技巧和注意事项。写好了新闻稿还不够,还需要说好大白话。下面就让我们一起来探索一下如何写好大白话。
说好大白话,为文字赋予形象,拉近与用户的距离。
“大白话”与“新闻稿”相比具有明显的区别:
首先是语言风格。新闻体严肃谨慎给人一种正式正规的感觉,“白话体”轻松随意给人一种活泼亲切的感觉;
其次,由于使用场景的不同:白话体更适合和用户进行交流,以此来培养和用户之间的感情。
“白话体”的文案形式,广泛用在和用户沟通交流的使用场景中,包括:活动通知帖、社群讨论、社区运营公告、评论回复、客服答疑等。这些场由于要和用户直接接触,所以语言力求轻松简单,形象生动。这种情况下,与其说是写文案,不如说是“说”文案,如何“说”好这种文案呢?朱朱总结了以下几种方法:
多用第一、第二人称,打造零距离现场感
常用第一、第二人称,会有一种和对方面对面交流的亲切感,便于拉近和用户之间的距离。同时,由于口语话常常伴随鲜明的语言风格,也能快速为产品赋予性格和生命,会让用户觉得是和活生生的人交流。这种文案风格,常用在社区活动帖、社群运营及评论回复中,有些运营人员还会直接以产品名字为昵称和用户进行交流。
例如:杜蕾斯的产品甚至运营人员都会自称为“杜杜”,在微博、微信等对外平台和用户进行直接互动。
多用表情包打造“接地气”聊天式语言
表情包代替文字、表情包斗图是网络社交化背景下用户喜爱的沟通形式,究其原因无非两点:1 不用打字却能够生动幽默的表情达意,简单方便;2 可以呈现一些文字表达不出来的特殊含义。同时,用带有“表情包”的文案和用户进行沟通也能达到以下两点效果:
和聊天一般,生动自然,最大程度地增加和用户的互动性;避免大段文字的繁琐介绍,能让用户快速获取信息要点。
甚至可以去设计,能够展示自己产品内容的表情包,使用这样的表情包,还能达到二次宣传的作用。这其中,也包括 不少的成功案例,比如卫龙辣条和暴走漫画的合作,作品被广泛运用在日常的网络社交聊天中,无形之中也增加了品牌的曝光率。
打造“大白话” 文案,除了以上的方法外,朱朱也总结了几点注意事项,了解了它们更有利于打造针对性强、个性化明显的文案内容。
明确产品/用户特点,定位语言风格
在朱朱看来文案内容需依托产品自身特点运营,进而进行用户的拉新留存。也就是说,首先要弄明白产品的特点和类型;其次,需要分析年龄、性别、使用时间等用户画像内容,并进行数据的分析整理,文案测试进而定制某些风格明确、个性十足的“白话式”文案语言。这种区别可能会是:老年、少儿等不同类别之间的语言的差别。
同时,保持微信、微博、社群/社区等各沟通平台语言风格的一致性,保证用户认知的统一性。
区别用户性别,针对性打造文案内容
这一点,是基于上一点更加精细化并以微妙用户心理为出发所做的语言风格的细微调整。这种调整,是基于用户性别分析后的文案语言风格的差异性体现。这一句话,第一眼看上去貌似和朱朱说的上一点存在一些理念上的偏差。
明明说好的保持风格的一致性,为啥还要“差异”呢?看到这一点的同学,肯定是没有关注到我的前半句“用户性别”这几个字。朱朱想说的是我们可以在产品特点、大多数用户性别的基础上,转换产品语言性别风格,以此来增加用户的凝聚性。
这样的文案运营技巧,朱朱还是去年和西安本地某知名农产品电商平台的一用户运营小姑娘沟通时了解的。她所在的公司线上有七八个500人以上,平均年25岁左右的女性用户群,群中不仅定期发布产品最新促销信息,还有一些凝聚用户情感的小活动和话题性的用户意见收集。她一个人负责所有的用户群,用户参与度高活跃性强且都按照既定话题参与讨论,甚至所有的群管理都来源于用户。当时我就很诧异,这个小姑娘是如何同时管理好这么多用户群的。我以为这个小姑娘为保持和用户性别的一致性,也用少女感十足的文案去在管理社群。但我的想法被这个小姑娘否定了,她说他用男性化的文案语言将自己打造成阳光潇洒热爱美食的“暖男”形象去管理这群女性用户。
和这个小姑娘沟通后,让我对个性化文案的打造有了新的认识即:当产品用户年龄段、性别趋向一致化且目的一致的时候,转化文案的语言风格,可能会有意外的惊喜收获。对这一点的认识,让我运用到了一款以男性用户为主的研发管理工具的运营中来。这是一款针对华为内部产品研发的产品管理工具,用户多为25—35岁段的男性软件工程师,属于一款刚需性强用户性别明确的产品。在一切和用户存在沟通交流的场景中,我都用女性化的文案风格呈现。这种女性化的角色定位,也受到了很多用户的欢迎,首先让原本冷清少语的用户群慢慢变得活跃起来,其次用户也愿意主动和我交流反馈他们的使用心得和产品优化建议。
逻辑层次明晰,文案清晰明了
最后一点也是极为重要的一点,“大白话”文案语言轻松自然诙谐活泼的同时也要有明确清晰的逻辑思维。也就是说“说”出的文案,需要主次明确、条例清楚。让用户能在最短的时间内,清楚你想表达的内容。
在朱朱看来,“新闻体”和“大白话”是文案的两种主要形式,很多使用场景不同的文案以此衍生出来的。因此,需要在日常的工作生活中努力练习这两种风格的文案。当能够熟练转换这两种文案风格,且有形成了自己语言风格让自己的文案有一定的标识度的时候,就离“资深内容运营”又了一近步哦。
那么,作为一个“资深的内容运营”是否只需要掌握好几种文案形式,逻辑清晰层次明确地写出文案就可以了呢?朱朱的答案肯定是否定的,你还需要明白啥样的内容容易“火”、用户点击率高。这一点首先建立在你对热点的“敏感性”,其次对用户心理的“洞察性”之上。
二、 对于热点有天然的好奇心,对于用户行为有自然的自觉能力
针对这一点,朱朱在内容运营系列的第二篇文章“爆款内容”的“选题”部分已经有了比较详细的描述以及相关方法论的介绍。
这一点总结起来,最重要的无非为两点:
要多看多想,实时了解当下热点内容,让自己的思维时刻处于一个“新鲜”的状态、结合产品、用户特点,选取可以“蹭”的热点,在突发热点的24小时内迅速借势。
具备了扎实的文案能力和敏锐的洞察性,还需在多写多练的基础上探索多种内容渠道、内容形式,了解热门渠道的运营法则,构建产品内容运营矩阵。
三、全方面把控不同渠道的运营法则
初级的内容运营,需要掌握基本的文案能力以及某些单点的运营技巧。但是,作为一个资深的内容运营,需要对时下热门的内容渠道的运营法则有一些整体性宏观性的了解。需要了解这些渠道的内容推送机制、内容选材特点以及用户特征等,并以次为依托对相同的内容做精细化的区分。
为了更好的说明这个问题,朱朱就拿自己的一些文章给大家举例子吧。下面两篇文章,在内容上基本上没有任何的出入,都是我“内容运营”系列文章的第2篇文章。图一发布在人人都是产品经理、站长之家、搜狐自媒体等PC端为主的平台;图二发布在微信公共号“朱朱生活实验室”这类社交移动端为主的平台。
图一的标题严肃正规,属于标准的“新闻体
图二的标题“调侃”式的反问句,属于明显的“白话体”
朱朱为啥在标题中做了如此的区分呢?还是基于两个平台的内容展现形式、用户打开方式决定的。不同内容平台的差异化运营法则,朱朱会在下一篇的内容矩阵中做详细介绍。
如何做到对各渠道的熟悉:
多渠道多...
- ?
资深婚姻咨询师基于大数据分析:这几种男人最容易背叛婚姻!
牧访云
展开
出轨问题一直是已婚女士的一块心病。当前社会,人与人接触越来越频繁,外界形形色色的诱惑越来越多。那么哪种男人会是出轨的高发区呢?一位从业十多年的专业婚姻咨询师通过多年的实践经验和数据分析来展示给大家。
工作压力太大
在长期高压的工作环境下的男人心理往往比较压抑,情绪永远崩在一根弦上得不到发泄,面对异性的诱惑时,往往极难压抑内心的欲望,把持不住。
咨询师点评:这样的男人妻子最好多给他一些鼓励,最好多多营造下生活上的乐趣,男人高压工作为了谁,还是不是为了家庭,所以,请多给这样的男人一些耐心,做一个温柔的妻子。
长得帅
在这个世界里什么样的男人最受欢迎?第一种,长得帅的,有一句话非常流行,叫颜知即是正义,人类作为视觉动物总归逃不过这一点终极定律,看看那些明星男神有多少狂热迷妹就明白了。
咨询师点评:如果你的男人颜如宋玉,貌比潘安,那你可要好好注意,自身要打理自己的形象和气质,同时不要经常夸他帅,不然他可是会飘飘然。
多金
某种程度上来讲,这种男人是最是容易出轨的,人的欲望是会随着自己能力的增长而增长的,当有了钱后他发现这个世界上大部分东西都可以通过钱财获取到,他便会蠢蠢欲动,在大把的票子挥洒下,总有女人愿意往上贴。
咨询师点评:提升自己的学识和修养,加强自己的价值,强大的男人需要一个强大的女人去驾驭。
没有行事原则
做事没有原则的男人做事往往没有自己的底线,道德伦理三观也很难束缚不到他,那么自然而然,出轨这种事情肯定也不放在他的眼中,这世界上太少东西能束缚住他。
咨询师点评:这种男人一定要帮他设立底线!平时多给他灌输传播一些正能量,帮他建立正确的道德框架。
才华横溢
有才的人通常会散发自己强大的个人魅力,光芒万丈之下自然会招蜂引蝶,如果遇到了另一个才华横溢的女人,两人很容易惺惺相惜,产生异样的情感。
咨询师点评:不妨多提升一下自己,一个有才华的女子绝对会在男人心中有大大加分,当你的眼界和知识跟你的伴侣相匹配的话,夫妻二人会有更多的互相理解,大大加深感情稳定。
总结:当然不是说只要有以上特点的男人都容易出轨,这是这部分里出轨率稍高,总体来说,大部分男人还是相当忠于婚姻的,只要自己的丈夫没有什么明显的异常现象,还是多多给予些信任就行啦。
- ?
一个资深数据人对数据挖掘解读
安雁
展开
在银行做了两年的数据分析和挖掘工作,较少接触互联网的应用场景,因此,一直都在思考一个问题,“互联网和金融,在数据挖掘上,究竟存在什么样的区别”。在对这个问题的摸索和理解过程中,发现数据挖掘本身包含很多层次。并且模型本身也是存在传统和时髦之分的。本文就想聊聊这些话题。
一、数据挖掘的层次
一直想整理下对数据挖掘不同层次的理解,这也是这两年多的时间里面,和很多金融领域、互联网做数据相关工作的小伙伴,聊天交流的一些整理和归纳。大概可以分为四类。
(一)纯粹的数据加工
侧重于变量加工和预处理,从源系统或数据仓库,对相关数据进行提取、加工、衍生处理,生成各种业务表。然后,以客户号为主键,把这些业务表整合汇总,最终可以拉出一张大宽表,这张宽表就可以称之为“客户画像”。即,有关客户的很多变量和特征的集合。
在这个阶段,主要的数据加工工具为SQL和SAS base。
(二)傻瓜式的挖掘工具
较为典型的就是SAS EM和clementine,里面嵌入很多较为传统成熟的算法、模块和节点(例如逻辑回归、决策树、SVM、神经网络、KNN、聚类等)。通过鼠标的托拉拽,流程式的节点,基本上就可以实现你挖掘数据的需求。
傻瓜式操作的优点就是使得数据挖掘,入手非常快,较为简单。但是,也存在一些缺陷,即,使得这个挖掘过程变得有点单调和无趣。没办法批量运算模型,也没办法开发一些个性化的算法和应用。用的比较熟练,并且想要进一步提升的时候,建议把这两者抛弃。
(三)较为自由的挖掘工具
较为典型的就是R语言和Python。这两个挖掘工具是开源的,前者是统计学家开发的,后者是计算机学家开发的。
一方面,可以有很多成熟的、前沿的算法包调用,另外一方面,还可以根据自己的需求,对既有的算法包进行修改调整,适应自己的分析需求,较为灵活。此外,Python在文本、非结构化数据、社会网络方面的处理,功能比较强大。
(四)算法拆解和自行开发
一般会利用python、c、c++,自己重新编写算法代码。例如,通过自己的代码实现逻辑回归运算过程。甚至,根据自己的业务需求和数据特点,更改其中一些假定和条件,以便提高模型运算的拟合效果。尤其,在生产系统上,通过C编写的代码,运行速度比较快,较易部署,能够满足实时的运算需求。
一般来说,从互联网的招聘和对技能的需求来说,一般JD里面要求了前三种,这样的职位会被称为“建模分析师”。但是如果增加上了最后一条,这样的职位或许就改称为“算法工程师”。
二、模型的理解:传统的和时髦的
据理解,模型应该包括两种类型。一类是传统的较为成熟的模型,另外一类是较为时髦有趣的模型。对于后者,大家会表现出更多的兴趣,一般是代表着新技术、新方法和新思路。
(一)传统的模型
传统的模型,主要就是为了解决分类(例如决策树、神经网络、逻辑回归等)、预测(例如回归分析、时间序列等)、聚类(kmeans、系谱、密度聚类等)、关联(无序关联和有序关联)这四类问题。这些都是较为常规和经典的。
(二)时髦有趣的模型
比较有趣、前沿的模型,大概包括以下几种类型,即社会网络分析、文本分析、基于位置的服务(Location-Based Service,LBS)、数据可视化等。
它们之所以比较时髦,可能的原因是,采用比较新颖前沿的分析技术(社会网络、文本分析),非常贴近实际的应用(LBS),或者是能够带来更好的客户体验(数据可视化)。
(1)社会网络的应用
传统的模型将客户视为单一个体,忽视客户之间的关系,基于客户的特征建立模型。社会网络是基于群体的,侧重研究客户之间的关联,通过网络、中心度、联系强度、密度,得到一些非常有趣的结果。典型的应用,例如,关键客户的识别、新产品的渗透和扩散、微博的传播、风险的传染、保险或信用卡网络团伙欺诈、基于社会网络的推荐引擎开发等。
(2)文本挖掘的应用
文本作为非结构化数据,加工分析存在一定的难度,包括如何分词、如何判断多义词、如何判断词性,如何判断情绪的强烈程度。典型的应用,包括搜索引擎智能匹配、通过投诉文本判断客户情绪、通过舆情监控品牌声誉、通过涉诉文本判定企业经营风险、通过网络爬虫抓取产品评论、词云展示等。
文本和湿人。关于文本分析,最近朋友圈有篇分享,很有意思,号称可以让你瞬间变成湿人。原理很简单,就是先把《全宋词》分词,然后统计频数前100的词语。然后你可以随机凑6个数(1-100),这样就可以拼凑出两句诗。比如,随机写两组数字,(2,37,66)和(57,88,33),对应的词语为(东风、无人、黄花)和(憔悴、今夜、风月)。组成两句诗,即“东风无人黄花落,憔悴今夜风月明”。还真像那么一回事,有兴趣可以玩一玩。
(3)LBS应用
即基于位置的服务,即如何把服务和用户的地理位置结合。当下的APP应用,如果不能很好地和地理位置结合,很多时候很难有旺盛的生命力。典型的APP,例如大众点评(餐饮位置)、百度地图(位置和路径)、滴滴打车、微信位置共享、时光网(电影院位置)等服务。此外,银行其实也在研究,如何把线上客户推送到距离客户最近的网点,完成O2O的完美对接,从而带来更好的客户体验。
(4)可视化应用
基于地图的一些可视化分析,比较热门,例如,春节人口迁徙图、微信活跃地图、人流热力图、拥堵数据的可视化、社会网络扩散可视化等。
如果你想让你的分析和挖掘比较吸引眼球,请尽量往以上四个方面靠拢。
三、互联网和金融数据挖掘的差异
博士后两年,对银行领域的数据挖掘有些基本的了解和认识,但是面对浩瀚的数据领域,也只能算刚刚入门。很多时候,会很好奇互联网领域,做数据挖掘究竟是什么样的形态。
很早之前,就曾在知乎上提了个问题,“金融领域的数据挖掘和互联网中的数据挖掘,究竟有什么的差异和不同”。这个问题挂了几个月,虽有寥寥的回答,但是没有得到想要的答案。
既然没人能够提供想要的答案,那就,根据自己的理解、一些场合的碰壁、以及和一些互联网数据小伙伴的接触,试图归纳和回答下。应该有以下几个方面的差异。
(一)“分析”和“算法”
在互联网中,“分析”和“算法”,分得非常开,对应着“数据分析师”和“算法工程师”两种角色。前者更多侧重数据提取、加工、处理、运用成熟的算法包,开发模型,探索数据中的模式和规律。后者更多的是,自己写算法代码,通过C或python部署到生产系统,实时运算和应用。
在银行领域,基本上,只能看到第一种角色。数据基本上来源于仓库系统,然后运用SQL、SAS、R,提取、加工、建模和分析。
(二)数据类型
数据类型,主要包括“结构化”和“非结构化”两类数据。前者就是传统的二维表结构。一行一条记录,一列一个变量。后者包括文本、图像、音频、视频等。
银行里面的数据,更多的是结构化数据,也有少量的非结构化数据(投诉文本、贷款审批文本等)。业务部门对非结构化数据的分析需求比较少。因此,在非结构化数据的分析建模方面,稍显不足。
互联网,更多的是网络日志数据,以文本等非结构化数据为主,然后通过一定的工具将非结构化数据转变为结构化数据,进一步加工和分析。
(三)工具、存储和架构
互联网,基本上是免费导向,所以常常选择开源的工具,例如MySql、R、Python等。常常是基于hadoop的分布式数据采集、加工、存储和分析。
商业银行一般基于成熟的数据仓库,例如TD,以及一些成熟的数据挖掘工具,SAS EG和EM。
(四)应用场景
在应用场景上,两者之间也存在着非常大的差异。
(1)金融领域
金融领域的数据挖掘,不同的细分行业(如银行和证券),也是存在差别的。
银行领域的统计建模。银行内的数据挖掘,较为侧重统计建模,数据分析对象主要为截面数据,一般包括客户智能(CI)、运营智能(OI)和风险智能(RI)。开发的模型以离线为主,少量模型,例如反欺诈、申请评分,对实时性的要求比较高。
证券领域的量化分析。证券行业的挖掘工作,更加侧重量化分析,分析对象更多的是时间序列数据,旨在从大盘指数、波动特点、历史数据中发现趋势和机会,进行短期的套利操作。量化分析的实时性要求也比较高,可能是离线运算模型,但是在交易系统部署后,实时运算,捕捉交易事件和交易机会。
(2)互联网
互联网的实时计算。互联网的应用场景,例如推荐引擎、搜索引擎、广告优化、文本挖掘(NLP)、反欺诈分析等,很多时候需要将模型部署在生产系统,对实时响应要求比较高,需要保证比较好的客户体验。
四、数据挖掘在金融领域的典型应用
别人常常会问,在银行里面,数据挖掘究竟是做什么的。也常常在思考如何从对方的角度回答这个问题。举几个常见的例子做个诠释。
(一)信用评分
申请评分。当你申请信用卡、消费贷款、经营贷款时,银行是否会审批通过,发放多大规模的额度?这个判断很可能就是申请评分模型运算的结果。通过模型计算你的还款能力和还款意愿,综合评定放款额度和利率水平。
行为评分。当你信用卡使用一段时间后,银行会根据你的刷卡行为和还款记录,通过行为评分模型,判断是否给你调整固定额度。
(二)个性化产品推荐
很多时候,你可能会收到银行推送的短信或者接到银行坐席的外呼,比如,向你推荐某款理财产品。这背后,很可能就是产品响应模型运算的结果。银行会通过模型,计算你购买某款理财产品的概率,如果概率比价高的话,就会向你推送这款理财产品。
此外,很多时候,不同的客户,银行会个性化的推荐不同的产品,很可能就是产品关联分析模型运算的结果。
(三)个性化广告展示
登陆商业银行网站时,通常会有一个广告banner,banner上会展示若干幅广告。很多时候,不同的客户登陆网站,会接触到不同的广告,即个性化的广告推送。一般来说,后台经过计算,会判断,你对哪几款广告和产品感兴趣,最后推送3-5款你最感兴趣的产品,从而能够有效吸引你的注意,促进点击、转化和成交。
End.
来源:36大数据
资深数据分析
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并