- ?
数据分析都用什么工具
董凝芙
展开
欢迎关注天善智能,我们是专注于商业智能BI,大数据,数据分析领域的垂直社区,学习,问答、求职一站式搞定!
本文是上一篇文章《全国及重点城市“数据分析”岗位需求量及工资水平分析》的续篇,从“数据分析”职位招聘单位给出的职位描述中分析各种工具的热门程度。
1.整体概览
经常看见有网友争论R和python谁才是主流的数据分析工具,网友们分门别派各抒己见。今天我们从实际需求出发,在招聘单位的职位描述中用正则表达式匹配统计常用的数据分析工具出现的频率,看看谁才是你最应该掌握的工具。
话不多说,先上图
毫无疑问,excel才是最主流的数据分析工具,在招聘单位的职位描述中出现频率远远高于其他工具(实际上居第八位的office也含有excel,其真实数据应该比这还高),作为最基础的工具,excel是一个数据分析工作者的必备技能。excel之后的4门工具分别是sqlsever、spss、sas和r,其中排名第二位的sqlsever频率高出另外两门主流数据库语言mysql、oracle近两倍,spss作为无需编程的专业统计软件也在职位描述中有较高的频率,sas则是编程类统计软件的代表,今年来火热的r语言也水涨船高,另一门火热的程序语言python在数据分析方面则要稍稍落后。
2.各职位具体情况
数据分析也有细分很多具体职位,那么不同的职位以上各种工具的要求是否存在差异呢?
表中数据显示“大数据分析师”需掌握的工具主要是r、python、hadoop、spark和java;“数据分析工程师”需要掌握的工具主要是sqlsever、r、python和hadoop,这两个职位都很看重编程开发能力。
“数据分析经理”、“高级数据分析师”和“数据分析师”需要掌握的工具大体一致,均为excel、sqlsever、spss、sas和r。
“数据分析主管”、“数据分析”、“数据分析专员”和“数据分析员”等职位对基础技能的要求更为突出,excel、ppt、word等office办公软件出现的频率较其他工具明显更高。
作为一名数据分析从业者或者想转行过来的人来说,要想有好的职业发展,首先,必须熟练掌握office办公软件,尤其是excel(不要瞧不起excel,你不一定玩得转);其次,还需要学习一门数据库语言,sqlsever是不错的选择(mysql、oracle与sqlsever较为类似,通一门后,其他的学起来也很容易);专业的统计分析工具也需要掌握一门,如果讨厌编程,可以选择spss,如果有编程能力那么sas和r可以选择一个学习,如果你精通python也可以用python做统计分析;如果想往大数据方向发展,或者是做数据分析工程师那就还需要掌握python、hadoop等工具。
最后附上一张数据分析职位描述的词云图,可以看出招聘单位除了看重工具的使用外,也很注重分析、业务、经验、沟通、团队等方面的能力。
本文作者:Mr.Hu,转自:一胡诌先生
- ?
什么叫大数据分析
华怜阳
展开
大数据行业发展如火如荼,国家政策利好,互联网大佬纷纷在大数据行业布局,我们想让自己的职业生涯在一个朝阳行业发展,肯定又要学习相关技术,让自己与时俱进,但是难就难在大数据是一个新兴事物,目前我国大学的专业里面还鲜少有这个专业,国家刚批的大数据专业,全国目前35个高校,但是从17年开始招生,2021年才有第一批毕业生进入职场,在四年期间,是大数据行业发展的飞速时期,没有行业发展是等着人才进入的,而是需要要虚位以待、蓄势待发,所以在没有高等教育准备好的大数据教育,如何高效的学习大数据,如何快速的与行业发展想契合,那么需要我们成为第一个吃螃蟹的人,作为一个随着大数据行业成长的职业人,首先要知道大数据是个啥?
大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
那来帮大家分析下:如何高效的学习大数据。
经常有初学者会问,自己想往大数据方向发展,该学哪些技术,学习路线是什么样的,觉得大数据很火,就业很好,薪资很高……首先,如果你确定了想往这个方面发展,先考虑自己的过去从业经历、专业、兴趣是什么。计算机专业——操作系统、硬件、网络、服务器?软件专业——软件开发、编程、写代码?还是数学、统计学专业——对数据和数字特别感兴趣?
那么你能找师傅带吗?
但凡有这种想法的人,或多或少都会存有侥幸之心,或者叫做“天真,单纯”。希望不花一分钱,就能更快速的学到更优质,更实用的技能。
关于这一点,我只想反问一句你:“如果你是大师,你凭什么愿意带我?”
其实这就是想告诉你大数据的三个发展方向,平台搭建/优化/运维/监控、大数据开发/设计/架构、数据分析/挖掘。
先说一下大数据的4V特征:
数据量大,TB->PB
数据类型繁多,结构化、非结构化文本、日志、视频、图片、地理位置等;
商业价值高,但是这种价值需要在海量数据之上,通过数据分析与机器学习更快速的挖掘出来;
处理时效性高,海量数据的处理需求不再局限在离线计算当中。
现如今,正式为了应对大数据的这几个特点,开源的大数据框架越来越多,越来越强,先列举一些常见的:
文件存储:Hadoop HDFS、Tachyon、KFS
离线计算:Hadoop MapReduce、Spark
流式、实时计算:Storm、Spark Streaming、S4、Heron
K-V、NOSQL数据库:HBase、Redis、MongoDB
资源管理:YARN、Mesos
日志收集:Flume、Scribe、Logstash、Kibana
消息系统:Kafka、StormMQ、ZeroMQ、RabbitMQ
查询分析:Hive、Impala、Pig、Presto、Phoenix、SparkSQL、Drill、Flink、Kylin、Druid
分布式协调服务:Zookeeper
集群管理与监控:Ambari、Ganglia、Nagios、Cloudera Manager
数据挖掘、机器学习:Mahout、Spark MLLib
数据同步:Sqoop
任务调度:Oozie
······
第一步:初识Hadoop
1.1 学会百度与Google
不论遇到什么问题,先试试搜索并自己解决。
Google首选,翻不过去的,就用百度吧。
1.2 参考资料首选官方文档
特别是对于入门来说,官方文档永远是首选文档。
相信搞这块的大多是文化人,英文凑合就行,实在看不下去的,请参考第一步。
1.3 先让Hadoop跑起来
Hadoop可以算是大数据存储和计算的开山鼻祖,现在大多开源的大数据框架都依赖Hadoop或者与它能很好的兼容。
关于Hadoop,你至少需要搞清楚以下是什么:
· Hadoop 1.0、Hadoop 2.0
· MapReduce、HDFS
· NameNode、DataNode
· JobTracker、TaskTracker
· Yarn、ResourceManager、NodeManager
自己搭建Hadoop,请使用第一步和第二步,能让它跑起来就行。
建议先使用安装包命令行安装,不要使用管理工具安装。
另外:Hadoop1.0知道它就行了,现在都用Hadoop 2.0.
1.4 尝试使用Hadoop
· HDFS目录操作命令;
· 上传、下载文件命令;
· 提交运行MapReduce示例程序;
· 打开Hadoop WEB界面,查看Job运行状态,查看Job运行日志。
· 知道Hadoop的系统日志在哪里。
1.5了解它们的原理
MapReduce:如何分而治之;
HDFS:数据到底在哪里,什么是副本;
Yarn到底是什么,它能干什么;
NameNode到底在干些什么;
ResourceManager到底在干些什么;
1.6 自己写一个MapReduce程序
仿照WordCount例子,自己写一个(照抄也行)WordCount程序,
打包并提交到Hadoop运行。
不会Java的话,Shell、Python都可以,有个东西叫Hadoop Streaming。
如果能认真完成了以上几步,恭喜你,你的一只脚已经进来了。
第二步:更高效的WordCount
2.1 学点SQL吧
如果不懂数据库的童鞋先学习使用SQL句。
2.2 SQL版WordCount
在1.6中,你写(或者抄)的WordCount一共有几行代码?
如果用SQL的话:
SELECT word,COUNT(1) FROM wordcount GROUP BY word;
这便是SQL的魅力,编程需要几十行,甚至上百行代码,SQL一句就搞定;使用SQL处理分析Hadoop上的数据,方便、高效、易上手、更是趋势。不论是离线计算还是实时计算,越来越多的大数据处理框架都在积极提供SQL接口。
2.3 安装配置Hive
Hive算是数据仓库工具,安装不难,网上有很多教程,配置完成后,可以正常进入Hive命令行。
2.4 试试使用Hive
尝试在Hive中创建wordcount表,并运行2.2中的SQL语句。在Hadoop WEB界面中找到刚才运行的SQL任务。看SQL查询结果是否和1.4中MapReduce中的结果一致。
明明写的是SQL,为什么Hadoop WEB界面中看到的是MapReduce任务?
2.5 学会Hive的基本命令
创建、删除表;加载数据到表;下载Hive表的数据;并学习更多关于Hive的语法和命令。
0和Hadoop2.0的区别
MapReduce的原理(还是那个经典的题目,一个10G大小的文件,给定1G大小的内存,如何使用Java程序统计出现次数最多的10个单词及次数);
HDFS读写数据的流程;向HDFS中PUT数据;从HDFS中下载数据;
自己会写简单的MapReduce程序,运行出现问题,知道在哪里查看日志;
会写简单的SELECT、WHERE、GROUP BY等SQL语句;
Hive SQL转换成MapReduce的大致流程;
Hive中常见的语句:创建表、删除表、往表中加载数据、分区、将表中数据下载到本地;
从上面的学习,你已经了解到,HDFS是Hadoop提供的分布式存储框架,它可以用来存储海量数据,MapReduce是Hadoop提供的分布式计算框架,它可以用来统计和分析HDFS上的海量数据,而Hive则是SQL On Hadoop,Hive提供了SQL接口,开发人员只需要编写简单易上手的SQL语句,Hive负责把SQL翻译成MapReduce,提交运行。
第三步:把别处的数据搞到Hadoop上
此处也可以叫做数据采集,把各个数据源的数据采集到Hadoop上。
3.1 HDFS PUT命令
put命令在实际环境中也比较常用,通常配合shell、python等脚本语言来使用。建议需熟练掌握。
3.2 HDFS API
HDFS提供了写数据的API,自己用编程语言将数据写入HDFS,put命令本身也是使用API。
实际环境中一般自己较少编写程序使用API来写数据到HDFS,通常都是使用其他框架封装好的方法。比如:Hive中的INSERT语句,Spark中的saveAsTextfile等。
可以尝试了解原理,试着写几个Demo。
3.3 Sqoop
Sqoop是一个主要用于Hadoop/Hive与传统关系型数据库Oracle/MySQL/SQLServer等之间进行数据交换的开源框架。
就像Hive把SQL翻译成MapReduce一样,Sqoop把你指定的参数翻译成MapReduce,提交到Hadoop运行,完成Hadoop与其他数据库之间的数据交换。
自己下载和配置Sqoop(建议先使用Sqoop1,Sqoop2比较复杂)。
了解Sqoop常用的配置参数和方法。
使用Sqoop完成从MySQL同步数据到HDFS;
使用Sqoop完成从MySQL同步数据到Hive表;
PS:如果后续选型确定使用Sqoop作为数据交换工具,那么建议熟练掌握,否则,了解和会用Demo即可。
3.4 Flume
Flume是一个分布式的海量日志采集和传输框架,因为“采集和传输框架”,所以它并不适合关系型数据库的数据采集和传输。Flume可以实时的从网络协议、消息系统、文件系统采集日志,并传输到HDFS上。因此,如果你的业务有这些数据源的数据,并且需要实时的采集,那么就应该考虑使用Flume。
下载和配置Flume。使用Flume监控一个不断追加数据的文件,并将数据传输到HDFS;
PS:Flume的配置和使用较为复杂,如果你没有足够的兴趣和耐心,可以先跳过Flume。
3.5 阿里开源的DataX
之所以介绍这个,是因为以前某公司客户目前使用的Hadoop与关系型数据库数据交换的工具,就是之前基于DataX开发的,个人感觉非常好用。现在DataX已经是3.0版本,支持很多数据源。你也可以在其之上做二次开发。
PS:有兴趣的可以研究和使用一下,对比一下它与Sqoop。
至此,你的“大数据平台”应该是这样的:
第四步:把Hadoop上的数据搞到别处去
前面介绍了如何把数据源的数据采集到Hadoop上,数据到Hadoop上之后,便可以使用Hive和MapReduce进行分析了。那么接下来的问题是,分析完的结果如何从Hadoop上同步到其他系统和应用中去呢?
其实此处的方法和第三步基本一致的。
4.1 HDFS GET命令
把HDFS上的文件GET到本地。需要熟练掌握。
4.2 HDFS API
原理同3.2。
4.3 Sqoop
原理同3.3。
使用Sqoop完成将HDFS上的文件同步到MySQL;
使用Sqoop完成将Hive表中的数据同步到MySQL;
4.4 DataX
原理同3.4
此时,“你的大数据平台”应该是这样的:
走完第三步和第四步的流程,那么你应该已经具备以下技能和知识点:
· 知道如何把已有的数据采集到HDFS上,包括离线采集和实时采集;
· 知道sqoop(或者还有DataX)是HDFS和其他数据源之间的数据交换工具;
· 知道flume可以用作实时的日志采集;
至此,对于大数据平台,应该已经掌握如何搭建Hadoop集群,把数据采集到Hadoop上,使用Hive和MapReduce来分析数据,把分析结果同步到其他数据源。
接下来的问题就是,Hive使用的越来越多,你会发现很多不愉快的地方,特别是速度慢,
大多情况下,明明我的数据量很小,它都要申请资源,启动MapReduce来执行。
第五步:快一点吧,我的SQL
其实大家都已经发现Hive后台使用MapReduce作为执行引擎,实在是有点慢。因此SQL On Hadoop的框架越来越多,按我的了解,最常用的按照流行度依次为SparkSQL、Impala和Presto.这三种框架基于半内存或者全内存,提供了SQL接口来快速查询分析Hadoop上的数据。
目前我们的方案使用的是SparkSQL,至于为什么用SparkSQL,原因大概如下:
· 使用Spark还做了其他事情,不想引入过多的框架;
· Impala对内存的需求太大,没有过多资源部署;
5.1 关于Spark和SparkSQL
什么是Spark,什么是SparkSQL。
Spark有的核心概念及名词解释。
SparkSQL和Spark是什么关系,SparkSQL和Hive是什么关系。
5.2 如何部署和运行SparkSQL
Spark有哪些部署模式?
如何在Yarn上运行SparkSQL?
使用SparkSQL查询Hive中的表。
PS:Spark不是一门短时间内就能掌握的技术,因此建议在了解了Spark之后,可以先从SparkSQL入手,循序渐进。
第六步:一夫多妻制
其实我想说的是数据的一次采集、多次消费。
在实际业务场景下,特别是对于一些监控日志,想即时的从日志中了解一些指标(关于实时计算,后面步节会有介绍),这时候,从HDFS上分析就太慢了,尽管是通过Flume采集的,但Flume也不能间隔很短就往HDFS上滚动文件,这样会导致小文件特别多。
为了满足数据的一次采集、多次消费的需求,这里要说的便是Kafka。
6.1 关于Kafka
Kafka是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模的网站中的所有动作流数据。这种动作(网页浏览,搜索和其他用户的行动)是在现代网络上的许多社会功能的一个关键因素。这些数据通常是由于吞吐量的要求而通过处理日志和日志聚合来解决。
6.2 如何部署和使用Kafka
使用单机部署Kafka,并成功运行自带的生产者和消费者例子。
使用Java程序自己编写并运行生产者和消费者程序。
Flume和Kafka的集成,使用Flume监控日志,并将日志数据实时发送至Kafka。
至此,“大数据平台”应该扩充成这样:
这时,使用Flume采集的数据,不是直接到HDFS上,而是先到Kafka,Kafka中的数据可以由多个消费者同时消费,其中一个消费者,就是将数据同步到HDFS。
总结:
为什么Spark比MapReduce快。
使用SparkSQL代替Hive,更快的运行SQL。
使用Kafka完成数据的一次收集,多次消费架构。
自己可以写程序完成Kafka的生产者和消费者。
前面的学习已经掌握了大数据平台中的数据采集、数据存储和计算、数据交换等大部分技能,而这其中的每一步,都需要一个任务(程序)来完成,各个任务...
- ?
什么是数据、什么叫分析?这才是数据分析!
村上
展开
你说是个笑话也可以,但是确实说明了一个道理!
一个哥们,有次聚会时说自己买了很多条iphone数据线,家里每个房间插一条,走到哪儿都能随时充电·····
在场的姑娘们都当成是段子笑笑就过去了,只有一个细心的姑娘悄悄问他买了多少条,他说:42条!
现在她和他在北京三环内总共42个房间的数套豪宅里愉快地生活,已定好日子:下个月结婚!
这,就是数据分析!
如果你是她,你会反问他吗?如果你是他,你会理解她对数据的分析吗?
- ?
你真的懂什么是数据分析么?
丽塔
展开
你明白为什么要分析数据么?
说实话,这个问题我自己思考过无数遍,也和很多同事聊过,目前我最认同的还是前老板一句总结:数据是用来反馈经营现实,并帮助管理者指导经营的。
话说出来很简单,但要时刻用这个标准来衡量我们做的数据分析是否有意义却是一个不容易的事儿。很多情况是调取了一堆数据,做各种环比、同比,各种横向、纵向比较,各种占比等等,每个指标你还都能准确找出他们代表的经营现实么?
如果你发现你只能分析出最简单、最基本的数据变化原因的话,那我觉得你应该去实际业务中去看一看、聊一聊、做一做了,数据分析工作绝不是仅在电脑前就能完成的!
当你真的了解业务后,你会发现你具备一种很重要的能力:你可以很轻松的判断一个数据是否可靠!是的,你没听错,即使这个数据在别人看来是多么正常,即使这个数据是SQL跑出来的,你可以1秒钟就告诉领导,这个数据并不准确,我们还是重新核实一下吧!
用数据分析业务,用业务衡量数据!
BY BoraBora
数据分析 - ?
数据分析:哪个行业正兴旺,哪个行业已衰败
於靖儿
展开
识大势而后伐谋,所以“识大势”是非常重要的,这对我们择业、跳槽影响深远。 为了给大家直观地展示当前哪些行业正走向兴旺,哪些行业已衰败没落 ,我分析了世界500强中的115家中国企业,它们分别来自金融、制造、电信等22个不同的行业,这些超级大企业通常都是各自所属行业中的巨头,从这些最具代表性的企业身上可以看到其行业的走向。
1. 哪个行业入选500强的企业数量多?
前五位分别为能源(23家)、金融(11家)、电子/电气设备(9家)、房地产(9家)和保险(8家)。好吧,中国不愧为发展中的人口大国, 源源不断的人口红利足以支撑一些毫无技术含量的企业发展壮大 。
图1
有人可能会质疑说,电子/电气设备行业的技术含量很高啊,那我把这9家企业列出来吧:鸿海精密(台湾)、正威国际、联想集团、和硕(台湾)、中国电子信息、台积电(台湾)、广达电脑(台湾)、中国电子科技、仁宝电脑(台湾)。 台湾企业占据超过半壁江山 。
数据也同时印证了, “对基础技术缺乏研究”正是当今中国企业的最大问题 ,互联网企业更多地是关心模式的创新、用户体验的创新,在技术创新上还是一贯的依靠舶来品,很少中国互联网企业愿意在那些基础而又核心的技术上投入过多的精力,因为这些基础而又核心的东西往往需要长时间的技术积累,远不如模式创新在变现上来得快。但技术才是这个世界进步的根本,所有的模式创新、体验创新都只是依附在技术创新的基础之上, 如果中国互联网一直在技术创新上采取“拿来主义”,在用完中国的人口红利后就将迅速面临断崖式的崩溃。
2. 哪个行业的平均营业收入最高?
营收是衡量企业发展状况的最重要的指标。各行业平均营收前五名和后五名的情况如下:
前五名:工程与建筑、网络/通讯设备、综合商业、金融、电信
后五名:工业机械、船务、房地产、互联网服务、批发零售
图2
也许有些人会觉得很意外,为什么“互联网服务”的营收会排名倒数第二呢?这里面的企业都是赫赫有名的,京东、腾讯、阿里,哪个不是跺跺脚中国互联网就得震一震的主儿?而数据恰恰说明, 互联网当前还远不是中国的支柱经济,它虽然抢尽眼球,但还是实体经济在支撑着中国在前行 ,当前互联网的发展还处于画地为牢的阶段,虽然红红火火,但还远没有融入到庞大的实体经济中去。而我们的决策者在制定各种行业政策时是不是也可以适当考虑下传统经济的现状,包括它背负的责任和当前的困境。
工程与建筑行业夺魁,网络/通讯设备夺得榜眼,说明中国仍处于基建大发展阶段,包括硬件的发展(铁路、公路、建筑)和软件的发展(网络、IT设备),所以,未来相当长一段时间内 ,“工程师”仍是非常紧缺的人才,包括建筑工程师和软件工程师。 当然,金融无论在哪个时代都是处于金字塔的最顶尖的,但这个行业情况有点复杂,后面我们结合其利润和增长情况来谈。
2.1 哪个行业的营收增长率最高?
营收增长率衡量的是行业的发展态势。前五和后五的情况如下——
前五名:航空、船务、网络/通讯设备、金属产品、房地产
后五名:电子/电气设备、贸易、物流、能源、金融
图3
航空和船务应该是受到“一带一路”的国家政策强烈刺激,在营收增长上表现良好。房地产行业的高增长率也印证“中国仍处于基础建设大发展阶段”的观点, 房子是无数中国人的终极追求 ,房地产行业在中国应该还能兴盛很久。
电子/电气设备行业正在被云计算等新兴技术革命,所以其滞涨是正常现象;传统贸易被电子商务、海淘的狙击,估计很难缓得过气来;因为顺丰去年仍没进入500强,这里的物流只包括一个企业——邮政,所以其低速发展没有代表性,不符合当前行业现状;最让人吃惊的是金融行业竟然营收增长率倒数第一,难道金融行业在与支付宝、微信支付等新型金融工具的对抗中已经伤筋动骨?这不禁让人疑问, 金融业还有明天吗?
3. 哪个行业的平均利润最高?
利润是衡量一个企业可持续发展能力的关键指标。前五和后五的情况如下——
前五名:金融、网络/通讯设备、物流、互联网服务、电信
后五名:医药、航空、批发零售、金属产品、化学品
图4
好了,谈到利润的时候,终于回到我们熟悉的世界了。金融行业荣膺利润之王的称号,而阿里巴巴、腾讯、工商银行、中国移动、华为等今昔的王者都悉数回归,这说明一件事情:世界也许很复杂,但有人一直在默默赚钱。
我们常常会有一种疑惑,像国外的亚马逊、国内的京东这些巨头,年年亏损,但丝毫不影响它们的市值一路攀升。其实原因很简单,它们代表未来的发展方向,它们有层出不穷的可炒作的热点,所以利润对它们而言一点都不重要。但对另外一些行业、企业而言,情况就大不一样了。
如,利润排名后五名的行业:化学品、金属产品、批发零售、医药等,这些行业已经被冠名“落后的传统行业”,对于未来没有任何的想象空间,赚取利润可能是它们唯一的价值,可惜也已经不胜重负了。
所以,你还在犹豫选专业的时候要不要选化学吗?
3.1 哪个行业的利润增长率最高?
前五名:汽车制造、船务、航空、物流、医药
后五名:贸易、能源、房地产、工业机械、金属产品
图5
好吧,又一次颠覆了我们对世界的认知,前五名没有BAT、没有中国移动,更多的是传统的行业,如汽车制造,我们是不是可以理解为: 先醒过来的传统行业正在通过拥抱互联网重获新生?
而后五名,能源、金属产品、传统贸易都是落后分子里的老面孔了,房地产利润增长率不佳是因为本来已经是暴利行业的缘故吗?还是政府卖地越来越贵了?哈哈。
4. 哪个行业的净利率最高?
净利率衡量的是企业的变现能力,也是企业的核心竞争力。前五和后五的情况——
前五名:金融、互联网服务、物流、网络/通讯设备、房地产
后五名:医药、航空、批发零售、金属产品、化学品
图6
跟利润有关的,金融行业永远是王者,因为 全世界几乎所有的精算师、风险评估师都在金融行业,你觉得这个行业能亏吗? 互联网行业的特点就是大者恒大,一旦实现了对其领域的控制,其盈利能力就会爆发出来,阿里、腾讯这些主儿的净利率都是近30%的。房地产,一言蔽之“暴利行业!”, 凡是华人聚居的地方,那里的首富肯定是卖房子的 ,如李嘉诚、许家印。
后五名就不再多说了,这些行业估计短期内很难以摆脱当前的现状。
5. 哪个行业的人均产值最高?
人均产值代表该行业的员工的工作能力和价值输出。前五名和后五名情况——
前五名:贸易、批发零售、保险、金融、电子/电气设备
后五名:航空、航天与防务、电信、综合商业、物流
图7
贸易是一种特殊的行业形势,所以造就了人均高达5000万的逆天的人均产值。而金融、保险和电子/电器设备的高人均产值也正说明了在一个大势向上的行业里,个人的价值能更好地发挥出来。
让人悲痛的事,电信行业的人均产值位列倒数第三,而电信行业多年以来都是国企中管理水平出色的代表,多年来也一直笼天下之英才而用,员工的能力应该是不容置疑的,如今落得这局面,是不是说明电信行业已经不在当前的“大势”之中?另外,是不是也说明了三大运营商当前机构臃肿、人浮于事?是体制机制之祸还是经营管理不善?
三流企业做事,二流企业做市,一流企业做势。 所谓做势,就是善于谋形划势。势是一个物理学概念,指的是一种必然,一种出于对宏观把握的结果,一种规律性的认知。
6. 哪个行业的人均利润最高?
人均利润则更能反映出行业的发展势头,以及人在其间的作用。
前五名:互联网服务、金融、保险、电子/电气设备、网络、通讯设备
后五名:批发零售、工业机械、金属产品、航空、化学品
图8
在人均利润指标上,各行业相差悬殊, 互联网服务和金融可谓是人均利润的“双寡头”,高达63、62万元,是第三名的2倍,第四名的3倍,是电信行业的11倍,是倒数第一名(化学品行业)的574倍。 试想一下,可能大家都是朝九晚五地上下班,但别人创造的利润是你的500多倍,这是一件多么让人沮丧和绝望的事情啊。
而一个最基本的道理,你不能为企业带来利润,企业也肯定无法给你带来更好的薪酬收入,无论商业社会多复杂,这是一个最基本的准则。
其实不光是中国,全球的经济格局正在重构,全球化和数字化是两大重要的趋势,正在改变着中国乃至全球的商业世界的面貌,在过去30多年里,中国很多企业从人口规模和全球化市场中获得了很大的红利,这让它们能在很短的时间内发展壮大,位列世界500强,但这只是简单地反映出它们的营收规模庞大,而实际上, 从开放、创新这两个衡量企业新的竞争力的指标来看,中国企业还有很远很远的路要走。
- ?
作为数据分析师,鬼知道我经历了什么!
参差
展开
谨以此文献给所有数据从业苦逼之人,如有中伤之处,请自行戴好盔甲,以防中伤过深。同时也以此文献给后期对数据热情,想长期从事此行业的年轻人,希望对你们有所启发,并快速的调整思路和方向,以对自己的职业生涯有更好的发展。
最近听到一些段子,很有意思,分享给大家!
这些段子是很多数据分析人员的真实写照:
新招进公司做大数据分析师,好开心好兴奋好激动!!!然而...
入职第一天,老板给了我一张 50M 的 Excel 表说:
“你看我们有 100多万条用户信息,这么大的数据,来个大数据分析下!”
还没从震惊中恢复过来,业务部又神补一刀:
“我们准备跟星巴克合作,来预测下明年多少人喝咖啡,几千万的大项目,预测不准公司要亏很多钱的,你加油哈!”
面对这样的业务部,我只想说:“我要是未卜先知为啥不去炒股来给你打工”
IT大哥贼兮兮的说:“哥们你可来了,那失散到天涯的数据有娘啦!”
没法,最终还是把数据拼起来开始分析...
发现好有规律啊~好工整啊~这...是不是有坑?!
去业务部一问才知道,这些都是被经销商篡改操纵的数据...
后来拿到了全真实的数据!全部没有规律了!喜极而泣!!
擦干泪仔细一看,80%的记录缺失,10%记录不全,5%记录出错……
整完数据开始统计,然而领导觉得只做加减乘除太简单了,有没有更深度的方法(解读:需要纠正的是,有用为先,花哨次之,这种说法不太合理)
简单了就做个模型吧,然而检验值还没讲完领导表示太复杂搞不懂,能简单点不(解读:这个是解读能力的问题,跟领导没关系...没关系..没关系...)
改来改去已很多遍了!我已不太记得领导唠叨了什么,总之又听到一句:“再改一下,看看其他维度深入分析分析”,然后默默新建一个文件:《分析报告V16-8版》
输出结果和业务部的认知差不多,被评价为:
“我们都知道了啊,这大数据做了跟没做一样啊”
输出结果和业务部的认知差很多,被评价为:
“这个与业务经验完全不同,肯定是数据的问题,我们都十多年经验了,快回去检查数据,上次我去见XXX客户人家就不是这样的!一定是你错了!一定!”
此段子一出,群里都炸开了锅,大家都开始不断的煽风点火,各种数据背锅,各种吐槽,说尽了数据分析师的辛酸苦辣。
我做数据分析师的时候也经常遇到上面这些遭遇,乃至后来找到了一些规避这些问题的方法,希望对大家有所帮助。
同时,我也希望借此号召所有的数据从业者,在数据应用实践上能够深入思考并有所突破,在正确的轨道上更好的发挥出数据的价值,从而让数据从业者有更大的 ,不再拘泥于每天的抱怨和自怨自艾中。
数据之苦
进入正文,数据人之苦最苦的是:有好处想不到你,出了问题都是你的错
这句话的意思就是你做好是应该的,做得不好就得承担责任。这种痛苦完全命中了马云蜀黍对离职的两点看法:
心累(得不到价值肯定)、钱少(没业绩肯定哪来的升职加薪)
区分数据流程的不同阶段,数据人之苦又有所区分侧重不同,说一下我的个人浅见。
根据数据应用的不同阶段,我的划分方法如下,从数据底层到最后应用:
大数据平台
目前很火,数据源头,各种炫酷新技术,搭建 Hadoop、Hive、Spark、Kylin、Druid、Beam~,前提是你要懂 Java,很多平台都是用 Java 开发的。
现在很多企业都把数据采集下来了。对于传统的业务,用传统的数据是完全够用的;可是对于用户行为和点击行为这些数据或者很多非结构化的数据,文本、图像和文本类的,由于数据量太大,很多公司都不知道怎么进行存储。
这里面要解决的是实时、近实时和离线的大数据框架如何搭建,各数据流之间如何耦合和解耦,如何进行容灾、平台稳定、可用是需要重点考虑的。
我的感觉是:最近两三年中,这块人才还是很稀缺的,因为大数据概念炒作的这么厉害,很多企业都被忽悠说,我们也来开始进入大数据行业吧。但是,进入的前提之一就是需要把数据存储下来,特别是很多用户行为方面的数据,对于业务的提升了比较明显的,如果你能很好的刻画用户,那么对你的产品设计、市场营销、开发市场都是有帮助的。
现阶段,很多公司都要做第一步:存储更多的数据。这也就是我们这块人员流动性比较高,因为都被高薪挖走了。
和传统的 SQL 不同的是,针对大数据量的非结构式数据,我们所想的就是:用最廉价的成本存储数据同时能够达到容灾、扩展性高、高性能、跨域,从目前来看有两个方向
分布式已经被证明是个很好的一个方式。云端会是个很好的方向。不是每个公司都养得起这么多这么贵的大数据平台开发人员和运维人员 OPS,从事这个行业的我们要有很好的危机意识,及时贡献出自己的价值,积极主动的学习新技术、否则你就要被淘汰了。
此外,花点钱把数据托管给云服务提供商对于创业公司或者一些传统的企业来说是个很好的思路,这样能够最快速地确定数据对你的价值是什么,而不用采购这么多的服务器、雇佣这么多的运维和网站开发人员。
说了以上这些,主要是想给未来会从事这块的人或者想存储数据的公司一点方向。我自己不做这块,体会不深,大家看看就行。
这块工作最被吐槽的一点就是:Hive 速度好慢,SQL 查询好慢,集群怎么又挂掉了,Hadoop 版本升级后,怎么数据跑出来不对了等等。
因此,在这个领域内工作,需要有强大的
攻坚能力。快速定位和解决 bug 的能力。因为有很多工具都是开源的。Java 开发能力。因为是开源的,所以会出现各种坑爹,甚至出现无法向下兼容的情况。
如果想在这块做的很好,还需要有整个系统架构的设计能力、比较的强的抗压能力和解决问题的能力、资源收集的能力,可以打入开源社区,这样就可以随时 follow 最新的潮流和技术。
数据仓库-ETL
确实做仓库的人很辛苦,单单 Oncall 就会让人望而却步。有很多数据库工程师,晚上睡觉的时候经常被 Oncall 电话吵醒,因为数据流程出问题,需要第一时间去排查,是哪个数据源出问题,并且要立即解决,否则整个数据流程都会受到影响。
如果数据流程受到了影响,你就可能会被大领导一言不合叫到办公室说:我要的数据怎么还没有准备好,我的业务报表今天怎么没有发出来。
通过上面这个情景,我们可以知道:这是个很重要的岗位,因为数据流程很重要,决定了数据从源头杂乱无章的状况,通过 ETL 之后变成了整齐的数据,这些整齐一致性的数据可以让你很方便地把各业务的统计结果计算出来,并且能够统一口径。要不然就会变成有几个部门,就有几种统计结果,到时候 A 部门说业务增长了 5%,B 部门说业务涨了 10%,OMG,到底信谁?
至少在以下几点上,我觉得数据仓库人员是应该要做好:
数据字典的完整性,用的人都希望能够清晰的知道这个字段的逻辑是什么。字段要保持很好的一致性,不要同样一个字段在不同表里有不同的定义。核心流程的稳定性,不要让每天订单主表能够使用的时间很不稳定,有的时候很早,有的时候要中午才出来,如果不稳定就会导致使用数据的人对你很没有信心。仓库版本迭代不要过于频繁,要保持不同版本之间的兼容性。不要做好了仓库 1.0,很快就把原来的推倒重来,变成了 2.0。在数据仓库中需要考虑到延续性,主表的变动不要太频繁,否则使用的人会非常痛苦,好不容易才用习惯了 1.0 的表结构,没办法这么快进行切换。简单地说,要能向下兼容。在这点上,我是深有体会,之前出现过每来一个大领导都来换一次数据仓库的。保持各业务逻辑的统一性,不要出现同样的业务逻辑,同一个组别的人统计出来的结果不同。原因在于共同的逻辑没有落地成通用的东西,所以导致每个人写法不同。这点其实需要特别注意。
针对以上,这个岗位的技能要求是:不要成为仅仅会写 SQL 的人,现在工具都很发达,如果你的技能很单一的话,那么可替代指数是非常高的,并且你自身也没有什么成就感。这里并不是说会写 SQL 的人很 low,只是说应该多学一些技能,否则你很危险。
技能上,除了 SQL 熟练之外,还需要知道如何写 Transform,MapReduce,因为有很多业务逻辑用 SQL 实现起来非常复杂,但是如果你会其他脚本语言,那么就能给你提供便利,让你的效率提升很多。
另外好的仓库人员需要写 Java 或者 Scala,通过写 UDTF 或者 UDAF 来提升你的效率是很有必要的。
仓库人员应该要常常思考,如何进行架构设计是最合理的,你要考虑是否需要字段冗余、行存储还是列存储、字段如何扩展最有效,热数据和冷数据如何拆分等,所以需要有架构思维。
数据仓库人员也应该常常考虑自动化和工具化方面的事情,需要很好的工具或者模块的抽象能力,动手实现自动化的工具来提高整个组织效能。针对经常碰到的数据倾斜问题,需要很快定位问题并进行优化。
说完了数据存储这块,接下来是数据应用的几个关键职位,在此之前,我想说数据应用的一个最关键的前提是:数据质量、数据质量、数据质量!!在每次阐述你的观点、分析结论或者用算法的时候,都需要先检查,源头数据正确性,否则任何结论都是伪命题。
数据可视化
这是个很炫的工作,最好是能懂点前端,比如 js。
数据可视化人员需要有很好的分析思维,不能为了炫技而忽视对业务的帮助程度。因为我对这个岗位客串的不多,所以没有特别深入的感悟,不过我觉得这个岗位需要有分析的能力,才能把可视化做好。
另外一方面来说,做数据应用的人都应该懂点数据可视化,要知道观点表达的素材顺序是:图片>表格>文字,一个能够用图片来阐述的机会千万别用文字来描述,因为这样更易于让别人理解。要知道,给大领导讲解事情的时候,需要把大领导设想成是个“数据白痴”,这样才能把一件事情说的比较生动。
4
数据分析师
现在对数据分析的需求是很大的,因为大家都想着说:数据有了,但是能做些什么呢?这就需要有数据分析师, 。
对数据分析师吐槽最多的是:你分析出来的不就是正常的业务逻辑吗,还需要你分析什么?或者是你分析的结论不对,跟我们的业务逻辑不符合。
特别是 ABTest 的结果和当初设定的预期不相符合的时候,分析师会常常被拉过去说:分析一下,为什么我的 AB 实验结果不显著,里面肯定有原因的。
很多时候,宝宝的心里苦啊,你说这个转化率下降了,从数据上可以看出哪个细分渠道下降了,至于为什么客户不下单,我们得问用户去,很多时候,数据上也体现不出来为什么,只能告诉你现状是什么。
如果你一直在写分析报告,给结论中,持续周而复始,没有直接在业务中体现成绩的时候,数据分析师们该醒醒了,你该想想这个是你要的岗位吗?
对于数据分析师的定位:个人认为,成为优秀的数据分析师是非常难的,现在市面上也没有多少优秀的分析师。
我个人对数据分析师的技能要求除了会数据分析、提炼结论、洞察数据背后的原因之外,还需要了解业务,懂算法。只有这样,当面对一个业务问题时,数据分析师们才可以针对问题抽丝剥茧,层层递进去解决问题,再根据定位的问题进行策略的应对,比如是先做上策略进行测试还是应用算法进行优化,用算法用在哪个场景上,能不能用算法来解决问题。
一个优秀的数据分析师,是个精通业务和算法的全能数据科学家,不是那个只会听从业务的需求而进行拉数据、做报表、只做分析的闲杂人等。
我们都说分析要给出结论,优秀分析师的结论就是一个能解决问题的一揽子策略和应对措施,同时很多需求是分析师去主动发现并通过数据来挖掘出来的。
从上述描述中,可以看到对数据分析师的要求是:
会写sql拉数据精通业务会数据洞察精通算法主动性强
如果你一直只是忙于应付日常分析需求,热衷于写华丽的报告,那么你要记得,你很危险,因为会有一堆人在那里质疑你存在的价值,特别是小公司。因为数据人员的薪资是个不小的支出。
大部分不落地的分析都是伪分析,有一些探索性的可行性研究可以不考虑落地,但是其他的特定业务需求的分析都需要考虑落地,然后通过实践来反推你的作用,如此反复,才能慢慢的给你价值的肯定,同时提升你的分析技能,也只有这样才能证明你作为分析师、数据落地者的价值。
数据挖掘/算法
这块的话,经过这三年的摸爬滚打,感触蛮多的。体会比较深的吐槽主要有以下几点:
一个规则搞定了,还用什么算法。你的准确率怎么这么低?!你的准确率可以到 99% 吗?你的推荐有价值吗?你不推荐客人也会下那个产品的订单的。帮我做个大数据预测他想要什么?
很多时候,不同的场景对准确率的要求是不同的,所以在一定合理的场景下和业务进行据理力争是必要,不要害怕让业务吐槽,更多的时候管理...
- ?
App数据分析到底要分析什么
陶寻绿
展开
按大众化的分法,产品的生命周期(PLC, Product Lifetime Cycle)分为初创期、成长期、成熟期、衰退期,在产品的每个阶段,数据分析的工作权重和分析重点有所区别,下面按阶段结合案例来聊聊。
一、初创期
初创期的重点在于验证产品的核心价值,或者说验证产品的假设:通过某种产品或服务可以为特定的人群解决某个问题。这个阶段应当遵循MVP(Minimum Variable Product) 的思想,以最小的成本来验证创业的想法,并根据用户的反馈快速迭代以调整解决方案,最终在数据上得到验证。
案例:
拿之前做的某款国外移动端论坛社交应用为例,产品在idea时期(12,13年左右)发现了论坛用户经常在吐槽从移动端Wap页访问论坛速度慢、广告多、完全没有移动端适配,于是我们提出假设:做一个App,连接论坛系统与用户,让论坛用户在移动端也能享受流畅的论坛访问体验,并且用户愿意为了这种体验付费。
于是在初期,整个产品完全围绕看帖、发帖两个核心场景进行挖掘,在论坛里进行宣传,售价$18,发现有许多用户为之付费,且这些用户的留存率达到60%+(当然与用户付费了有关),有一半的用户使用时长都超过了70分钟。当时没过多久陆续出来了一些竞品 (Vbulletin团队,当时最大的论坛系统,开发了一个移动端的App,意图解决同样的问题),但是没过多久都远远落在了我们后面,就是因为整个团队遵循MVP的思想,按用户反馈专心反复打磨看帖、发帖的流畅体验,获得了非常好的用户口碑并领先市场,也获得了某著名硅谷投资机构的投资。
关键数据——目标人群画像
除此之外,初创期可以通过接入一些第三方的应用监测SDK来了解初期用户群体的画像,从侧面验证用户群体与假设的目标用户群体特征是否一致,常见的是人口学属性(性别、年龄、学历、地域)。
案例:
今年4月初在和国内某健身类的APP的产品经理聊到, 该APP最初是一款健身、运动记步的工具App,在产品前期新用户的次日留存处于业内平均水平,在其观察到目标用户群体的画像时,发现女性用户明显比男性用户要多,且女性用户留存明显比男性用户要高。于是决定在产品策略上向女性用户倾斜,主攻女性健身、减脂、美容方向的功能以及内容推荐,产品整体次日留存率相比之前增长近100%。
同样,最近服务了一个鹅厂内部客户,他们开发了一款新产品,意在面向年轻人群体,结果却发现其用户年龄分布以青少年和老年人居多:
这正好与他们的用户渠道相关,原来他们有一款面向青少年和老年人的产品,为了给产品带来第一批用户,他们直接从老的产品将用户引流过来,结果发现他们并非产品的目标用户。
关键数据——留存率
在当前用户符合目标受众特征时,核心关注这些用户的留存率、使用时长/频率、用户的黏性等指标,这里就留存率展开来讲。
留存率的维度分很多种(7日,双周,30日等),依据产品特征来选择,若产品本身满足的是小众低频需求,留存率则宜选择双周甚至是30日;留存率高,代表用户对产品价值认可并产生依赖,一般来说,假设便能得到验证,通常低于20%的留存会是一个比较危险的信号。
介绍一个以数据为驱动的先行指标模型,可以通过找到先行性指标指导产品设计,从而提升留存率。先看下先行性指标的定义,先行性指标是指新用户在使用产品早期的一种产品行为,这个指标与用户的留存率指标之间存在着非常高的线性相关关系,可以预测用户是否会在产品中留存下来。
用自己总结的公式来描述,大致如下:
积极预测可能性(%):表示用户执行了该行为,即可预测该用户留存活跃的可能性
消极预测可能性(%) :表示用户如果不执行该行为,即可预测该用户不留存活跃的可能性
最终,先行性指标的可信度=积极预测可能性 X 消极预测可能性 ,我们直接看案例。
案例
拿之前的论坛社交App为假设,假设“用户在注册前10天内添加好友超过7个”为先行性指标,那么我们计算一组数据:
其中,用户前10天内添加好友超过7个,则其30日留存下来可能性为99%;若添加好友小于7个,则其30日不留存下来(流失)可能性为95%,综合指标可信度为0.9405。
同理,计算以下两个先行性指标可信度:
最终,我们得到对比:
以上只是假设的数据,实际上,我们需要对比十几个甚至是二十几个行为指标才能找出先行性可信度最高的行为。
这个模型中第一条“新用户在注册后的10天内添加好友超过7个”,也就是Facebook一个经典的“aha moments”,所谓”aha moments”即当用户意识到产品的核心价值的时刻,也就是我们的“先行指标”。
(Facebook,Instagram推荐好友截图)
除此之外,先行性指标应当满足以下条件:
二、快速成长期
经过了产品打磨的初始阶段,产品有了较好的留存率了,这个时候产品开始进入自发增长期。自发增长期的产品阶段,仍需要关注用户留存、用户时长、用户画像的变化等数据,但可以将侧重点关注在用户的整个生命周期的管理,其中以新用户的增长、激活、触发“aha moments”到产品稳定活跃用户的整个漏斗分析为主。
新用户的增长和激活
其中新用户的增长和激活一般有两种方式,第一种是构建产品的病毒性传播系数, 让产品自发增长,《精益运营数据分析》书中有提到的几个用户病毒式传播分类很有趣:
原生病毒性,即通过App本身的邀请好友功能而传播吸引的新用户的方式;
口碑病毒性,即通过口碑传播,用户主动通过搜索引擎成为的新用户;
人工病毒性,即通过人工干预,如有奖邀请等激励措施来鼓励用户进行邀请行为。
这里关注的一个指标称之为“病毒式传播系数”,感兴趣的同学可以自行深入了解。
新用户下载->激活->‘Aha Moments’->产品稳定活跃
产品开始进入自发增长期后,需要关注用户从新用户到活跃用户(留存后)、到核心用户的生命周期,并将每个过程的关键指标提炼并精细化。
案例
以之前的论坛社交APP为例,新用户进入产品会看到一个欢迎页(如左下图),经过注册、登录后会看到产品的首页(如右下图的Feed流页面),多数App都有类似的流程:
一个新用户从进入App欢迎页到最终成为核心用户大概是以下流程:新用户(探索发现产品价值中)-> 旁观者(逐渐认知产品价值并有一定的参与感)->生产者(认同产品价值并积极参与):
按大众化的分法,产品的生命周期(PLC, Product Lifetime Cycle)分为初创期、成长期、成熟期、衰退期,在产品的每个阶段,数据分析的工作权重和分析重点有所区别,下面按阶段结合案例来聊聊:
此时,对各个阶段的用户行为进行指标分解:
新用户&探索发现者:
欢迎页跳出率新用户注册率新用户引导流程转化率初始看到Feed页跳出率搜索结果转化率推送权限开通率
旁观者(路过者):
平均每个用户关注板块数平均每个用户关注其他用户数平均每个活跃用户赞/分享数Feed卡片展示数Feed卡片点击数订阅内容推送点击率
内容生产者:
· 平均每个活跃用户发帖数
· 平均每个活跃用户发照片、视频数
· 平均每个用户在论坛内使用时长
· 活跃用户在论坛内行为分布
精细化的拆分用户生命周期前中期的行为指标,在产品快速增长期帮助了产品不断打磨细节,将用户从新进到成为核心用户体验不断完善。与此同时,在各节点数据提升并稳定后,产品运营的同学则开始进行各种推广、投放的宣传以扩大盘子、占领市场。
三、成熟期
随着用户快速增长,产品不断完善,产品在进入成熟期前后,数据运营关注的重心开始从用户生命周期的前半段(吸引、激活、留存)往后半段(流失、回流)开始偏移。
这里分享一个在增长期和成熟期关注的数据模板 Daily Net Change (应用自John Egan@Pinterest),区别于只关注DAU、MAU数据,只关注活跃用户数的增减很多时候都是取悦自己,而这个模型能帮助直观地观察到用户增长的因子是什么,或者用户盘子变化的情况,通过一张图展示了产品的新增、回流和留存情况。
其中Net Change = 新增用户 + 回流用户 – 流失用户。
新增用户即当天有多少新用户加入
回流用户即多少老用户连续28天没有使用,今天又开始使用
流失用户即有多少已有用户刚好最后一次使用应用是在28天前
流失与回流
在关注流失回流的过程中,数据会揭示当前用户盘子的一个变化情况,具体分析流失原因则可以参考下方流程:
核心思路即,通过回访定性+数据验证为主要手段,确定流失原因,改变产品运营策略以预防用户流失或拉回用户,促进回流。
除此之外,对于一些稳定的投放渠道,普通的改善方法可能提升转化有限,此时可以进行更精细化的渠道分析来优化提升ROI:
案例:
提升ROI
四、衰退期
最终,产品进入衰退期,一般在进入衰退期前可以采取两种方式:
1、规模化
常出现在零售业中,如开一家按摩养生店,在一定范围内收获好评,那产品成熟的时候则可以开启连锁加盟模式,通过迅速而广泛的扩大市场形成品牌效应,以形成壁垒,此时衰退的风险则被抵御。
2、生态化
在产品增长或接近完善时,单一的产品很容易存在需求过于垂直、用户无法形成依赖的问题,可以开发具有协同能力的新产品以搭建完整的产品生态,使得在当前产品上无法被得到满足或失去兴趣的用户被引流到新产品,作为新产品的新用户;同时新产品的用户也能在新产品上被引流回老产品,产品之间形成互相依赖的链条,最终用户有效流转,形成生态。
- ?
最常用的四种大数据分析方法
穆菲音
展开
本文主要讲述数据挖掘分析领域中,最常用的四种数据分析方法:描述型分析、诊断型分析、预测型分析和指令型分析。
当刚涉足数据挖掘分析领域的分析师被问及,数据挖掘分析人员最重要的能力是什么时,他们给出了五花八门的答案。
其实我想告诉他们的是,数据挖掘分析领域最重要的能力是:能够将数据转化为非专业人士也能够清楚理解的有意义的见解。
使用一些工具来帮助大家更好的理解数据分析在挖掘数据价值方面的重要性,是十分有必要的。其中的一个工具,叫做四维分析法。
简单地来说,分析可被划分为4种关键方法。
下面会详细介绍这四种方法。
1. 描述型分析:发生了什么?
这是最常见的分析方法。在业务中,这种方法向数据分析师提供了重要指标和业务的衡量方法。
例如,每月的营收和损失账单。数据分析师可以通过这些账单,获取大量的客户数据。了解客户的地理信息,就是“描述型分析”方法之一。利用可视化工具,能够有效的增强描述型分析所提供的信息。
2. 诊断型分析:为什么会发生?
描述性数据分析的下一步就是诊断型数据分析。通过评估描述型数据,诊断分析工具能够让数据分析师深入地分析数据,钻取到数据的核心。
良好设计的BI dashboard能够整合:按照时间序列进行数据读入、特征过滤和钻取数据等功能,以便更好的分析数据。
3. 预测型分析:可能发生什么?
预测型分析主要用于进行预测。事件未来发生的可能性、预测一个可量化的值,或者是预估事情发生的时间点,这些都可以通过预测模型来完成。
预测模型通常会使用各种可变数据来实现预测。数据成员的多样化与预测结果密切相关。
在充满不确定性的环境下,预测能够帮助做出更好的决定。预测模型也是很多领域正在使用的重要方法。
4. 指令型分析:需要做什么?
数据价值和复杂度分析的下一步就是指令型分析。指令模型基于对“发生了什么”、“为什么会发生”和“可能发生什么”的分析,来帮助用户决定应该采取什么措施。通常情况下,指令型分析不是单独使用的方法,而是前面的所有方法都完成之后,最后需要完成的分析方法。
例如,交通规划分析考量了每条路线的距离、每条线路的行驶速度、以及目前的交通管制等方面因素,来帮助选择最好的回家路线。
结论
最后需要说明,每一种分析方法都对业务分析具有很大的帮助,同时也应用在数据分析的各个方面。
原文链接:http://kdnuggets/2017/07/4-types-data-analytics.html
转载请注明出自:葡萄城控件
关于葡萄城
葡萄城是全球控件行业领导者,世界领先的企业应用定制工具、企业报表和商业智能解决方案提供商,为超过75%的全球财富500强企业提供服务。
- ?
【前瞻】大数据分析是好还是坏?
香彤
展开
数据本身并不会窥探人,真正窥探人的是人类本身。但是,这么简单的事实却经常很难被理解。美国国家安全局丑闻、日常数据泄露以及电视监视人们私人谈话的故事……这些事件导致公众越来越不信任数据收集,这并不奇怪。91%的美国人认为用户已经失去了对商业公司如何收集和使用他们个人信息的控制。而61%的公众希望多做一些事来保护他们的网上信息。不管这些数据是故意通过社交媒体披露的,还是不知不觉中通过手机或网站数字足迹被收集的,人们已经为隐私、信息自由,甚至民主受到威胁而感到恐慌。
当通过法庭了解到所有相关的诉讼细节以及看到媒体上讨论的种种可怕的数据泄露的可能性的时候,我们很容易得出结论说大数据分析有其固有的邪恶的一面。那么,果真如此吗?
利大于弊
全球最大数据分析公司之一Teradata的首席分析官比尔·弗兰克斯(Bill Franks)最近就与一些州议员及高管参加了一个会议,来讨论如何帮助他们的州更好的控制支出、减少欺诈以及如何运用大数据更精密的分析和更新数据管理平台,更有效率的进行公共服务。隐私权和数据滥用的问题被提出并引起了激烈讨论。讨论的中心是:考虑到数据有可能被掌权者滥用,政府收集大量的数据是否是个好主意。
其中举了一些例子来说明健康的数据可以提供极大的好处。想想那些负责监控有虐待儿童史的家庭的国家社会工作者。当一个新的案件工作者无法拿到与此家庭有关的历史数据时,这个家庭的孩子可能会遭到没有必要的伤害甚至死亡威胁。打个比方,有很多儿童的死亡是因为工作人员没有掌握重要的信息,从而没有及时了解到孩子已经面临的危险。
一个政府官员指出了对于这些工作人员收集的高度敏感的数据的合理担忧:要让这些数据容易得到就意味着低收入、非技术人员将掌握着这些高度隐私和敏感的信息,而且显然这些信息将会被滥用。
然而,现实是利用这些信息解救的儿童的案例远比被滥用的情况多。尤其是当这些能够接触数据的人知道滥用数据不仅会让他们的工作处于危险的境地,也会引起曾经信任他们的人的强烈控诉(也就是说,你将不会再被信任)的时候。
这有一点像开车。我们每一次开车都在冒失去性命的危险。即使我们没有做错任何事,也随时有可能被某人猛撞然后丧命。当这件事情发生的时候,它无疑是一场悲剧,但因为它发生的概率很低,因此人们把它看作可接受的风险。我们从开车这项技能中所获得的许多好处远远超过并足以弥补其可能带来的风险。没有人严肃的提出禁止汽车上路来避免这些完全可以避免的交通事故。整个社会都认同汽车带来的好处比风险多很多。
对于大数据及分析我们应该持相同的态度。只要合理的利用大数据,益处将是巨大的。但是,无论我们有多么小心,有时数据依然会被滥用。我们的目标应该是将滥用发生的机率最小化,并且将处罚力度定在足以阻止大部分人不去尝试。如果政府和其他的组织都能从哪怕一小部分的积极面去利用大数据,促进信息之间的对接、流通、反馈,这就会发生其杠杆效应,那么我们都会变得更好。
- ?
什么样的人比较适合做数据分析?
漫步者2017
展开
我觉得无论什么工作兴趣最重要,要做数据分析师最基本的就是不讨厌数字,如果你跟他讲那个指标是通过怎么样的乘除加减得到的,他会觉得不耐烦,那么显然他不适合做数据分析;如果对数据较敏感,能够一眼发现异常值,数据分布情况,当然是最好的。
再则就是逻辑性,可以让他试试爱因斯坦的那道经典的逻辑题,看看能否解出来,需要多久;逻辑思维对数据分析尤其重要,不然会被各种指标的定义规则、与业务的联系纠结死,逻辑思维好的人写SQL等数据处理脚本也会更加高效。
接着是业务理解能力,最简单的就是让他定义下网站的目标是什么,哪些指标可以作为KPI,用户从进入网站到达成网站目标的整个过程是怎么实现转化的,能否画出业务流程图。(宏观层面,不要深入细节)
如果偏技术则需要懂一些数据库结构和SQL,如果偏展现需要考验下对图表的掌控能力,什么时候用什么图表合适,甚至如何配色。
最后就是细心、耐心和交流能力,做数据分析有时会很纠结,细心和耐心是必需的,好的交流能力可以让数据分析师更好地阐述清楚各类问题。
这些都是比较基础的东西,也是短期难以培养起来的技能。至于另外业务相关的一些知识,可以通过培训获取,问一个未接触过你的网站业务的人一些业务知识其实有些不公平,其实如果具备上面几点,一旦熟悉网站和业务之后,一定会成为优秀的数据分析师。
——谷芬芬
专业内的要求基本就是对数据的意识和一些技能的掌握。下面具体说说从一些非专业内要求的方面出发,有哪些方面能表现这个人更适合数据分析。
首先是看到数据有兴奋感的人。有兴奋感说明你有兴趣,那说明很会有意愿把数据分析好。
其次是愿意学习的人。你分析的内容永远不会一尘不变,即使你分析的主题是相对固定,但业务是变化的,你需要不断的学习业务,同不同人沟通,吸收别人的观点。所以分析师一定要报着学习的态度。
然后是逻辑思维较强的人。数据分析师想要把你的分析好,一定要有结论思维。
还有就是较强的表达与沟通能力。因为数据分析最终价值的实现,一般来说不会是分析师亲自去制定或者实施。所以你一定很有条理、逻辑清晰向别人表达,让业务方认识到你分析结果的价值,从而影响业务方去愿意使用你从数据中得到的观点。
——欧阳帅
觉得还是应该先看清楚自己的未来的方向吧~
我有不少朋友 非数学/计算机/统计学 专业毕业的朋友走的是这个方向,数据相关,非技术路线,更偏向于市场方向,对技术的要求只是Excel、PPT,最多要求SPSS,很少要求会写SQL。这条路线看起来比较高大上,可以走外企路线。
数据分析师方向,很多读数学、统计学、计算机的童鞋会选这个方向,终极目标都是成为数据中心的负责人。中间有2个分叉,一条是从数据分析师到数据产品经理,这个路线最近很流行,主要是结合了数据分析和产品经理的能力。一条是高大上一点的数据挖掘方向,这条路线要求比较高,但薪资也高。当然能走数据挖掘路线是很多数据分析师的梦想,但算法和代码实现能力不是谁都能掌握的。.
根据你自己想走的路,加上自己的技能点。
——张锦华
想了解更多相关内容,记得持续关注我们哦。
如果你觉得有点意思,请有秩序的评论、转发、收藏。
数据分析哪个好
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并