中企动力 > 商学院 > 数据分析是什么行业
  • ?

    一个工作3年的数据分析师,所具备的能力有哪些?

    迷惑

    展开

    文 | 邹昕-知乎

    来源:再生谈|reborn_chat

    受本人背景和知识水平所限,本答案局限性如下(包括但不限于):

    1. 更适用于中大型公司;

    2. 更适用于互联网公司;

    3. 可能更适用于美国的工作环境。

    个人以为,一个三年工作经验的数据分析师应该具备以下方面的能力:对技术的掌握,对产品的理解,对数据的敏锐性,数据和产品之间互相转化的能力,分析思维的广度、深度和速度,数理统计的能力,沟通的能力,辅导新人的能力,面试把关的能力。

    以下分开来说,同时举例的时候假设这个数据分析师是知乎这个产品的,目的是为了增长活跃用户。

    【1】对技术的掌握

    不一定需要非常高深的技术,但是基本的一定要过关。比如针对互联网行业的数据分析,SQL 是一定要过关的。在这基础之上,掌握公司惯用的BI工具或者报表工具,譬如帆软系列;Python / R 可以提高长期的工作效率,但在初期并不一定需要。

    简单来说,技术能力决定了一名数据分析能力的下限,而对产品和业务的理解则决定了上限。

    如果缺乏技术的支持,那就只能去当 CEO 了。

    就好比在电影 Margin Call 里,底下的小兵负责分析数据,各种模型预测金融危机什么时候会发生。

    而对于 CEO 来说,他的任务就是猜。

    【2】对产品的理解

    数据分析的目的是为了改进产品。如果缺乏对产品的理解,那么技术再好,也有可能像是无头苍蝇到处乱撞。

    或者是变成 data dump,提供一堆一堆的图表,但其中有互相什么关联,能说明什么问题,提供什么样的建议,却并没有好的想法。

    如果是初入行的话,这还是问题不大的。

    因为新人可以有老板带着,或者是老人带着,但是如果想要更进一步,那就必须能够自己独立的做项目。

    尤其是在互联网行业更是如此,除了新人之外,对大多数人的基本要求都是能单兵作战,不需要详细的指导。

    同时在很多情况下,问题是很开放性的,对于如何解决并没有一个非常固定的套路,或者是因为这完全就是一个新的问题,或者因为不同产品之间套路无法直接套用,需要做大量的调整和创新。

    比如这里面增长的例子,哪些是可以借用于知乎的,哪些是需要调整的,哪些是完全不适用的?

    【3】对数据的敏锐性

    对数据的敏锐性体现在两方面,一是在结果还不是那么清晰的时候,甚至根本就没有什么数据的时候,能够大致感觉往哪个方向深挖是更有可能出成果的;二是在数据出问题的时候,能够反应出来,及时找出原因。

    比如做知乎的数据分析,目的是为了增长活跃用户,可以做的地方有很多,比如增加获新、增加内容、增加用户关注话题数、增加用户关注人数等等。一个经验丰富的老司机可以快糙猛的大概估算一下各个方面的机会有多大,大致的实施难度如何,风险是大是小,产品哪些方面是有缺陷可以改进的。

    另一方面,是人就会犯错,最大的区别在于有的人可以很好的纠错,而有的人则需要别人提醒,还有的人即使别人提醒了也反应不过来。

    【4】数据和产品之间互相转化的能力

    在互联网行业,多数时候问题是很不清晰的,比如说问题可能是2017年新用户留存远差于2015年的用户,如何解决?

    对数据分析师来说,并不会有一个详细的单子来告诉你都有哪些步骤,而是需要自己灵活处理。

    一方面这些问题本身就比较新,虽然会有一个大致的套路,比如 AARRR 模型,解决增长需要先解决留存等等;然而再往下具体的时候,套路就没有那么固定了,因为不同的产品之间可以差别很大。

    即使像是 Quora 和知乎这样理应非常类似的产品,也可能因为一些或大或小的差异,导致给分析数据也带来差别。

    比如 Quora 的 upvote 并不完全代表赞同,而更多带有传播的意味。

    而对于知乎来说,点赞即是赞同,传播只是副产品而已。

    如果只懂数据不懂产品的话,很容易进入一个误区,要么产品/业务方追着问数据,要么没活儿干。

    【5】分析思维的广度、深度和速度

    速度这个比较好理解,尤其是在互联网行业,讲究快糙猛,没有时间精细打磨。

    比如一个项目可以花两个月时间做出 95%,也可以花两周时间做 80%,那么多数时候都会是后者。

    广度:产品的各个方面之间总是互相牵扯的。最简单的例子,如果知乎的拉新做得非常好,那么留存就有可能降低,用户活跃度也有会降低。

    如何分析各者之间的关系,如何保持一个合理的平衡,如何增加其中一个不过于负面影响其它,这些数据分析都需要在广度上有一定的了解。

    深度:有些问题一个人解决不了或者很难,多几个人就可以了,比如说搬砖,十人人搬总会比一个人搬快得多,哪怕不是十倍速度。而有些问题,靠堆人力是没用的。

    【6】数理统计的能力

    这一部分跟 1,3,5 是相关的。不一定需要特别高精尖,但是对于分析问题会有很大的帮助。比如说如何识别数据分析里可能出现的错误。

    【7】沟通的能力

    除非兼任软件工程师和产品经理的职,否则数据分析师总是需要通过说服产品和工程方面来改变产品,产生影响力。

    有了好的结果是第一位,如何影响合作伙伴,让他们接受自己的建议甚至比有好的结果还重要。

    毕竟,没有声音,再好的戏也出不来。

    【8】辅导新人的能力

    毛主席说过,人多力量大,要把敌人淹没在人民战争的汪洋大海中。

    辅导新人,不只是团队 leader/manager 的要求,对于独立贡献者(inpidual contributor)也是一样重要的。

    闻道有先后,术业有专攻。

    一个人的力量终究是有限的,如果把自己的能力复制到整个团队甚至整个公司,是增大自己影响力最有效的办法之一。

    【9】面试把关的能力

    大多数人应该都希望自己的公司处于一个增长的状况,如果是高速增长那就更好不过了。

    有增长,就必然要招人。

    而招人并不是简单的招人来干活,而是招来更优秀的人进一步提高团队的水平。

    这对于高速增长的团队来说是一个很大的挑战,所以提高面试技能和精准的判断面试者的能力,无疑是有效的扩张团队的不二法则。

    【10】少睡的能力

    比如说七周不睡觉,快速成为数据分析师(开玩笑的)。

  • ?

    中国大数据行业就业现状

    Jerry

    展开

    大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    大数据5V特性:

    ——Volume(大量)

    ——Velocity(高速)

    ——Variety(多样)

    ——Value(低价值密度)

    ——Veracity(真实性)

    大数据的就业前景?

    近年来大数据迅速发展,成为工业界,学术界,甚至世界各地政府,高度关注的热点。大数据领域正面临全球性的“人才荒”。而在国内,根据数联寻英发布《大数据人才报告》,目前全国的大数据人才仅46万,3-5年内大数据人才的缺口将高达150万。

    对数据的占有和控制,将成为国家间和企业间新的争夺焦点。大数据正在成为继云计算之后的新的热词,大数据时代已然来临,大数据背后,隐匿着巨大的商机。包括IBM,微软,谷歌,亚马逊等一大批知名企业纷纷掘金这一市场。

    中国商业联合会数据分析专业委员会统计,未来中国基础性数据分析人才缺口将达到1400万,而在BAT企业招聘的职位里,60%以上都在招大数据人才。

    职位技能需求

    1.学历需求现状:大专最多,本科次之

    2.工作经验需求现状:半数企业经验不限

    从工作经验来看,69.1%的企业对求职者的要求是经验不限,这很大一部分说明的人才的稀缺,这对于应届大学生而言,无疑是一大机遇,因为企业对于工作经验要求的低,而应届大学生只需要通过培训就能掌握该岗位应有的技能,就能轻松上岗拿高薪,这也充分说明当下学习大数据绝对是千载难逢的黄金时间点。

    不管你是谁,学历如何,只要技术好,你就是老大!!!

    大数据就业薪资

    1. Hadoop大数据开发方向

    据了解Hadoop开发工程师入门薪资已经达到了 8K 以上,工作1年可达到 1.2W 以上,具有2-3年工作经验的hadoop开发工程师年薪可以达到 30万—50万,一般需要大数据开发的公司基本上都是大公司,Hadoop开发工程师是目前BAT企业、大数据公司最急需的人才,所以学习大数据专业也是进大公司的捷径!

    2. 数据挖掘、数据分析&机器学习方向

    机器学习职位薪水范围:12k--30K,最大值30k+若干股票,最小值12k+若干期权,上四分位25k,中位数18k,下四分位13k;数据挖掘薪水范围:12k--30K,最大值30k+若干股票,最小值12k,上四分位23k,中位数18k,下四分位14k。

    ★北京大数据开发平均工资: 30230/月。

    1、基础人才-数据分析师

    北京数据分析平均工资: 10630/月,取自 15526 份样本,较 2016 年,增长 9.4%。

    2、大数据开发工程师

    北京大数据开发平均工资: 30230/月。

    3、Hadoop开发工程师

    北京hadoop平均工资: 20130/月,取自 1734 份样本。

    4、数据挖掘工程师

    北京数据挖掘平均工资: 21740/月,取自 3449 份样本,较 2016 年,增长 20.3%;

    5、算法工程师

    北京算法工程师平均工资: 22640/月,取自 10176 份样本。

  • ?

    专访|17年数据分析经验告诉你大数据行业的门道

    酆白梅

    展开

    本文根据具有十七年数据分析行业经验的嘉宾陈晨的纪实采访整理。

    本期专访嘉宾:陈晨

    简历:现任电通安吉斯 – 美库尔(DAN – Merkle) 中国(上海/南京) 数据与分析部高级总监,兼任Merkle南京公司总负责人。十七年以上美国、加拿大及中国咨询业及行业领先公司数据营销、风险分析、定量模型,客户关系管理策略的经验,拥有市场营销、定量方法 、经济计量和统计学方面坚实基础,和建立银行/金融/零售业营销模型和信用评分模型的丰富项目背景。

    Q:如果企业想要挖掘数据价值,但由于种种原因,导致数据本身维度不完备,或缺失较多等情况。您能利用多年项目经验,跟我们分享一下这类企业应该怎样有效利用数据吗?

    陈晨:对于广告营销而言,有用的数据维度是越多越好。即使企业自身CRM做得非常完备,有了其他数据源的补充,对于理解现有客户群体,如何进行下一步营销活动的准备都是非常有好处的。

    事实上,没有任何一家数据提供商能够满足品牌所有的营销信息需求,品牌需要的是因地制宜地购买、结合与其最相关的高质量数据内容。Merkle可以利用其购买力和强大的合作伙伴网络,帮助品牌在全球范围内找到需要的数据,再结合数据整合和落地效果分析,为客户创造了战略优势。

    按照Merkle常用的用户生命周期来说,我们把用户的生命周期分成接触潜在用户(获客阶段)、老客维护(互动阶段)及留存分析(促使回购阶段)。在获客阶段,Merkle可以结合其他数据来源,丰富数据维度。比如我们在为某知名在线英语教育品牌服务中,由于客户本身数据不足以支撑建模,我们就利用运营商数据和某知名科技公司数据为客户做了数据增强,用户画像及建模准确度都提高了不少。

    而且和运营商数据做对接有个好处,运营商天然有接触消费者的渠道,所以这个项目的第二阶段,我们会应用模型挑选最有可能转化的消费者,通过发短信、弹窗的形式,在合适的触点做营销活动。

    如果是在互动阶段,数据维度越多,我们越能基于用户行为/状态对用户分群,实现个性化交互。举例来说,我们曾为NBA提供了Loyalty Plus平台解决方案,帮助客户打造出“NBA球迷圈“。”球迷圈”是Merkle通过收集、清洗和整合多个数据源的顾客数据,确立会员策略,为NBA中国建立的客户忠诚度系统,从而可以基于球迷的行为和状态建立球迷分群,个性化地实施与球迷的有效交互。

    目前该忠诚度系统已有超过60万球迷注册,活跃用户达到64%,收集到的会员交互数据将用于客户分群和定制化的服务,实现营销上升闭环的效果。对于留存分析而言,更多的做竞品分析,了解用户为何流失。

    在用户生命周期的不同时段,不同对应策略

    Q:什么情况下公司会考虑利用数据分析/模型来做优化,具体怎么操作,落地效果又是如何评估的呢?

    陈晨:从根本来说,数据分析/建模/统计等都是用来更科学的衡量数据资产的一些方法。就我的角度来讲,只要有数据,有余力,都可以尝试从数据中感知用户,提升营销效果。

    我们姑且把公司分为两类,一类是注重用户增长型的企业,一类是注重客户维系的企业,当然这个划分不是很严格的,许多企业是两者并重的。注重用户增长意味着获客,获客没有哪个企业是不需要的,但是随着互联网的兴起,数据的兴起,获客在具体做法上有了很大的改变。

    互联网刚兴起的时候,大家会发现网上获客又简单又便宜,比如在搜索引擎上投一投付费广告,或者做做SEO,效果很显著。

    现在呢?网上的流量越来越贵,对于某些特定行业,比如汽车或者教育,一个销售线索的成本达到了几十甚至到几百人民币,所以如何在当下环境找到有效、便宜的方法来接触到更多的潜在消费者对企业来说是很重要的。

    我们现在的做法是帮助客户量身打造一个精准获客的策略和完整的CRM(CustomerRelationship Marketing客户关系营销)解决方案。

    首先了解到客户现有的获客流程,基于行业和客户自身特点提出解决方案,落地之后还可以通过与历史数据对比来看效果如何,在这个过程中我们又学习到什么,再去调整具体的操作或者实施步骤,形成闭环优化的结果。以某著名电脑品牌客户为例,原来的获客方法就是做线上线下活动,网上购买一些用户资源,但是我们可以帮他做细,我们可以通过模型来挑选出对品牌感兴趣的人群,在此基础上再做活动,省钱省力。

    之后在转化阶段,原先客户的方法就是通过电话中心接触,或者直销的形式,我们可以丰富这些手段,比如可以结合数据来核实用户的真实意图和具体需求,在接触到的时候做到个性化推荐;或者可以用模型对这些用户做分群,之后再促进转化,都是非常好的方法。

    Merkle CRM解决方案流程图

    对于注重客户维系的企业,我们可以帮助企业建立用户价值和生命周期的体系。用户价值的主要目标是作为投资标准,而对用户的投资有多种形式:比如为高价值用户提供更频繁、便利的服务;在营销活动中为不同用户提供定制化的接触策略等。

    我们在确定用户价值时会考虑很多因素,比如考虑到任期,流失,风险,营销和服务成本,交易历史以及预期的未来盈利能力和收入。而且用户价值会随着其生命周期的改变而改变,这是一个动态的过程,完全可以在这种变化中放大营销效果和增加决策正确性。还是举电脑行业的例子,我们可以结合用户历史购买/保修/网上浏览等行为,给每一个用户一个生命周期所在阶段,然后在合适的时间点接触到用户。

    Q:能否给志在从事大数据行业的年轻人一些您的意见?

    陈晨:我觉得从事大数据行业首先要可以沉得下心来,必须能够掌握一两种常用的数据分析工具,比如R,Python等,能够进行一定程度的编程,这样才能对数据理解和分析有一个直观的学习深入过程,也可以训练新人的数学和逻辑思维能力。

    当然这是进入行业的基本前提。然后是要有一定的统计学基础和商业分析能力,能够迅速地从数据分析的结果中得出对商业运用或其他相关专业领域的洞察和应用方向。简单地说不是把模型跑出来,图表画出来就完事儿了,还需要能够从模型结果和数据可视化呈现中推断总结出后面真正的故事和意义。

    在这些基本的能力和技能掌握后,要保持持续学习的心态,不断追随和了解行业最新动态和趋势,并能够横向进行多产业方向的融汇贯通。另外,大数据分析专业往往需要和不同部门,不同类型的客户进行沟通、讲解,所以如果在职业生涯的后端需要保持持续发展的竞争力,能用专业和非专业的语言和不同层次背景的合作方进行有效沟通也是必不可少的技能。

    这次的访谈到此结束,谢谢陈晨分享关于数据整合/增强、数据分析和建模的一些项目经验。

    End.

  • ?

    大数据行业分析报告

    应怜梦

    展开

    一、大数据产业概述

    1. 大数据的认识

    大数据是新资源、新技术和新理念的混合体。从资源视角来看,大数据是新资源,体现了一种全新的资源观。1990年以来,在摩尔定律的推动下,计算存储和传输数据的能力在以指数速度增长,每GB存储器的价格每年下降40%。

    2000年以来,Hadoop为代表的分布式存储和计算技术迅猛发展,极大的提升了互联网企业数据管理能力,互联网企业对“数据废气”(Data Exhaust)的挖掘利用大获成功,引发全社会开始重新审视“数据”的价值,开始把数据当作一种独特的战略资源对待。大数据的所谓3V特征(体量大、结构多样、产生处理速度快)主要是从这个角度描述的。

    从技术视角看,大数据代表了新一代数据管理与分析技术。传统的数据管理与分析技术以结构化数据为管理对象、在小数据集上进行分析、以集中式架构为主,成本高昂。

    与“贵族化”的数据分析技术相比,源于互联网的,面向多源异构数据、在超大规模数据集(PB量级)上进行分析、以分布式架构为主的新一代数据管理技术,与开源软件潮流叠加,在大幅提高处理效率的同时(数据分析从T+1到T+0甚至实时),成百倍的降低了数据应用成本。

    从理念的视角看,大数据打开了一种全新的思维角度。大数据的应用,赋予了“实事求是”新的内涵,其一是“数据驱动”,即经营管理决策可以自下而上地由数据来驱动,甚至像量化股票交易、实时竞价广告等场景中那样,可以由机器根据数据直接决策;

    其二是“数据闭环”,观察互联网行业大数据案例,它们往往能够构造起包括数据采集、建模分析、效果评估到反馈修正各个环节在内的完整“数据闭环”,从而能够不断地自我升级,螺旋上升。

    目前很多“大数据应用”,要么数据量不够大,要么并非必须使用新一代技术,但体现了数据驱动和数据闭环的思维,改进了生产管理效率,这是大数据思维理念应用的体现。

    2.大数据的产业体系

    大数据本身既能形成新兴产业,也能推动其他产业发展。当前,国内外缺乏对大数据产业的公认界定。我们认为,大数据产业可以从狭义和广义两个层次界定。

    从狭义看,当前全球围绕大数据采集、存储、管理和挖掘,正在逐渐形成了一个“小生态”,即大数据核心产业。大数据核心产业为全社会大数据应用提供数据资源、产品工具和应用服务,支撑各个领域的大数据应用,是大数据在各个领域应用的基石。应该注意到,狭义大数据产业仍然围绕信息的采集加工构建,属于信息产业的一部分。

    数据资源部分负责原始数据的供给和交换,根据数据来源的不同,可以细分为数据资源提供者和数据交易平台两种角色。数据基础能力部分负责与数据生产加工相关的基础设施和技术要素供应,根据数据加工和价值提升的生产流程,数据基础能力部分主要包括数据存储、数据处理和数据库(数据管理)等多个角色。

    数据分析/可视化部分负责数据隐含价值的挖掘、数据关联分析和可视化展现等,既包括传统意义上的BI、可视化和通用数据分析工具,也包括面向非结构化数据提供的语音、图像等媒体识别服务。

    数据应用部分根据数据分析和加工的结果,面向电商、金融、交通、气象、安全等细分行业提供精准营销、信用评估、出行引导、信息防护等企业或公众服务。根据IDC、Wikibon等咨询机构预测,2016年,全球的大数据核心产业规模约为300亿美元。

    3.大数据的规模

    据中商产业研究院数据,我国大数据行业市场规模增速明显,2015年中国大数据市场规模为115.9亿元,增速达53.10%。

    4.大数据产业图谱

    二、大数据的行业运用

    1.零售业领域

    具体来说,在零售企业,大数据分析的应用可以归纳为如下方面:在智慧的客户体验领域的全方位的顾客洞察、提升客户服务、基于位置的营销和服务以及精准营销;在智慧的商品管理和供应联网络领域的供应链优化和商品优化;在智慧的运营领域的财务管理、劳动力管理和防损 / 防偷盗管理。

    大数据驱动的快速响应系统是ZARA实现供应链神话的重要原因之一

    ZARA有一个全天候开放的“数据处理中心”。每一个零售网点都可以通过该系统追踪销售数据。此外,顾客的反馈也能在系统上反映出来,ZARA能够很快发现哪些款好卖,哪些款滞销。ZARA店内,柜台和店内各角落都装有摄影机,店经理随身带着PDA。

    当客人向店员反映诸如“这个衣领图案很漂亮”、“我不喜欢口袋的拉链”等意见时,店员通过ZARA内部全球资讯网络,每天至少两次传递资讯给总部设计人员,由总部汇总信息进行分析并作出决策后立刻传送到生产线,改变产品样式。

    微软Dynamics零售分销渠道管解决方案

    微软Dynamics零售渠道管理解决方案提供通过系统管理渠道的收发货信息的渠道进销存管理;收集各渠道经营的其他竞争对手产品信息的客户拜访管理;管理会员信息及购买习惯发会员管理;

    管理会员促销及积分兑换的促销管理;报表分析,提供数据报表支持,帮助企业分析会员购买行为,对下一步销售策略做预测工作。

    新零售解决方案提供商—— 小工蚁科技推出客户大数据平台

    小工蚁科技是一家互联网创业公司,专注新零售解决方案。小工蚁推出的客户大数据平台可帮助企业从各给历史遗留系统中将客户相关的数据抽取出来,然后建模分析,使用大数据分析引擎帮助快速将企业客户360°画像、针对客户个性化产品推荐、进行客户群体分析,将数据变成可视化工具平台;

    同时小工蚁也提供客户社区,帮助企业和客户建立强连接。帮助传统企业将客户相关数据和信息提炼出规律和价值的平台工具。

    2.电信领域

    电信行业掌握体量巨大的数据资源,单个运营商其手机用户每天产生的话单记录、信令数据、上网日志等数据就可达到PB级规模。电信行业利用IT技术采集数据改善网络运营、提供客户服务已有数十年的历史,而传统处理技术下运营商实际上只能用到其中百分之一左右的数据。

    大数据对于电信运营商而言,首先意味着利用廉价便捷的大数据技术提升其传统的数据处理能力,聚合更多的数据提升洞察能力。比如法国电信、T-Mobile借助大数据加快了诊断网络潜在问题的效率,改善服务水平,为客户提供了更好的体验,获得了更多的客户以及更高的业务增长。

    中国移动、德国电信、沃达丰利用大数据技术加大对历史数据的分析,动态优化调整网络资源配置,大幅提高无线网络的运行效率。T-Mobile通过集成数据综合分析客户流失原因,在一个季度内将客户流失率减半。SK电讯成立SK Planet公司专门处理与大数据相关的业务,通过分析客户的使用行为防止客户流失。

    中国联通利用大数据技术对其全国3G/4G用户进行精准画像,形成大量有价值的标签数据,为客户服务和市场营销提供了有力支持。中国移动通过对消费、通话、位置、浏览、使用和交往圈等数据的分析,利用各种联系记录发现各种圈子,分析影响力及关键人员,用来进行家庭客户、政企客户和关键客户的识别,以实现主动营销和客户维系。

    二是提高数据意识,寻求合适的商业模式,尝试数据价值的外部变现。主要有数据即服务(DaaS)和分析即服务(AaaS)两种模式,数据即服务模式往往通过开放数据或开放API的方式直接向外出售脱敏后的数据;

    分析即服务(AaaS)模式往往与第三方公司合作,利用脱敏后的(自身或整合外部)数据资源为政府、企业或行业客户提供通用信息、数据建模、策略分析等多种形式的信息和服务,以创造外部收益,实现数据资源变现。

    数据即服务方面,AT&T将客户在WiFi网络中的地理位置、网络浏览历史记录以及使用的应用等数据销售给广告公司可以获取客观收益;AT&T同时还提供Alert业务,当客户距离商家很近时,就有可能收到该商家提供的折扣很大的电子优惠券;

    英国电信基于安全数据分析服务Assure Analytics,帮助企业收集、管理和评估大数据集,将这些数据通过可视化的方式呈现给企业,帮助企业改进决策;

    德国电信和沃达丰主要尝试通过开放API,向数据挖掘公司等合作方提供部分用户匿名地理位置数据,以掌握人群出行规律,有效的与一些LBS应用服务对接。限于国内对数据交易流通方面缺乏明确规定,国内运营商很少尝试数据即服务(DaaS)模式。

    分析即服务方面,西班牙电信成立动态洞察部门Dynamic Insights开展大数据业务,与市场研究机构Gfk进行合作,在英国、巴西推出名为智慧足迹的创新产品,该产品基于完全匿名和聚合的移动网络数据,可对某个时段、某个地点人流量的关键影响因素进行分析,并将洞察结果面向政企客户提供;

    Verizon成立精准营销部门Precision Marketing Divisio,提供精准营销洞察、精准营销、移动商务等服务,包括联合第三方机构对其用户群进行大数据分析,再将有价值的信息提供给政府或企业获取额外价值;

    中国电信在大数据RTB精准广告业务(根据客户行为和位置分析进行商铺选址和实施营销)、景区流动人口监测业务、基于客户行为的中小微企业通用信用评价等方面均有尝试,且成效显著,借助对不同行业、不同类型企业的行为数据分析,中国电信的“贷 189”平台,一个月吸引中小企业580家,金融机构24家,订单成交3368万元。

    中国移动和中国联通也与第三方合作,开展智慧旅游、智能交通、智慧城市等项目,探索数据外部变现的新型商业模式,寻找新的业务增长点。

    3.金融领域

    消费金融中的运用

    天创为消费金融机构提供“数据+风控+场景”的完整解决方案。

    可靠的数据渠道保障了数据的真实性、连续性和稳定性。

    多角度贷后监控与风险预警

    基于大数据的反欺诈服务

    4.交通领域

    对于驾驶者来说,不想开车的时候,在大数据和人工智能的支持下,车辆可以自动驾驶,并且对于你经常开的线路可以自学习自优化。

    谷歌的自动驾驶汽车,为了对周围环境作出预测,每秒钟要收集差不多 1GB的数据,没有大数据的支持,自动驾驶是不可想象的;在和周围车辆过近的时候,会及时提醒车主避让;上下班的时候,会根据实时大数据情况,对于你经常开车的线路予以提醒,绕开拥堵点,帮你选择最合适的线路;

    在出现紧急状况的时候,比如爆胎,自动驾驶系统将自动接管,提高安全性(人一辈子可能难以碰到一次爆胎,但人在紧急时的反应往往是灾难性的,只会更糟);到城市中心,寻找车位是一件很麻烦的事情,但未来你可以到了商场门口后,让汽车自己去找停车位,等想要回程的时候,提前通知让汽车自己开过来接。

    车辆是城市最大最活跃的移动物体,是拥堵的来源,也是最大的污染来源之一。数字化的车辆、大数据应用将带来很多的改变。红绿灯可以自动优化,根据不同道路的拥堵情况自动进行调整,甚至在很多地方可以取消红绿灯;

    城市停车场也可以大幅度优化,根据大数据的情况优化城市停车位的设计,如果配合车辆的自动驾驶功能,停车场可以革命性演变,可以设计专门为自动驾驶车辆的停车楼,地下、地上楼层可以高达几十层,停车楼层可以更矮,只要能高于车高度即可(或者把车竖起来停),这样将对城市规划产生巨大的影响;

    在出现紧急情况,如前方塌方的时候,可以第一时间通知周围车辆(尤其是开往塌方道路的车辆);现在的燃油税也可以发生革命性变化,可以真正根据车辆的行驶路程,甚至根据汽车的排污量来收费,排污量少的车甚至可以搞碳交易,卖排放量卖给高油耗的车;政府还可以每年公布各类车型的实际排污量、税款、安全性等指标,鼓励民众买更节能、更安全的车。

    三、大数据运用安全实践

    1.国内企业的方案

    京东大数据安全实践

    数据资源已经成为一种基础战略资源,数据的共享和流通会产生巨大价值。然而,数据资源在流通过程中却面临着诸多瓶颈和制约,尤其是当数据一种特殊的数字内容产品时,其权益保护难度远大于传统的大数据,一旦发生侵权问题,举证和追责过程都十分困难。

    为了解决这些问题,京东万象数据服务平台(如图B-6所示)利用区块链技术对流通的数据进行确权溯源,数据买家在数据服务平台上购买的每一笔交易信息都会在区块链中存储起来。

    数据买家通过获得交易凭证可以看到该笔交易的数字证书以及该笔交易信息在区块链中的存储地址,待买家需要进行数据确权时,登录用户中心进入查询平台,输入交易凭证中的相关信息,查询到存储在区块链中的该笔交易信息,从而完成交易数据的溯源确权。

    京东万象数据服务平台主要通过数据交易平台和区块链溯源平台2个核心模块提供服务:

    数据交易平台。平台通过数据搜索、数据展示、数据评论等服务,以各种维度展示数据商品,并提供订单和支付系统完成用户数据交易;

    区块链溯源平台。用户订单信息、数据标识、交易私钥等交易信息存入区块链集群中,用户获得交易凭证,并可利用该溯源平台查询溯...

  • ?

    数据分析师的就业方向,一位过来人的职业规划告诉你!

    丢掉

    展开

    随着大数据时代的到来,各个行业对数据价值越来越重视,他别是近两年,数据分析师岗位的需求激增,数据分析师已成为当今最具发展潜力的职业,人才缺口达到150万,在生活中很多想转行数据分析师培训的从业人员纷纷报名数据分析师培训机构,来增强自己的技能因此转行高薪行业。那么数据分析师的就业方向是什么,一位过来人的职业规划之路告诉你!

    大数据时代

    数据分析师作为一个出现时间不长的工种,大数据时代下,成为螺丝钉还是成为龙头,需要尝试新的可能。

    数据分析师的职业规划

    数据分析师手中拥有一座宝藏。作为滴滴出行数据分析团队的负责人,刘普成发现了数据分析师通往卓越的秘诀:视野。数据分析提供了这样一种可能:它不是简单的技术工种,它是最具有潜力的一项工作,背后蕴藏着相当多的机会。刘普成是中国最懂互联网数据分析的人之一。北大ccer硕士出身,做过公务员,这位业界资深的大牛,曾先后任职于百度、豆瓣、豌豆荚,对产品、设计、运营等互联网业务有着深刻的理解。现在,他担任滴滴出行数据分析团队的负责人,统筹这家体量巨大的公司随时产生的海量数据。作为一个成长经历颇为不同的资深大牛,他认为,推动一个人进步的本质原因是开放的心态和兴趣。硕士毕业后,他没有像大多数同学那样出国读博,或顺理成章进入金融业,而是选择在中国互联网界进行数据方面的探索,寻找一些“新”的东西。随着专业能力的提升,又开始深入学习互联网行业的其他技能,拓展自己的知识领域。

    在八年时间,从一名普通的数据分析师,成长为精通技术和业务的数据科学家,刘普成发现,数据分析师在不同阶段需要掌握不同的能力,本质上,是让自己的视野更开阔。

    数据分析师

    数据分析师不能只成为一个技术专家,要成为可以影响公司运作的人。结合自身经历,刘普成认为数据分析师在进阶的道路上有如下选择:

    1、成为数据技能超强的产品经理

    2、成为数据指导业务的运营VP

    3、成为管理或战略

    4、成为博学广识的数据科学家

    而关于数据分析师的职业规划,小编认为主要是从两个方面表现,一个方向是偏文一些(即运营分析),另一个方向则偏理一些(即挖掘分析)。不管是文的还是理的,可能你都需要掌握一些入行的行规,例如Excel技能、数据库操作(MySQL/SQL Server/Oracal/Hive等)、Tableau可视化、R或Python的编程能力等。这些都是用人单位在招聘数据分析师时提到最多的“任职资格”,其实这也都是技能门槛。如果这些你还没有接触过,可以在准备入行前花3~6个月去充充电,可以选择闭关修炼、或观看学习视频、甚至可以挑选口碑比较好的数据分析师培训班。而不管是数据运营分析师和数据挖掘工程师,它们在企业中都属于技术岗。根据工作人员的能力,会匹配相应的段位,一般来说,较高的技术段位,也可以对标到相应的管理岗。最后,就看你希望往哪个方向去发展,然后在这个方向上去努力,如果顺利的话你可以成为高级总监。

    以上有关数据分析师的就业方向,一位过来人的职业规划之路告诉你的内容介绍,到这里就结束了,更多数据分析师相关信息可关注容大教育。

  • ?

    什么叫大数据分析

    傲霜

    展开

    大数据行业发展如火如荼,国家政策利好,互联网大佬纷纷在大数据行业布局,我们想让自己的职业生涯在一个朝阳行业发展,肯定又要学习相关技术,让自己与时俱进,但是难就难在大数据是一个新兴事物,目前我国大学的专业里面还鲜少有这个专业,国家刚批的大数据专业,全国目前35个高校,但是从17年开始招生,2021年才有第一批毕业生进入职场,在四年期间,是大数据行业发展的飞速时期,没有行业发展是等着人才进入的,而是需要要虚位以待、蓄势待发,所以在没有高等教育准备好的大数据教育,如何高效的学习大数据,如何快速的与行业发展想契合,那么需要我们成为第一个吃螃蟹的人,作为一个随着大数据行业成长的职业人,首先要知道大数据是个啥?

    大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    那来帮大家分析下:如何高效的学习大数据。

    经常有初学者会问,自己想往大数据方向发展,该学哪些技术,学习路线是什么样的,觉得大数据很火,就业很好,薪资很高……首先,如果你确定了想往这个方面发展,先考虑自己的过去从业经历、专业、兴趣是什么。计算机专业——操作系统、硬件、网络、服务器?软件专业——软件开发、编程、写代码?还是数学、统计学专业——对数据和数字特别感兴趣?

    那么你能找师傅带吗?

    但凡有这种想法的人,或多或少都会存有侥幸之心,或者叫做“天真,单纯”。希望不花一分钱,就能更快速的学到更优质,更实用的技能。

    关于这一点,我只想反问一句你:“如果你是大师,你凭什么愿意带我?”

    其实这就是想告诉你大数据的三个发展方向,平台搭建/优化/运维/监控、大数据开发/设计/架构、数据分析/挖掘。

    先说一下大数据的4V特征:

    数据量大,TB->PB

    数据类型繁多,结构化、非结构化文本、日志、视频、图片、地理位置等;

    商业价值高,但是这种价值需要在海量数据之上,通过数据分析与机器学习更快速的挖掘出来;

    处理时效性高,海量数据的处理需求不再局限在离线计算当中。

    现如今,正式为了应对大数据的这几个特点,开源的大数据框架越来越多,越来越强,先列举一些常见的:

    文件存储:Hadoop HDFS、Tachyon、KFS

    离线计算:Hadoop MapReduce、Spark

    流式、实时计算:Storm、Spark Streaming、S4、Heron

    K-V、NOSQL数据库:HBase、Redis、MongoDB

    资源管理:YARN、Mesos

    日志收集:Flume、Scribe、Logstash、Kibana

    消息系统:Kafka、StormMQ、ZeroMQ、RabbitMQ

    查询分析:Hive、Impala、Pig、Presto、Phoenix、SparkSQL、Drill、Flink、Kylin、Druid

    分布式协调服务:Zookeeper

    集群管理与监控:Ambari、Ganglia、Nagios、Cloudera Manager

    数据挖掘、机器学习:Mahout、Spark MLLib

    数据同步:Sqoop

    任务调度:Oozie

    ······

    第一步:初识Hadoop

    1.1 学会百度与Google

    不论遇到什么问题,先试试搜索并自己解决。

    Google首选,翻不过去的,就用百度吧。

    1.2 参考资料首选官方文档

    特别是对于入门来说,官方文档永远是首选文档。

    相信搞这块的大多是文化人,英文凑合就行,实在看不下去的,请参考第一步。

    1.3 先让Hadoop跑起来

    Hadoop可以算是大数据存储和计算的开山鼻祖,现在大多开源的大数据框架都依赖Hadoop或者与它能很好的兼容。

    关于Hadoop,你至少需要搞清楚以下是什么:

    · Hadoop 1.0、Hadoop 2.0

    · MapReduce、HDFS

    · NameNode、DataNode

    · JobTracker、TaskTracker

    · Yarn、ResourceManager、NodeManager

    自己搭建Hadoop,请使用第一步和第二步,能让它跑起来就行。

    建议先使用安装包命令行安装,不要使用管理工具安装。

    另外:Hadoop1.0知道它就行了,现在都用Hadoop 2.0.

    1.4 尝试使用Hadoop

    · HDFS目录操作命令;

    · 上传、下载文件命令;

    · 提交运行MapReduce示例程序;

    · 打开Hadoop WEB界面,查看Job运行状态,查看Job运行日志。

    · 知道Hadoop的系统日志在哪里。

    1.5了解它们的原理

    MapReduce:如何分而治之;

    HDFS:数据到底在哪里,什么是副本;

    Yarn到底是什么,它能干什么;

    NameNode到底在干些什么;

    ResourceManager到底在干些什么;

    1.6 自己写一个MapReduce程序

    仿照WordCount例子,自己写一个(照抄也行)WordCount程序,

    打包并提交到Hadoop运行。

    不会Java的话,Shell、Python都可以,有个东西叫Hadoop Streaming。

    如果能认真完成了以上几步,恭喜你,你的一只脚已经进来了。

    第二步:更高效的WordCount

    2.1 学点SQL吧

    如果不懂数据库的童鞋先学习使用SQL句。

    2.2 SQL版WordCount

    在1.6中,你写(或者抄)的WordCount一共有几行代码?

    如果用SQL的话:

    SELECT word,COUNT(1) FROM wordcount GROUP BY word;

    这便是SQL的魅力,编程需要几十行,甚至上百行代码,SQL一句就搞定;使用SQL处理分析Hadoop上的数据,方便、高效、易上手、更是趋势。不论是离线计算还是实时计算,越来越多的大数据处理框架都在积极提供SQL接口。

    2.3 安装配置Hive

    Hive算是数据仓库工具,安装不难,网上有很多教程,配置完成后,可以正常进入Hive命令行。

    2.4 试试使用Hive

    尝试在Hive中创建wordcount表,并运行2.2中的SQL语句。在Hadoop WEB界面中找到刚才运行的SQL任务。看SQL查询结果是否和1.4中MapReduce中的结果一致。

    明明写的是SQL,为什么Hadoop WEB界面中看到的是MapReduce任务?

    2.5 学会Hive的基本命令

    创建、删除表;加载数据到表;下载Hive表的数据;并学习更多关于Hive的语法和命令。

    0和Hadoop2.0的区别

    MapReduce的原理(还是那个经典的题目,一个10G大小的文件,给定1G大小的内存,如何使用Java程序统计出现次数最多的10个单词及次数);

    HDFS读写数据的流程;向HDFS中PUT数据;从HDFS中下载数据;

    自己会写简单的MapReduce程序,运行出现问题,知道在哪里查看日志;

    会写简单的SELECT、WHERE、GROUP BY等SQL语句;

    Hive SQL转换成MapReduce的大致流程;

    Hive中常见的语句:创建表、删除表、往表中加载数据、分区、将表中数据下载到本地;

    从上面的学习,你已经了解到,HDFS是Hadoop提供的分布式存储框架,它可以用来存储海量数据,MapReduce是Hadoop提供的分布式计算框架,它可以用来统计和分析HDFS上的海量数据,而Hive则是SQL On Hadoop,Hive提供了SQL接口,开发人员只需要编写简单易上手的SQL语句,Hive负责把SQL翻译成MapReduce,提交运行。

    第三步:把别处的数据搞到Hadoop上

    此处也可以叫做数据采集,把各个数据源的数据采集到Hadoop上。

    3.1 HDFS PUT命令

    put命令在实际环境中也比较常用,通常配合shell、python等脚本语言来使用。建议需熟练掌握。

    3.2 HDFS API

    HDFS提供了写数据的API,自己用编程语言将数据写入HDFS,put命令本身也是使用API。

    实际环境中一般自己较少编写程序使用API来写数据到HDFS,通常都是使用其他框架封装好的方法。比如:Hive中的INSERT语句,Spark中的saveAsTextfile等。

    可以尝试了解原理,试着写几个Demo。

    3.3 Sqoop

    Sqoop是一个主要用于Hadoop/Hive与传统关系型数据库Oracle/MySQL/SQLServer等之间进行数据交换的开源框架。

    就像Hive把SQL翻译成MapReduce一样,Sqoop把你指定的参数翻译成MapReduce,提交到Hadoop运行,完成Hadoop与其他数据库之间的数据交换。

    自己下载和配置Sqoop(建议先使用Sqoop1,Sqoop2比较复杂)。

    了解Sqoop常用的配置参数和方法。

    使用Sqoop完成从MySQL同步数据到HDFS;

    使用Sqoop完成从MySQL同步数据到Hive表;

    PS:如果后续选型确定使用Sqoop作为数据交换工具,那么建议熟练掌握,否则,了解和会用Demo即可。

    3.4 Flume

    Flume是一个分布式的海量日志采集和传输框架,因为“采集和传输框架”,所以它并不适合关系型数据库的数据采集和传输。Flume可以实时的从网络协议、消息系统、文件系统采集日志,并传输到HDFS上。因此,如果你的业务有这些数据源的数据,并且需要实时的采集,那么就应该考虑使用Flume。

    下载和配置Flume。使用Flume监控一个不断追加数据的文件,并将数据传输到HDFS;

    PS:Flume的配置和使用较为复杂,如果你没有足够的兴趣和耐心,可以先跳过Flume。

    3.5 阿里开源的DataX

    之所以介绍这个,是因为以前某公司客户目前使用的Hadoop与关系型数据库数据交换的工具,就是之前基于DataX开发的,个人感觉非常好用。现在DataX已经是3.0版本,支持很多数据源。你也可以在其之上做二次开发。

    PS:有兴趣的可以研究和使用一下,对比一下它与Sqoop。

    至此,你的“大数据平台”应该是这样的:

    第四步:把Hadoop上的数据搞到别处去

    前面介绍了如何把数据源的数据采集到Hadoop上,数据到Hadoop上之后,便可以使用Hive和MapReduce进行分析了。那么接下来的问题是,分析完的结果如何从Hadoop上同步到其他系统和应用中去呢?

    其实此处的方法和第三步基本一致的。

    4.1 HDFS GET命令

    把HDFS上的文件GET到本地。需要熟练掌握。

    4.2 HDFS API

    原理同3.2。

    4.3 Sqoop

    原理同3.3。

    使用Sqoop完成将HDFS上的文件同步到MySQL;

    使用Sqoop完成将Hive表中的数据同步到MySQL;

    4.4 DataX

    原理同3.4

    此时,“你的大数据平台”应该是这样的:

    走完第三步和第四步的流程,那么你应该已经具备以下技能和知识点:

    · 知道如何把已有的数据采集到HDFS上,包括离线采集和实时采集;

    · 知道sqoop(或者还有DataX)是HDFS和其他数据源之间的数据交换工具;

    · 知道flume可以用作实时的日志采集;

    至此,对于大数据平台,应该已经掌握如何搭建Hadoop集群,把数据采集到Hadoop上,使用Hive和MapReduce来分析数据,把分析结果同步到其他数据源。

    接下来的问题就是,Hive使用的越来越多,你会发现很多不愉快的地方,特别是速度慢,

    大多情况下,明明我的数据量很小,它都要申请资源,启动MapReduce来执行。

    第五步:快一点吧,我的SQL

    其实大家都已经发现Hive后台使用MapReduce作为执行引擎,实在是有点慢。因此SQL On Hadoop的框架越来越多,按我的了解,最常用的按照流行度依次为SparkSQL、Impala和Presto.这三种框架基于半内存或者全内存,提供了SQL接口来快速查询分析Hadoop上的数据。

    目前我们的方案使用的是SparkSQL,至于为什么用SparkSQL,原因大概如下:

    · 使用Spark还做了其他事情,不想引入过多的框架;

    · Impala对内存的需求太大,没有过多资源部署;

    5.1 关于Spark和SparkSQL

    什么是Spark,什么是SparkSQL。

    Spark有的核心概念及名词解释。

    SparkSQL和Spark是什么关系,SparkSQL和Hive是什么关系。

    5.2 如何部署和运行SparkSQL

    Spark有哪些部署模式?

    如何在Yarn上运行SparkSQL?

    使用SparkSQL查询Hive中的表。

    PS:Spark不是一门短时间内就能掌握的技术,因此建议在了解了Spark之后,可以先从SparkSQL入手,循序渐进。

    第六步:一夫多妻制

    其实我想说的是数据的一次采集、多次消费。

    在实际业务场景下,特别是对于一些监控日志,想即时的从日志中了解一些指标(关于实时计算,后面步节会有介绍),这时候,从HDFS上分析就太慢了,尽管是通过Flume采集的,但Flume也不能间隔很短就往HDFS上滚动文件,这样会导致小文件特别多。

    为了满足数据的一次采集、多次消费的需求,这里要说的便是Kafka。

    6.1 关于Kafka

    Kafka是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模的网站中的所有动作流数据。这种动作(网页浏览,搜索和其他用户的行动)是在现代网络上的许多社会功能的一个关键因素。这些数据通常是由于吞吐量的要求而通过处理日志和日志聚合来解决。

    6.2 如何部署和使用Kafka

    使用单机部署Kafka,并成功运行自带的生产者和消费者例子。

    使用Java程序自己编写并运行生产者和消费者程序。

    Flume和Kafka的集成,使用Flume监控日志,并将日志数据实时发送至Kafka。

    至此,“大数据平台”应该扩充成这样:

    这时,使用Flume采集的数据,不是直接到HDFS上,而是先到Kafka,Kafka中的数据可以由多个消费者同时消费,其中一个消费者,就是将数据同步到HDFS。

    总结:

    为什么Spark比MapReduce快。

    使用SparkSQL代替Hive,更快的运行SQL。

    使用Kafka完成数据的一次收集,多次消费架构。

    自己可以写程序完成Kafka的生产者和消费者。

    前面的学习已经掌握了大数据平台中的数据采集、数据存储和计算、数据交换等大部分技能,而这其中的每一步,都需要一个任务(程序)来完成,各个任务...

  • ?

    数据分析、数据科学、ML应用在哪些行业?

    寄翠

    展开

    【IT168 资讯】客户关系管理/消费者分析,金融和银行仍然是领先的应用,但医疗保健和欺诈检测正在增长。反垃圾邮件、制造业和社交是2017年发展最快的行业,而石油/天然气/能源和社会网络分析则有所下降。

    2017年应用分析、数据科学、机器学习的行业/领域

    最受欢迎的前三名地区是相同的,与去年几乎相同。医疗保健工作没有进展,从第5位变成第4位,和欺诈检测从第7位上升到第5位。

    ·CRM /消费者分析,16.8%(2016年为16.3%)

    ·金融,15.2%(15.0%)

    ·银行业,14.1%(13.4%)

    ·卫生保健,13.2%(12.0%)

    ·欺诈检测,13.0%(11.1%)

    ▲数据科学和机器学习2016年和2017年的应用分析

    从图像中我们可以看到,与2016年相比,2017年的颜色绿色的增加,如果份额连续两年增加超过1%,则三角形呈现向上,如果2年以上减少超过1%则三角形向下,否则循环。

    与2016年调查相比:2016年数据挖掘和数据科学的应用分析,我们发现最大的增长量为

    ·垃圾邮件/反垃圾邮件,上升106%,从2016年的1.1%至2017年的2.2%

    ·制造业增长60%,从5.6%上升至9.0%

    ·社会公益/非营利,上升35%,从2.0%上升至2.7%

    ·教育,上涨33%,从7.1%上升至9.4%

    ·医疗/制药,增长31%,从6.5%上涨至8.5%

    ·供应链上涨31%,从6.5%上涨至8.5%

    ·人力资源/劳动力分析增长30%,从3.6%下降至4.7%

    申请份额下降幅度最大的行业/地区是

    ·移动应用下降了59%,从3.3%下降到1.3%

    ·投资/股票下跌45%,从6.2%下降至3.4%

    ·安全/反恐怖主义,下降42%,从2.7%下降至1.6%

    ·娱乐/音乐/电视/电影下降32%,从4.0%下降至2.7%

    ·电信/有线,下降30%,从8.3%下降至5.8%

    有意思的是,每个选民的平均行业/地区数量为2.7,与2016年相同,仅与2015年的2.65略有不同。也许在各行业中有效应用数据科学存在限制?

    在这次民意调查中,我们有446名参与者,而2016年申请人数为552人,2015年为350人。

    三年中大部分地区的应用份额比例相对稳定,而且应用程序的多样性也在增加。

    只有2个行业连续两年显示增长10%或以上:

    ·垃圾邮件/反垃圾邮件

    ·欺诈检测

    只有2个地区连续两年下降10%或更多:

    ·石油/天然气/能源

    ·社交媒体/社交网络

    区域分布与去年的调查类似,但与美国/加拿大和欧洲的份额几乎完全相同,亚洲份额较高,非洲/中东和拉丁美洲份额较低:

    ·美国/加拿大39%

    ·欧洲34%

    ·亚洲16%

    ·拉丁美洲5.2%

    ·非洲/中东3.1%

    ·澳大利亚/新西兰2.9%

  • ?

    大数据分析师现在的行业需求量非常大吗?

    世平

    展开

    你好,大数据分析师专业已经上线,但是很多人看见这个专业瞬间蒙圈!感觉真的是高难度的一个专业!但是,其实他就是相对于传统的数据更庞大,分析更精准,同时给企业高层提供精准决策。当然,这是一切都是有用工具来实现的。

    一、大数据分析师现在的行业需求量非常大吗?其实我也不知道。但是我用这组数据还说明:

    从20世纪90年代起,欧美国家开始大量培养数据分析师,直到现在,对数据分析师的需求仍然长盛不衰,而且还有扩展之势。

    根据美国劳工部预测,到2018年,数据分析师的需求量将增长20%。就算你不是数据分析师,但数据分析技能也是未来必不可少的工作技能之一。据数联寻英发布《大数据人才报告》显示,目前全国的大数据人才仅46万,未来3-5年内大数据人才的缺口将高达150万。

    目前,研发工程师、产品经理、人力资源、市场营销、运营和数据分析是当下中国互联网行业需求最旺盛的六类人才职位。其中研发工程师需求量最大,而数据分析人才最为稀缺。领英报告表明,数据分析人才的供给指数最低,仅为0.05,属于高度稀缺。数据分析人才跳槽速度也最快,平均跳槽速度为19.8个月。

    在数据分析行业发展成熟的国家,90%的市场决策和经营决策都是通过数据分析研究确定的。

    二、学完大数据分析师薪资到底有多少呢?

    有媒体报道,在美国,大数据分析师平均每年薪酬高达17.5万美元,而国内顶尖互联网公司,大数据分析师的薪酬可能要比同一个级别的其他职位高20%至30%,且颇受企业重视。

    国内某大型招聘平台给出的数据分析师平均薪酬为:9724(取自 1139份样本),且北京、上海、广州、深圳、杭州、南京、武汉、成都、长沙为大数据分析师需求量前十的城市。

    三、如何成为大数据分析师呢?

    相信很多人对大数据行业非常感兴趣。但是零基础的学生发愁,担心自己能不能学会这个专业。很多人会发愁这个问题。

    华信智原(南京)从事IT教育培训行业十余载,结合企业用人需求已经研发出专属零基础学员的定制课程,个性化培训。项目实训及演练+大数据行业专家级讲师授课,让你在短短数月的时间内成为一名合格的大数据分析师。而且学完保就业!薪资不低于6000元。名额有限,报名从速!!!

  • ?

    什么是数据分析?数据分析的作用是什么?

    掩埋

    展开

    1.什么是数据分析?

    数据分析的目的是把隐藏在一些看似杂乱无章的数据背后的信息提炼出来,总结出所研究对象的内在规律。在实际工作中,数据分析能够帮助管理者进行判断和决策,以便采取适当策略与行动。比如:企业的高管希望通过市场分析和研究,把握当前产品的市场动向,从而制定合理的产品研发和销售计划,这就必须依赖数据分析才能够完成。

    简单的说,就是对数据进行分析,比较专业的说法是,数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,未提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。以求最大化地开发数据的功能,发挥数据的作用。

    数据分析包含“数据”和“分析”两个方面一方面包括加工和整理数据,另一方面也包括分析数据,从中提取有价值的信息并形成对业务有帮助的结论。

    数据分析的成果通常以分析报告的形式呈现。对于数据分析报告,分析就是论点,数据就是论据,两者缺一不可。

    2.数据分析类别

    其中,探索性数据分析侧重于在数据中发现新的特征,而验证性数据分析则侧重于验证已有假设的真伪证明。

    数据分析的划分:描述性数据分析、探索性数据分析、验证性数据分析。

    1)描述性数据分析:属于初级数据分析,常见的分析方法有对比分析法、平均分析法、交叉分析法。

    2)探索性数据分析:侧重于再数据之中发现新的特征

    3)验证性数据分析:侧重于验证已有假设的真伪证明

    其中探索性数据分析和验证性数据分析属于高级数据分析,常见的分析方法有相关分析、因子分析、回归分析等等。

    3.数据分析的作用

    数据分析在日常企业运营中主要有三大作用:

    1.现状分析

    简单的说就是告诉你过去发生了什么。

    具体表现在:

    第一,告诉你企业现阶段的整体运营情况,通过各个经营指标的完成情况来衡量企业的运营状态,以说明企业整体运营是更好了还是坏了,好的程度是如何,坏的程度又到哪里。

    第二,告诉你企业各项业务的构成,让你了解企业各项业务的发展及变动情况,对企业经营状况有更深入的了解。

    现状分析一般通过日常通报来完成,如日报、周报、月报等形式。

    2.原因分析

    简单的说就是告诉你某一现状为什么发生。经过第一阶段的现状分析,我们对企业的运营情况有了一个基本的了解,但是不知道运营情况具体好在哪里,差在哪里,是什么原因引起的。这时候我们就需要开展原因分析,以进一步确定业务变动的具体原因。

    原因分析一般通过专题分析来完成,根据企业运营情况选择针对某一现状进行原因分析。

    3.预测分析

    简单来说就是告诉你将来会发生什么。

    在了解企业运营现状后,有时候还需要对企业未来发展趋势做出预测,为企业制定经营目标以及提供有效的策略参考与决策依据,以确保企业的可持续健康发展。

    预测分析一般通过专题分析来完成,通常在制定企业季度、年度等计划时进行,其开展的频率没有现状分析及原因分析高。

    什么时候开展什么样的数据分析,需要根据自身的需求及目的来确定。

    分享 IT 技术和行业经验,请关注-技术学派。

  • ?

    数据分析:哪个行业正兴旺,哪个行业已衰败

    Louise

    展开

    识大势而后伐谋,所以“识大势”是非常重要的,这对我们择业、跳槽影响深远。 为了给大家直观地展示当前哪些行业正走向兴旺,哪些行业已衰败没落 ,我分析了世界500强中的115家中国企业,它们分别来自金融、制造、电信等22个不同的行业,这些超级大企业通常都是各自所属行业中的巨头,从这些最具代表性的企业身上可以看到其行业的走向。

    1. 哪个行业入选500强的企业数量多?

    前五位分别为能源(23家)、金融(11家)、电子/电气设备(9家)、房地产(9家)和保险(8家)。好吧,中国不愧为发展中的人口大国, 源源不断的人口红利足以支撑一些毫无技术含量的企业发展壮大 。

    图1

    有人可能会质疑说,电子/电气设备行业的技术含量很高啊,那我把这9家企业列出来吧:鸿海精密(台湾)、正威国际、联想集团、和硕(台湾)、中国电子信息、台积电(台湾)、广达电脑(台湾)、中国电子科技、仁宝电脑(台湾)。 台湾企业占据超过半壁江山 。

    数据也同时印证了, “对基础技术缺乏研究”正是当今中国企业的最大问题 ,互联网企业更多地是关心模式的创新、用户体验的创新,在技术创新上还是一贯的依靠舶来品,很少中国互联网企业愿意在那些基础而又核心的技术上投入过多的精力,因为这些基础而又核心的东西往往需要长时间的技术积累,远不如模式创新在变现上来得快。但技术才是这个世界进步的根本,所有的模式创新、体验创新都只是依附在技术创新的基础之上, 如果中国互联网一直在技术创新上采取“拿来主义”,在用完中国的人口红利后就将迅速面临断崖式的崩溃。

    2. 哪个行业的平均营业收入最高?

    营收是衡量企业发展状况的最重要的指标。各行业平均营收前五名和后五名的情况如下:

    前五名:工程与建筑、网络/通讯设备、综合商业、金融、电信

    后五名:工业机械、船务、房地产、互联网服务、批发零售

    图2

    也许有些人会觉得很意外,为什么“互联网服务”的营收会排名倒数第二呢?这里面的企业都是赫赫有名的,京东、腾讯、阿里,哪个不是跺跺脚中国互联网就得震一震的主儿?而数据恰恰说明, 互联网当前还远不是中国的支柱经济,它虽然抢尽眼球,但还是实体经济在支撑着中国在前行 ,当前互联网的发展还处于画地为牢的阶段,虽然红红火火,但还远没有融入到庞大的实体经济中去。而我们的决策者在制定各种行业政策时是不是也可以适当考虑下传统经济的现状,包括它背负的责任和当前的困境。

    工程与建筑行业夺魁,网络/通讯设备夺得榜眼,说明中国仍处于基建大发展阶段,包括硬件的发展(铁路、公路、建筑)和软件的发展(网络、IT设备),所以,未来相当长一段时间内 ,“工程师”仍是非常紧缺的人才,包括建筑工程师和软件工程师。 当然,金融无论在哪个时代都是处于金字塔的最顶尖的,但这个行业情况有点复杂,后面我们结合其利润和增长情况来谈。

    2.1 哪个行业的营收增长率最高?

    营收增长率衡量的是行业的发展态势。前五和后五的情况如下——

    前五名:航空、船务、网络/通讯设备、金属产品、房地产

    后五名:电子/电气设备、贸易、物流、能源、金融

    图3

    航空和船务应该是受到“一带一路”的国家政策强烈刺激,在营收增长上表现良好。房地产行业的高增长率也印证“中国仍处于基础建设大发展阶段”的观点, 房子是无数中国人的终极追求 ,房地产行业在中国应该还能兴盛很久。

    电子/电气设备行业正在被云计算等新兴技术革命,所以其滞涨是正常现象;传统贸易被电子商务、海淘的狙击,估计很难缓得过气来;因为顺丰去年仍没进入500强,这里的物流只包括一个企业——邮政,所以其低速发展没有代表性,不符合当前行业现状;最让人吃惊的是金融行业竟然营收增长率倒数第一,难道金融行业在与支付宝、微信支付等新型金融工具的对抗中已经伤筋动骨?这不禁让人疑问, 金融业还有明天吗?

    3. 哪个行业的平均利润最高?

    利润是衡量一个企业可持续发展能力的关键指标。前五和后五的情况如下——

    前五名:金融、网络/通讯设备、物流、互联网服务、电信

    后五名:医药、航空、批发零售、金属产品、化学品

    图4

    好了,谈到利润的时候,终于回到我们熟悉的世界了。金融行业荣膺利润之王的称号,而阿里巴巴、腾讯、工商银行、中国移动、华为等今昔的王者都悉数回归,这说明一件事情:世界也许很复杂,但有人一直在默默赚钱。

    我们常常会有一种疑惑,像国外的亚马逊、国内的京东这些巨头,年年亏损,但丝毫不影响它们的市值一路攀升。其实原因很简单,它们代表未来的发展方向,它们有层出不穷的可炒作的热点,所以利润对它们而言一点都不重要。但对另外一些行业、企业而言,情况就大不一样了。

    如,利润排名后五名的行业:化学品、金属产品、批发零售、医药等,这些行业已经被冠名“落后的传统行业”,对于未来没有任何的想象空间,赚取利润可能是它们唯一的价值,可惜也已经不胜重负了。

    所以,你还在犹豫选专业的时候要不要选化学吗?

    3.1 哪个行业的利润增长率最高?

    前五名:汽车制造、船务、航空、物流、医药

    后五名:贸易、能源、房地产、工业机械、金属产品

    图5

    好吧,又一次颠覆了我们对世界的认知,前五名没有BAT、没有中国移动,更多的是传统的行业,如汽车制造,我们是不是可以理解为: 先醒过来的传统行业正在通过拥抱互联网重获新生?

    而后五名,能源、金属产品、传统贸易都是落后分子里的老面孔了,房地产利润增长率不佳是因为本来已经是暴利行业的缘故吗?还是政府卖地越来越贵了?哈哈。

    4. 哪个行业的净利率最高?

    净利率衡量的是企业的变现能力,也是企业的核心竞争力。前五和后五的情况——

    前五名:金融、互联网服务、物流、网络/通讯设备、房地产

    后五名:医药、航空、批发零售、金属产品、化学品

    图6

    跟利润有关的,金融行业永远是王者,因为 全世界几乎所有的精算师、风险评估师都在金融行业,你觉得这个行业能亏吗? 互联网行业的特点就是大者恒大,一旦实现了对其领域的控制,其盈利能力就会爆发出来,阿里、腾讯这些主儿的净利率都是近30%的。房地产,一言蔽之“暴利行业!”, 凡是华人聚居的地方,那里的首富肯定是卖房子的 ,如李嘉诚、许家印。

    后五名就不再多说了,这些行业估计短期内很难以摆脱当前的现状。

    5. 哪个行业的人均产值最高?

    人均产值代表该行业的员工的工作能力和价值输出。前五名和后五名情况——

    前五名:贸易、批发零售、保险、金融、电子/电气设备

    后五名:航空、航天与防务、电信、综合商业、物流

    图7

    贸易是一种特殊的行业形势,所以造就了人均高达5000万的逆天的人均产值。而金融、保险和电子/电器设备的高人均产值也正说明了在一个大势向上的行业里,个人的价值能更好地发挥出来。

    让人悲痛的事,电信行业的人均产值位列倒数第三,而电信行业多年以来都是国企中管理水平出色的代表,多年来也一直笼天下之英才而用,员工的能力应该是不容置疑的,如今落得这局面,是不是说明电信行业已经不在当前的“大势”之中?另外,是不是也说明了三大运营商当前机构臃肿、人浮于事?是体制机制之祸还是经营管理不善?

    三流企业做事,二流企业做市,一流企业做势。 所谓做势,就是善于谋形划势。势是一个物理学概念,指的是一种必然,一种出于对宏观把握的结果,一种规律性的认知。

    6. 哪个行业的人均利润最高?

    人均利润则更能反映出行业的发展势头,以及人在其间的作用。

    前五名:互联网服务、金融、保险、电子/电气设备、网络、通讯设备

    后五名:批发零售、工业机械、金属产品、航空、化学品

    图8

    在人均利润指标上,各行业相差悬殊, 互联网服务和金融可谓是人均利润的“双寡头”,高达63、62万元,是第三名的2倍,第四名的3倍,是电信行业的11倍,是倒数第一名(化学品行业)的574倍。 试想一下,可能大家都是朝九晚五地上下班,但别人创造的利润是你的500多倍,这是一件多么让人沮丧和绝望的事情啊。

    而一个最基本的道理,你不能为企业带来利润,企业也肯定无法给你带来更好的薪酬收入,无论商业社会多复杂,这是一个最基本的准则。

    其实不光是中国,全球的经济格局正在重构,全球化和数字化是两大重要的趋势,正在改变着中国乃至全球的商业世界的面貌,在过去30多年里,中国很多企业从人口规模和全球化市场中获得了很大的红利,这让它们能在很短的时间内发展壮大,位列世界500强,但这只是简单地反映出它们的营收规模庞大,而实际上, 从开放、创新这两个衡量企业新的竞争力的指标来看,中国企业还有很远很远的路要走。

数据分析是什么行业

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP