中企动力 > 商学院 > 专业大数据分析
  • ?

    大数据专业,未来就业的潜力股!你可了解?

    FR

    展开

    2017年高考已经顺利结束,接下来考生也应该为填志愿好好准备了,今天小编为大家解读一下最近最热门的专业-大数据科学与大数据技术,供高三毕业生填志愿时参考大数据专业产生的背景

    21世纪中国互联网经济的兴起,特别是以电商为主的商业平台的兴起以及智能手机的普及,各行业强化与互联网的结合,各行业产生的大量数据需要收集、处理、分析以及云数据库的兴起等都需要大量的大数据人才。

    另一方面,随着互联网的发展,网络安全和个人隐私的保护都需要大量的人才进行数据的保护。而我国开设大数据相关专业的高校少之又少。所以各高校从2016年才起积极申请开设大数据相关的专业,第一批招生从2017年6月开始

    “大数据”专业学什么?

    大数据领域三个大的技术方

    方向一、Hadoop大数据开发方向

    方向二、数据挖掘、数据分析&机器学习方向

    方向三、大数据运维&云计算方向

    该专业包括基础课程、核心课程及选修课程三大模块。其中专业基础部分侧重为语言和专业基础方面的课程,包括《大数据的Python基础》、《Linux系统基础》、《大数据的统计基础》等。专业核心部分涵盖了数据采集、存储与处理方面的内容,包括《数据存储(MySQL)》及《数据清洗》等课程。专业选修部分以大数据分析、开发及应用为重点,开设包括《数据分析导论》、《大数据行业应用导论》、《数据可视化》、《Hadoop大数据平台基础》等课程。

    开设大数据专业的高校

    在教育部公布的高校新增专业名单中,有35所高校成为第成功申请“数据科学与大数据技术”本科新专业的高校,第一批三所高校为:北京大学、对外经济贸易大学、中南大学

    第二批高校清单如下:

    大数据专业培养本科生的目标

    “大数据技术与应用”专业强调培养具有大数据实践能力的大数据人才。该专业重点培养具有以下两方面素质的人才:一是工具的掌握,掌握数据采集和数据分析的基本工具;二是数据分析能力,掌握实用数据分析和初步数据建模能力。

    大数据专业毕业生的发展前景

    随着工业生产的智能化、互联网技术对各行业的渗透,未来大数据专业人才的就业面会更广阔,晋升的速度也会相对较快;据全球咨询公司麦肯锡的报告显示:预计到2018年大数据人才的岗位需求会激增,特别是在中国,需求缺口会更大。这些都为大数据专业的毕业生提供很好的就业前景

    填报建议

    高三毕业生在选择大数据及其相关专业时,最好与自身的兴趣相结合,不要因为大数据专业热门而盲目地填报;大数据专业一般只招收理科生,学习大数据的理论知识及其技术需要很强的逻辑思维和长久的坚持;如果在大学期间没有学到真技术,毕业后也会面临失业的危险!

  • ?

    大数据分析:比你自己更加了解你自己

    全牛青

    展开

    如果大数据能够如此诡异地了解到我个性的方方面面,我只想问:为什么Facebook一直想让我花80元买双拖鞋?

    如果大数据能够如此诡异地了解到我个性的方方面面,我只想问:为什么Facebook一直想让我花80元买双拖鞋?

    我上Facebook或Instagram时几乎总会看到一则标价过高的帆布便鞋广告。我怀疑自己迄今从没买过超过25元的拖鞋,我也不太可能在马莎百货(Marks and Spencer)以外的地方买这类东西。我从来没在网上搜索过拖鞋二字,也想不出我上网时哪些举动会暗示出我喜欢“新潮”的拖鞋。(实际上,这款拖鞋有种难看的可拆户外鞋底,所以人们多半会说我是个穿拖鞋出门溜达的“中年大叔”,而不会说我“新潮”,如果我买了它的话。)

    对那些数据科学天才们来说,公平地讲,Facebook并不总是给我推销天价拖鞋。有时它也向我推销天价耳塞,或购买一款正念app的机会。照说,我们应该相信,建立在数据抓取和机器学习基础上的复杂算法现在比我们最亲密的朋友还了解我们。然而,在我们公司,不用15分钟你就能了解,我这个人不太可能花80元去买拖鞋,也不会破费购买什么正念app。

    这些广告还会根据浏览历史来投放。我明白为什么我在浏览过某个城市的旅游景点后会看到爱彼迎(Airbnb)的招租广告。在一个数据被认为无所不知的时代,令我困惑的是,为什么我在订完房后还能看到广告。总是如此。有谁没在网购后的六周接连不断地收到同一个商品的广告推送?去年,我们买了台电子琴送给儿子当生日礼物。几个月后,我仍会收到相同型号产品的广告。要么是数据分析师们不知道我们已经下了单,要么是他们认为我们是电音组合“宠物店男孩(Pet Shop Boys)”,一台电子琴不够使。

    在我看来,这些广告不像是来自别有用心的数据天才,它们更像出自一位上了年纪的大爷之手,他记得你小时候爱吃夹心饼干,所以即使你都过完45岁生日了,他还在给你买。

    很明显,还有更多原因。如果不值当的话,像Facebook和谷歌(Google)这种企业才不会做这么麻烦的事。我们必须假设,密集的数据挖掘会带来更有针对性的广告,从而为客户提供更优质的筛选结果,也会给平台带来更高的回报。

    我只想提一个忠告。不管这些公司掌握了我多少数据,在有针对性地推送消息上,他们显然还得再接再厉。我每天大部分时间都耗在网上,访问那些被Facebook搜索的网站,并通过Chrome浏览器将我的一举一动反馈给谷歌。我大致的生活状况不难了解,然而,它们还在给我推送金拖鞋。我想这意味着Facebook将我界定为国际精英阶层,但更有可能的是,我被归入了“钱多人傻”一族。

    定向广告的价值显而易见。给巴黎某个对麸质过敏的人推销一家伦敦的面包店毫无意义,但夸大算法的能力却符合每个人的利益。

    一种合理的解释也许是,这些平台尚未将它们掌握的有关我的海量数据整合为有用的行动。目前,它们仅需胜过其它媒介,如报纸和电视。虽然它们可能还没有很好地将自身掌握的大量数据投入使用,但有理由相信它们会越来越擅长利用这些资源。这也许就是为什么如今监管机构应该认真考虑限制数据采集的规模。

    还有另一种解释。也许它们非常了解我,以至于还没等我自己意识到,它们就知道我需要这些华而不实的高价货。它们知道,私下里我就是那种把脚套进80英镑的居家鞋的人。也许大数据革命就像许多人宣称的那样高深莫测,而且比我本人更了解我自己。或许我只需要屈服,它让我买啥我就买啥。噢,金拖鞋;噢,金拖鞋。

  • ?

    大数据属于什么专业?

    鹏煊

    展开

    很多院校有大数据课程和方向,关联度较高的专业有:软件工程、计算机科学、信息管理、应用数学/数学与统计。大数据应用有三个主要层面(即数据管理、系统开发、海量数据分析与挖掘),这三个层面系统地帮助企业掌握大数据应用中的各种典型问题的解决办法。

    大数据的核心技术:(1)大数据与Hadoop生态系统。详细介绍分析分布式文件系统HDFS、集群文件系统ClusterFS和NoSQL Database技术的原理与应用;分布式计算框架Mapreduce、分布式数据库HBase、分布式数据仓库Hive。(2)关系型数据库技术。详细介绍关系型数据库的原理,掌握典型企业级数据库的构建、管理、开发及应用。(3)分布式数据处理。详细介绍分析Map/Reduce计算模型和Hadoop Map/Reduce技术的原理与应用。(4)海量数据分析与数据挖掘。详细介绍数据挖掘技术、数据挖掘算法–Minhash, Jaccard and Cosine similarity,TF-IDF数据挖掘算法–聚类算法;以及数据挖掘技术在行业中的具体应用。(5)物联网与大数据。详细介绍物联网中的大数据应用、遥感图像的自动解译、时间序列数据的查询、分析和挖掘。(6)文件系统(HDFS)。详细介绍HDFS部署,基于HDFS的高性能提供高吞吐量的数据访问。(7)NoSQL。详细介绍NoSQL非关系型数据库系统的原理、架构及典型应用。

  • ?

    大数据课程(专业版)

    心语愿

    展开

    大数据是IT领域热度最高的项目之一,其主体内容为统计学、运筹学、机器学习、沟通能力、编程、可视化、商业直觉、数据处理和行业知识等。大数据培训是大数据发展带动下的衍生行业,是培养大数据专业人才的关键。北大青鸟旗舰总校给您更好的发展,体验不一样的大数据课程。

    课程模块

    模块一

    模块一

    模块二

    模块三

    模块四

    模块五

    产品体系-优势、亮点(专业版)

    01课程绝对深度+前沿性 好工作、职业发展、各种技术转型

    Java+大数据 全栈、技术储备

    加入“互联网架构师”课程 绝对提升Level

    业务架构

    信息架构

    应用架构

    技术架构

    安全架构

    网络拓扑架构

    不断增加的新技能点

    02遇到问题、分析问题、解决问题—最佳实践性教学

    业务级解决方案

    03遇到问题、分析问题、解决问题—最佳实践性教学

    业务级解决方案

    系统级解决方案

    04项目贯穿、真枪实弹

    丰富的项目库,互联网项目为主

    垂直架构 | 分布式架构 | 微服架构

    互联网应用——最佳解决方案

    架构方面

    技术方面

    业务方面

    所有的项目均采用敏捷方式进行开发管理

    传统行业

    1、架构:垂直架构

    业务相对简单、用户量较小、较少的高并发处理考虑

    2、技术

    Java Core、Web框架(SSM/SSH)等

    3、数据存储

    Oracle、MySql

    互联网行业

    1、架构:分布式集群架构

    用户量/PV量大增、高并发/高访问处理、业务模块化…

    2、技术

    DubboX(微服)、MQ、分布式事务处理、缓存技术等

    3、海量数据大数据(抓取数据+数据分析挖掘+可视化)

    Hadoop、Spark、Storm、Deep-Learning

    互联网技术岗位变化-1

    1、技术相互交融,各岗位之间界限不明显

    对人员的要求:广度+深度

    2、技术岗位的职业发展

    Backend Dev—技术转型便捷性

    3、大数据岗位需具备开发语言基础

    互联网技术岗位变化-2

    1、产品变革,大数据学院更适应市场需求

    2、开发语言作为基础纳入到大数据学院中

    大数据岗位技术要求

    1、java/Python

    2、分布式、高并发、集群、架构设计

    3、Hadoop、Spark、Storm、Hive......

    4、数据库&缓存技术

    5、Web框架

    大数据岗位开发语言要求

    在大数据岗位总体技术要求分析中,其中Java语言占到73.12%的出现频率,即在大数据工程师招聘信息中有73.12%的招聘信息对Java语言有技术要求

    大数据岗位类型

    大数据岗位薪资

    规划思路

    立足当下,把握趋势,分层次培养,成就高薪就业

    旗舰总校具备拓展市场的能力

    多产品,清晰各类产品的市场定位

    产品体系:广度+深度 | 基础升级

    产品模块化,可自由组合+拆分

    线下培训是适用于所有想学大数据的朋友,对于基础差、自学能力较弱、自控力较弱的朋友来说,选择线下机构是最好的选择,远程和视频等教学方式很容易半途而废。

    在如此快速的到来的大数据革命时代,我们还有很多知识需要学习,选择北大青鸟旗舰总校,未来定会前程似锦。

  • ?

    最常用的四种大数据分析方法

    爱太重

    展开

    本文主要讲述数据挖掘分析领域中,最常用的四种数据分析方法:描述型分析、诊断型分析、预测型分析和指令型分析。

    当刚涉足数据挖掘分析领域的分析师被问及,数据挖掘分析人员最重要的能力是什么时,他们给出了五花八门的答案。

    其实我想告诉他们的是,数据挖掘分析领域最重要的能力是:能够将数据转化为非专业人士也能够清楚理解的有意义的见解。

    使用一些工具来帮助大家更好的理解数据分析在挖掘数据价值方面的重要性,是十分有必要的。其中的一个工具,叫做四维分析法。

    简单地来说,分析可被划分为4种关键方法。

    下面会详细介绍这四种方法。

    1. 描述型分析:发生了什么?

    这是最常见的分析方法。在业务中,这种方法向数据分析师提供了重要指标和业务的衡量方法。

    例如,每月的营收和损失账单。数据分析师可以通过这些账单,获取大量的客户数据。了解客户的地理信息,就是“描述型分析”方法之一。利用可视化工具,能够有效的增强描述型分析所提供的信息。

    2. 诊断型分析:为什么会发生?

    描述性数据分析的下一步就是诊断型数据分析。通过评估描述型数据,诊断分析工具能够让数据分析师深入地分析数据,钻取到数据的核心。

    良好设计的BI dashboard能够整合:按照时间序列进行数据读入、特征过滤和钻取数据等功能,以便更好的分析数据。

    3. 预测型分析:可能发生什么?

    预测型分析主要用于进行预测。事件未来发生的可能性、预测一个可量化的值,或者是预估事情发生的时间点,这些都可以通过预测模型来完成。

    预测模型通常会使用各种可变数据来实现预测。数据成员的多样化与预测结果密切相关。

    在充满不确定性的环境下,预测能够帮助做出更好的决定。预测模型也是很多领域正在使用的重要方法。

    4. 指令型分析:需要做什么?

    数据价值和复杂度分析的下一步就是指令型分析。指令模型基于对“发生了什么”、“为什么会发生”和“可能发生什么”的分析,来帮助用户决定应该采取什么措施。通常情况下,指令型分析不是单独使用的方法,而是前面的所有方法都完成之后,最后需要完成的分析方法。

    例如,交通规划分析考量了每条路线的距离、每条线路的行驶速度、以及目前的交通管制等方面因素,来帮助选择最好的回家路线。

    结论

    最后需要说明,每一种分析方法都对业务分析具有很大的帮助,同时也应用在数据分析的各个方面。

    原文链接:http://kdnuggets/2017/07/4-types-data-analytics.html

    转载请注明出自:葡萄城控件

    关于葡萄城

    葡萄城是全球控件行业领导者,世界领先的企业应用定制工具、企业报表和商业智能解决方案提供商,为超过75%的全球财富500强企业提供服务。

  • ?

    哪些大学可报考大数据专业?2017年大数据专业就业前景

    借口

    展开

    作者|笑面虎 (本文为36大数据专稿)

    十二年寒窗苦读,一朝踏上高考路,一举成名天下知。

    高考,对于每一个学子都是一场无烟的战场,十几年的努力拼搏,只为这一刻能够走进自己梦想的校园。高考就像是鲤鱼跃龙门中的龙门一样,跃过去的学子就可以欢欢喜喜进入梦想大学校园,开启人生新的篇章,用知识改变命运。在距离2017年高考时间还剩下不到48小时的时间里,36大数据想和你谈谈目前炙手可热的大数据专业以及与高考相关的大数据。

    据教育部数据显示,目前,全国已有35所高等院校开通了大数据专业。也就是说,高考报志愿可直接报大数据专业的学校了。那么,哪些大学可以报考大数据专业呢?大数据专业的就业前景如何呢?

    全国有哪些高校开通了大数据专业呢?

    从统计表可以看出,开通了大数据专业的学校主要分布在一线城市(北京、上海、广州)以及云南、贵州和四川三个西南地区。

    高校填报志愿,过来人的建议,通常情况下:城市比学校更重要,学校比专业更重要。当然,考生也可以根据自己的实际情况(所在地、分数)来进行选择。

    专业介绍

    计算机科学与技术(数据科学与大数据技术方向)主要培养大数据科学与工程领域的复合型高级技术人才。毕业生具有信息科学、管理科学和数据科学基础知识与基本技能,掌握大数据科学与技术所需要的计算机、网络、数据编码、数据处理等相关学科的基本理论和基本知识,熟练掌握大数据采集、存储、处理与分析、传输与应用等技术,具备大数据工程项目的系统集成能力、应用软件设计和开发能力,具有一定的大数据科学研究能力及数据科学家岗位的基本能力与素质。毕业后能从事各行业大数据分析、处理、服务、开发和利用工作,大数据系统集成与管理维护等各方面工作,亦可从事大数据研究、咨询、教育培训工作。

    专业名称:计算机科学与技术专业(数据科学与大数据技术方向),本科四年制;

    2017年大数据专业就业前景

    大数据人才稀缺

    据数联寻英发布《大数据人才报告》显示,目前全国的大数据人才仅46万,未来3-5年内大数据人才的缺口将高达150万。

    据职业社交平台LinkedIn发布的《2016年中国互联网最热职位人才报告》显示,研发工程师、产品经理、人力资源、市场营销、运营和数据分析是当下中国互联网行业需求最旺盛的六类人才职位。其中研发工程师需求量最大,而数据分析人才最为稀缺。领英报告表明,数据分析人才的供给指数最低,仅为0.05,属于高度稀缺。数据分析人才跳槽速度也最快,平均跳槽速度为19.8个月。

    根据中国商业联合会数据分析专业委员会统计,未来中国基础性数据分析人才缺口将达到1400万,而在BAT企业招聘的职位里,60%以上都在招大数据人才。

    大数据专业就业三大方向

    大数据主要的三大就业方向:大数据系统研发类人才、大数据应用开发类人才和大数据分析类人才。

    在此三大方向中,各自的基础岗位一般为大数据系统研发工程师、大数据应用开发工程师和数据分析师。

    大数据专业人才就业薪资

    1、基础人才-数据分析师

    北京数据分析平均工资: 10630/月,取自 15526 份样本,较 2016 年,增长 9.4%。

    数据分析师岗位职责

    业务类别:技术

    业务方向:数据分析

    工作职责:

    1. 根据公司产品和业务需求,利用数据挖掘等工具对多种数据源进行诊断分析,建设征信分析模型并优化,为公司征信运营决策、产品设计等方面提供数据支持;

    2. 负责项目的需求调研、数据分析、商业分析和数据挖掘模型等,通过对运行数据进行分析挖掘背后隐含的规律及对未来的预测;

    3. 参与数据挖掘模型的构建、维护、部署和评估;

    4. 整理编写商业数据分析报告,及时发现和分析其中变化和问题,为业务发展提供决策支持;

    5. 独立完成项目需求管理、方案设计、实施管理和项目成果质量的把控;

    6. 参与编写项目相关文档。

    教育背景:

    学历:本科其它:

    经验要求:工作经验:3-5年

    任职要求:

    1. 统计学、数学或计算机、数理统计或数据挖掘专业方向相关专业本科或以上学历;有扎实的数据统计和数据挖掘专业知识;

    2. 熟练使用数理统计、数据分析、数据挖掘工具软件(SAS、R、Python等的一种或多种),能熟练使用SQL读取数据;

    3. 使用过 逻辑回归、神经网络、决策树、聚类 等的一种或多种建模方法;

    4. 3年以上数据分析工作经验,征信从业背景人员优先;

    5. 具有金融行业项目经验的相关经验者优先考虑;

    6. 主动性强,有较强的责任心,积极向上的工作态度,有团队协作精神。

    能力素养:

    良好的分析、归纳和总结能力,善于分析、解决实际问题; 主动性强,有较强的责任心,积极向上的工作态度,有团队协作精神。

    2、大数据开发工程师

    北京大数据开发平均工资:30230/月。

    大数据开发工程师/专家 岗位指责(引自 滴滴出行):

    职位描述:

    1、构建分布式大数据服务平台,参与和构建公司包括海量数据存储、离线/实时计算、实时查询,大数据系统运维等系统;

    2、服务各种业务需求,服务日益增长的业务和数据量;

    3、深入源码内核改进优化开源项目,解决各种hadoop、spark、hbase疑难问题,参与到开源社区建设和代码贡献;

    岗位要求:

    1、计算机或相关专业本科以上学历(3年以上工作经验);

    2、精通C++/Java/Scala程序开发(至少一种),熟悉Linux/Unix开发环境;

    3、熟悉常用开源分布式系统,精通Hadoop/Hive/Spark/Storm/Flink/HBase之一源代码;

    4、有大规模分布式系统开发、维护经验,有故障处理能力,源码级开发能力;

    5、具有良好的沟通协作能力,具有较强的分享精神;

    6、对Kudu、Kylin、Impala、ElasticSearch,github等系统有深入使用和底层研究者加分;

    3、Hadoop开发工程师

    北京hadoop平均工资: 20130/月,取自 1734 份样本。

    Hadoop开发工程师岗位职责(引自新浪网):

    职位描述:

    1.参与优化改进新浪集团数据平台基础服务,参与日传输量超过百TB的数据传输体系优化,日处理量超过PB级别的数据处理平台改进,多维实时查询分析系统的构建优化;

    2.分布式机器学习算法在数据平台的构建与优化(包括常见的LR、GBDT、FM、LDA、Word2Vec及DNN等);

    3.深入源码改进各种开源大数据项目(包括Hadoop、Spark、Kafka、HBase等)。

    任职要求:

    1.计算机或相关专业本科以上学历;

    2.熟悉Linux环境下开发,熟练掌握C++/Java/Scala等一种以上编程语言;

    3.熟悉Hadoop生态系统相关项目,精通以下项目之一的源码(Hadoop/Spark/Kafka/HBase/Flume/ElasticSearch/Druid/Kylin);

    4.具备良好的学习能力、分析能力和解决问题的能力。

    4、数据挖掘工程师

    北京数据挖掘平均工资:21740/月,取自 3449 份样本,较 2016 年,增长 20.3%;

    数据挖掘工程师招聘要求(引自蚂蚁金服集团技术部):

    工作职责:

    1、在分布式系统上进行数据计算、挖掘、和实现算法;

    2、数据仓库模型设计和建立;

    3、数据梳理流程的实现和维护;

    4、物流场景下的地址文本、空间属性研究和分析。

    任职资格:

    1、本科以上学历,有扎实的统计学,数据挖掘,机器学习,自然语言识别理论基础,一种或几种以上的实际使用经验。

    2、熟悉聚类、分类、回归等机器学习算法和实现,对常见的核心算法和数据挖掘方法有透彻的理解和实际经验。

    3、深入理解Map-Reduce模型,对Hadoop、Hive、Spark、Storm等大规模数据存储于运算平台有实践经验。

    4、有扎实的计算机理论基础,至少熟悉一种编程语言,Java优先。

    5、有三年以上互联网公司或者海量数据处理工作经验,大数据挖掘、分析、建模经验

    5、算法工程师

    北京算法工程师平均工资: 22640/月,取自 10176 份样本。

    算法工程师 招聘要求(引自美团点评数据平台部):

    职位描述:

    互联网公司背景优先

    A、广告算法

    岗位职责:

    1.负责点击率预估等主要广告算法的技术选型;

    2.负责核心算法的开发;

    3.负责广告大数据处理流程的建设及相关工具的研发;

    4.负责广告技术研究项目的推进与管理;

    职位需求:

    1.计算机或相关专业本科以上学历,3年以上相关工作经验;

    2.熟练掌握一门开发语言;

    3.有机器学习、数据挖掘相关知识;

    4.在广告、搜索、推荐等相关领域之一有技术研究工作经验;

    5.有较强的沟通协调能力;

    B、推荐算法

    职位描述:

    1. 参与各个产品线的个性化推荐系统的研发;

    2. 分析用户行为数据,并设计合理的推荐算法模型及策略,并优化推荐排序;

    3. 通过对用户行为数据的挖掘,对用户进行建模,精准刻画用户各种属性;

    职位要求:

    1. 全日制本科及以上学历,计算机相关专业;

    2. 熟练掌握各类个性化推荐算法,并有开发个性化推荐系统的实际项目经验;熟练掌握各类回归及排序算法,能够利用相关算法进行推荐排序的优化;

    3. 熟练掌握分类、聚类、回归、降维等经典机器学习算法和技术,能够根据实际问题选择合适的模型和算法并进行相应的开发;

    4. 有较强的工程架构和开发能力,能够实现支撑千万级用户和TB级用户行为数据的推荐系统或算法;

    5. 掌握python、matlab等脚本语言,熟悉各类数据挖掘工具(如weka、Mahout),能够快速建立模型并进行验证;

    C、算法工程师

    岗位职责:

    1、开发和优化用户行为数据挖掘,文本分类和语义理解,社交网络分析,网页搜索,推荐系统等领域的特定算法

    2、能够很快学习和利用state-of-the-art的算法解决实际产品问题,提升产品用户体验

    任职资格:

    1、有一定的研究、实验的能力,优秀的分析问题和解决问题的能力

    2、理解自然语言处理、机器学习、网页搜索,推荐系统,用户数据分析和建模的基本概念和常用方法,有相关领域的实际项目研发或者实习经历者优先。

    3、熟悉C++, Java或Python,熟悉Linux或类Unix系统开发,有较强的编程能力。 能独立实现线上算法模块者优先。

    4、对大数据处理平台和工具有一定经验者优先, 包括: Hadoop, Hive, Pig, Spark 等

    最后一个问题,哪些公司需求大数据人才?

    答:所有的公司。大到世界500强,BAT这样的公司,小到创业公司,他们都需求数据人才。

    马云爸爸说“我们已从IT时代进入了DT时代,未来我们的汽车、电灯泡、电视机、电冰箱等将全部装上操作系统,并进行数据集成,数据将会让机器更“聪明”。DT时代,数据将成为主要的能源,离开了数据,任何组织的创新都基本上是空壳。”

    数据,未来的一切。

    本文数据来自职友集、拉勾网、全程无忧等多个招聘网站。

    End.

  • ?

    什么叫大数据分析

    裴幻天

    展开

    大数据行业发展如火如荼,国家政策利好,互联网大佬纷纷在大数据行业布局,我们想让自己的职业生涯在一个朝阳行业发展,肯定又要学习相关技术,让自己与时俱进,但是难就难在大数据是一个新兴事物,目前我国大学的专业里面还鲜少有这个专业,国家刚批的大数据专业,全国目前35个高校,但是从17年开始招生,2021年才有第一批毕业生进入职场,在四年期间,是大数据行业发展的飞速时期,没有行业发展是等着人才进入的,而是需要要虚位以待、蓄势待发,所以在没有高等教育准备好的大数据教育,如何高效的学习大数据,如何快速的与行业发展想契合,那么需要我们成为第一个吃螃蟹的人,作为一个随着大数据行业成长的职业人,首先要知道大数据是个啥?

    大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    那来帮大家分析下:如何高效的学习大数据。

    经常有初学者会问,自己想往大数据方向发展,该学哪些技术,学习路线是什么样的,觉得大数据很火,就业很好,薪资很高……首先,如果你确定了想往这个方面发展,先考虑自己的过去从业经历、专业、兴趣是什么。计算机专业——操作系统、硬件、网络、服务器?软件专业——软件开发、编程、写代码?还是数学、统计学专业——对数据和数字特别感兴趣?

    那么你能找师傅带吗?

    但凡有这种想法的人,或多或少都会存有侥幸之心,或者叫做“天真,单纯”。希望不花一分钱,就能更快速的学到更优质,更实用的技能。

    关于这一点,我只想反问一句你:“如果你是大师,你凭什么愿意带我?”

    其实这就是想告诉你大数据的三个发展方向,平台搭建/优化/运维/监控、大数据开发/设计/架构、数据分析/挖掘。

    先说一下大数据的4V特征:

    数据量大,TB->PB

    数据类型繁多,结构化、非结构化文本、日志、视频、图片、地理位置等;

    商业价值高,但是这种价值需要在海量数据之上,通过数据分析与机器学习更快速的挖掘出来;

    处理时效性高,海量数据的处理需求不再局限在离线计算当中。

    现如今,正式为了应对大数据的这几个特点,开源的大数据框架越来越多,越来越强,先列举一些常见的:

    文件存储:Hadoop HDFS、Tachyon、KFS

    离线计算:Hadoop MapReduce、Spark

    流式、实时计算:Storm、Spark Streaming、S4、Heron

    K-V、NOSQL数据库:HBase、Redis、MongoDB

    资源管理:YARN、Mesos

    日志收集:Flume、Scribe、Logstash、Kibana

    消息系统:Kafka、StormMQ、ZeroMQ、RabbitMQ

    查询分析:Hive、Impala、Pig、Presto、Phoenix、SparkSQL、Drill、Flink、Kylin、Druid

    分布式协调服务:Zookeeper

    集群管理与监控:Ambari、Ganglia、Nagios、Cloudera Manager

    数据挖掘、机器学习:Mahout、Spark MLLib

    数据同步:Sqoop

    任务调度:Oozie

    ······

    第一步:初识Hadoop

    1.1 学会百度与Google

    不论遇到什么问题,先试试搜索并自己解决。

    Google首选,翻不过去的,就用百度吧。

    1.2 参考资料首选官方文档

    特别是对于入门来说,官方文档永远是首选文档。

    相信搞这块的大多是文化人,英文凑合就行,实在看不下去的,请参考第一步。

    1.3 先让Hadoop跑起来

    Hadoop可以算是大数据存储和计算的开山鼻祖,现在大多开源的大数据框架都依赖Hadoop或者与它能很好的兼容。

    关于Hadoop,你至少需要搞清楚以下是什么:

    · Hadoop 1.0、Hadoop 2.0

    · MapReduce、HDFS

    · NameNode、DataNode

    · JobTracker、TaskTracker

    · Yarn、ResourceManager、NodeManager

    自己搭建Hadoop,请使用第一步和第二步,能让它跑起来就行。

    建议先使用安装包命令行安装,不要使用管理工具安装。

    另外:Hadoop1.0知道它就行了,现在都用Hadoop 2.0.

    1.4 尝试使用Hadoop

    · HDFS目录操作命令;

    · 上传、下载文件命令;

    · 提交运行MapReduce示例程序;

    · 打开Hadoop WEB界面,查看Job运行状态,查看Job运行日志。

    · 知道Hadoop的系统日志在哪里。

    1.5了解它们的原理

    MapReduce:如何分而治之;

    HDFS:数据到底在哪里,什么是副本;

    Yarn到底是什么,它能干什么;

    NameNode到底在干些什么;

    ResourceManager到底在干些什么;

    1.6 自己写一个MapReduce程序

    仿照WordCount例子,自己写一个(照抄也行)WordCount程序,

    打包并提交到Hadoop运行。

    不会Java的话,Shell、Python都可以,有个东西叫Hadoop Streaming。

    如果能认真完成了以上几步,恭喜你,你的一只脚已经进来了。

    第二步:更高效的WordCount

    2.1 学点SQL吧

    如果不懂数据库的童鞋先学习使用SQL句。

    2.2 SQL版WordCount

    在1.6中,你写(或者抄)的WordCount一共有几行代码?

    如果用SQL的话:

    SELECT word,COUNT(1) FROM wordcount GROUP BY word;

    这便是SQL的魅力,编程需要几十行,甚至上百行代码,SQL一句就搞定;使用SQL处理分析Hadoop上的数据,方便、高效、易上手、更是趋势。不论是离线计算还是实时计算,越来越多的大数据处理框架都在积极提供SQL接口。

    2.3 安装配置Hive

    Hive算是数据仓库工具,安装不难,网上有很多教程,配置完成后,可以正常进入Hive命令行。

    2.4 试试使用Hive

    尝试在Hive中创建wordcount表,并运行2.2中的SQL语句。在Hadoop WEB界面中找到刚才运行的SQL任务。看SQL查询结果是否和1.4中MapReduce中的结果一致。

    明明写的是SQL,为什么Hadoop WEB界面中看到的是MapReduce任务?

    2.5 学会Hive的基本命令

    创建、删除表;加载数据到表;下载Hive表的数据;并学习更多关于Hive的语法和命令。

    0和Hadoop2.0的区别

    MapReduce的原理(还是那个经典的题目,一个10G大小的文件,给定1G大小的内存,如何使用Java程序统计出现次数最多的10个单词及次数);

    HDFS读写数据的流程;向HDFS中PUT数据;从HDFS中下载数据;

    自己会写简单的MapReduce程序,运行出现问题,知道在哪里查看日志;

    会写简单的SELECT、WHERE、GROUP BY等SQL语句;

    Hive SQL转换成MapReduce的大致流程;

    Hive中常见的语句:创建表、删除表、往表中加载数据、分区、将表中数据下载到本地;

    从上面的学习,你已经了解到,HDFS是Hadoop提供的分布式存储框架,它可以用来存储海量数据,MapReduce是Hadoop提供的分布式计算框架,它可以用来统计和分析HDFS上的海量数据,而Hive则是SQL On Hadoop,Hive提供了SQL接口,开发人员只需要编写简单易上手的SQL语句,Hive负责把SQL翻译成MapReduce,提交运行。

    第三步:把别处的数据搞到Hadoop上

    此处也可以叫做数据采集,把各个数据源的数据采集到Hadoop上。

    3.1 HDFS PUT命令

    put命令在实际环境中也比较常用,通常配合shell、python等脚本语言来使用。建议需熟练掌握。

    3.2 HDFS API

    HDFS提供了写数据的API,自己用编程语言将数据写入HDFS,put命令本身也是使用API。

    实际环境中一般自己较少编写程序使用API来写数据到HDFS,通常都是使用其他框架封装好的方法。比如:Hive中的INSERT语句,Spark中的saveAsTextfile等。

    可以尝试了解原理,试着写几个Demo。

    3.3 Sqoop

    Sqoop是一个主要用于Hadoop/Hive与传统关系型数据库Oracle/MySQL/SQLServer等之间进行数据交换的开源框架。

    就像Hive把SQL翻译成MapReduce一样,Sqoop把你指定的参数翻译成MapReduce,提交到Hadoop运行,完成Hadoop与其他数据库之间的数据交换。

    自己下载和配置Sqoop(建议先使用Sqoop1,Sqoop2比较复杂)。

    了解Sqoop常用的配置参数和方法。

    使用Sqoop完成从MySQL同步数据到HDFS;

    使用Sqoop完成从MySQL同步数据到Hive表;

    PS:如果后续选型确定使用Sqoop作为数据交换工具,那么建议熟练掌握,否则,了解和会用Demo即可。

    3.4 Flume

    Flume是一个分布式的海量日志采集和传输框架,因为“采集和传输框架”,所以它并不适合关系型数据库的数据采集和传输。Flume可以实时的从网络协议、消息系统、文件系统采集日志,并传输到HDFS上。因此,如果你的业务有这些数据源的数据,并且需要实时的采集,那么就应该考虑使用Flume。

    下载和配置Flume。使用Flume监控一个不断追加数据的文件,并将数据传输到HDFS;

    PS:Flume的配置和使用较为复杂,如果你没有足够的兴趣和耐心,可以先跳过Flume。

    3.5 阿里开源的DataX

    之所以介绍这个,是因为以前某公司客户目前使用的Hadoop与关系型数据库数据交换的工具,就是之前基于DataX开发的,个人感觉非常好用。现在DataX已经是3.0版本,支持很多数据源。你也可以在其之上做二次开发。

    PS:有兴趣的可以研究和使用一下,对比一下它与Sqoop。

    至此,你的“大数据平台”应该是这样的:

    第四步:把Hadoop上的数据搞到别处去

    前面介绍了如何把数据源的数据采集到Hadoop上,数据到Hadoop上之后,便可以使用Hive和MapReduce进行分析了。那么接下来的问题是,分析完的结果如何从Hadoop上同步到其他系统和应用中去呢?

    其实此处的方法和第三步基本一致的。

    4.1 HDFS GET命令

    把HDFS上的文件GET到本地。需要熟练掌握。

    4.2 HDFS API

    原理同3.2。

    4.3 Sqoop

    原理同3.3。

    使用Sqoop完成将HDFS上的文件同步到MySQL;

    使用Sqoop完成将Hive表中的数据同步到MySQL;

    4.4 DataX

    原理同3.4

    此时,“你的大数据平台”应该是这样的:

    走完第三步和第四步的流程,那么你应该已经具备以下技能和知识点:

    · 知道如何把已有的数据采集到HDFS上,包括离线采集和实时采集;

    · 知道sqoop(或者还有DataX)是HDFS和其他数据源之间的数据交换工具;

    · 知道flume可以用作实时的日志采集;

    至此,对于大数据平台,应该已经掌握如何搭建Hadoop集群,把数据采集到Hadoop上,使用Hive和MapReduce来分析数据,把分析结果同步到其他数据源。

    接下来的问题就是,Hive使用的越来越多,你会发现很多不愉快的地方,特别是速度慢,

    大多情况下,明明我的数据量很小,它都要申请资源,启动MapReduce来执行。

    第五步:快一点吧,我的SQL

    其实大家都已经发现Hive后台使用MapReduce作为执行引擎,实在是有点慢。因此SQL On Hadoop的框架越来越多,按我的了解,最常用的按照流行度依次为SparkSQL、Impala和Presto.这三种框架基于半内存或者全内存,提供了SQL接口来快速查询分析Hadoop上的数据。

    目前我们的方案使用的是SparkSQL,至于为什么用SparkSQL,原因大概如下:

    · 使用Spark还做了其他事情,不想引入过多的框架;

    · Impala对内存的需求太大,没有过多资源部署;

    5.1 关于Spark和SparkSQL

    什么是Spark,什么是SparkSQL。

    Spark有的核心概念及名词解释。

    SparkSQL和Spark是什么关系,SparkSQL和Hive是什么关系。

    5.2 如何部署和运行SparkSQL

    Spark有哪些部署模式?

    如何在Yarn上运行SparkSQL?

    使用SparkSQL查询Hive中的表。

    PS:Spark不是一门短时间内就能掌握的技术,因此建议在了解了Spark之后,可以先从SparkSQL入手,循序渐进。

    第六步:一夫多妻制

    其实我想说的是数据的一次采集、多次消费。

    在实际业务场景下,特别是对于一些监控日志,想即时的从日志中了解一些指标(关于实时计算,后面步节会有介绍),这时候,从HDFS上分析就太慢了,尽管是通过Flume采集的,但Flume也不能间隔很短就往HDFS上滚动文件,这样会导致小文件特别多。

    为了满足数据的一次采集、多次消费的需求,这里要说的便是Kafka。

    6.1 关于Kafka

    Kafka是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模的网站中的所有动作流数据。这种动作(网页浏览,搜索和其他用户的行动)是在现代网络上的许多社会功能的一个关键因素。这些数据通常是由于吞吐量的要求而通过处理日志和日志聚合来解决。

    6.2 如何部署和使用Kafka

    使用单机部署Kafka,并成功运行自带的生产者和消费者例子。

    使用Java程序自己编写并运行生产者和消费者程序。

    Flume和Kafka的集成,使用Flume监控日志,并将日志数据实时发送至Kafka。

    至此,“大数据平台”应该扩充成这样:

    这时,使用Flume采集的数据,不是直接到HDFS上,而是先到Kafka,Kafka中的数据可以由多个消费者同时消费,其中一个消费者,就是将数据同步到HDFS。

    总结:

    为什么Spark比MapReduce快。

    使用SparkSQL代替Hive,更快的运行SQL。

    使用Kafka完成数据的一次收集,多次消费架构。

    自己可以写程序完成Kafka的生产者和消费者。

    前面的学习已经掌握了大数据平台中的数据采集、数据存储和计算、数据交换等大部分技能,而这其中的每一步,都需要一个任务(程序)来完成,各个任务...

  • ?

    非常热门的大数据专业

    詹妮弗

    展开

    所谓大数据是指将来自于包括网络在内等多种渠道的数据进行采集、存储、分析、整合、控制而得到的数据,其目的是将其进行加工处理,更好的为决策服务。

    在本科专业中,大数据所对应的专业是“数据科学与大数据技术”,该专业是教育部2016年公布的新增专业,北京大学、对外经济贸易大学和中南大学3所院校首批获批开设“数据科学与大数据技术”专业;2017年又有32所高校获批“;2018年3月,教育部公布的审批结果中,共有250所院校获批开设“数据科学与大数据技术”专业。该专业学制为四年,大部分为工学。

    院校及专业信息摘自教育部《2015年度普通高等学校本科专业备案和审批结果》

    “数据科学与大数据技术”是个新兴的专业,是多学科交叉的复合型专业。大多数院校将其设在工学计算机门类下,授予工学学位;而有的院校将其设在理学下,授予理学学位,比如北京大学,就是将这个专业是设在理学下。无论院校将其设在哪个学院下,数学、统计学、计算机三大课程是必须要学的。另外,各院校还可根据本校的特色而增加相应的课程。

    大数据专业将来主要有三大就业方向:大数据系统研发类、大数据应用开发类和大数据分析类。岗位有大数据分析师、大数据工程师等。

    目前,我国大数据从业人员约有30万,而据中国商业联合会数据分析专业委员会资料显示,未来3至5年,中国将需要180万数据人才。人才缺口非常之大,大数据行业也成了现在的热门行业,其中的很多职位中人才的薪资待遇也是不菲的。

    数据来源:教育部阳光高考信息平台,仅供参考;部分素材源于网络,如有侵权,请联系删除!

  • ?

    大数据分析,不要错过这些最有“前途”的专业

    蔺笑白

    展开

    图片来源于网络

    又到了一年一度的毕业季,高考在即,很多的学子面临着选择专业的问题,虽然说兴趣很重要,但是家长们考虑更多的是将来的就业和生活问题。而那些准备毕业的大学生们,也都在考虑从事一个什么样的专业能够最有“钱途”。

    下面的这则报道可能会对你有所帮助

    近日,麦可思研究院近日对外发布了一份关于中国大学毕业生收入状况的调查报道。报告显示,在2016年的应届本科毕业生从事的职业中,“互联网开发及应用”在职业高薪榜上独领风骚,毕业半年后的平均月薪就达到了5679元!而紧随其后的分别是“计算机与数据处理”(5636元)和“房地产经营”(5057元)。

    图表数据来自麦可思研究院

    据悉,这份针对大学毕业生收入情况的调查结论,基于麦可思对2016届本科毕业生毕业半年后,以及2013届毕业生毕业3年后的跟踪调查。

    2016届大学生毕业生回收到的全国总样本约28.9万份,其中本科生样本约14.7万,高职高专生样本约14.2万。对2013届大学生毕业3年后的连续跟踪调查,回收全国总样本约5万。

    对于上述高收入职业,报告分析,当前,互联网行业的迅速发展促进了有关职业的旺盛需求,让计算机、软件工程等专业毕业生收入较高。

    上述调查研究除了调查了2016届毕业生毕业半年后的收入情况,还调查了2013届大学毕业生毕业3年后的收入变化情况。

    数据显示,2013届本科生毕业三年后月收入涨幅最大的职业类是“律师/律政调查员”(半年后:3388元,三年后:7656元),涨幅为126%,其次为“医疗保健/紧急救助”(半年后:2908元,三年后:6407元),涨幅为120%。“农/林/牧/渔”(半年后:3001元,三年后:6579元)位列第三,涨幅为119%。

    除了本科生,调查显示,2013届高职高专生毕业三年后月收入涨幅最大的职业类是“经营管理”(半年后:3185元,三年后:7133元),涨幅为124%,其次是“计算机与数据处理”(半年后:3015元,三年后:6564元),涨幅为118%,“房地产经营”(半年后:3257元,三年后:7078元)位列第三,涨幅为117%。

    从这份报告中不难看出,计算机与数据处理、互联网开发及应用、经营管理、房地产经营等行业在收入方面都有很大的优势。而诸如医疗保健/紧急救助和农/林/牧/渔等职业,虽然起薪平平,但是中、长期薪酬待遇也有不错的发展。

    盛景哥温馨提示:收入不应是职业和专业选择的唯一衡量标准,在选择专业和职业时,考生或者毕业生还要将社会需求量、个人兴趣爱好等因素都考虑在内。

  • ?

    就业前景极好的大数据专业,你了解吗?

    颜雨泽

    展开

    当下,人工智能、大数据等热门词汇频频出现在人们的视野中。作为万物分析的大数据更是站在互联网的风口浪尖上,直接催热了大学里的大数据专业。

    从IT时代进入DT时代,高校在大数据方向上设置了什么专业,具体学什么,就业怎么样,作为新兴专业,考生如何报考?今天,就来谈一谈这个大家关注的热门专业。

    1.什么叫大数据?

    进入互联网时代,中国的网民人数已超7亿,大数据的应用涉及到生活的方方面面。例如,你在网站上买书,商家就会根据你的喜好和其他购书者的评价给你推荐另外的书籍;手机定位数据和交通数据可以帮助城市规划;甚至用户的搜索习惯和股市都有很大关系。

    在谈到大数据的时候,人们往往知道的就是数据很大,但大数据≠大的数据。大数据,就是存储在各种存储介质中的海量的各种形态数据,具有5V特点,即:Volume(大量)、Velocity(高速)、Variety(多样)、Value(价值密度)、Veracity(真实性)。大数据之“大”,不仅在于其“大容量”,更在于其“大价值”,并已成为除人力、土地、财务、技术之外的另一种重要的基础资源。对各种存储介质中海量信息的采集、存储、分析、整合、控制而得到的数据就是大数据。大数据技术的意义不在于掌握庞大的数据信息,而在于对这些数据进行专业化处理,通过“加工”实现数据的“增值”,更好地辅助决策。

    2.数据科学与大数据技术专业

    本科专业中和大数据相对应的是“数据科学与大数据技术”专业,它是2015年教育部公布的新增专业。2016年3月公布的《高校本科专业备案和审批结果》中,北京大学、对外经济贸易大学和中南大学3所高校首批获批开设“数据科学与大数据技术”专业。随后第二年又有32所高校获批“数据科学与大数据技术”专业。两次获批的名单中显示,该专业学制为四年,大部分为工学。

    数据科学与大数据技术是个交叉性很强的专业,很难说完全归属于哪个独立的学科。所以,不同的学校有的是信息学院申报,有的是计算机学院牵头申报,有的设在统计学院,还有的在经管学院。像北京大学这个专业是放在理学下,授予理学学位。大多数是设在工学计算机门类下,授予的是工学学位。数据科学很早就存在,是个比较经典的学科,现在和大数据技术结合形成了这个专业。目前教育部设定的本科专业名称为“数据科学与大数据技术”,专科名称是“大数据技术与应用”。

    3.数据科学与大数据技术学什么?

    以对外经济贸易大学该专业为例,专业知识结构包括数学、统计、计算机和大数据分析四大模块,具体课程设置如下:

    数学:数学分析一、数学分析二、高等代数、离散数学。统计学:概率论与数理统计、多元统计分析、随机过程。计算机:数据机构、计算机组成原理、操作系统、数据库系统原理、C++程序设计、Java程序设计、Python与大数据分析、科学计算与Matlab应用、R语言等。大数据分析:数据科学导论、机器学习与数据挖掘、信息检索与数据处理、自然语言处理、智能计算、推荐系统原理、大数据分析技术基础、数据可视化、大数据存储与管理、大数据分析实践等课程。

    数据科学与大数据技术是一门实践性很强的新兴交叉复合型学科:以统计学、数学、计算机为三大支撑性学科;生物、医学、环境科学、经济学、社会学、管理学为应用拓展性学科。此外还需学习数据采集、分析、处理软件,学习数学建模软件及计算机编程语言等,知识结构是二专多能复合的跨界人才(有专业知识、有数据思维)。根据各校偏重的专业方向,课程设置有所差异,感兴趣的同学可以具体查看各校的专业和课程设置情况。

    1.行业增速快 人才缺口大

    随着移动互联网和智能终端的普及,信息技术与经济社会的交汇融合,引发了数据迅猛增长。新摩尔定律认为,人类有史以来的数据总量,每过18个月就会翻一番。而海量的数据蕴含着巨大生产力和商机。

    2011年至2014年四年间,我国大数据处于起步阶段,每年均增长在20%以上。2015年,大数据市场规模已达到98.9亿元。2016年增速达到45%,超过160亿元。预计2020年,我国大数据市场规模将超过8000亿元,有望成世界第一数据资源大国。但数据开放度低、技术薄弱、人才缺失、行业应用不深入等都是产业发展中亟待解决的问题。

    根据领英发布《2016年中国最热职位人才报告》显示,有六类热门职位的人才当前都处于供不应求状态,稀缺程度各有不同,其中,数据分析人才的供给指数最低,仅为0.05,属于高度稀缺。

    目前的当务之急是解决大数据人才瓶颈问题,相关调查显示,未来3-5年大数据人才缺口达到150万之多。,但截至目前,中国大数据从业人员只有约30万人。同时,大数据行业选才的标准也在不断变化。初期,大数据人才的需求主要集中在ETL研发、系统架构开发、数据仓库研究等偏硬件领域,以IT、计算机背景的人才居多。随着大数据往各垂直领域延伸发展,对统计学、数学专业的人才,数据分析、数据挖掘、人工智能等偏软件领域的需求加大。

    数据分析师现在需求就很旺盛了,2年工作经验的月薪可达到8K,硕士学历的数据分析师月薪可达到12K,5年工作经验的可达到40万至60万元。

    2.大数据主要就业方向

    2015年9月国务院印发《促进大数据发展行动纲要》,系统部署大数据发展工作。《纲要》明确提出了七方面政策机制,其中第六条就是加强专业人才培养,建立健全多层次、多类型的大数据人才培养体系。目前,大数据主要有三大就业方向:大数据系统研发类、大数据应用开发类和大数据分析类。具体岗位如下:

    1.大数据系统架构师

    大数据平台搭建、系统设计、基础设施。

    2.大数据系统分析师

    面向实际行业领域,利用大数据技术进行数据安全生命周期管理、分析和应用。

    3.hadoop开发工程师。

    解决大数据存储问题。

    4.数据分析师

    不同行业中,专门从事行业数据搜集、整理、分析,并依据数据做出行业研究、评估和预测的专业人员。在工作中通过运用工具,提取、分析、呈现数据,实现数据的商业意义。

    作为一名数据分析师,至少需要熟练SPSS、STATISTIC、Eviews、SAS、大数据魔镜等数据分析软件中的一门,至少能用Acess等进行数据库开发,至少掌握一门数学软件如matalab、mathmatics进行新模型的构建,至少掌握一门编程语言。总之,一个优秀的数据分析师,应该业务、管理、分析、工具、设计都不落下。

    5.数据挖掘工程师

    做数据挖掘要从海量数据中发现规律,这就需要一定的数学知识,最基本的比如线性代数、高等代数、凸优化、概率论等。经常会用到的语言包括Python、Java、C或者C++,我自己用Python或者Java比较多。有时用MapReduce写程序,再用Hadoop或者Hyp来处理数据,如果用Python的话会和Spark相结合。

    6.大数据可视化工程师

    随着大数据在人们工作及日常生活中的应用,大数据可视化也改变着人类的对信息的阅读和理解方式。从百度迁徙到谷歌流感趋势,再到阿里云推出县域经济可视化产品,大数据技术和大数据可视化都是幕后的英雄。

    1.院校开设情况

    大数据人才的典型胜任特征:善于做需求分析、写代码;善于与人沟通,喜欢探索未知;需要根据数据推演、分析、提出解决方案,有数据思维;需要持续保持学习状态;内性格上能动能静。

    不同办学层次的院校开设此专业,培养模式会有差异。例如,高职类院校学生由于数学基础相对薄弱,会跟多偏向于工具的使用,如数据清洗、数据存储以及数据可视化等相关工具的使用;本科院校会倾向于大数据相关基础知识全面覆盖性教学,在研究生段则会专攻某一技术领域,比如数据挖掘、数据分析、商业智能、人工智能等。

    在“教育部2015年度普通高等学校本科专业备案和审批结果”中北京大学、中南大学、对外经贸大学成为首批开设 “数据科学与大数据技术”本科专业的高校,随后中国人民大学、北京邮电大学、复旦大学等32所高校成为第二批成功申请该专业的高校。至去年上半年,我国已有35所高校获批“数据科学与大数据技术”本科专业。经过一年的发展,申请院校成井喷式的增长,全国高校大数据教育联盟通过教育部公示的申请2017年“数据科学与大数据技术”专业的院校来看,2017年申请院校高达263所,其中工学190所,理学73所。

    数据科学与大数据技术是个交叉性强、跨学科的专业,很难说是完全归属与那个独立的学科。高校牵头申报的学院不同,培养重点和授予的学位可能不一样。因为课程来自于不同的学院,也有高校是联合一些学院单独成立机构来申报。从名单可以看出,在大部分开设院校中该专业都属于工学类,有个别院校将其归属在理学门类,授予理学学位。

    有志于学习数据科学与大数据技术专业的学生,可以从大学的传统优势领域和行业背景考虑选择。比如,复旦大学的大数据技术本科专业是设在大数据学院下;北京大学是在数学院开设了该专业,偏数学的内容更多一些。对外经济贸易大学该专业设在信息学院,因为财经是学校传统优势,专业还会偏重经济、金融等相关学科领域的知识。

    2.报考注意事项

    了解了大数据行业和大数据专业后,对于考生填报与大数据相关的热门专业,需要注意以下几点:

    1.报考热门专业和就业热的专业并不一定是重合的,比如软件、计算机、金融,这些专业的就业率实际并没有那么高,地质勘探、石油、遥感等专业,虽然报考时是冷门,但行业需求大,就业率更高。

    2.选择热门专业,更需要考虑就业质量。专业就业好,是统计学意义,指的是平均收入水平高,比如金融专业的收入,比其他纯文科专业的平均收入较高,但落实到个体层面,就业情况就不一样了,尤其像金融专业是典型的名校高学历好就业,但对于考试成绩较低的同学来说,如果去一些普通院校、专科院校学习金融,最后就业情况可能还不如会计专业。

    3.志愿填报,除了专业,城市因素也很重要:如果想从事金融、互联网的工作,更适合去一线城市,如果是去三、四线大学的学生可以考虑应用面比较广的专业,就是各行各业都能用到的专业,比如会计专业,专科层次的会计和985层次的会计都有就业渠道。如果先选择报考城市,也可以针对所在城市的行业特点选择专业,比如沿海城市外贸相对发达,选择国际贸易、外语类专业就业情况更好,比如武汉有光谷,选择光电类专业更好就业。

    4.最终家长和考生更需要考虑个人与专业匹配的问题,金融、计算机等热门专业不是所有人都适合学,好专业不见得对所有个体都是好的。

    5.最后,考生报考时要注意,有的高校大数据专业是按大类招生,即按计算机大类,且只招理科生。

    下面是人大、北邮、中南大学三校2017年数据科学与大数据技术专业在五个省市的录取数据。其中,人大的大数据专业归统计学大类;北邮的大数据专业归计算机大类。

专业大数据分析

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP