- ?
教育部:208所高职院校“大数据技术与应用”专业获批
甄雪兰
展开
2018年1月18日,教育部公布“大数据技术与应用”专业备案和审批结果。已有270所高职院校申报开展“大数据技术与应用”专业,其中共有208所职业院校获批“大数据技术与应用”专业。根据公布结果分析如下:
各省对比图
从图中可以看出申报“大数据技术与应用”专业的省份数量前三为贵州、河南、广东,申报数量较少的是北京、天津、上海、新疆。
所有申报学校汇总表如下:
省份
学校名称
年限
北京市
北京信息职业技术学院
3
北京市
北京北大方正软件职业技术学院
3
天津市
天津机电职业技术学院
3
天津市
天津现代职业技术学院
3
河北省
河北工业职业技术学院
3
河北省
河北软件职业技术学院
3
河北省
河北政法职业学院
3
河北省
沧州职业技术学院
3
河北省
石家庄城市经济职业学院
3
河北省
河北旅游职业学院
3
河北省
河北对外经贸职业学院
3
河北省
河北机电职业技术学院
3
河北省
石家庄邮电职业技术学院
3
河北省
河北劳动关系职业学院
3
河北省
渤海理工职业学院
3
山西省
山西建筑职业技术学院
3
山西省
山西工程职业技术学院
3
山西省
山西机电职业技术学院
3
山西省
山西职业技术学院
3
山西省
山西信息职业技术学院
3
山西省
山西国际商务职业学院
3
山西省
晋中职业技术学院
3
山西省
山西轻工职业技术学院
3
山西省
吕梁职业技术学院
3
内蒙古自治区
内蒙古丰州职业学院
3
内蒙古自治区
呼和浩特职业学院
3
内蒙古自治区
内蒙古电子信息职业技术学院
3
内蒙古自治区
内蒙古商贸职业学院
3
内蒙古自治区
锡林郭勒职业学院
3
内蒙古自治区
乌兰察布职业学院
3
内蒙古自治区
赤峰工业职业技术学院
3
辽宁省
辽宁轨道交通职业学院
3
辽宁省
辽宁建筑职业学院
3
辽宁省
沈阳北软信息职业技术学院
3
吉林省
长春金融高等专科学校
3
吉林省
长春职业技术学院
3
吉林省
长春信息技术职业学院
3
吉林省
吉林省教育学院
3
吉林省
吉林职业技术学院
3
黑龙江省
牡丹江大学
3
黑龙江省
黑龙江生物科技职业学院
3
黑龙江省
黑龙江信息技术职业学院
3
黑龙江省
黑龙江生态工程职业学院
3
上海市
上海思博职业技术学院
3
上海市
上海中侨职业技术学院
3
江苏省
连云港师范高等专科学校
3
江苏省
常州信息职业技术学院
3
江苏省
苏州工业职业技术学院
3
江苏省
苏州托普信息职业技术学院
3
江苏省
常州纺织服装职业技术学院
3
江苏省
宿迁职业技术学院
3
江苏省
苏州健雄职业技术学院
3
江苏省
苏州高博软件技术职业学院
3
江苏省
南通师范高等专科学校
3
江苏省
江苏财会职业学院
3
江苏省
盐城幼儿师范高等专科学校
3
浙江省
温州职业技术学院
3
浙江省
浙江长征职业技术学院
3
浙江省
浙江广厦建设职业技术学院
3
浙江省
浙江安防职业技术学院
3
安徽省
芜湖职业技术学院
3
安徽省
安徽商贸职业技术学院
3
安徽省
民办万博科技职业学院
3
安徽省
淮南职业技术学院
3
安徽省
安徽电子信息职业技术学院
3
安徽省
合肥职业技术学院
3
安徽省
安徽国际商务职业学院
3
安徽省
安徽审计职业学院
3
安徽省
安徽涉外经济职业学院
3
安徽省
安徽现代信息工程职业学院
3
安徽省
安徽粮食工程职业学院
3
安徽省
合肥科技职业学院
3
福建省
福州职业技术学院
3
福建省
福建信息职业技术学院
3
福建省
湄洲湾职业技术学院
3
福建省
福州软件职业技术学院
3
福建省
厦门南洋职业学院
3
福建省
福州墨尔本理工职业学院
3
江西省
江西科技学院
3
江西省
九江职业技术学院
3
江西省
江西工程学院
3
江西省
江西应用技术职业学院
3
江西省
南昌工学院
3
江西省
江西工业贸易职业技术学院
3
江西省
江西青年职业学院
3
江西省
上饶职业技术学院
3
江西省
江西师范高等专科学校
3
山东省
山东商业职业技术学院
3
山东省
济宁职业技术学院
3
山东省
潍坊职业学院
3
山东省
山东信息职业技术学院
3
山东省
青岛黄海学院
3
山东省
山东电子职业技术学院
3
山东省
山东铝业职业学院
3
山东省
青岛远洋船员职业学院
3
河南省
河南职业技术学院
3
河南省
三门峡职业技术学院
3
河南省
洛阳理工学院
3
河南省
河南工学院
3
河南省
濮阳职业技术学院
3
河南省
黄河水利职业技术学院
3
河南省
商丘职业技术学院
3
河南省
郑州工业应用技术学院
3
河南省
河南司法警官职业学院
3
河南省
河南工业职业技术学院
3
河南省
郑州信息科技职业学院
3
河南省
河南信息统计职业学院
3
河南省
商丘学院
3
河南省
新乡职业技术学院
3
河南省
开封文化艺术职业学院
3
河南省
河南应用技术职业学院
3
河南省
河南机电职业学院
3
河南省
郑州商贸旅游职业学院
3
河南省
洛阳职业技术学院
3
河南省
洛阳科技职业学院
3
湖北省
荆州职业技术学院
3
湖北省
武汉软件工程职业学院
3
湖北省
湖北水利水电职业技术学院
3
湖北省
武汉商贸职业学院
3
湖北省
黄冈科技职业学院
3
湖北省
湖北工程职业学院
3
湖南省
湖南信息职业技术学院
3
湖南省
湖南科技职业学院
3
湖南省
湖南商务职业技术学院
3
湖南省
湖南机电职业技术学院
3
湖南省
湖南软件职业学院
3
湖南省
湖南汽车工程职业学院
3
湖南省
湖南现代物流职业技术学院
3
湖南省
湖南三一工业职业技术学院
3
湖南省
湖南劳动人事职业学院
3
广东省
广东轻工职业技术学院
3
广东省
广东水利电力职业技术学院
3
广东省
深圳职业技术学院
3
广东省
广州番禺职业技术学院
3
广东省
广东农工商职业技术学院
3
广东省
佛山职业技术学院
3
广东省
广东科学技术职业学院
3
广东省
广东行政职业学院
3
广东省
汕尾职业技术学院
3
广东省
罗定职业技术学院
3
广东省
河源职业技术学院
3
广东省
广东邮电职业技术学院
3
广东省
广东亚视演艺职业学院
3
广东省
珠海城市职业技术学院
3
广东省
广东生态工程职业学院
3
广东省
惠州城市职业学院
3
广西壮族自治区
南宁职业技术学院
3
广西壮族自治区
柳州职业技术学院
3
广西壮族自治区
广西生态工程职业技术学院
3
广西壮族自治区
广西电力职业技术学院
3
广西壮族自治区
广西城市职业学院
3
广西壮族自治区
广西经济职业学院
3
广西壮族自治区
广西金融职业技术学院
3
重庆市
重庆电子工程职业学院
3
重庆市
重庆城市管理职业学院
3
重庆市
重庆水利电力职业技术学院
3
重庆市
重庆青年职业技术学院
3
重庆市
重庆科创职业学院
3
重庆市
重庆商务职业学院
3
重庆市
重庆交通职业学院
3
重庆市
重庆服装工程职业学院
3
四川省
成都纺织高等专科学校
3
四川省
四川化工职业技术学院
3
四川省
四川航天职业技术学院
3
四川省
四川工商职业技术学院
3
四川省
四川托普信息技术职业学院
3
四川省
泸州职业技术学院
3
四川省
电子科技大学成都学院
3
四川省
成都理工大学工程技术学院
3
四川省
四川信息职业技术学院
3
四川省
西南科技大学城市学院
3
四川省
四川科技职业学院
3
贵州省
贵州交通职业技术学院
3
贵州省
贵州航天职业技术学院
3
贵州省
贵州电子信息职业技术学院
3
贵州省
安顺职业技术学院
3
贵州省
黔南民族职业技术学院
3
贵州省
贵州城市职业学院
3
贵州省
贵州工业职业技术学院
3
贵州省
六盘水职业技术学院
3
贵州省
铜仁职业技术学院
3
贵州省
贵州轻工职业技术学院
3
贵州省
毕节职业技术学院
3
贵州省
贵州职业技术学院
3
贵州省
贵州盛华职业学院
3
贵州省
贵州工商职业学院
3
贵州省
贵州工程职业学院
3
贵州省
贵州工贸职业学院
3
贵州省
贵州农业职业学院
3
贵州省
贵州水利水电职业技术学院
3
贵州省
贵州电子商务职业技术学院
3
贵州省
贵州电子科技职业学院
3
贵州省
贵州经贸职业技术学院
3
云南省
云南交通职业技术学院
3
云南省
云南机电职业技术学院
3
云南省
云南工程职业学院
3
云南省
云南工商学院
3
陕西省
陕西国防工业职业技术学院
3
陕西省
西安高新科技职业学院
3
陕西省
陕西航空职业技术学院
3
陕西省
西安铁路职业技术学院
3
陕西省
延安职业技术学院
3
陕西省
陕西青年职业学院
3
陕西省
陕西工商职业学院
3
陕西省
陕西电子科技职业学院
3
甘肃省
兰州石化职业技术学院
3
甘肃省
庆阳职业技术学院
3
新疆
新疆农业职业技术学院
3
大数据人才缺口达150万!各大高校紧锣密鼓启动大数据人才培养,缘于大数据时代催生的大量相关人才缺口。全球最顶尖管理咨询公司麦肯锡(McKinsey)出具的一份详细分析报告显示,预计到2018年,大数据或者数据工作者的岗位需求将激增,其中大数据科学家的缺口在140000到190000之间,对于懂得如何利用大数据做决策的分析师和经理的岗位缺口则将达到1500000!“大数据”专业毕业后干什么?事实上,大数据工作者可以施展拳脚的领域非常广泛,从国防部、互联网创业公司到金融机构,到处需要大数据项目来做创新驱动。数据分析或数据处理的岗位报酬也非常丰厚,在硅谷,入门级的数据科学家的收入已经是6位数了(美元)。目前全国各类高校、高职院校已陆续开始围绕大数据专业建设展开研究并申报大数据专业。作为交叉型学科,大数据的相关课程涉及数学、统计和计算机等学科知识,“数据科学与大数据技术”专业也强调培养具有多学科交叉能力的大数据人才。
“全国高校大数据教育联盟”是非盈利、公益性的社会组织。联盟将本着“共建共享”、“平等互利”、“合作共赢”的原则开展活动,紧密围绕“推进高校间合作交流、实现联盟高校资源共享、大数据理论研究与成果推广、提升服务国家建设的能力、促进大数据产业生态体系的发展”五大职责,共同开展大数据理论的研究和实践活动。同时,加强联盟高校在教学、科研、师资培训等方面的合作,为我国高校大数据教育的发展发挥重要的引领和示范作用。
- ?
大数据分析,不同专业之间的就业难度指数
干凌丝
展开
就业难度排名前十的专业有:农业经济管理类、地质类、矿业类、草学类、财政学类、旅游管理类、安全科学与工程类、经济与贸易类、自然保护与环境生态类、环境科学与工程类。
究其原因,这十个专业情况有所不同,地质类、矿业类是由于中国经济放缓以及供给侧改革造成的需求量的减少,而经济贸易类岗位需求量并不低,但是由于此专业毕业生供给量更大,因此经济贸易类专业毕业生就业难度较大。
相对容易就业的专业,分布在一些供需量不大的冷门专业,比如军事类、医学类、天文学类、艺术理论学等,其中尤其以医学供需矛盾最为突出,在最容易就业的20个专业中,医学类专业有10个之多,占据了半壁江山。
分析原因,随着人们对健康的需求不断提升,除了医院之外,医药公司、制药厂、医药贸易、经销、检验等企业对医药类专业技术人才的需求也在逐年增加,是导致医学类毕业生需求量不断增加的原因。而临床医学专业学制长,实习时间也长工作压力大待遇不高,再加上医患关系紧张,导致学医的热情不高。需求量增加而供给量不足,医学类就业容易也就不难理解。
- ?
数据科学与大数据技术专业都有哪些课程,前景如何?
晓歌
展开
目前数据中国“百校工程”已有73所入选院校,23所项目院校通过教育部规建中心专家验收,曙光瑞翼教育与项目院校校企合作协同育人,服务于全国各地近30所院校的曙光瑞翼大数据学院,招录近6000名学生,在数据科学与大数据技术专业的课程设计上,设计以下的专业课程。
数据科学与大数据专业的必修基础课程方面大数据(人工智能)概论、Linux操作系统、Java语言编程、数据库原理与应用、数据结构、数学及统计类课程(高等数学、线性代数、概率论、数理统计)、大数据应用开发语言、Hadoop大数据技术、分布式数据库原理与应用、数据导入与预处理应用、数据挖掘技术与应用、大数据分析与内存计算等。选修的课程方面数据可视化技术、商务智能方法与应用、机器学习、人工智能技术与应用等。实践应用课程方面海量数据预处理实战、海量数据挖掘与可视化实战等。
数据科学与大数据技术可从事的岗位有:分析类,分析工程师、算法工程师;研发类,架构工程师、开发工程师、运维工程师;管理类,产品经理、运营经理。
大数据与人工智能不但是社会发展急需的新兴专业方向,同时也将渗透并影响着其他许多传统学科和专业的发展。腾讯研究院于2017年12月发布了《2017年全球人工智能人才白皮书》,数据显示,中国592家公司中约有4万位员工,而中国对于人工智能人才的需求数量已经突破百万,人才严重短缺,迫使企业不断降低工作经验门槛,甚至不惜从零培养人才。
数据科学与大数据技术专业不仅有着明朗的就业前景,在就业岗位的薪资待遇上有着无法比拟的就业优势。依据招聘网站给出薪资数据,目前国内人工智能相关岗位的应届毕业生的起薪基本都在10k—20k之间,毕业三年后人工智能岗位的技术人员,平均月薪在25k以上,基本实现薪酬翻番,薪资水平、就业满意度都优于全国平均水平的专业。随着未来科技应用的逐步推进,人工智能以及大数据技术的岗位需求逐步上升,未来必定会发展为就业前景最好的专业之一。
- ?
数据分析:大数据时代背景下对应用统计学专业的思考,看完长见识
南莲
展开
大数据时代背景下对应用统计学专业的思考
一、概述 众所周知,统计学自古至今就是一门以研究数据为主的学科,至今已经形成了较为成熟的数据研究体系与框架。统计学专业的学生的主要就业方向是银行、会计师事务所、市场调查公司或其它企事业单位。因此目前统计学教育的主要目的是能够培养出独立完成问卷设计、数据收集、应用模型进行数据分析的高级统计人才,其主要专业课程包括:高等概率论与数理统计、应用回归、多元统计、市场调查实务、时间序列分析、金融计算等,这些课程仍然是传统的课程设置,并不符合大数据时代数据科学家的专业知识构成。因此,在大数据时代背景下对应用型本科院校应用统计学专业的培养模式和教学改革的思考是非常有必要的。 2012年3月29日,美国在倡议书中指出,美国将应用收集巨大、复杂数据的挖掘能力,加速科学与工程学科的创新脚步,改革学生培养模式。北京师范大学邱东教授探讨了面对大数据潮流人们应持有的科学态度,从大数据的概念功能、统计学与数据科學的关系、大数据潮流对统计学产生的影响等4个方面论述了大数据对统计学的挑战[1]。英国学者维克托·迈尔·舍恩伯格认为大数据的精髓在于分析信息时的3个转变:一是可以分析和处理更多甚至是全部的数据,不再依赖随机抽样;二是研究数据如此之多,以至于人们不再追求精确度;三是人们不再热衷于寻找因果关系[2]。为适应大数据时代对数据处理人才更高综合素质的要求,统计学科教师与专业教育应在知识结构、教育内容、教育方式和人才培养模式等方面,主动进行与时俱进的充实、调整及变革[3]。文章拟从数据挖掘与统计分析的联系与区别、大数据对统计教育及统计人才的机遇与挑战的新形势下从政府、企业和人才等多个角度进行展开调查,对于应用型本科院校培养顺应时代发展的应用统计学专业的高层次人才提供相应的建议。
二、统计分析与数据挖掘的区别与联系 统计分析是指运用统计收集整理方法及与分析对象有关的知识,从定量与定性的结合上进行的研究活动。 统计分析过程:描述要分析的数据的性质,研究基础群体的数据关系,创建一个模型,总结数据与基础群体的联系,证明(或否定)该模型的有效性,采用预测分析来预测将来的趋势。 统计分析方法:(1)描述统计:将研究中所得的数据加以整理、归类、简化或绘制成图表,以此描述和归纳数据的特征及变量之间的关系的方法。集中趋势、离散程度、相关强度等、指标有平均数、标准差、相关系数等;(2)推断统计:用概率形式来决断数据之间是否存在某种关系及用样本统计值来推测总体特征的一种重要的统计方法。总体参数估计、假设检验、Z检验、T检验、卡方检验等数据挖掘是从庞大的数据中分析出有目标数据群,筛选出利于决策的有效信息。数据挖掘的数据量极大,注重数据查询分析的可行性。数据挖掘是着眼于预测未来,从大量的数据中寻找某些规律。
数据挖掘过程:(1)定义问题:分析业务需求、定义问题的范围、定义计算模型所使用的度量、定义数据挖掘项目的特定目标等;(2)准备数据:删除错误数据或插入缺失值、查找数据中的隐含相关性、标识最准确的数据源、确定哪些列最适合用于分析;(3)浏览数据:计算最小值和最大值、计算平均偏差和标准偏差、查看数据的分布;(4)部署和更新模型:根据实际数据部署、更新模型;(5)浏览和验证模型:测试模型的性能、需要使用不同配置创建多个模型,并对所有这些模型进行测试,查看哪个模型为最佳;(6)生成模型:通过创建挖掘结构定义要使用的数据列、将挖掘结构链接到数据源,但只有对挖掘结构进行处理后,该结构才会实际包含数据。 从上可以看出大数据虽与统计学密切相关,但二者也在研究目的、数据处理对象和技术工具上有着诸多差异。大数据的兴起不仅在分析手段、工作重心和价值理念上给统计学带来了重大影响,而且也使担负着培养现代统计工作和数据分析之人才的统计教育面临严峻挑战。
三、大数据对统计人才及统计教育的机遇与挑战 根据2014年大数据应用现状和趋势展开的调研分析,被调查者最关注的大数据技术中,排在前三位的分别是数据分析(统计分析与数据挖掘等)(25.5%)、数据采集(19.9%)、数据处理 (18.5%)。企业数据管理面临的挑战:缺乏专业的大数据人才(26.95%)成为企业面临的最大挑战,其次是非结构化数据的分析和处理(26.65%)、传统技术难以处理大数据(25.27%)以及新技术门槛过高(21.13%)。根据2015年2月Forrest报告,很多企业都在努力挖掘其拥有的大量数据,包括结构化、非结构化、半结构化数据等,探索对数据的深入利用。从国内企业大数据应用的现状和规划来看,已经部署大数据应用的企业所占比例达到21.89%,计划1年内部署的企业占27.92%,计划2年内部署的企业占14.34%,没有相关计划和不确定的企业分别占11.32%和24.53%。大数据相关人才的欠缺将会成为影响大数据市场发展的一个重要因素。据Gartner预测,到2016年,全球将新增440万个与大数据相关的工作岗位,且会有25%的组织设立首席数据官职位。大数据的相关职位需要的是复合型人才,能够对数学、统计学、数据分析、机器学习和自然语言处理等多方面知识综合掌控。 根据学院统计学不同方向等专业的学生、老师、专家以及政府范围工作人员等进行访问调查的结果,然后结合现如今大数据时代企业和政府对人才的需求,最终制定应用型人才培养方案分别如下: (一)深化课程教学内容改革 1. 更新教学内容,紧跟时代发展——大数据、互联网金融、国民经济统计、货币银行、经济预测与决策;2. 强化统计基础,提高实践操作——统计方法、软件实现、贝叶斯统计、非参数估计、统计软件、数据挖掘;3. 强调专业导向,拓宽就业方向-选修、考证;金融类、经济类、管理类、会计类;统计从业资格证书。 最终根据学院不同方向统计学专业设置专业核心课如下: (1)应用统计学:主要专业课 调整为:概率论、数理统计、统计学、回归分析、时间序列分析、多元统计分析,抽样技术、数据挖掘、贝叶斯统计、计量经济学、统计软件、非参数统计、统计调查等;(2)应用统计学(金融统计):主要专业课 调整為:概率论、数理统计、统计学、回归分析、时间序列分析、多元统计分析,抽样技术、数据挖掘、金融计量学、风险管理、保险学、非寿险精算、统计软件、国民经济核算、统计调查等;(3)经济统计学:主要专业课 调整为:概率论、数理统计、统计学、回归分析、时间序列分析、多元统计分析,抽样技术、数据挖掘、国民经济核算、风险管理、保险学、非寿险精算、统计软件、金融计量学、统计调查等。
(二)重视教学方法改革 1. 教师教学理念——单向灌输式转向引导探究式、教学案例能贴近实际问题(体测数据、大学生婚恋、手机);2. 鼓励学生参与各类项目——科研、调研、方案设计、抽样调查、统计调查、学科竞赛、教师课题(分解子课题);3. 注重综合能力提升——表达、协作、创新、研究报告、PPT展示等。 (三)建立完善的实践教学系统 1. 基本知识技能实验——理论教学的课内实验,大一、二:数学类;大二、大三(上):专业基础;2. 综合性实践教学——综合性数据的采集、处理、分析,大三(下)、四(上):数据挖掘、统计软件、统计调查;3. 探索性实践教学——社会调查、毕业实习、毕业论文,大四(下)。 (四)改革课程考试方式 1. 基本知识(理论)+实验报告(平时)+综合实验(期末)数学类;专业基础课程;2. 方案设计、调研报告、抽样调查、统计调查;3. 综合实验,数据挖掘、统计软件。 四、结束语 最终学院统计系下设两个教研室和一个研究中心,即基础统计教研室、专业统计教研室和大数据统计科学应用研究中心。秉承和依托母体学校——上海财经大学的办学宗旨和学术底蕴。在全校统计学公共课教学方面,针对学生的特点,课程教学采用课堂教学、调查实践与统计调查大赛相结合的教学方式与形式。也采取和校外企业、单位等合作项目老师指导学生参与的形式,这样既提高学生的实践能力又加强了师生之间的交流。在这样边学理论边实践的过程中也让学生足够了解现在企业所需人才的类型、找到自己的不足再补充理论方面的知识,然后学生还可以向学校反馈信息,这样最终形成一个学院专业始终跟得上经济的发展形势,不断地改革和完善教学内容,争取培养出在各级政府机关、银行、证券以及上市公司、企业集团、跨国公司等企事业单位和经营管理机构从事统计、市场调研、市场预测与决策、信息咨询、可行性研究和综合评价等实际工作以及科研单位从事研究工作的应用型人才。
- ?
什么叫大数据分析
冥蝶
展开
大数据行业发展如火如荼,国家政策利好,互联网大佬纷纷在大数据行业布局,我们想让自己的职业生涯在一个朝阳行业发展,肯定又要学习相关技术,让自己与时俱进,但是难就难在大数据是一个新兴事物,目前我国大学的专业里面还鲜少有这个专业,国家刚批的大数据专业,全国目前35个高校,但是从17年开始招生,2021年才有第一批毕业生进入职场,在四年期间,是大数据行业发展的飞速时期,没有行业发展是等着人才进入的,而是需要要虚位以待、蓄势待发,所以在没有高等教育准备好的大数据教育,如何高效的学习大数据,如何快速的与行业发展想契合,那么需要我们成为第一个吃螃蟹的人,作为一个随着大数据行业成长的职业人,首先要知道大数据是个啥?
大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
那来帮大家分析下:如何高效的学习大数据。
经常有初学者会问,自己想往大数据方向发展,该学哪些技术,学习路线是什么样的,觉得大数据很火,就业很好,薪资很高……首先,如果你确定了想往这个方面发展,先考虑自己的过去从业经历、专业、兴趣是什么。计算机专业——操作系统、硬件、网络、服务器?软件专业——软件开发、编程、写代码?还是数学、统计学专业——对数据和数字特别感兴趣?
那么你能找师傅带吗?
但凡有这种想法的人,或多或少都会存有侥幸之心,或者叫做“天真,单纯”。希望不花一分钱,就能更快速的学到更优质,更实用的技能。
关于这一点,我只想反问一句你:“如果你是大师,你凭什么愿意带我?”
其实这就是想告诉你大数据的三个发展方向,平台搭建/优化/运维/监控、大数据开发/设计/架构、数据分析/挖掘。
先说一下大数据的4V特征:
数据量大,TB->PB
数据类型繁多,结构化、非结构化文本、日志、视频、图片、地理位置等;
商业价值高,但是这种价值需要在海量数据之上,通过数据分析与机器学习更快速的挖掘出来;
处理时效性高,海量数据的处理需求不再局限在离线计算当中。
现如今,正式为了应对大数据的这几个特点,开源的大数据框架越来越多,越来越强,先列举一些常见的:
文件存储:Hadoop HDFS、Tachyon、KFS
离线计算:Hadoop MapReduce、Spark
流式、实时计算:Storm、Spark Streaming、S4、Heron
K-V、NOSQL数据库:HBase、Redis、MongoDB
资源管理:YARN、Mesos
日志收集:Flume、Scribe、Logstash、Kibana
消息系统:Kafka、StormMQ、ZeroMQ、RabbitMQ
查询分析:Hive、Impala、Pig、Presto、Phoenix、SparkSQL、Drill、Flink、Kylin、Druid
分布式协调服务:Zookeeper
集群管理与监控:Ambari、Ganglia、Nagios、Cloudera Manager
数据挖掘、机器学习:Mahout、Spark MLLib
数据同步:Sqoop
任务调度:Oozie
······
第一步:初识Hadoop
1.1 学会百度与Google
不论遇到什么问题,先试试搜索并自己解决。
Google首选,翻不过去的,就用百度吧。
1.2 参考资料首选官方文档
特别是对于入门来说,官方文档永远是首选文档。
相信搞这块的大多是文化人,英文凑合就行,实在看不下去的,请参考第一步。
1.3 先让Hadoop跑起来
Hadoop可以算是大数据存储和计算的开山鼻祖,现在大多开源的大数据框架都依赖Hadoop或者与它能很好的兼容。
关于Hadoop,你至少需要搞清楚以下是什么:
· Hadoop 1.0、Hadoop 2.0
· MapReduce、HDFS
· NameNode、DataNode
· JobTracker、TaskTracker
· Yarn、ResourceManager、NodeManager
自己搭建Hadoop,请使用第一步和第二步,能让它跑起来就行。
建议先使用安装包命令行安装,不要使用管理工具安装。
另外:Hadoop1.0知道它就行了,现在都用Hadoop 2.0.
1.4 尝试使用Hadoop
· HDFS目录操作命令;
· 上传、下载文件命令;
· 提交运行MapReduce示例程序;
· 打开Hadoop WEB界面,查看Job运行状态,查看Job运行日志。
· 知道Hadoop的系统日志在哪里。
1.5了解它们的原理
MapReduce:如何分而治之;
HDFS:数据到底在哪里,什么是副本;
Yarn到底是什么,它能干什么;
NameNode到底在干些什么;
ResourceManager到底在干些什么;
1.6 自己写一个MapReduce程序
仿照WordCount例子,自己写一个(照抄也行)WordCount程序,
打包并提交到Hadoop运行。
不会Java的话,Shell、Python都可以,有个东西叫Hadoop Streaming。
如果能认真完成了以上几步,恭喜你,你的一只脚已经进来了。
第二步:更高效的WordCount
2.1 学点SQL吧
如果不懂数据库的童鞋先学习使用SQL句。
2.2 SQL版WordCount
在1.6中,你写(或者抄)的WordCount一共有几行代码?
如果用SQL的话:
SELECT word,COUNT(1) FROM wordcount GROUP BY word;
这便是SQL的魅力,编程需要几十行,甚至上百行代码,SQL一句就搞定;使用SQL处理分析Hadoop上的数据,方便、高效、易上手、更是趋势。不论是离线计算还是实时计算,越来越多的大数据处理框架都在积极提供SQL接口。
2.3 安装配置Hive
Hive算是数据仓库工具,安装不难,网上有很多教程,配置完成后,可以正常进入Hive命令行。
2.4 试试使用Hive
尝试在Hive中创建wordcount表,并运行2.2中的SQL语句。在Hadoop WEB界面中找到刚才运行的SQL任务。看SQL查询结果是否和1.4中MapReduce中的结果一致。
明明写的是SQL,为什么Hadoop WEB界面中看到的是MapReduce任务?
2.5 学会Hive的基本命令
创建、删除表;加载数据到表;下载Hive表的数据;并学习更多关于Hive的语法和命令。
0和Hadoop2.0的区别
MapReduce的原理(还是那个经典的题目,一个10G大小的文件,给定1G大小的内存,如何使用Java程序统计出现次数最多的10个单词及次数);
HDFS读写数据的流程;向HDFS中PUT数据;从HDFS中下载数据;
自己会写简单的MapReduce程序,运行出现问题,知道在哪里查看日志;
会写简单的SELECT、WHERE、GROUP BY等SQL语句;
Hive SQL转换成MapReduce的大致流程;
Hive中常见的语句:创建表、删除表、往表中加载数据、分区、将表中数据下载到本地;
从上面的学习,你已经了解到,HDFS是Hadoop提供的分布式存储框架,它可以用来存储海量数据,MapReduce是Hadoop提供的分布式计算框架,它可以用来统计和分析HDFS上的海量数据,而Hive则是SQL On Hadoop,Hive提供了SQL接口,开发人员只需要编写简单易上手的SQL语句,Hive负责把SQL翻译成MapReduce,提交运行。
第三步:把别处的数据搞到Hadoop上
此处也可以叫做数据采集,把各个数据源的数据采集到Hadoop上。
3.1 HDFS PUT命令
put命令在实际环境中也比较常用,通常配合shell、python等脚本语言来使用。建议需熟练掌握。
3.2 HDFS API
HDFS提供了写数据的API,自己用编程语言将数据写入HDFS,put命令本身也是使用API。
实际环境中一般自己较少编写程序使用API来写数据到HDFS,通常都是使用其他框架封装好的方法。比如:Hive中的INSERT语句,Spark中的saveAsTextfile等。
可以尝试了解原理,试着写几个Demo。
3.3 Sqoop
Sqoop是一个主要用于Hadoop/Hive与传统关系型数据库Oracle/MySQL/SQLServer等之间进行数据交换的开源框架。
就像Hive把SQL翻译成MapReduce一样,Sqoop把你指定的参数翻译成MapReduce,提交到Hadoop运行,完成Hadoop与其他数据库之间的数据交换。
自己下载和配置Sqoop(建议先使用Sqoop1,Sqoop2比较复杂)。
了解Sqoop常用的配置参数和方法。
使用Sqoop完成从MySQL同步数据到HDFS;
使用Sqoop完成从MySQL同步数据到Hive表;
PS:如果后续选型确定使用Sqoop作为数据交换工具,那么建议熟练掌握,否则,了解和会用Demo即可。
3.4 Flume
Flume是一个分布式的海量日志采集和传输框架,因为“采集和传输框架”,所以它并不适合关系型数据库的数据采集和传输。Flume可以实时的从网络协议、消息系统、文件系统采集日志,并传输到HDFS上。因此,如果你的业务有这些数据源的数据,并且需要实时的采集,那么就应该考虑使用Flume。
下载和配置Flume。使用Flume监控一个不断追加数据的文件,并将数据传输到HDFS;
PS:Flume的配置和使用较为复杂,如果你没有足够的兴趣和耐心,可以先跳过Flume。
3.5 阿里开源的DataX
之所以介绍这个,是因为以前某公司客户目前使用的Hadoop与关系型数据库数据交换的工具,就是之前基于DataX开发的,个人感觉非常好用。现在DataX已经是3.0版本,支持很多数据源。你也可以在其之上做二次开发。
PS:有兴趣的可以研究和使用一下,对比一下它与Sqoop。
至此,你的“大数据平台”应该是这样的:
第四步:把Hadoop上的数据搞到别处去
前面介绍了如何把数据源的数据采集到Hadoop上,数据到Hadoop上之后,便可以使用Hive和MapReduce进行分析了。那么接下来的问题是,分析完的结果如何从Hadoop上同步到其他系统和应用中去呢?
其实此处的方法和第三步基本一致的。
4.1 HDFS GET命令
把HDFS上的文件GET到本地。需要熟练掌握。
4.2 HDFS API
原理同3.2。
4.3 Sqoop
原理同3.3。
使用Sqoop完成将HDFS上的文件同步到MySQL;
使用Sqoop完成将Hive表中的数据同步到MySQL;
4.4 DataX
原理同3.4
此时,“你的大数据平台”应该是这样的:
走完第三步和第四步的流程,那么你应该已经具备以下技能和知识点:
· 知道如何把已有的数据采集到HDFS上,包括离线采集和实时采集;
· 知道sqoop(或者还有DataX)是HDFS和其他数据源之间的数据交换工具;
· 知道flume可以用作实时的日志采集;
至此,对于大数据平台,应该已经掌握如何搭建Hadoop集群,把数据采集到Hadoop上,使用Hive和MapReduce来分析数据,把分析结果同步到其他数据源。
接下来的问题就是,Hive使用的越来越多,你会发现很多不愉快的地方,特别是速度慢,
大多情况下,明明我的数据量很小,它都要申请资源,启动MapReduce来执行。
第五步:快一点吧,我的SQL
其实大家都已经发现Hive后台使用MapReduce作为执行引擎,实在是有点慢。因此SQL On Hadoop的框架越来越多,按我的了解,最常用的按照流行度依次为SparkSQL、Impala和Presto.这三种框架基于半内存或者全内存,提供了SQL接口来快速查询分析Hadoop上的数据。
目前我们的方案使用的是SparkSQL,至于为什么用SparkSQL,原因大概如下:
· 使用Spark还做了其他事情,不想引入过多的框架;
· Impala对内存的需求太大,没有过多资源部署;
5.1 关于Spark和SparkSQL
什么是Spark,什么是SparkSQL。
Spark有的核心概念及名词解释。
SparkSQL和Spark是什么关系,SparkSQL和Hive是什么关系。
5.2 如何部署和运行SparkSQL
Spark有哪些部署模式?
如何在Yarn上运行SparkSQL?
使用SparkSQL查询Hive中的表。
PS:Spark不是一门短时间内就能掌握的技术,因此建议在了解了Spark之后,可以先从SparkSQL入手,循序渐进。
第六步:一夫多妻制
其实我想说的是数据的一次采集、多次消费。
在实际业务场景下,特别是对于一些监控日志,想即时的从日志中了解一些指标(关于实时计算,后面步节会有介绍),这时候,从HDFS上分析就太慢了,尽管是通过Flume采集的,但Flume也不能间隔很短就往HDFS上滚动文件,这样会导致小文件特别多。
为了满足数据的一次采集、多次消费的需求,这里要说的便是Kafka。
6.1 关于Kafka
Kafka是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模的网站中的所有动作流数据。这种动作(网页浏览,搜索和其他用户的行动)是在现代网络上的许多社会功能的一个关键因素。这些数据通常是由于吞吐量的要求而通过处理日志和日志聚合来解决。
6.2 如何部署和使用Kafka
使用单机部署Kafka,并成功运行自带的生产者和消费者例子。
使用Java程序自己编写并运行生产者和消费者程序。
Flume和Kafka的集成,使用Flume监控日志,并将日志数据实时发送至Kafka。
至此,“大数据平台”应该扩充成这样:
这时,使用Flume采集的数据,不是直接到HDFS上,而是先到Kafka,Kafka中的数据可以由多个消费者同时消费,其中一个消费者,就是将数据同步到HDFS。
总结:
为什么Spark比MapReduce快。
使用SparkSQL代替Hive,更快的运行SQL。
使用Kafka完成数据的一次收集,多次消费架构。
自己可以写程序完成Kafka的生产者和消费者。
前面的学习已经掌握了大数据平台中的数据采集、数据存储和计算、数据交换等大部分技能,而这其中的每一步,都需要一个任务(程序)来完成,各个任务...
- ?
大数据分析与数据分析的根本区别在哪里?
Haley
展开
作者:CDA数据分析师
大数据分析与数据分析这几年一直都是个高频词,很多人都开始纷纷转行到这个领域,也有不少人开始跃跃欲试,想找准时机进到大数据或数据分析领域。如今大数据分析和数据分析火爆,要说时机,可谓处处都是时机,关键要明了的一点是,大数据分析和数据分析两者的根本区别在哪里,只有真正了解了,才会知晓更加适合自己的领域是大数据分析师还是数据分析师。毕竟职场如战场,时间就是生活,不容儿戏,更不容怠慢。下面我来好好告诉大家两者的本质区别到底是什么!
大数据分析:指无法在可承受的时间范围内用常规软件工具进行捕捉、管理和处理的数据集合。是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
在维克托·迈尔-舍恩伯格及肯尼斯·库克耶编写的《大数据时代》 中大数据分析指不用随机分析法(抽样调查)这样的捷径,而采用所有数据进行分析处理,因此不用考虑数据的分布状态(抽样数据是需要考虑样本分布是否有偏,是否与总体一致)也不用考虑假设检验,这点也是大数据分析与一般数据分析的一个区别。
数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。
大数据分析与数据分析最核心的区别是处理的数据规模不同,由此导致两个方向从业者的技能也是不同的。在CDA人才能力标准中从理论基础、软件工具、分析方法、业务分析、可视化五个方面对数据分析师与大数据分析师进行了定义。
【数据分析师的要求】
数据分析师的理论要求:统计学、概率论和数理统计、多元统计分析、时间序列、数据挖掘。
工具要求:必要:Excel、SQL可选:SPSS MODELER、R、Python、SAS等
分析方法要求:除掌握基本数据处理及分析方法以外,还应掌握高级数据分析及数据挖掘方法(多元线性回归法,贝叶斯,神经网络,决策树,聚类分析法,关联规则,时间序列,支持向量机,集成学习等)和可视化技术。
业务分析能力:可以将业务目标转化为数据分析目标;熟悉常用算法和数据结构,熟悉企业数据库构架建设;针对不同分析主体,可以熟练的进行维度分析,能够从海量数据中搜集并提取信息;通过相关数据分析方法,结合一个或多个数据分析软件完成对海量数据的处理和分析。
结果展现能力:报告体现数据挖掘的整体流程,层层阐述信息的收集、模型的构建、结果的验证和解读,对行业进行评估,优化和决策。
【大数据分析师的要求】
理论要求:统计学、概率论和数据库、数据挖掘、JAVA基础、Linux基础。
工具要求:必要: SQL、Hadoop、HDFS、Mapreduce、Mahout、Hive、Spark可选:RHadoop、Hbase、ZooKeeper等
分析方法要求:熟练掌握hadoop集群搭建;熟悉nosql数据库的原理及特征,并会运用在相关的场景;熟练运用mahout、spark提供的进行大数据分析的数据挖掘算法,包括聚类(kmeans算法、canopy算法)、分类(贝叶斯算法、随机森林算法)、主题推荐(基于物品的推荐、基于用户的推荐)等算法的原理和使用范围。
业务分析能力:熟悉hadoop+hive+spark进行大数据分析的架构设计,并能针对不同的业务提出大数据架构的解决思路。掌握hadoop+hive+ Spark+tableau平台上Spark MLlib、SparkSQL的功能与应用场景,根据不同的数据业务需求选择合适的组件进行分析与处理。并对基于Spark框架提出的模型进行对比分析与完善。
结果展现能力:报告能体现大数据分析的优势,能清楚地阐述数据采集、大数据处理过程及最终结果的解读,同时提出模型的优化和改进之处,以利于提升大数据分析的商业价值。
综上大数据分析与数据分析的根本区别就是分析的思维与分析所用的工具不同。大家在求职或转行过程认清自己对两者的偏好和自己的兴趣所在,以及自己的能力更适合在哪个领域发挥,还有自己所在城市对两者的职业需求,综合天时地利人和三个条件,我们才能做出更理智更客观更科学的抉择。
- ?
就业前景极好的大数据专业,你了解吗?
笑旋
展开
当下,人工智能、大数据等热门词汇频频出现在人们的视野中。作为万物分析的大数据更是站在互联网的风口浪尖上,直接催热了大学里的大数据专业。
从IT时代进入DT时代,高校在大数据方向上设置了什么专业,具体学什么,就业怎么样,作为新兴专业,考生如何报考?今天,就来谈一谈这个大家关注的热门专业。
1.什么叫大数据?
进入互联网时代,中国的网民人数已超7亿,大数据的应用涉及到生活的方方面面。例如,你在网站上买书,商家就会根据你的喜好和其他购书者的评价给你推荐另外的书籍;手机定位数据和交通数据可以帮助城市规划;甚至用户的搜索习惯和股市都有很大关系。
在谈到大数据的时候,人们往往知道的就是数据很大,但大数据≠大的数据。大数据,就是存储在各种存储介质中的海量的各种形态数据,具有5V特点,即:Volume(大量)、Velocity(高速)、Variety(多样)、Value(价值密度)、Veracity(真实性)。大数据之“大”,不仅在于其“大容量”,更在于其“大价值”,并已成为除人力、土地、财务、技术之外的另一种重要的基础资源。对各种存储介质中海量信息的采集、存储、分析、整合、控制而得到的数据就是大数据。大数据技术的意义不在于掌握庞大的数据信息,而在于对这些数据进行专业化处理,通过“加工”实现数据的“增值”,更好地辅助决策。
2.数据科学与大数据技术专业
本科专业中和大数据相对应的是“数据科学与大数据技术”专业,它是2015年教育部公布的新增专业。2016年3月公布的《高校本科专业备案和审批结果》中,北京大学、对外经济贸易大学和中南大学3所高校首批获批开设“数据科学与大数据技术”专业。随后第二年又有32所高校获批“数据科学与大数据技术”专业。两次获批的名单中显示,该专业学制为四年,大部分为工学。
数据科学与大数据技术是个交叉性很强的专业,很难说完全归属于哪个独立的学科。所以,不同的学校有的是信息学院申报,有的是计算机学院牵头申报,有的设在统计学院,还有的在经管学院。像北京大学这个专业是放在理学下,授予理学学位。大多数是设在工学计算机门类下,授予的是工学学位。数据科学很早就存在,是个比较经典的学科,现在和大数据技术结合形成了这个专业。目前教育部设定的本科专业名称为“数据科学与大数据技术”,专科名称是“大数据技术与应用”。
3.数据科学与大数据技术学什么?
以对外经济贸易大学该专业为例,专业知识结构包括数学、统计、计算机和大数据分析四大模块,具体课程设置如下:
数学:数学分析一、数学分析二、高等代数、离散数学。统计学:概率论与数理统计、多元统计分析、随机过程。计算机:数据机构、计算机组成原理、操作系统、数据库系统原理、C++程序设计、Java程序设计、Python与大数据分析、科学计算与Matlab应用、R语言等。大数据分析:数据科学导论、机器学习与数据挖掘、信息检索与数据处理、自然语言处理、智能计算、推荐系统原理、大数据分析技术基础、数据可视化、大数据存储与管理、大数据分析实践等课程。
数据科学与大数据技术是一门实践性很强的新兴交叉复合型学科:以统计学、数学、计算机为三大支撑性学科;生物、医学、环境科学、经济学、社会学、管理学为应用拓展性学科。此外还需学习数据采集、分析、处理软件,学习数学建模软件及计算机编程语言等,知识结构是二专多能复合的跨界人才(有专业知识、有数据思维)。根据各校偏重的专业方向,课程设置有所差异,感兴趣的同学可以具体查看各校的专业和课程设置情况。
1.行业增速快 人才缺口大
随着移动互联网和智能终端的普及,信息技术与经济社会的交汇融合,引发了数据迅猛增长。新摩尔定律认为,人类有史以来的数据总量,每过18个月就会翻一番。而海量的数据蕴含着巨大生产力和商机。
2011年至2014年四年间,我国大数据处于起步阶段,每年均增长在20%以上。2015年,大数据市场规模已达到98.9亿元。2016年增速达到45%,超过160亿元。预计2020年,我国大数据市场规模将超过8000亿元,有望成世界第一数据资源大国。但数据开放度低、技术薄弱、人才缺失、行业应用不深入等都是产业发展中亟待解决的问题。
根据领英发布《2016年中国最热职位人才报告》显示,有六类热门职位的人才当前都处于供不应求状态,稀缺程度各有不同,其中,数据分析人才的供给指数最低,仅为0.05,属于高度稀缺。
目前的当务之急是解决大数据人才瓶颈问题,相关调查显示,未来3-5年大数据人才缺口达到150万之多。,但截至目前,中国大数据从业人员只有约30万人。同时,大数据行业选才的标准也在不断变化。初期,大数据人才的需求主要集中在ETL研发、系统架构开发、数据仓库研究等偏硬件领域,以IT、计算机背景的人才居多。随着大数据往各垂直领域延伸发展,对统计学、数学专业的人才,数据分析、数据挖掘、人工智能等偏软件领域的需求加大。
数据分析师现在需求就很旺盛了,2年工作经验的月薪可达到8K,硕士学历的数据分析师月薪可达到12K,5年工作经验的可达到40万至60万元。
2.大数据主要就业方向
2015年9月国务院印发《促进大数据发展行动纲要》,系统部署大数据发展工作。《纲要》明确提出了七方面政策机制,其中第六条就是加强专业人才培养,建立健全多层次、多类型的大数据人才培养体系。目前,大数据主要有三大就业方向:大数据系统研发类、大数据应用开发类和大数据分析类。具体岗位如下:
1.大数据系统架构师
大数据平台搭建、系统设计、基础设施。
2.大数据系统分析师
面向实际行业领域,利用大数据技术进行数据安全生命周期管理、分析和应用。
3.hadoop开发工程师。
解决大数据存储问题。
4.数据分析师
不同行业中,专门从事行业数据搜集、整理、分析,并依据数据做出行业研究、评估和预测的专业人员。在工作中通过运用工具,提取、分析、呈现数据,实现数据的商业意义。
作为一名数据分析师,至少需要熟练SPSS、STATISTIC、Eviews、SAS、大数据魔镜等数据分析软件中的一门,至少能用Acess等进行数据库开发,至少掌握一门数学软件如matalab、mathmatics进行新模型的构建,至少掌握一门编程语言。总之,一个优秀的数据分析师,应该业务、管理、分析、工具、设计都不落下。
5.数据挖掘工程师
做数据挖掘要从海量数据中发现规律,这就需要一定的数学知识,最基本的比如线性代数、高等代数、凸优化、概率论等。经常会用到的语言包括Python、Java、C或者C++,我自己用Python或者Java比较多。有时用MapReduce写程序,再用Hadoop或者Hyp来处理数据,如果用Python的话会和Spark相结合。
6.大数据可视化工程师
随着大数据在人们工作及日常生活中的应用,大数据可视化也改变着人类的对信息的阅读和理解方式。从百度迁徙到谷歌流感趋势,再到阿里云推出县域经济可视化产品,大数据技术和大数据可视化都是幕后的英雄。
1.院校开设情况
大数据人才的典型胜任特征:善于做需求分析、写代码;善于与人沟通,喜欢探索未知;需要根据数据推演、分析、提出解决方案,有数据思维;需要持续保持学习状态;内性格上能动能静。
不同办学层次的院校开设此专业,培养模式会有差异。例如,高职类院校学生由于数学基础相对薄弱,会跟多偏向于工具的使用,如数据清洗、数据存储以及数据可视化等相关工具的使用;本科院校会倾向于大数据相关基础知识全面覆盖性教学,在研究生段则会专攻某一技术领域,比如数据挖掘、数据分析、商业智能、人工智能等。
在“教育部2015年度普通高等学校本科专业备案和审批结果”中北京大学、中南大学、对外经贸大学成为首批开设 “数据科学与大数据技术”本科专业的高校,随后中国人民大学、北京邮电大学、复旦大学等32所高校成为第二批成功申请该专业的高校。至去年上半年,我国已有35所高校获批“数据科学与大数据技术”本科专业。经过一年的发展,申请院校成井喷式的增长,全国高校大数据教育联盟通过教育部公示的申请2017年“数据科学与大数据技术”专业的院校来看,2017年申请院校高达263所,其中工学190所,理学73所。
数据科学与大数据技术是个交叉性强、跨学科的专业,很难说是完全归属与那个独立的学科。高校牵头申报的学院不同,培养重点和授予的学位可能不一样。因为课程来自于不同的学院,也有高校是联合一些学院单独成立机构来申报。从名单可以看出,在大部分开设院校中该专业都属于工学类,有个别院校将其归属在理学门类,授予理学学位。
有志于学习数据科学与大数据技术专业的学生,可以从大学的传统优势领域和行业背景考虑选择。比如,复旦大学的大数据技术本科专业是设在大数据学院下;北京大学是在数学院开设了该专业,偏数学的内容更多一些。对外经济贸易大学该专业设在信息学院,因为财经是学校传统优势,专业还会偏重经济、金融等相关学科领域的知识。
2.报考注意事项
了解了大数据行业和大数据专业后,对于考生填报与大数据相关的热门专业,需要注意以下几点:
1.报考热门专业和就业热的专业并不一定是重合的,比如软件、计算机、金融,这些专业的就业率实际并没有那么高,地质勘探、石油、遥感等专业,虽然报考时是冷门,但行业需求大,就业率更高。
2.选择热门专业,更需要考虑就业质量。专业就业好,是统计学意义,指的是平均收入水平高,比如金融专业的收入,比其他纯文科专业的平均收入较高,但落实到个体层面,就业情况就不一样了,尤其像金融专业是典型的名校高学历好就业,但对于考试成绩较低的同学来说,如果去一些普通院校、专科院校学习金融,最后就业情况可能还不如会计专业。
3.志愿填报,除了专业,城市因素也很重要:如果想从事金融、互联网的工作,更适合去一线城市,如果是去三、四线大学的学生可以考虑应用面比较广的专业,就是各行各业都能用到的专业,比如会计专业,专科层次的会计和985层次的会计都有就业渠道。如果先选择报考城市,也可以针对所在城市的行业特点选择专业,比如沿海城市外贸相对发达,选择国际贸易、外语类专业就业情况更好,比如武汉有光谷,选择光电类专业更好就业。
4.最终家长和考生更需要考虑个人与专业匹配的问题,金融、计算机等热门专业不是所有人都适合学,好专业不见得对所有个体都是好的。
5.最后,考生报考时要注意,有的高校大数据专业是按大类招生,即按计算机大类,且只招理科生。
下面是人大、北邮、中南大学三校2017年数据科学与大数据技术专业在五个省市的录取数据。其中,人大的大数据专业归统计学大类;北邮的大数据专业归计算机大类。
- ?
大数据属于什么专业?
元正
展开
很多院校有大数据课程和方向,关联度较高的专业有:软件工程、计算机科学、信息管理、应用数学/数学与统计。大数据应用有三个主要层面(即数据管理、系统开发、海量数据分析与挖掘),这三个层面系统地帮助企业掌握大数据应用中的各种典型问题的解决办法。
大数据的核心技术:(1)大数据与Hadoop生态系统。详细介绍分析分布式文件系统HDFS、集群文件系统ClusterFS和NoSQL Database技术的原理与应用;分布式计算框架Mapreduce、分布式数据库HBase、分布式数据仓库Hive。(2)关系型数据库技术。详细介绍关系型数据库的原理,掌握典型企业级数据库的构建、管理、开发及应用。(3)分布式数据处理。详细介绍分析Map/Reduce计算模型和Hadoop Map/Reduce技术的原理与应用。(4)海量数据分析与数据挖掘。详细介绍数据挖掘技术、数据挖掘算法–Minhash, Jaccard and Cosine similarity,TF-IDF数据挖掘算法–聚类算法;以及数据挖掘技术在行业中的具体应用。(5)物联网与大数据。详细介绍物联网中的大数据应用、遥感图像的自动解译、时间序列数据的查询、分析和挖掘。(6)文件系统(HDFS)。详细介绍HDFS部署,基于HDFS的高性能提供高吞吐量的数据访问。(7)NoSQL。详细介绍NoSQL非关系型数据库系统的原理、架构及典型应用。
- ?
大数据分析,不要错过这些最有“前途”的专业
奈何桥
展开
图片来源于网络
又到了一年一度的毕业季,高考在即,很多的学子面临着选择专业的问题,虽然说兴趣很重要,但是家长们考虑更多的是将来的就业和生活问题。而那些准备毕业的大学生们,也都在考虑从事一个什么样的专业能够最有“钱途”。
下面的这则报道可能会对你有所帮助
近日,麦可思研究院近日对外发布了一份关于中国大学毕业生收入状况的调查报道。报告显示,在2016年的应届本科毕业生从事的职业中,“互联网开发及应用”在职业高薪榜上独领风骚,毕业半年后的平均月薪就达到了5679元!而紧随其后的分别是“计算机与数据处理”(5636元)和“房地产经营”(5057元)。
图表数据来自麦可思研究院
据悉,这份针对大学毕业生收入情况的调查结论,基于麦可思对2016届本科毕业生毕业半年后,以及2013届毕业生毕业3年后的跟踪调查。
2016届大学生毕业生回收到的全国总样本约28.9万份,其中本科生样本约14.7万,高职高专生样本约14.2万。对2013届大学生毕业3年后的连续跟踪调查,回收全国总样本约5万。
对于上述高收入职业,报告分析,当前,互联网行业的迅速发展促进了有关职业的旺盛需求,让计算机、软件工程等专业毕业生收入较高。
上述调查研究除了调查了2016届毕业生毕业半年后的收入情况,还调查了2013届大学毕业生毕业3年后的收入变化情况。
数据显示,2013届本科生毕业三年后月收入涨幅最大的职业类是“律师/律政调查员”(半年后:3388元,三年后:7656元),涨幅为126%,其次为“医疗保健/紧急救助”(半年后:2908元,三年后:6407元),涨幅为120%。“农/林/牧/渔”(半年后:3001元,三年后:6579元)位列第三,涨幅为119%。
除了本科生,调查显示,2013届高职高专生毕业三年后月收入涨幅最大的职业类是“经营管理”(半年后:3185元,三年后:7133元),涨幅为124%,其次是“计算机与数据处理”(半年后:3015元,三年后:6564元),涨幅为118%,“房地产经营”(半年后:3257元,三年后:7078元)位列第三,涨幅为117%。
从这份报告中不难看出,计算机与数据处理、互联网开发及应用、经营管理、房地产经营等行业在收入方面都有很大的优势。而诸如医疗保健/紧急救助和农/林/牧/渔等职业,虽然起薪平平,但是中、长期薪酬待遇也有不错的发展。
盛景哥温馨提示:收入不应是职业和专业选择的唯一衡量标准,在选择专业和职业时,考生或者毕业生还要将社会需求量、个人兴趣爱好等因素都考虑在内。
- ?
大数据技术与应用专业的就业前景、就业待遇如何呢?
景念瑶
展开
大数据(big data)
指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合。
是需要新处理模式分布式处理技术、存储技术和感知技术从采集、处理、存储到形成结果的整个过程。
从而拥有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
专业背景
近几年来,互联网行业发展风起云涌,而移动互联网、电子商务、物联网以及社交媒体的快速发展更促使我们快速进入了大数据时代。截止到目前,人们日常生活中的数据量已经从TB(1024GB=1TB)级别一跃升到PB(1024TB=1PB)、EB(1024PB=1EB)乃至ZB(1024EB=1ZB)级别,数据将逐渐成为重要的生产因素,人们对于海量数据的运用将预示着新一波生产率增长和消费者盈余浪潮的到来。大数据时代,专业的大数据人才必将成为人才市场上的香饽饽。
当下,大数据从业人员的两个主要趋势是:
1、大数据领域从业人员的薪资将继续增长;
2、大数据人才供不应求。
图示说明:2012-2020年全球数据产生量预测
专业发展现状
填补大数据技术与应用专业人才巨大缺口的最有效办法无疑还需要依托众多的高等院校来培养输送,但互联网发展一日千里,大数据技术、手段日新月异,企业所需要的非常接地气的人才培养对于传统以培养学术型、科研型人才为主要使命的高校来说还真有些难度。
幸好这个问题已经被全社会关注,政府更是一再提倡产教融合、校企合作来创办新型前沿几乎以及“互联网+”专业方向,也已经有一些企业大胆开始了这方面的创新步伐。据我了解,慧科教育就是一家最早尝试高校校企合作的企业,其率先联合各大高校最早开设了互联网营销,这也是它们的优势专业,后来慧科教育集团又先后和北京航空航天大学、对外经济贸易大学、贵州大学、华南理工大学、宜春学院、广东开放大学等高校在硕、本、专各个层次开设了大数据专业方向,在课程体系研发、教学授课及实训实习环节均有来自BAT以及各大行业企业一线的技术大拿参与,所培养人才能够很好地满足企业用人需求。
那大数据有哪些应用领域呢?
1.顾客需求分析。
2.改善生活。
3.业务流程优化。
4.客户体验优化。
5.医疗优化。
6.结果预测。
而且工资也给的不低
最后,需要特别指出的是:大数据专业都采用的校企合作专业共建的形式办学,并且由于是新兴前沿专业,更加注重对技能的要求和掌握,所以大家在选择就读学校的时候不仅要注意学校的层次和水平,也要注意企业的资质和经验等。
大数据分析与应用专业
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并