中企动力 > 商学院 > 统计与数据分析专业
  • ?

    推荐 :数据科学与大数据技术专业特色课程研究

    冰兰

    展开

    在我国,数据科学与大数据技术专业的建设已成为新的热点话题。 在系统调研 世界一流大学数据科学专业建设现 状的基础上,从特色课程视角重点分析 加州大学伯克利分校、约翰·霍普金斯大学、华盛顿大学、纽约大学、斯坦福大学、卡内基梅隆大学、哥伦比亚大学、伦敦城市大学等 8所大学的数据科学专业,提出 数据科学与大数据技术这一新专业 应重视的10门特色课程,并分析了现阶段我 国 数据科学教育中 普遍存在的8种曲解现象及对策建议 。

    2016 年,教育部发布的《 2015 年度普通高等学校本科专业备案和审批结果》中就首次增设“数据科学与大数据技术专业”,并获批了北京大学、对外经济贸易大学及中南大学的新增专业申请。接着, 2017 年,中国人民大学等 32 所高校出现在第二批次的获批名单中。另, 全国高校大数据教育联盟的统计数据显示, 2017 年申请该专业的院校高达 263 所,其中工学 190 所,理学 73 所 [1] 。从申请资料看,国内数据科学专业是一门主要以统计学和计算机科学与技术专业为基础建设的全新专业。数据科学专业已成为我国现阶段高等教育的热点问题之一。但是,建设什么样的专业以及如何建设该专业仍为各高校面临的难点问题。

    在国外,数据科学( Data Science )专业是以数据分析学( Data Analytics )专业为基础发展而来的,可追溯至 2007 年北卡罗来纳州立大学( North Carolina State University )率先设立的数据分析硕士学位( Master of Science in Analytics ) [2] 。与统计学和计算机科学与技术等基础学科不同的是,数据分析学进一步抽象了这些底层科学中的数据问题,连接了包括统计学和计算机科学在内的基础学科与数据科学之间的空白,为数据科学这一新学科的出现奠定了直接基础。从“数据分析学”向“数据科学”的实质性过渡出现在 2013 年左右,比较有代表性的是纽约大学于 2013 年新开设的数据科学硕士专业( The Master of Science in Data Science ) [3] 。 之后,包括加州大学伯克利分校、约翰 · 霍普金斯大学、华盛顿大学在内的多个学校设立了数据科学专业。可见,国外一流大学的数据科学专业建设至少早于国内 三 年。

    为此,本文在调查分析世界一流大学数据科学专业的培养方案,重点分析数据科学专业中开设的特色课程,并对探讨我国数据科学专业建设的借鉴意义。

    1 数据调研及分析

    作者通过 Study Portal 进行调查发现,截止 2017 年 11 月,国外数据科学专业的本科、硕士、博士学位项目分别已达到 5601 、 4179 和 301 项,主要分布在美国、英国、澳大利亚、加拿大、德国和意大利等国家。但是,从课程体系和人才培养定位看,能够体现国外数据科学专业教育的本质与特色的是硕士层次的教育,比较有典型的学校有加州大学伯克利分校、约翰·霍普金斯大学、华盛顿大学、纽约大学、斯坦福大学、卡内基梅隆大学、哥伦比亚大学、伦敦城市大学,如表 1 所示。

    表 1 典型数据科学专业及其特色课程( Typical Data Science Programs and their Core Courses )

    学校

    学位名称

    特色课程

    加州大学伯克利分校 [4]

    信息与数据科学硕士

    ( Master of Information and Data Science )

    Python 与数据科学 /Python for Data Science

    研究设计及数据与分析中的应用 /Research Design and Application for Data and Analysis

    数据存储与检索 / Storing and Retrieving Data

    应用机器学习 / Applied Machine Learning

    试验与因果分析 /Experiments and Causality

    大数据 —— 人与价值 / Behind the Data: Humans and Values

    ( 纵向扩展及真正的 ) 大数据 / Scaling Up! Really Big Data

    数据可视化与沟通 / Data Visualization and Communication

    (数据科学)综合训练课程 / Synthetic Capstone Course

    约翰 · 霍普金斯大学 [5]

    数据科学理学硕士

    ( Master of Science in Data Science )

    数据科学 /Data Science

    数据可视化 /Data Visualization

    随机优化与控制 /Stochastic Optimization and Control

    数据科学家的工具箱 / Data Scientist's Toolbox

    数据采集与清洗 /Getting and Cleaning Data

    探索性数据分析 /Exploratory Data Analysis

    可重复研究 /Reproducible Research

    实用机器学习 /Practical Machine Learning

    数据产品开发 /Developing Data Products

    数据科学综合训练课程 /Data Science Capstone

    华盛顿大学 [6]

    数据科学理学硕士

    Master of Science in Data Science

    数据可视化与探索性分析 / Data Visualization & Exploratory Analytics

    应用统计与试验设计 /Applied Statistics & Experimental Design

    数据管理与数据科学 /Data Management for Data Science

    数据科学家常用的统计机器学习 /Statistical Machine Learning for Data Scientists

    面向数据科学的软件设计 /Software Design for Data Science

    可扩展的数据系统与算法 /Scalable Data Systems & Algorithms

    以人为中心的数据科学 /Human-Centered Data Science

    数据科学综合训练课程 /Data Science Capstone Project

    纽约大学 [7]

    数据科学理学硕士 MS in Data Science

    数据科学导论 / Intro to Data Science

    大数据 /Big Data

    面向数据科学的统计学与概率论 /Probability and Statistics for Data Science

    推理与表示 / Inference and Representation

    机器学习与计算统计学 / Machine Learning and Computational Statistics

    数据科学综合训练课程 / Capstone Project in Data Science

    基于优化的数据分析 /Optimization-based Data Analysis

    非光滑凸优化 /Convex and Nonsmooth Optimization

    斯坦福大学 [8]

    统计学 : 数据科学 理学硕士学位

    M.S.in Statistics:Data Science

    现代应用统计学 : 学习 /Modern Applied Statistics: Learning

    现代应用统计学 : 数据挖掘 /Modern Applied Statistics: Data Mining

    数据驱动型医学 / Data Driven Medicine

    现代统计学与现代生物学 /Modern Statistics for Modern Biology

    大数据商务智能 / Business Intelligence from Big Data

    基于数据的计算范式 /Paradigms for Computing with Data

    卡内基梅隆大学 [9]

    计算数据科学硕士学位

    Master of Computational Data Science

    云计算 /Cloud Computing

    高级云计算 /Advanced Cloud Computing

    多媒体数据库及数据挖掘 /Multimedia Databases and Data Mining

    移动与普适计算 /Mobile and Pervasive Computing

    大数据集的机器学习 /Machine Learning with Big Data Sets

    智能信息系统的设计与开发 /Design and Engineering of Intelligent Info Systems

    大数据分析学 /Big Data Analytics

    哥伦比亚大学(纽约) [10]

    数据科学理学硕士

    Master of Science in Data Science

    数据科学导论 /Introduction to Data Science

    面向数据科学的计算机系统 /Computer Systems for Data Science

    探索性数据分析与可视化 /Exploratory Data Analysis & Visualization

    数据科学中的因果推理 / Causal Inference for Data Science

    大数据分析学 /Big Data Analytics

    数据科学综合训练及伦理 /Data Science Capstone & Ethics

    伦敦城市大学 [11]

    数据科学理学硕士

    MSc in Data Science

    数据科学原理 /Principles of data science

    大数据 /Big Data

    可视分析学 /Visual analytics

    数据可视化 /Data visualization

    神经计算 /Neural computing

    研究方法与专业问题 /Research Methods and Professional Issues

    高级并发编程 /Advanced Programming: Concurrency

    1.1加州大学伯克利分校

    该学校的数据科学专业由信息学院( School of Information )开设,专业名称为信息与数据科学,授予的学位为信息和数据科学专业硕士( Professional Master of Information and Data Science, MIDS ) [12] 。该专业主要侧重于培养学生的研究设计、数据清洗、存储与检索、挖掘与探索、数据可视化、道德与隐私、数据分析、沟通与呈现的能力,如图 1 所示。

    图 1 加州大学伯克利分校 MIDS 专业所关注的学生能力

    ( Key Skill Areas of MIDS at UC Berkeley ) [12]

    为了达到上述人才培养目的,该专业开设基础课程、高级课程和综合训练课程等 3 类课程。其中 ,基础课程共有5门,即面向数据科学的Python语言(Python for Data Science)、面向数据与分析的研究设计(Research Design and Application for Data and Analysis)、面向数据科学的统计学(Statistics for Data Science)、数据存储与检索(Storing and Retrieving Data)以及应用机器学习(Applied Machine Learning);高级课程有7门,包括试验与因果分析(Experiments and Causality)、数据、人与价值(Behind the Data: Humans and Values)、(纵向扩展及真正的)大数据(Scaling Up! Really Big Data)、面向离散响应,时间序列和面板数据的统计方法(Statistical Methods for Discrete Response, Time Series, and Panel Data)、可扩展的机器学习(Machine Learning at Scale)、基于深度学习的自然语言处理(Natural Language Processing with Deep Learning)以及数据可视化与沟通(Data Visualization and Communication)。除了基础课程和高级课程,该学校还开设一门综合训练课程(Synthetic Capstone),培 养学生综合运用所学专业知识及解决现实问题的能力。

    从总体上看,人才培养定位在培养数据科学领域的领导者,侧重培养学生的运用新工具和新方法,从现实数据中获得洞见( Insights )以及如何有效地沟通与阐释自己的研究发现,进而改变他人行动和思想的能力。 该学校的数据科学专业的人才培养具有如下几个特点 :

    强调数据科学的多学科交叉特点 ,将社会科学,计算机科学,统计学,管理学和法学等多学科知识融入具体课程之中;

    凸显数据科学本身的讲解 ,注重提升学生的基于数据提出好问题的能力以及面向数据科学的研究设计、数据清理、存储与检索、交流与沟通、统计分析、道德与隐私、数据可视化以及数据挖掘与探索等关键技能;

    引入基于项目的学习方法 ,借鉴本校信息学院其他专业的培养经验,通过基于项目的教学方式,鼓励学生综合运用多种不同的工具和方法来解决复杂问题;

    强调动手实践能力的培养,为学生提供亚马逊 Web 服务和 IBM 大数据平台等实践平台。

    1.2 约翰 · 霍普金斯大学

    该学校的怀廷工程学院( Whiting School of Engineering )开设名为数据科学( Data Science )的新专业,授予的学位为数据科学理学硕士( Master of Science in Data Science )。

    该专业的课程体系包含先修课程( Prerequisite Courses )、基础课程( Foundation Course )、必修课程( Required Courses )、选修课程( Electives )以及独立学习( Independent study )课程等近 60 门课程 [13] 。 基础课程有 2 门,即算法基础( Foundations of Algorithms )和统计方法与数据分析( Statistical Methods and Data Analysis );必修课程包括数据库系统原理、数据科学、数据可视化、优化导论( Introduction to Optimization )、统计模型与回归、计算统计学;选修课分为机器学习和统计学两个大方向,共有 14 门主要课程,均为较为常见课程。 值得一提的是,该专业另提供了近 30 门扩展选修课程( Additional Selections ),供学生用于置换同一个领域的必须 / 选修课程,这些扩展课程均为统计学和计算机科学与技术专业常见课程。 独立学习( Independent study )课程主要包括独立动手实战( Capstone 项目)和独立学习( Independent Study )。

    从总体上看, 该学校的数据科学专业的人才培养具有如下几个特点 :

    从人才培养的目的看,专业旨在培养“有竞争力”的数据科学家,要求学生具备三方面的能力:综合运用计算机科学和应用数学的知识,分析与处理大规模数据集的能力;从复杂数据中快速洞察到有价值信息的能力和从信息中发现相关关系的能力;基于规范的技术和抽象的方法以及面向现实世界中的具体问题的建模能力[14]。

    强调学生对数据科学的理论基础的掌握程度,突出了三个主要领域:计算机科学与技术、统计学与应用数学。其中,对应用数学的重视是该学校数据科学专业的一大特色。

    从课程设计及内容选择看,该专业鼓励在每一门课程中引入来自现实世界的具体问题作为例题和主要关注点。例如,独立学习(Independent Study)课程中强调对具体行业中实际问题的处理能力。

    强调培养学生的数据全生命期管理、统计 分析和故事化描述能力。

    1.3华盛顿大学

    整合自己的应用数学系、生物统计学系、 Paul G. Allen 计算机科学与工程学院、以人为本的设计与工程系、统计系、信息学院 6 大院系以及电子科学研究所的资源,开设出了一种面向在职人员的夜大类数据科学专业项目,所授予的学位为数据科学理学硕士( Master of Science in Data Science )。该专业的课程设计较为简洁,包括 8 门核心课程以及 1 个 Capstone 项目。其中, 8 个核心课程分别是统计与概率论( Introduction to Statistics & Probability )、信息可视化( Information Visualization )、应用统计与试验设计( Applied Statistics & Experimental Design )、面向数据科学的数据管理( Data Management for Data Science )、数据科学家常用的统计机器学习( Statistical Machine Learning for Data Scientists )、面向数据科学的软件设计( Software Design for Data Science )、可扩展的数据系统与算法( Scalable Data Systems & Algorithms )和以人为中心的数据科学( Human-Centered Data Science )。 Capstone 项目要求学生自...

  • ?

    数据分析:浅谈统计学在生活中的应用,看完长见识了!

    寻芹

    展开

    浅谈统计学在生活中的应用

    统计学并不是一门独立存在的学科,它是以数学知识和数理统计作为基础,将数理统计方法和其他学科专业知识交叉融合形成的具有极强推断性的一种分析方法。现阶段,随着科学技术的快速发展,为了加强对自然社会各个领域现象的判断和整理能力,将统计学应用在生活各个方面已经成为现阶段的数理统计的一种便捷方法。

      

    一、统计学的概念   统计学指的是调研人员通过一些列的手段对整理出来的数据信息进行整理分析,从而推断出调研对象本质,甚至可以对未来的类似事情进行预判的一门综合性学科。在进行统计学整体分析的过程中需要用到大量的数学知识以及其他相关学科的专业知识,统计学由于其自身独特的性质,在社会科学和自然科学的各个领域几乎都可以使用。   二、统计学在生活中的应用分析   (一)统计学在经济学中的重要应用   运用统计学对生活中的数据信息进行整理分析,首先要学习统计学的基础知识以及数据统计个分析等学科,这些基础知识和方法都是在开展统计学应用活动之前调研人员所必须掌握的。统计学课程的学习作为经济学学科当中的重要分支,在经济学课程中经常被应用,例如,经济学的计量统计就需要根据统计学在金融里面的重要意义和地位作为基础,将金融知识和统计学知识相结合,将金融计量和时间的序列进行结合,对收集到的金融数据进行整理分析,最后得出金融计量和时间序列的一定关系。   统计学在金融经济学中有着十分重要的工具性作用,主要包括两个方面,分别是:在思想上而言,统计学是对数据统计分析结果进行研究,最后得出研究对象的判断结果,为了保证研究结果的准确可靠性,统计学在进行数据整理分析过程中必须是带着严谨的科学态度,这种严谨的科学态度对于经济学的相关理论分析具有十分重要的指导地位,这是由于研究人员在对金融量进行数学分析的过程中,为了保证金融数学分析结果的准确可靠性就必须保证金融量数据收集分析等预处理过程是科学合理的;其本收集整理次,统计学是经济学进行科学试验研究最优化的选择,经济试验研究活动的多样性以及研究对象之间错综复杂的关系导致经济学的试验研究活动受到诸多限制,运用统计学进行经济学试验研究活动,使得经济学实验研究的对象变得简洁明了,降低试验研究的成本支出。从统计学在经济学中的应用我们可以看出,经济学当中的统计学应用主要是运用了统计学当中经济必然性的思想,使得经济学当中的统计结论不具备复杂的思想成本。   

    (二)统计学在医学中的重要应用   统计学在医学中应用的主要原因就是生物医学中存在的不确定性和变异性。生物医学主要的研究目标就是与人体健康相关的不确定因素,也就是通常所说的医学变异现象,变异现象在生物体当中是普遍存在的,例如,对于外在条件基本相同的两个病人,在相同的条件下进行治疗时,却有可能出现有的病人被治愈,有的病人治疗效果不明显,甚至还会出现死亡的现象。造成这些外在条件相同的生命体却出现不同程度治愈的主要原因就是生物医学中存在的不确定性或者是人体中存在的错综复杂的随机因素,客观差异存在的原因是因为某种偶然性的潜在的揭露必然性的发现。   在医学临床统计中发现,对于同一种病因的客观性规律进行调查,对于健康人的共同作用的交织与疗效的考查的病人很少。在医学当中运用统计学最主要的就是通过观察不同疗效病人的医疗诊断效果,将实际的医学诊断治疗效果与医学理论和假设进行验证,运用概率论以及数学方法对对比结果进行分析、判断,运用电子计算机等相关软件设备对研究对象的指标进行记录,并绘制相应的图表等,通过综合运用多种数理统计方法,得出与研究对象相关的研究结果。将统计学应用到医学当中,可以促进统计方法和多变量分析法在医学试验研究中的应用,对未知病因所造成的医疗诊断事故进行分析,可以促进医疗诊治手段的不断创新發展。

      

    (三)统计学在体育比赛中竞技指标的应用。   统计学在体育比赛中的应用主要是用统计的职业联赛的数字反应比赛队伍能否成为世界顶级,这是因为在体育比赛中应用统计学可以对比赛中的胜率进行分析,主要是将每个队员在每个赛季比赛的分数和常规赛场上的分数进行统计,通过一系列的数学计算分析,制定出每个队员得分平均值和标准差之间的正态分布图,通过正态分布图的稳定性来判断队员的技术稳定性。以众所周的NBA篮球比赛为例,NBA比赛中由于明星球员众多,在运用统计学进行数据整体分析时,需要依据本质上的规律进行数据统计,而不是随意的选择数据进行统计,例如在进行篮球比赛发球这一项双方队员的进攻和防守的概率时,在进行指标选择时就涉及到随机事件的发生概率,因此,可以运用统计学统计球员在每一场比赛上的均得分,通过这些数据指标的正态分布图来确定球员的技术稳定性。   三、结束语   在日常生活中应用统计学对数据进行管理分析,可以极大提高生产生活中对研究对象的管理效率,使得研究对象变得明确,降低管理成本。在实际的生产生活中应用统计学时,调研人员需要通过多次的试验和随机概率对比来确定事件发生的概率,通过定量定性的数理统计分析工作,充分发挥统计学对生产生活的促进作用。

  • ?

    数据分析师和数据科学家有什么区别?

    空气

    展开

    关于数据分析师,数据工程师和数据科学家有什么区别,三者有着相关的共同点,又有着不同点,数据科学家的影响力与互联网同进同退。数据工程师和数据分析师与数据科学家携手共同完成这幅“大数据时代”巨作。

    数据科学家是什么样一个存在呢?

    通常情况下,数据科学家有数学或物理方面的高等学位。有博士学位的情况并不少见,硕士学位仅是一个前提条件。数据科学家精通统计建模以及如何构建与定制高级数学算法。这既在他们专业范围内,也是他们所擅长的地方。我听到过有人这样形容一个数据科学家“软件工程技能牛过多数人的酷炫统计学家”。

    我结合加工的说:所谓数据科学家,是指运用统计分析、机器学习、分布式处理等技术,从大量数据中提取出对业务有意义的信息,以易懂的形式传达给决策者,并创造出新的数据运用服务的人才。

    数据工程师如何定义呢?

    数据工程师一般被定义成“深刻理解统计学科的明星软件工程师”。如果你正为一个商业问题烦恼,那么你需要一个数据工程师。这些伙计就是那些能提供可建模数据所需平台的人。他们的核心价值在于他们借由清晰数据创建数据管道的能力。

    如何区分数据科学家,数据工程师与数据分析师

    数据工程师对演算法有相当好的理解。因此,数据工程师理应能运行基本数据模型。商业需求的高端化催生了演算高度复杂化的需求。很多时候,这些需求超过了数据工程师掌握知识范围,这个时候你就需要打电话寻求数据科学家的帮助。

    数据分析师如何理解呢?

    数据分析师能洞悉一个方程式的商业意义。他们知道如何提出正确的问题,非常善于数据分析,数据可视化和数据呈现。不管是给另一个数据分析师还是C级执行做演讲,数据分析师都是数据提取,模式识别以及从大量数据中洞察问题方面的能手。

    如果你或者你的公司正考虑顺应这股大数据浪潮的发展,你应该从明确你想利用大数据解决所面临的商业问题处下手。接着找出你真正的需求:是数据采集,检索,仓储还是数据分析?然后编写相应的职位描述并做好准备。

    想要快速进入大数据行业,西线学院大数据培训是不错的选择,除了坚持小班化教学之外,还以项目式教学为宗旨,手把手辅导学员,进行大量的案例操作,保障学员不光学会书本上的知识,更具有实际操作的能力。

  • ?

    机器学习与数据分析常用术语-基础篇(一)

    平行线

    展开

    前言

    之前在给公司的程序员培训机器学习专题实战的时候,发现他们听的认真,也非常想学,但是每当问他们有哪里不懂的时候,他们总是回答不出哪里不懂,识懂非懂的状态,后来我总结了一下原因,1.机器学习领域跟程序开发的区别非常大,机器学习属于一个交叉学科,即需要数学也需要计算机学,难度相对与单学科要大些,2.机器学习领域有很多专业词汇与术语,之前程序员都没听说过和接触过,即使当时讲解的时候讲的非常细,也很难接触的过来,需要有个消化过程。

    本篇文章将着重介绍机器学习与数据挖掘领域常用的专业术语,希望能在机器学习路上的你带来帮助,假如你正准备学机器学习或数据挖掘建议你先了解该篇文章后在去学习。

    一.基础

    1.数据集(DataSet)

    数据集,又称为资料集、数据集合或资料集合,是一种由数据所组成的集合。

    程序员可以简单的理解成数据库表。

    2.变量(variable)

    变量来源于数学,是计算机语言中能储存计算结果或能表示值抽象概念。变量可以通过变量名访问。

    可以理解为字段。

    3.向量(Vector)

    在数学中,向量(也称为欧几里得向量、几何向量、矢量),指具有大小(magnitude)和方向的量。它可以形象化地表示为带箭头的线段。

    4.X变量(Independent variable)

    又称自变量,自变量一词来自数学。在数学中,y=f(x) 。在这一方程中自变量是x,因变量是y。将这个方程运用到心理学的研究中,自变量是指研究者主动操纵,而引起因变量发生变化的因素或条件,因此自变量被看作是因变量的原因。如在比较男女性白细胞数的实验中,性别被称为了自变量,而白细胞数则为因变量。

    可以理解成我们在机器学习中需要分析的变量叫做X变量。

    5.Y变量(dependent variable)

    又称因变量,可以理解为结果变量,如我们在金融贷款项目中预测某人是否可以放款,是否可以放款这个变量就叫做因变量。

    6.连续变量

    在统计学中,变量按变量值是否连续可分为连续变量与离散变量两种。在一定区间内可以任意取值的变量叫连续变量,其数值是连续不断的,相邻两个数值可作无限分割,即可取无限个数值。如:年龄、体重等变量。

    7.离散变量

    离散变量的各变量值之间都是以整数断开的,如人数、工厂数、机器台数等,都只能按整数计算。离散变量的数值只能用计数的方法取得。

    8.二元变量

    通常可以理解成哑变量或虚拟变量,虚拟变量 ( Dummy Variables) 又称虚设变量、名义变量或哑变量,用以反映质的属性的一个人工变量,是量化了的自变量,通常取值为0或1。

    9.定性变量

    统计学概念,定性变量(qualitative variable)又名分类变量 ( categorical variable ): 观测的个体只能归属于几种互不相容类别中的一种时,一般是用非数字来表达其类别,这样的观测数据称为定性变量。可以理解成可以分类别的变量,如学历、性别、婚否等。

    10.均值

    即平均值,平均数是表示一组数据集中趋势的量数,是指在一组数据中所有数据之和再除以这组数据的个数。

    11.中位数

    对于有限的数集,可以通过把所有观察值高低排序后找出正中间的一个作为中位数。如果观察值有偶数个,通常取最中间的两个数值的平均数作为中位数。

    12.缺失值

    它指的是现有数据集中某个或某些属性的值是不完全的。

    13.缺失率

    某属性的缺失率=数据集中某属性的缺失值个数/数据集总行数

    14.异常值

    异常值(outlier)是指一组测定值中与平均值的偏差超过两倍标准差的测定值,与平均值的偏差超过三倍标准差的测定值,称为高度异常的异常值。

    15.度量

    度量(metric)亦称距离函数,是度量空间中满足特定条件的特殊函数,一般用d表示。度量空间也叫做距离空间,是一类特殊的拓扑空间。弗雷歇(Fréchet,M.R.)将欧几里得空间的距离概念抽象化,于1906年定义了度量空间。

    16.矩阵

    在数学中,矩阵(Matrix)是一个按照长方阵列排列的复数或实数集合,最早来自于方程组的系数及常数所构成的。

    矩阵是高等代数学中的常见工具,也常见于统计分析等应用数学学科中。

    即可以看成一个方便用来计算的数组。

    17.方差

    (variance)是在概率论和统计方差衡量随机变量或一组数据时离散程度的度量。概率论中方差用来度量随机变量和其数学期望(即均值)之间的偏离程度。统计中的方差(样本方差)是每个样本值与全体样本值的平均数之差的平方值的平均数。在许多实际问题中,研究方差即偏离程度有着重要意义。

    方差是衡量源数据和期望值相差的度量值。

    18.标准差

    标准差(Standard Deviation) ,中文环境中又常称均方差,是离均差平方的算术平均数的平方根,用σ表示。标准差是方差的算术平方根。标准差能反映一个数据集的离散程度。平均数相同的两组数据,标准差未必相同。

    19.皮尔森相关系数

    皮尔森相关系数(Pearson correlation coefficient)也称皮尔森积矩相关系数(Pearson product-moment correlation coefficient) ,是一种线性相关系数。皮尔森相关系数是用来反映两个变量线性相关程度的统计量。相关系数用r表示,其中n为样本量,分别为两个变量的观测值和均值。r描述的是两个变量间线性相关强弱的程度。r的绝对值越大表明相关性越强。

    20.相关系数

    相关系数是最早由统计学家卡尔·皮尔逊设计的统计指标,是研究变量之间线性相关程度的量,一般用字母 r 表示。由于研究对象的不同,相关系数有多种定义方式,较为常用的是皮尔逊相关系数。

    21.特征值

    特征值是线性代数中的一个重要概念。在数学、物理学、化学、计算机等领域有着广泛的应用。设 A 是n阶方阵,如果存在数m和非零n维列向量 x,使得 Ax=mx 成立,则称 m 是A的一个特征值(characteristic value)或本征值(eigenvalue)。非零n维列向量x称为矩阵A的属于(对应于)特征值m的特征向量或本征向量,简称A的特征向量或A的本征向量。

    22.特征向量

    矩阵的特征向量是矩阵理论上的重要概念之一,它有着广泛的应用。数学上,线性变换的特征向量(本征向量)是一个非简并的向量,其方向在该变换下不变。该向量在此变换下缩放的比例称为其特征值(本征值)。

    23.求导

    求导是微积分的基础,同时也是微积分计算的一个重要的支柱。物理学、几何学、经济学等学科中的一些重要概念都可以用导数来表示。如导数可以表示运动物体的瞬时速度和加速度、可以表示曲线在一点的斜率、还可以表示经济学中的边际和弹性。

    24.MSE(Mean Square Error 均方误差)

    均方误差(mean-square error, MSE)是反映估计量与被估计量之间差异程度的一种度量。设t是根据子样确定的总体参数θ的一个估计量,(θ-t)2的数学期望,称为估计量t的均方误差。它等于σ2+b2,其中σ2与b分别是t的方差与偏倚。反映估计量与被估计量差异程度。

    25.LMS(LeastMean Square 最小均方)

    最小均方算法,简称LMS算法,是一种最陡下降算法的改进算法, 是在维纳滤波理论上运用速下降法后的优化延伸,最早是由 Widrow 和 Hoff 提出来的。 该算法不需要已知输入信号和期望信号的统计特征,“当前时刻”的权系数是通过“上一 时刻”权系数再加上一个负均方误差梯度的比例项求得。 其具有计算复杂程度低、在信号为平稳信号的环境中收敛性好、其期望值无偏地收敛到维纳解和利用有限精度实现算法时的平稳性等特性,使LMS算法成为自适应算法中稳定性最好、应用最广的算法。

    26.LSM(Least Square Methods 最小二乘法)

    最小二乘法(又称最小平方法)是一种数学优化技术。它通过最小化误差的平方和寻找数据的最佳函数匹配。利用最小二乘法可以简便地求得未知的数据,并使得这些求得的数据与实际数据之间误差的平方和为最小。最小二乘法还可用于曲线拟合。其他一些优化问题也可通过最小化能量或最大化熵用最小二乘法来表达。

    27.MLE(MaximumLikelihood Estimation最大似然估计)

    最大似然估计(maximum likelihood estimation, MLE)4一种重要而普遍的求估计量的方法。最大似然法明确地使用概率模型,其目标是寻找能够以较高概率产生观察数据的系统发生树。最大似然法是一类完全基于统计的系统发生树重建方法的代表。

    28.QP(Quadratic Programming 二次规划)

    二次规划是非线性规划中的一类特殊数学规划问题,在很多方面都有应用,如投资组合、约束最小二乘问题的求解、序列二次规划在非线性优化问题中应用等。在过去的几十年里,二次规划已经成为运筹学、经济数学、管理科学、系统分析和组合优化科学的基本方法。

    最大似然法明确地使用概率模型,其目标是寻找能够以较高概率产生观察数据的系统发生树。最大似然法是一类完全基于统计的系统发生树重建方法的代表。该方法在每组序列比对中考虑了每个核苷酸替换的概率。

    29.CP(Conditional Probability条件概率)

    条件概率是指事件A在另外一个事件B已经发生条件下的发生概率。条件概率表示为:P(A|B),读作“在B条件下A的概率”。条件概率可以用决策树进行计算。条件概率的谬论是假设 P(A|B) 大致等于 P(B|A)。数学家John Allen Paulos 在他的《数学盲》一书中指出医生、律师以及其他受过很好教育的非统计学家经常会犯这样的错误。这种错误可以通过用实数而不是概率来描述数据的方法来避免。

    30. JP(Joint Probability 联合概率)

    联合概率是指在多元的概率分布中多个随机变量分别满足各自条件的概率。假设X和Y都服从正态分布,那么P{X<4,Y<0}就是一个联合概率,表示X<4,Y<0两个条件同时成立的概率。表示两个事件共同发生的概率。A与B的联合概率表示为 P(AB) 或者P(A,B),或者P(A∩B)。

    31.MP(Marginal Probability边缘概率)

    边缘概率 Marginal Probability 是某个事件发生的概率,而与其它事件无关。边缘概率是这样得到的:在联合概率中,把最终结果中不需要的那些事件合并成其事件的全概率而消失(对离散随机变量用求和得全概率,对连续随机变量用积分得全概率)。

    这称为边缘化(marginalization)。A的边缘概率表示为 P(A),B 的边缘概率表示为 P(B)。

    32. Bayesian Formula(贝叶斯公式)

    贝叶斯定理由英国数学家贝叶斯 ( Thomas Bayes 1702-1761 ) 发展,用来描述两个条件概率之间的关系,比如 P(A|B) 和 P(B|A)。按照乘法法则,可以立刻导出:P(A∩B) = P(A)*P(B|A)=P(B)*P(A|B)。如上公式也可变形为:P(B|A) = P(A|B)*P(B) / P(A)。

    贝叶斯的统计学中有一个基本的工具叫贝叶斯公式、也称为贝叶斯法则, 尽管它是一个数学公式,但其原理毋需数字也可明了。如果你看到一个人总是做一些好事,则那个人多半会是一个好人。这就是说,当你不能准确知悉一个事物的本质时,你可以依靠与事物特定本质相关的事件出现的多少去判断其本质属性的概率。 用数学语言表达就是:支持某项属性的事件发生得愈多,则该属性成立的可能性就愈大。

    L1 /L2Regularization(L1/L2正则,以及更多的,现在比较火的L2.5正则等)

    L1范数正则化( L1 regularization 或 lasso )是机器学习(machine learning)中重要的手段,在支持向量机(support vector machine)学习过程中,实际是一种对于成本函数(cost function)求解最优的过程,因此,L1范数正则化通过向成本函数中添加L1范数,使得学习得到的结果满足稀疏化(sparsity),从而方便人们提取特征。

    GD(GradientDescent 梯度下降)

    梯度下降法是一个最优化算法,通常也称为最速下降法。最速下降法是求解无约束优化问题最简单和最古老的方法之一,虽然现已不具有实用性,但是许多有效算法都是以它为基础进行改进和修正而得到的。最速下降法是用负梯度方向为搜索方向的,最速下降法越接近目标值,步长越小,前进越慢。

    可以用于求解非线性方程组。

    34. SGD(Stochastic Gradient Descent 随机梯度下降)

    随机并行梯度下降算法(stochastic parallel gradient descent algorithm),简称SPGD算法。作为一种无模型优化算法,比较适用于控制变量较多,受控系统比较复杂,无法建立准确数学模型的最优化控制过程。

    35.QR-decomposition(QR分解), 矩阵分解

    矩阵分解 (decomposition, factorization)是将矩阵拆解为数个矩阵的乘积,可分为三角分解、满秩分解、QR分解、Jordan分解和SVD(奇异值)分解等,常见的有三种:1)三角分解法 (Triangular Factorization),2)QR 分解法 (QR Factorization),3)奇异值分解法 (Singular Value Decomposition)。

    36.Quantile (分位数), 分位数

    分位数(Quantile),亦称分位点,是指将一个随机变量的概率分布范围分为几个等份的数值点,常用的有中位数(即二分位数)、四分位数、百分位数等。

    37.协方差

    协方差(Covariance)在概率论和统计学中用于衡量两个变量的总体误差。而方差是协方差的一种特殊情况,即当两个变...

  • ?

    与数据分析紧密相关的专业,发展前景可观,最强院校又有哪些?

    柳澜

    展开

    21世纪是知识经济的时代,信息技术、计算机技术为统计学理论与方法的发展将产生巨大的推动作用。统计学理论与方法的创新必将为众多领域和学科的发展体现出应有的价值。统计学与其他学科的紧密结合将产生新的边缘学科,许多学科的发展将依赖于统计理论与技术的应用。下面就给大家介绍一下,统计学专业发展的比较好的院校。

    NO.1北京大学

    北京大学是我国最早开展概率统计教学科研的单位。前本科生实行全院统一招生,前两年学院统一培养,大学二年级结束时再分析分专业。统计学专业很受欢迎,学生毕业后主要攻读国内外重点院校的研究生和博士后研究,以及到高等院校、科研机构、金融、保险、信息、制药等企业工作。

    NO.2中国人民大学

    中国人民大学统计学科始建于1950年,两年后成立统计学系,是新中国经济学科中最早设立的统计学系,2003年7月,成立中国人民大学统计学院,是全国拥有理学、经济学、医学三大门类统计学专业最齐全的统计学院。在2007年教育部统计学科评估中排名全国第一,2012年教育部统计学一级学科评估中排名全国第一。

    NO.3南开大学

    南开统计学科是在上世纪五十年代由王梓坤院士和胡国定先生奠定的概率论与数理统计专业的基础上发展起来的。2011年,国务院学科委员会把统计学调整为一级学科后,南开统计学获全国首批统计学一级学科博士学位授予权,并于2012年学科评估中并列全国第四,于2017年入选国家"双一流"建设学科,同年,在第四轮学科评估中并列全国第三(A)。

    NO.4东北师范大学

    东北师范大学数学与统计学院创建于1948年,其前身为东北师范大学数学系,2004年1月撤系建院。近5年数学与统计学院共承担 "211工程"三期重点学科建设项目,国家科技部973项目,自然科学基金委重点项目、杰出青年基金项目、面上项目,教育部新世纪人才培养计划和其它省部级项目70余项。学院教师每年在重点学术期刊上发表论文100余篇,其中SCI检索80篇以上。

    NO.5华东师范大学

    华东师范大学是中国获批最早设立概率论与数理统计专业的大学之一。1987年成为全国高等学校重点学科,是全国最早的三个概率论与数理统计国家重点学科之一。学院现有4个本科专业(统计学、经济统计学、金融工程、保险学)。

    NO.6厦门大学

    厦门大学1922年成立算学系,是厦门大学最早设立的系之一,2003年成立数学科学学院。学科位居ESI世界前1%,位次不断前移。2013-2017年,学院累计获得国家自然科学基金重大、重点、国际合作与交流、面上、青年、联合基金等资助117项,总经费达4724万元。

    NO.7北京师范大学

    北京师范大学统计学教育已有近百年历史,学院拥有一个本科专业(统计学,授理学学位)、两个学术型硕士、博士专业(经济统计学,授经济学学位;应用统计,授理学学位),同时招收应用统计专业硕士,并设有统计学博士后流动站。2015年QS世界大学排名中北京师范大学统计与运筹学科位列世界前200名。

    NO.8东北财经大学

    统计学专业设立于1948年,是文革期间全国唯一保留的统计学科和全国惟一一个有连续60多年历史的统计学科。统计学院设有经济统计学本科专业,2008年获评为辽宁省本科示范专业,2009年获评为国家级特色专业。专业课程体系中拥有国家级、省级精品课和国家级精品资源共享课。

    NO.9上海财经大学

    上海财经大学统计学成立于1946年,是上海财经大学设立最早的系科之一。近几年,统计与管理学院在学科建设取得重大进展。2012年在教育部一级学科评估中位居全国第4名,同年获准设置统计学一级学科博士后科研流动站;2013年,入选上海市高校一流学科(A类)建设计划;2015年,全国应用统计专硕评估位居第一;2017年,统计学科入选世界一流学科建设名单。

    NO.10浙江工商大学

    统计与数学学院是浙江工商大学的王牌学院之一,在全国范围内,具有一定的影响力和很高的美誉度,统计学科的排名雄踞全国统计学科的前沿。2012年统计学取得浙江省高校人文社科重点研究基地,统计学专业被评为省"十三五"优势专业。在2017年教育部第四轮学科评估中,浙江工商大学统计学一级学科进入全国前10%,并列全国第7、浙江省第1。

    虽然当下我国统计教育还存在着招生难、分配难、经费缺、师资不足、教材陈旧、课程设置不合理等诸多问题,但是相信在这些排名靠前的院校的带动下,我国的统计学发展终将会"更上一层楼"的。

  • ?

    哪些大学可报考大数据专业?2017年大数据专业就业前景

    唐水桃

    展开

    作者|笑面虎 (本文为36大数据专稿)

    十二年寒窗苦读,一朝踏上高考路,一举成名天下知。

    高考,对于每一个学子都是一场无烟的战场,十几年的努力拼搏,只为这一刻能够走进自己梦想的校园。高考就像是鲤鱼跃龙门中的龙门一样,跃过去的学子就可以欢欢喜喜进入梦想大学校园,开启人生新的篇章,用知识改变命运。在距离2017年高考时间还剩下不到48小时的时间里,36大数据想和你谈谈目前炙手可热的大数据专业以及与高考相关的大数据。

    据教育部数据显示,目前,全国已有35所高等院校开通了大数据专业。也就是说,高考报志愿可直接报大数据专业的学校了。那么,哪些大学可以报考大数据专业呢?大数据专业的就业前景如何呢?

    全国有哪些高校开通了大数据专业呢?

    从统计表可以看出,开通了大数据专业的学校主要分布在一线城市(北京、上海、广州)以及云南、贵州和四川三个西南地区。

    高校填报志愿,过来人的建议,通常情况下:城市比学校更重要,学校比专业更重要。当然,考生也可以根据自己的实际情况(所在地、分数)来进行选择。

    专业介绍

    计算机科学与技术(数据科学与大数据技术方向)主要培养大数据科学与工程领域的复合型高级技术人才。毕业生具有信息科学、管理科学和数据科学基础知识与基本技能,掌握大数据科学与技术所需要的计算机、网络、数据编码、数据处理等相关学科的基本理论和基本知识,熟练掌握大数据采集、存储、处理与分析、传输与应用等技术,具备大数据工程项目的系统集成能力、应用软件设计和开发能力,具有一定的大数据科学研究能力及数据科学家岗位的基本能力与素质。毕业后能从事各行业大数据分析、处理、服务、开发和利用工作,大数据系统集成与管理维护等各方面工作,亦可从事大数据研究、咨询、教育培训工作。

    专业名称:计算机科学与技术专业(数据科学与大数据技术方向),本科四年制;

    2017年大数据专业就业前景

    大数据人才稀缺

    据数联寻英发布《大数据人才报告》显示,目前全国的大数据人才仅46万,未来3-5年内大数据人才的缺口将高达150万。

    据职业社交平台LinkedIn发布的《2016年中国互联网最热职位人才报告》显示,研发工程师、产品经理、人力资源、市场营销、运营和数据分析是当下中国互联网行业需求最旺盛的六类人才职位。其中研发工程师需求量最大,而数据分析人才最为稀缺。领英报告表明,数据分析人才的供给指数最低,仅为0.05,属于高度稀缺。数据分析人才跳槽速度也最快,平均跳槽速度为19.8个月。

    根据中国商业联合会数据分析专业委员会统计,未来中国基础性数据分析人才缺口将达到1400万,而在BAT企业招聘的职位里,60%以上都在招大数据人才。

    大数据专业就业三大方向

    大数据主要的三大就业方向:大数据系统研发类人才、大数据应用开发类人才和大数据分析类人才。

    在此三大方向中,各自的基础岗位一般为大数据系统研发工程师、大数据应用开发工程师和数据分析师。

    大数据专业人才就业薪资

    1、基础人才-数据分析师

    北京数据分析平均工资: 10630/月,取自 15526 份样本,较 2016 年,增长 9.4%。

    数据分析师岗位职责

    业务类别:技术

    业务方向:数据分析

    工作职责:

    1. 根据公司产品和业务需求,利用数据挖掘等工具对多种数据源进行诊断分析,建设征信分析模型并优化,为公司征信运营决策、产品设计等方面提供数据支持;

    2. 负责项目的需求调研、数据分析、商业分析和数据挖掘模型等,通过对运行数据进行分析挖掘背后隐含的规律及对未来的预测;

    3. 参与数据挖掘模型的构建、维护、部署和评估;

    4. 整理编写商业数据分析报告,及时发现和分析其中变化和问题,为业务发展提供决策支持;

    5. 独立完成项目需求管理、方案设计、实施管理和项目成果质量的把控;

    6. 参与编写项目相关文档。

    教育背景:

    学历:本科其它:

    经验要求:工作经验:3-5年

    任职要求:

    1. 统计学、数学或计算机、数理统计或数据挖掘专业方向相关专业本科或以上学历;有扎实的数据统计和数据挖掘专业知识;

    2. 熟练使用数理统计、数据分析、数据挖掘工具软件(SAS、R、Python等的一种或多种),能熟练使用SQL读取数据;

    3. 使用过 逻辑回归、神经网络、决策树、聚类 等的一种或多种建模方法;

    4. 3年以上数据分析工作经验,征信从业背景人员优先;

    5. 具有金融行业项目经验的相关经验者优先考虑;

    6. 主动性强,有较强的责任心,积极向上的工作态度,有团队协作精神。

    能力素养:

    良好的分析、归纳和总结能力,善于分析、解决实际问题; 主动性强,有较强的责任心,积极向上的工作态度,有团队协作精神。

    2、大数据开发工程师

    北京大数据开发平均工资:30230/月。

    大数据开发工程师/专家 岗位指责(引自 滴滴出行):

    职位描述:

    1、构建分布式大数据服务平台,参与和构建公司包括海量数据存储、离线/实时计算、实时查询,大数据系统运维等系统;

    2、服务各种业务需求,服务日益增长的业务和数据量;

    3、深入源码内核改进优化开源项目,解决各种hadoop、spark、hbase疑难问题,参与到开源社区建设和代码贡献;

    岗位要求:

    1、计算机或相关专业本科以上学历(3年以上工作经验);

    2、精通C++/Java/Scala程序开发(至少一种),熟悉Linux/Unix开发环境;

    3、熟悉常用开源分布式系统,精通Hadoop/Hive/Spark/Storm/Flink/HBase之一源代码;

    4、有大规模分布式系统开发、维护经验,有故障处理能力,源码级开发能力;

    5、具有良好的沟通协作能力,具有较强的分享精神;

    6、对Kudu、Kylin、Impala、ElasticSearch,github等系统有深入使用和底层研究者加分;

    3、Hadoop开发工程师

    北京hadoop平均工资: 20130/月,取自 1734 份样本。

    Hadoop开发工程师岗位职责(引自新浪网):

    职位描述:

    1.参与优化改进新浪集团数据平台基础服务,参与日传输量超过百TB的数据传输体系优化,日处理量超过PB级别的数据处理平台改进,多维实时查询分析系统的构建优化;

    2.分布式机器学习算法在数据平台的构建与优化(包括常见的LR、GBDT、FM、LDA、Word2Vec及DNN等);

    3.深入源码改进各种开源大数据项目(包括Hadoop、Spark、Kafka、HBase等)。

    任职要求:

    1.计算机或相关专业本科以上学历;

    2.熟悉Linux环境下开发,熟练掌握C++/Java/Scala等一种以上编程语言;

    3.熟悉Hadoop生态系统相关项目,精通以下项目之一的源码(Hadoop/Spark/Kafka/HBase/Flume/ElasticSearch/Druid/Kylin);

    4.具备良好的学习能力、分析能力和解决问题的能力。

    4、数据挖掘工程师

    北京数据挖掘平均工资:21740/月,取自 3449 份样本,较 2016 年,增长 20.3%;

    数据挖掘工程师招聘要求(引自蚂蚁金服集团技术部):

    工作职责:

    1、在分布式系统上进行数据计算、挖掘、和实现算法;

    2、数据仓库模型设计和建立;

    3、数据梳理流程的实现和维护;

    4、物流场景下的地址文本、空间属性研究和分析。

    任职资格:

    1、本科以上学历,有扎实的统计学,数据挖掘,机器学习,自然语言识别理论基础,一种或几种以上的实际使用经验。

    2、熟悉聚类、分类、回归等机器学习算法和实现,对常见的核心算法和数据挖掘方法有透彻的理解和实际经验。

    3、深入理解Map-Reduce模型,对Hadoop、Hive、Spark、Storm等大规模数据存储于运算平台有实践经验。

    4、有扎实的计算机理论基础,至少熟悉一种编程语言,Java优先。

    5、有三年以上互联网公司或者海量数据处理工作经验,大数据挖掘、分析、建模经验

    5、算法工程师

    北京算法工程师平均工资: 22640/月,取自 10176 份样本。

    算法工程师 招聘要求(引自美团点评数据平台部):

    职位描述:

    互联网公司背景优先

    A、广告算法

    岗位职责:

    1.负责点击率预估等主要广告算法的技术选型;

    2.负责核心算法的开发;

    3.负责广告大数据处理流程的建设及相关工具的研发;

    4.负责广告技术研究项目的推进与管理;

    职位需求:

    1.计算机或相关专业本科以上学历,3年以上相关工作经验;

    2.熟练掌握一门开发语言;

    3.有机器学习、数据挖掘相关知识;

    4.在广告、搜索、推荐等相关领域之一有技术研究工作经验;

    5.有较强的沟通协调能力;

    B、推荐算法

    职位描述:

    1. 参与各个产品线的个性化推荐系统的研发;

    2. 分析用户行为数据,并设计合理的推荐算法模型及策略,并优化推荐排序;

    3. 通过对用户行为数据的挖掘,对用户进行建模,精准刻画用户各种属性;

    职位要求:

    1. 全日制本科及以上学历,计算机相关专业;

    2. 熟练掌握各类个性化推荐算法,并有开发个性化推荐系统的实际项目经验;熟练掌握各类回归及排序算法,能够利用相关算法进行推荐排序的优化;

    3. 熟练掌握分类、聚类、回归、降维等经典机器学习算法和技术,能够根据实际问题选择合适的模型和算法并进行相应的开发;

    4. 有较强的工程架构和开发能力,能够实现支撑千万级用户和TB级用户行为数据的推荐系统或算法;

    5. 掌握python、matlab等脚本语言,熟悉各类数据挖掘工具(如weka、Mahout),能够快速建立模型并进行验证;

    C、算法工程师

    岗位职责:

    1、开发和优化用户行为数据挖掘,文本分类和语义理解,社交网络分析,网页搜索,推荐系统等领域的特定算法

    2、能够很快学习和利用state-of-the-art的算法解决实际产品问题,提升产品用户体验

    任职资格:

    1、有一定的研究、实验的能力,优秀的分析问题和解决问题的能力

    2、理解自然语言处理、机器学习、网页搜索,推荐系统,用户数据分析和建模的基本概念和常用方法,有相关领域的实际项目研发或者实习经历者优先。

    3、熟悉C++, Java或Python,熟悉Linux或类Unix系统开发,有较强的编程能力。 能独立实现线上算法模块者优先。

    4、对大数据处理平台和工具有一定经验者优先, 包括: Hadoop, Hive, Pig, Spark 等

    最后一个问题,哪些公司需求大数据人才?

    答:所有的公司。大到世界500强,BAT这样的公司,小到创业公司,他们都需求数据人才。

    马云爸爸说“我们已从IT时代进入了DT时代,未来我们的汽车、电灯泡、电视机、电冰箱等将全部装上操作系统,并进行数据集成,数据将会让机器更“聪明”。DT时代,数据将成为主要的能源,离开了数据,任何组织的创新都基本上是空壳。”

    数据,未来的一切。

    本文数据来自职友集、拉勾网、全程无忧等多个招聘网站。

    End.

  • ?

    数据分析:浅谈大数据对统计学的挑战和机遇,看完长见识了!

    沧海

    展开

    浅谈大数据对统计学的挑战和机遇

    引言  国际数据公司的相关研究指出,2011年全球数据生产量达1.8ZB,且全球信息总量每隔两年增长一倍[1]。在大数据时代下,对于统计学发展而言,挑战与机遇并存,挑战指的是现阶段传统统计学相关方法难以适用大数据,机遇指的是基于统计学,大数据展开数据处理、分析,促使大数据具备可视化特性。由此可见,研究大数据对统计学的挑战和机遇有着十分重要的现实意义。  1.大数据及其目的  现阶段,关于大数据仍旧没有一个十分明确的界定,大数据起初是源自于技术领域。在信息量不断扩大的情况下,使得常规电脑原有存储空间已不能对新处理数据进行承载,新兴数据处理技术得以产生,好比雅虎的Hadoop平台、谷歌的MapReduce等。此类技术能够对僵化层次结构、一致性予以消除,促进数据无需通过常规数据库表格进行排列,极大程度地提升了人们可处理的数据量[1]。 

     2.大数据与统计学的对比  2.1样本统计与全样本统计的区别  样本统计属于统计学不可或缺的依赖,样本指的是结合相应的概率自总体中随机筛选并视作总体代表的集合内容,值得一提的是随机抽样是需要成本的,包括社会关系、资金成本或者时间成本等。基于样本数量提升有限前提下,样本估计误差会随着总体数量增多而增大,这亦是样本统计无法避免的不足。大数据时代下,收集整理庞大的数据信息应运而生,数据信息发展表现出总体即是样本的态势,该属性很好的消除了样本统计这一不足。大数据时代下的全样本统计,通常情况下可对完全总体进行覆盖,然而受大部分数据属于半结构、半结构数据影响,使得概率论应用遭受一定的制约[2]。鉴于此,将全样本统计应用到统计学中,应当就总体数据展开相应的归纳、筛选,即好比在样本统计中展开数据预处理。  2.2预测分析与非预测分析的区别  统计学的创立,是为了对变量相互相关关系展开分析,因此获取数据是发生于变量确定之后的,数据分析价值是能够被预测的。相较于统计学的预测分析,庞大数据将互联网、传感器作为载体,存在于分析需求之前,因此构建于大数据上的分析多为非预测性分析。在统计学中,出现大数据无法有效应用局面,这是由于不具备非预测分析所需的庞大数据,庞大数据产生与数据中心、存储系统存在紧密的联系,并非短期产生。也就是说,统计学中大数据的应用发展,说明了非预测分析正逐步取代传统统计学预测分析,数据多次利用正逐步取代传统数据一次性利用的。  3.大数据对统计学的挑战与机遇  3.1数据生产、处理与应用的转变 

     相关统计部门经开展严格的统计设计工作,获得相关的统计数据,数据的预处理分别有数据清洗、非全面数据填补以及数据矫正等。大数据时代下的统计手段尚不十分明确,自大数据流环境而言,要不断探索新型抽样方法,并确保抽样方法的实时、连贯及可行性。除去传统的统计分析方法,还应当开发大数据动态分析、数据流算法等[3]。  3.2大数据时代对市场营销的机遇  3.2.1大数据营销的特点与价值  大数据营销的特点:I.数据采集多平台化特点,即大数据时代下,大数据的数据大多来源于不同的领域、不同的渠道。II.时效性特点,随着信息技术的急速发展,互联网用户消费、购物行为方式往往会瞬间出现转变。国际先进大数据营销企业AdTime基于此大数据营销特点,采取了时间营销措施,即采取相应的技术方式全面获悉用户所需,于第一时间对用户当下的需求进行回应,以使用户在下决心购买的最佳时间及时看到对应的产品广告。III.个性化特点,在大数据时代下,广告商传统媒体导向的营销理念逐步由受众导向取代,现如今,广告商可应用大数据了解用户的地理方位,需求内容等信息,达到对用户个性化营销的目的。  大数据营销的价值:I.升级营销与用户的匹配度,大数据营销不仅可提供给企业了解用户有效的途径,还能够与网络环境下,选取相关技术方法达到对用户精确定位的目的,从而开展好营销工作,升级营销与用户的匹配度。II.改善用户体验,大数据营销促使企业真正意义上认识到用户及其所使用企业产品情况,以给予用户最人性化的提醒。  3.2.2大数据营销的应用  (1)与消费者建立紧密关系  现如今,我国一些企业营销行为仍旧处于个性化定位信息、创意设计阶段,而无法对不同消费者展开个性化的营销活动。大数据时代下,经采用相关数据分析技术方法,基于对消费群体喜好、传媒接触习惯等展开有效的分析,达到特定营销活动明确开展的目的,实现企业精心开展的营销活动精准的辐射至目标消费群体处,与消费者建立紧密关系,极大的改善营销效率、质量[4]。  (2)掌握竞争对手数据  企业通过对竞争对手数据的有效掌握,获悉竞争对手发展状况,基于此帮助企业制定科学合理的产品价格,提升企业产品市场竞争优势。与此同时,企业务必要全面实施以事实为前提的决策手段,广泛地应用数据分析方式对企业每一个发展运营步骤进行优化,经对企业一系列数据的充分优化、对接,促使业务环节中潜在的价值得以被有效挖掘,降低生产成本,知己知彼,促使企业在日趋白热化的市场竞争中占据有利位置。  (3)挖掘企业内部数据  “市场未动,数据先行”俨然转变为国际上企业有效运营发展的一致认识,为了提升企业管理效率,要求企业要充分挖掘企业内部数据,并展开有效的整合、分析,以为企业相关人员做决策提供有利的参考依据,提升决策准确性,促进企业可持续发展。

    3.2.4 企业的应用案例——以亚马逊为例  在应用大数据开展市场营销方面,美国亚马逊公司一直处于领先地位。亚马逊研发出“用户未下单,先发货”功能,即结合用户的购物需求数据信息,分析用户想要购买的产品,达到用户未下单,提前发货的目的。此外,亚马逊通过对用户检索信息的分析,评估流感的传播,但这仅仅为海量检索数据中的一项用途,相同的数据能够应用于预测大选结果、预测某类产品市场行情等等,极大地降低了统计成本[5]。  3.3大数据时代对市场营销的挑战  3.3.1信息收集  大数据并非就是对数据信息展开盲目的收集,即便收集了再多的数据,倘若这些数据并非是市场营销所需要的,如此便会导致前期收集来的数据信息,变成一堆“数据垃圾”。鉴于此,为了避免这一情况发生,务必要充分分析业务需求,再对自身存在价值的数据展开收集、归纳,如此方可实现大数据的有效收集应用。  3.3.2经验与数据  数据采集完毕后,面对参差不齐的数据,还应当做好数据评估工作,评估对何种目标受众开展市场营销工作。鉴于此,要求采取科学合理的手段,将这些参差不齐的数据整合成可被市场营销实践应用的,经结合过去的经验,与采集数据进行有机融合,实现对目标受众的有效分析确定。  3.3.3分析与优化  数据分析,一方面是实现数据优化,一方面是进行决策层面上的调整、转变。此环节对于专业人才的需求提出了严苛的挑战。数据分析、数据优化对于专业人才的知识框架要求大不相同,这要求相关企业不仅要培养专业的数据分析人才,还要打造数据优化人才队伍。 

     3.4大数据营销的未来发展趋势  信息技术不断发展,单一媒体导向的“消费者碎片化”俨然无法达到企业对于数据多样性的需求。大数据时代下,媒体的跨界融合实现对“碎片化”受众的充分聚合。在科学技术技术不断进步的背景下,跨媒介、跨平台、跨终端的多途径将不断被开拓,将使庞大的数据信息获取多维度的整合,并且在多样化网络环境下,消费者主观信息与客观数据有机融合,构筑全面用户数据库环节,将成为未来大数据营销发展的必然趋势[6]。  4.结束语  总而言之,大数据为传统统计学带来了严峻的考验,也为传统统计学有效发展创造了良好的契机。在大数据时代发展潮流中,我们应当充分的认识到大数据对于传统统计学而言,是补充而不是更替,构建于样本统计、预测分析内容上的传统统计学,仍旧于社会统计、经济分析中占据着主导位置。大数据时代下,为了实现企业市场营销的有效开展,相关人员务必要不断专研研究、总结经验,全面分析大数据与统计学的对比,充分认识大数据对统计学的挑战和机遇,“与消费者建立紧密关系”、“掌握竞争对手数据”、“挖掘企业内部数据”等,积极促进企业市场营销的科学合理化。

  • ?

    就业前景极好的大数据专业,你了解吗?

    Ted

    展开

    当下,人工智能、大数据等热门词汇频频出现在人们的视野中。作为万物分析的大数据更是站在互联网的风口浪尖上,直接催热了大学里的大数据专业。

    从IT时代进入DT时代,高校在大数据方向上设置了什么专业,具体学什么,就业怎么样,作为新兴专业,考生如何报考?今天,就来谈一谈这个大家关注的热门专业。

    1.什么叫大数据?

    进入互联网时代,中国的网民人数已超7亿,大数据的应用涉及到生活的方方面面。例如,你在网站上买书,商家就会根据你的喜好和其他购书者的评价给你推荐另外的书籍;手机定位数据和交通数据可以帮助城市规划;甚至用户的搜索习惯和股市都有很大关系。

    在谈到大数据的时候,人们往往知道的就是数据很大,但大数据≠大的数据。大数据,就是存储在各种存储介质中的海量的各种形态数据,具有5V特点,即:Volume(大量)、Velocity(高速)、Variety(多样)、Value(价值密度)、Veracity(真实性)。大数据之“大”,不仅在于其“大容量”,更在于其“大价值”,并已成为除人力、土地、财务、技术之外的另一种重要的基础资源。对各种存储介质中海量信息的采集、存储、分析、整合、控制而得到的数据就是大数据。大数据技术的意义不在于掌握庞大的数据信息,而在于对这些数据进行专业化处理,通过“加工”实现数据的“增值”,更好地辅助决策。

    2.数据科学与大数据技术专业

    本科专业中和大数据相对应的是“数据科学与大数据技术”专业,它是2015年教育部公布的新增专业。2016年3月公布的《高校本科专业备案和审批结果》中,北京大学、对外经济贸易大学和中南大学3所高校首批获批开设“数据科学与大数据技术”专业。随后第二年又有32所高校获批“数据科学与大数据技术”专业。两次获批的名单中显示,该专业学制为四年,大部分为工学。

    数据科学与大数据技术是个交叉性很强的专业,很难说完全归属于哪个独立的学科。所以,不同的学校有的是信息学院申报,有的是计算机学院牵头申报,有的设在统计学院,还有的在经管学院。像北京大学这个专业是放在理学下,授予理学学位。大多数是设在工学计算机门类下,授予的是工学学位。数据科学很早就存在,是个比较经典的学科,现在和大数据技术结合形成了这个专业。目前教育部设定的本科专业名称为“数据科学与大数据技术”,专科名称是“大数据技术与应用”。

    3.数据科学与大数据技术学什么?

    以对外经济贸易大学该专业为例,专业知识结构包括数学、统计、计算机和大数据分析四大模块,具体课程设置如下:

    数学:数学分析一、数学分析二、高等代数、离散数学。统计学:概率论与数理统计、多元统计分析、随机过程。计算机:数据机构、计算机组成原理、操作系统、数据库系统原理、C++程序设计、Java程序设计、Python与大数据分析、科学计算与Matlab应用、R语言等。大数据分析:数据科学导论、机器学习与数据挖掘、信息检索与数据处理、自然语言处理、智能计算、推荐系统原理、大数据分析技术基础、数据可视化、大数据存储与管理、大数据分析实践等课程。

    数据科学与大数据技术是一门实践性很强的新兴交叉复合型学科:以统计学、数学、计算机为三大支撑性学科;生物、医学、环境科学、经济学、社会学、管理学为应用拓展性学科。此外还需学习数据采集、分析、处理软件,学习数学建模软件及计算机编程语言等,知识结构是二专多能复合的跨界人才(有专业知识、有数据思维)。根据各校偏重的专业方向,课程设置有所差异,感兴趣的同学可以具体查看各校的专业和课程设置情况。

    1.行业增速快 人才缺口大

    随着移动互联网和智能终端的普及,信息技术与经济社会的交汇融合,引发了数据迅猛增长。新摩尔定律认为,人类有史以来的数据总量,每过18个月就会翻一番。而海量的数据蕴含着巨大生产力和商机。

    2011年至2014年四年间,我国大数据处于起步阶段,每年均增长在20%以上。2015年,大数据市场规模已达到98.9亿元。2016年增速达到45%,超过160亿元。预计2020年,我国大数据市场规模将超过8000亿元,有望成世界第一数据资源大国。但数据开放度低、技术薄弱、人才缺失、行业应用不深入等都是产业发展中亟待解决的问题。

    根据领英发布《2016年中国最热职位人才报告》显示,有六类热门职位的人才当前都处于供不应求状态,稀缺程度各有不同,其中,数据分析人才的供给指数最低,仅为0.05,属于高度稀缺。

    目前的当务之急是解决大数据人才瓶颈问题,相关调查显示,未来3-5年大数据人才缺口达到150万之多。,但截至目前,中国大数据从业人员只有约30万人。同时,大数据行业选才的标准也在不断变化。初期,大数据人才的需求主要集中在ETL研发、系统架构开发、数据仓库研究等偏硬件领域,以IT、计算机背景的人才居多。随着大数据往各垂直领域延伸发展,对统计学、数学专业的人才,数据分析、数据挖掘、人工智能等偏软件领域的需求加大。

    数据分析师现在需求就很旺盛了,2年工作经验的月薪可达到8K,硕士学历的数据分析师月薪可达到12K,5年工作经验的可达到40万至60万元。

    2.大数据主要就业方向

    2015年9月国务院印发《促进大数据发展行动纲要》,系统部署大数据发展工作。《纲要》明确提出了七方面政策机制,其中第六条就是加强专业人才培养,建立健全多层次、多类型的大数据人才培养体系。目前,大数据主要有三大就业方向:大数据系统研发类、大数据应用开发类和大数据分析类。具体岗位如下:

    1.大数据系统架构师

    大数据平台搭建、系统设计、基础设施。

    2.大数据系统分析师

    面向实际行业领域,利用大数据技术进行数据安全生命周期管理、分析和应用。

    3.hadoop开发工程师。

    解决大数据存储问题。

    4.数据分析师

    不同行业中,专门从事行业数据搜集、整理、分析,并依据数据做出行业研究、评估和预测的专业人员。在工作中通过运用工具,提取、分析、呈现数据,实现数据的商业意义。

    作为一名数据分析师,至少需要熟练SPSS、STATISTIC、Eviews、SAS、大数据魔镜等数据分析软件中的一门,至少能用Acess等进行数据库开发,至少掌握一门数学软件如matalab、mathmatics进行新模型的构建,至少掌握一门编程语言。总之,一个优秀的数据分析师,应该业务、管理、分析、工具、设计都不落下。

    5.数据挖掘工程师

    做数据挖掘要从海量数据中发现规律,这就需要一定的数学知识,最基本的比如线性代数、高等代数、凸优化、概率论等。经常会用到的语言包括Python、Java、C或者C++,我自己用Python或者Java比较多。有时用MapReduce写程序,再用Hadoop或者Hyp来处理数据,如果用Python的话会和Spark相结合。

    6.大数据可视化工程师

    随着大数据在人们工作及日常生活中的应用,大数据可视化也改变着人类的对信息的阅读和理解方式。从百度迁徙到谷歌流感趋势,再到阿里云推出县域经济可视化产品,大数据技术和大数据可视化都是幕后的英雄。

    1.院校开设情况

    大数据人才的典型胜任特征:善于做需求分析、写代码;善于与人沟通,喜欢探索未知;需要根据数据推演、分析、提出解决方案,有数据思维;需要持续保持学习状态;内性格上能动能静。

    不同办学层次的院校开设此专业,培养模式会有差异。例如,高职类院校学生由于数学基础相对薄弱,会跟多偏向于工具的使用,如数据清洗、数据存储以及数据可视化等相关工具的使用;本科院校会倾向于大数据相关基础知识全面覆盖性教学,在研究生段则会专攻某一技术领域,比如数据挖掘、数据分析、商业智能、人工智能等。

    在“教育部2015年度普通高等学校本科专业备案和审批结果”中北京大学、中南大学、对外经贸大学成为首批开设 “数据科学与大数据技术”本科专业的高校,随后中国人民大学、北京邮电大学、复旦大学等32所高校成为第二批成功申请该专业的高校。至去年上半年,我国已有35所高校获批“数据科学与大数据技术”本科专业。经过一年的发展,申请院校成井喷式的增长,全国高校大数据教育联盟通过教育部公示的申请2017年“数据科学与大数据技术”专业的院校来看,2017年申请院校高达263所,其中工学190所,理学73所。

    数据科学与大数据技术是个交叉性强、跨学科的专业,很难说是完全归属与那个独立的学科。高校牵头申报的学院不同,培养重点和授予的学位可能不一样。因为课程来自于不同的学院,也有高校是联合一些学院单独成立机构来申报。从名单可以看出,在大部分开设院校中该专业都属于工学类,有个别院校将其归属在理学门类,授予理学学位。

    有志于学习数据科学与大数据技术专业的学生,可以从大学的传统优势领域和行业背景考虑选择。比如,复旦大学的大数据技术本科专业是设在大数据学院下;北京大学是在数学院开设了该专业,偏数学的内容更多一些。对外经济贸易大学该专业设在信息学院,因为财经是学校传统优势,专业还会偏重经济、金融等相关学科领域的知识。

    2.报考注意事项

    了解了大数据行业和大数据专业后,对于考生填报与大数据相关的热门专业,需要注意以下几点:

    1.报考热门专业和就业热的专业并不一定是重合的,比如软件、计算机、金融,这些专业的就业率实际并没有那么高,地质勘探、石油、遥感等专业,虽然报考时是冷门,但行业需求大,就业率更高。

    2.选择热门专业,更需要考虑就业质量。专业就业好,是统计学意义,指的是平均收入水平高,比如金融专业的收入,比其他纯文科专业的平均收入较高,但落实到个体层面,就业情况就不一样了,尤其像金融专业是典型的名校高学历好就业,但对于考试成绩较低的同学来说,如果去一些普通院校、专科院校学习金融,最后就业情况可能还不如会计专业。

    3.志愿填报,除了专业,城市因素也很重要:如果想从事金融、互联网的工作,更适合去一线城市,如果是去三、四线大学的学生可以考虑应用面比较广的专业,就是各行各业都能用到的专业,比如会计专业,专科层次的会计和985层次的会计都有就业渠道。如果先选择报考城市,也可以针对所在城市的行业特点选择专业,比如沿海城市外贸相对发达,选择国际贸易、外语类专业就业情况更好,比如武汉有光谷,选择光电类专业更好就业。

    4.最终家长和考生更需要考虑个人与专业匹配的问题,金融、计算机等热门专业不是所有人都适合学,好专业不见得对所有个体都是好的。

    5.最后,考生报考时要注意,有的高校大数据专业是按大类招生,即按计算机大类,且只招理科生。

    下面是人大、北邮、中南大学三校2017年数据科学与大数据技术专业在五个省市的录取数据。其中,人大的大数据专业归统计学大类;北邮的大数据专业归计算机大类。

  • ?

    想从事数据分析师应该学什么专业好呢?就业现状怎么样?

    半边

    展开

    在回答“从事数据分析师学什么专业”这个问题之前,小编想先给大家介绍下数据分析这师的就业现状!

    一个优秀的数据分析师可以帮助企业根据现有数据做出科学、合理的分析,在前行中准确定位,为企业排除干扰,创造价值。数据分析师这个岗位的可以从事相关数据的职位有很多,如业务数据分析师、数据挖掘师、数据科学家、数据工程师等等。

    上海数据分析网

    业务/商业数据分析师(BA)是完全的咨询师设定,核心价值在分析框架+报告;

    数据科学家是完全的算法设定,核心价值在算法+数学;

    数据工程师是完全的程序员设定,核心价值在程序;

    其他还有建模分析师、数据架构师、数据产品等等;

    可以说数据分析师的就业面非常之广,在公司产生的价值与被重视程度不言而喻。

    小编从各大招聘网站找到国内三家大企业的招聘,从中可以发现企业对数据分析人才专业要求是怎样的。

    上海数据分析网

    可以看到职责描述里,第七条,数学、统计学、信息管理、计算机专业等。

    上海数据分析网

    岗位要求里,第一条:本科以上学历,统计学、数学、电子商务、计算机、市场营销等相关专业。

    上海数据分析网

    任职要求,第一条可以看到数学、统计学、数量经济学、计算机、营销学等相关专业。

    这几条招聘启事专业要求有数学、统计学、信息管理、计算机、电子商务、市场营销、数量经济学专业。这些专业具体都学些什么内容呢?

    数学

    随着科技事业的发展,数学专业和其他专业的联系也越来越紧密,所以数学专业知识也得广泛的应用。

    数据分析师需要有专业的数学功底和严密的逻辑思维,而严密的逻辑思维则来源于扎实的数学功底。 学数学的同学更注重理论的完备性和逻辑链的完整性,即对于在分析过程中出现的任何一些命题,都要能证明它是正确的还是错误的。

    统计学

    统计学贯穿数据分析的全过程,没有统计学基础,很难有专业的数据分析。数据分析的 各个步骤,都要用到统计学的知识。

    信息管理

    信管专业主要对各种“系统”进行分析、设计与实现,技术与管理的有机结合。学习内容:财务、系统数据分析、IT技术,可以说信管专业非常对口数据分析师职位,从信息中 发掘财富。与计算机结合,使计算机作为工具, 信息管理更加有效和实用,随着企业经营规模的现代化,对信息管理 的要求越来越强烈。

    例如铁路订票系统,就是对车票这种信息的查询和管理系统。可以说软件开发的最主要面向的客户就是 帮助企业制作良好的信息管理系统。

    计算机

    学习计算机专业同学可以从事数据研发/开发工程师,数据挖掘/机器学习工程师,对编程技术上的要求高一些。

    上海数据分析网

    电子商务

    电子商务专业培养具备管理、经济、法律及网络技术、计算机技术、市场营销、电子商 务技术以及电子商务管理等方面的知识和基本技能,现在各大交易都在网站等网络平台 交易完成,数据分析在电商行业的应用非常广。

    市场营销

    数据分析师常要为企业的营销决策提供支持,这就要求懂营销。

    具有营销背景的数据分析师思路会更清晰、更开阔。当让他做竞争分析时,他会想到波 特五个力;让他做环境分析时,他会想到PEST、让他做消费者偏好分析,他会想到科 特勒用户决策流程。

    数量经济学

    数量经济学是运用统计学、经济计量学、投入产出分析、最优规划方法、经济控制论和计算技术等各种手段,对各种经济问题进行理论分析、经验检验和政策分析的一门应用经济学科。数量经济学更偏技术类,相比其他经济学金融类专业,数经的优势是统计软件够独立编程。

  • ?

    数据分析:大数据时代背景下对应用统计学专业的思考,看完长见识

    Iria

    展开

    大数据时代背景下对应用统计学专业的思考

    一、概述 众所周知,统计学自古至今就是一门以研究数据为主的学科,至今已经形成了较为成熟的数据研究体系与框架。统计学专业的学生的主要就业方向是银行、会计师事务所、市场调查公司或其它企事业单位。因此目前统计学教育的主要目的是能够培养出独立完成问卷设计、数据收集、应用模型进行数据分析的高级统计人才,其主要专业课程包括:高等概率论与数理统计、应用回归、多元统计、市场调查实务、时间序列分析、金融计算等,这些课程仍然是传统的课程设置,并不符合大数据时代数据科学家的专业知识构成。因此,在大数据时代背景下对应用型本科院校应用统计学专业的培养模式和教学改革的思考是非常有必要的。   2012年3月29日,美国在倡议书中指出,美国将应用收集巨大、复杂数据的挖掘能力,加速科学与工程学科的创新脚步,改革学生培养模式。北京师范大学邱东教授探讨了面对大数据潮流人们应持有的科学态度,从大数据的概念功能、统计学与数据科學的关系、大数据潮流对统计学产生的影响等4个方面论述了大数据对统计学的挑战[1]。英国学者维克托·迈尔·舍恩伯格认为大数据的精髓在于分析信息时的3个转变:一是可以分析和处理更多甚至是全部的数据,不再依赖随机抽样;二是研究数据如此之多,以至于人们不再追求精确度;三是人们不再热衷于寻找因果关系[2]。为适应大数据时代对数据处理人才更高综合素质的要求,统计学科教师与专业教育应在知识结构、教育内容、教育方式和人才培养模式等方面,主动进行与时俱进的充实、调整及变革[3]。文章拟从数据挖掘与统计分析的联系与区别、大数据对统计教育及统计人才的机遇与挑战的新形势下从政府、企业和人才等多个角度进行展开调查,对于应用型本科院校培养顺应时代发展的应用统计学专业的高层次人才提供相应的建议。  

    二、统计分析与数据挖掘的区别与联系   统计分析是指运用统计收集整理方法及与分析对象有关的知识,从定量与定性的结合上进行的研究活动。   统计分析过程:描述要分析的数据的性质,研究基础群体的数据关系,创建一个模型,总结数据与基础群体的联系,证明(或否定)该模型的有效性,采用预测分析来预测将来的趋势。   统计分析方法:(1)描述统计:将研究中所得的数据加以整理、归类、简化或绘制成图表,以此描述和归纳数据的特征及变量之间的关系的方法。集中趋势、离散程度、相关强度等、指标有平均数、标准差、相关系数等;(2)推断统计:用概率形式来决断数据之间是否存在某种关系及用样本统计值来推测总体特征的一种重要的统计方法。总体参数估计、假设检验、Z检验、T检验、卡方检验等数据挖掘是从庞大的数据中分析出有目标数据群,筛选出利于决策的有效信息。数据挖掘的数据量极大,注重数据查询分析的可行性。数据挖掘是着眼于预测未来,从大量的数据中寻找某些规律。

    数据挖掘过程:(1)定义问题:分析业务需求、定义问题的范围、定义计算模型所使用的度量、定义数据挖掘项目的特定目标等;(2)准备数据:删除错误数据或插入缺失值、查找数据中的隐含相关性、标识最准确的数据源、确定哪些列最适合用于分析;(3)浏览数据:计算最小值和最大值、计算平均偏差和标准偏差、查看数据的分布;(4)部署和更新模型:根据实际数据部署、更新模型;(5)浏览和验证模型:测试模型的性能、需要使用不同配置创建多个模型,并对所有这些模型进行测试,查看哪个模型为最佳;(6)生成模型:通过创建挖掘结构定义要使用的数据列、将挖掘结构链接到数据源,但只有对挖掘结构进行处理后,该结构才会实际包含数据。 从上可以看出大数据虽与统计学密切相关,但二者也在研究目的、数据处理对象和技术工具上有着诸多差异。大数据的兴起不仅在分析手段、工作重心和价值理念上给统计学带来了重大影响,而且也使担负着培养现代统计工作和数据分析之人才的统计教育面临严峻挑战。  

    三、大数据对统计人才及统计教育的机遇与挑战   根据2014年大数据应用现状和趋势展开的调研分析,被调查者最关注的大数据技术中,排在前三位的分别是数据分析(统计分析与数据挖掘等)(25.5%)、数据采集(19.9%)、数据处理 (18.5%)。企业数据管理面临的挑战:缺乏专业的大数据人才(26.95%)成为企业面临的最大挑战,其次是非结构化数据的分析和处理(26.65%)、传统技术难以处理大数据(25.27%)以及新技术门槛过高(21.13%)。根据2015年2月Forrest报告,很多企业都在努力挖掘其拥有的大量数据,包括结构化、非结构化、半结构化数据等,探索对数据的深入利用。从国内企业大数据应用的现状和规划来看,已经部署大数据应用的企业所占比例达到21.89%,计划1年内部署的企业占27.92%,计划2年内部署的企业占14.34%,没有相关计划和不确定的企业分别占11.32%和24.53%。大数据相关人才的欠缺将会成为影响大数据市场发展的一个重要因素。据Gartner预测,到2016年,全球将新增440万个与大数据相关的工作岗位,且会有25%的组织设立首席数据官职位。大数据的相关职位需要的是复合型人才,能够对数学、统计学、数据分析、机器学习和自然语言处理等多方面知识综合掌控。   根据学院统计学不同方向等专业的学生、老师、专家以及政府范围工作人员等进行访问调查的结果,然后结合现如今大数据时代企业和政府对人才的需求,最终制定应用型人才培养方案分别如下:   (一)深化课程教学内容改革   1. 更新教学内容,紧跟时代发展——大数据、互联网金融、国民经济统计、货币银行、经济预测与决策;2. 强化统计基础,提高实践操作——统计方法、软件实现、贝叶斯统计、非参数估计、统计软件、数据挖掘;3. 强调专业导向,拓宽就业方向-选修、考证;金融类、经济类、管理类、会计类;统计从业资格证书。   最终根据学院不同方向统计学专业设置专业核心课如下:   (1)应用统计学:主要专业课 调整为:概率论、数理统计、统计学、回归分析、时间序列分析、多元统计分析,抽样技术、数据挖掘、贝叶斯统计、计量经济学、统计软件、非参数统计、统计调查等;(2)应用统计学(金融统计):主要专业课 调整為:概率论、数理统计、统计学、回归分析、时间序列分析、多元统计分析,抽样技术、数据挖掘、金融计量学、风险管理、保险学、非寿险精算、统计软件、国民经济核算、统计调查等;(3)经济统计学:主要专业课 调整为:概率论、数理统计、统计学、回归分析、时间序列分析、多元统计分析,抽样技术、数据挖掘、国民经济核算、风险管理、保险学、非寿险精算、统计软件、金融计量学、统计调查等。  

    (二)重视教学方法改革   1. 教师教学理念——单向灌输式转向引导探究式、教学案例能贴近实际问题(体测数据、大学生婚恋、手机);2. 鼓励学生参与各类项目——科研、调研、方案设计、抽样调查、统计调查、学科竞赛、教师课题(分解子课题);3. 注重综合能力提升——表达、协作、创新、研究报告、PPT展示等。   (三)建立完善的实践教学系统   1. 基本知识技能实验——理论教学的课内实验,大一、二:数学类;大二、大三(上):专业基础;2. 综合性实践教学——综合性数据的采集、处理、分析,大三(下)、四(上):数据挖掘、统计软件、统计调查;3. 探索性实践教学——社会调查、毕业实习、毕业论文,大四(下)。   (四)改革课程考试方式   1. 基本知识(理论)+实验报告(平时)+综合实验(期末)数学类;专业基础课程;2. 方案设计、调研报告、抽样调查、统计调查;3. 综合实验,数据挖掘、统计软件。   四、结束语   最终学院统计系下设两个教研室和一个研究中心,即基础统计教研室、专业统计教研室和大数据统计科学应用研究中心。秉承和依托母体学校——上海财经大学的办学宗旨和学术底蕴。在全校统计学公共课教学方面,针对学生的特点,课程教学采用课堂教学、调查实践与统计调查大赛相结合的教学方式与形式。也采取和校外企业、单位等合作项目老师指导学生参与的形式,这样既提高学生的实践能力又加强了师生之间的交流。在这样边学理论边实践的过程中也让学生足够了解现在企业所需人才的类型、找到自己的不足再补充理论方面的知识,然后学生还可以向学校反馈信息,这样最终形成一个学院专业始终跟得上经济的发展形势,不断地改革和完善教学内容,争取培养出在各级政府机关、银行、证券以及上市公司、企业集团、跨国公司等企事业单位和经营管理机构从事统计、市场调研、市场预测与决策、信息咨询、可行性研究和综合评价等实际工作以及科研单位从事研究工作的应用型人才。

统计与数据分析专业

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP