中企动力 > 商学院 > 大数据科学计算
  • ?

    数据科学与大数据技术专业都有哪些课程,前景如何?

    灵寒

    展开

    目前数据中国“百校工程”已有73所入选院校,23所项目院校通过教育部规建中心专家验收,曙光瑞翼教育与项目院校校企合作协同育人,服务于全国各地近30所院校的曙光瑞翼大数据学院,招录近6000名学生,在数据科学与大数据技术专业的课程设计上,设计以下的专业课程。

    数据科学与大数据专业的必修基础课程方面大数据(人工智能)概论、Linux操作系统、Java语言编程、数据库原理与应用、数据结构、数学及统计类课程(高等数学、线性代数、概率论、数理统计)、大数据应用开发语言、Hadoop大数据技术、分布式数据库原理与应用、数据导入与预处理应用、数据挖掘技术与应用、大数据分析与内存计算等。选修的课程方面数据可视化技术、商务智能方法与应用、机器学习、人工智能技术与应用等。实践应用课程方面海量数据预处理实战、海量数据挖掘与可视化实战等。

    数据科学与大数据技术可从事的岗位有:分析类,分析工程师、算法工程师;研发类,架构工程师、开发工程师、运维工程师;管理类,产品经理、运营经理。

    大数据与人工智能不但是社会发展急需的新兴专业方向,同时也将渗透并影响着其他许多传统学科和专业的发展。腾讯研究院于2017年12月发布了《2017年全球人工智能人才白皮书》,数据显示,中国592家公司中约有4万位员工,而中国对于人工智能人才的需求数量已经突破百万,人才严重短缺,迫使企业不断降低工作经验门槛,甚至不惜从零培养人才。

    数据科学与大数据技术专业不仅有着明朗的就业前景,在就业岗位的薪资待遇上有着无法比拟的就业优势。依据招聘网站给出薪资数据,目前国内人工智能相关岗位的应届毕业生的起薪基本都在10k—20k之间,毕业三年后人工智能岗位的技术人员,平均月薪在25k以上,基本实现薪酬翻番,薪资水平、就业满意度都优于全国平均水平的专业。随着未来科技应用的逐步推进,人工智能以及大数据技术的岗位需求逐步上升,未来必定会发展为就业前景最好的专业之一。

  • ?

    推荐 :数据科学与大数据技术专业特色课程研究

    微妙

    展开

    在我国,数据科学与大数据技术专业的建设已成为新的热点话题。 在系统调研 世界一流大学数据科学专业建设现 状的基础上,从特色课程视角重点分析 加州大学伯克利分校、约翰·霍普金斯大学、华盛顿大学、纽约大学、斯坦福大学、卡内基梅隆大学、哥伦比亚大学、伦敦城市大学等 8所大学的数据科学专业,提出 数据科学与大数据技术这一新专业 应重视的10门特色课程,并分析了现阶段我 国 数据科学教育中 普遍存在的8种曲解现象及对策建议 。

    2016 年,教育部发布的《 2015 年度普通高等学校本科专业备案和审批结果》中就首次增设“数据科学与大数据技术专业”,并获批了北京大学、对外经济贸易大学及中南大学的新增专业申请。接着, 2017 年,中国人民大学等 32 所高校出现在第二批次的获批名单中。另, 全国高校大数据教育联盟的统计数据显示, 2017 年申请该专业的院校高达 263 所,其中工学 190 所,理学 73 所 [1] 。从申请资料看,国内数据科学专业是一门主要以统计学和计算机科学与技术专业为基础建设的全新专业。数据科学专业已成为我国现阶段高等教育的热点问题之一。但是,建设什么样的专业以及如何建设该专业仍为各高校面临的难点问题。

    在国外,数据科学( Data Science )专业是以数据分析学( Data Analytics )专业为基础发展而来的,可追溯至 2007 年北卡罗来纳州立大学( North Carolina State University )率先设立的数据分析硕士学位( Master of Science in Analytics ) [2] 。与统计学和计算机科学与技术等基础学科不同的是,数据分析学进一步抽象了这些底层科学中的数据问题,连接了包括统计学和计算机科学在内的基础学科与数据科学之间的空白,为数据科学这一新学科的出现奠定了直接基础。从“数据分析学”向“数据科学”的实质性过渡出现在 2013 年左右,比较有代表性的是纽约大学于 2013 年新开设的数据科学硕士专业( The Master of Science in Data Science ) [3] 。 之后,包括加州大学伯克利分校、约翰 · 霍普金斯大学、华盛顿大学在内的多个学校设立了数据科学专业。可见,国外一流大学的数据科学专业建设至少早于国内 三 年。

    为此,本文在调查分析世界一流大学数据科学专业的培养方案,重点分析数据科学专业中开设的特色课程,并对探讨我国数据科学专业建设的借鉴意义。

    1 数据调研及分析

    作者通过 Study Portal 进行调查发现,截止 2017 年 11 月,国外数据科学专业的本科、硕士、博士学位项目分别已达到 5601 、 4179 和 301 项,主要分布在美国、英国、澳大利亚、加拿大、德国和意大利等国家。但是,从课程体系和人才培养定位看,能够体现国外数据科学专业教育的本质与特色的是硕士层次的教育,比较有典型的学校有加州大学伯克利分校、约翰·霍普金斯大学、华盛顿大学、纽约大学、斯坦福大学、卡内基梅隆大学、哥伦比亚大学、伦敦城市大学,如表 1 所示。

    表 1 典型数据科学专业及其特色课程( Typical Data Science Programs and their Core Courses )

    学校

    学位名称

    特色课程

    加州大学伯克利分校 [4]

    信息与数据科学硕士

    ( Master of Information and Data Science )

    Python 与数据科学 /Python for Data Science

    研究设计及数据与分析中的应用 /Research Design and Application for Data and Analysis

    数据存储与检索 / Storing and Retrieving Data

    应用机器学习 / Applied Machine Learning

    试验与因果分析 /Experiments and Causality

    大数据 —— 人与价值 / Behind the Data: Humans and Values

    ( 纵向扩展及真正的 ) 大数据 / Scaling Up! Really Big Data

    数据可视化与沟通 / Data Visualization and Communication

    (数据科学)综合训练课程 / Synthetic Capstone Course

    约翰 · 霍普金斯大学 [5]

    数据科学理学硕士

    ( Master of Science in Data Science )

    数据科学 /Data Science

    数据可视化 /Data Visualization

    随机优化与控制 /Stochastic Optimization and Control

    数据科学家的工具箱 / Data Scientist's Toolbox

    数据采集与清洗 /Getting and Cleaning Data

    探索性数据分析 /Exploratory Data Analysis

    可重复研究 /Reproducible Research

    实用机器学习 /Practical Machine Learning

    数据产品开发 /Developing Data Products

    数据科学综合训练课程 /Data Science Capstone

    华盛顿大学 [6]

    数据科学理学硕士

    Master of Science in Data Science

    数据可视化与探索性分析 / Data Visualization & Exploratory Analytics

    应用统计与试验设计 /Applied Statistics & Experimental Design

    数据管理与数据科学 /Data Management for Data Science

    数据科学家常用的统计机器学习 /Statistical Machine Learning for Data Scientists

    面向数据科学的软件设计 /Software Design for Data Science

    可扩展的数据系统与算法 /Scalable Data Systems & Algorithms

    以人为中心的数据科学 /Human-Centered Data Science

    数据科学综合训练课程 /Data Science Capstone Project

    纽约大学 [7]

    数据科学理学硕士 MS in Data Science

    数据科学导论 / Intro to Data Science

    大数据 /Big Data

    面向数据科学的统计学与概率论 /Probability and Statistics for Data Science

    推理与表示 / Inference and Representation

    机器学习与计算统计学 / Machine Learning and Computational Statistics

    数据科学综合训练课程 / Capstone Project in Data Science

    基于优化的数据分析 /Optimization-based Data Analysis

    非光滑凸优化 /Convex and Nonsmooth Optimization

    斯坦福大学 [8]

    统计学 : 数据科学 理学硕士学位

    M.S.in Statistics:Data Science

    现代应用统计学 : 学习 /Modern Applied Statistics: Learning

    现代应用统计学 : 数据挖掘 /Modern Applied Statistics: Data Mining

    数据驱动型医学 / Data Driven Medicine

    现代统计学与现代生物学 /Modern Statistics for Modern Biology

    大数据商务智能 / Business Intelligence from Big Data

    基于数据的计算范式 /Paradigms for Computing with Data

    卡内基梅隆大学 [9]

    计算数据科学硕士学位

    Master of Computational Data Science

    云计算 /Cloud Computing

    高级云计算 /Advanced Cloud Computing

    多媒体数据库及数据挖掘 /Multimedia Databases and Data Mining

    移动与普适计算 /Mobile and Pervasive Computing

    大数据集的机器学习 /Machine Learning with Big Data Sets

    智能信息系统的设计与开发 /Design and Engineering of Intelligent Info Systems

    大数据分析学 /Big Data Analytics

    哥伦比亚大学(纽约) [10]

    数据科学理学硕士

    Master of Science in Data Science

    数据科学导论 /Introduction to Data Science

    面向数据科学的计算机系统 /Computer Systems for Data Science

    探索性数据分析与可视化 /Exploratory Data Analysis & Visualization

    数据科学中的因果推理 / Causal Inference for Data Science

    大数据分析学 /Big Data Analytics

    数据科学综合训练及伦理 /Data Science Capstone & Ethics

    伦敦城市大学 [11]

    数据科学理学硕士

    MSc in Data Science

    数据科学原理 /Principles of data science

    大数据 /Big Data

    可视分析学 /Visual analytics

    数据可视化 /Data visualization

    神经计算 /Neural computing

    研究方法与专业问题 /Research Methods and Professional Issues

    高级并发编程 /Advanced Programming: Concurrency

    1.1加州大学伯克利分校

    该学校的数据科学专业由信息学院( School of Information )开设,专业名称为信息与数据科学,授予的学位为信息和数据科学专业硕士( Professional Master of Information and Data Science, MIDS ) [12] 。该专业主要侧重于培养学生的研究设计、数据清洗、存储与检索、挖掘与探索、数据可视化、道德与隐私、数据分析、沟通与呈现的能力,如图 1 所示。

    图 1 加州大学伯克利分校 MIDS 专业所关注的学生能力

    ( Key Skill Areas of MIDS at UC Berkeley ) [12]

    为了达到上述人才培养目的,该专业开设基础课程、高级课程和综合训练课程等 3 类课程。其中 ,基础课程共有5门,即面向数据科学的Python语言(Python for Data Science)、面向数据与分析的研究设计(Research Design and Application for Data and Analysis)、面向数据科学的统计学(Statistics for Data Science)、数据存储与检索(Storing and Retrieving Data)以及应用机器学习(Applied Machine Learning);高级课程有7门,包括试验与因果分析(Experiments and Causality)、数据、人与价值(Behind the Data: Humans and Values)、(纵向扩展及真正的)大数据(Scaling Up! Really Big Data)、面向离散响应,时间序列和面板数据的统计方法(Statistical Methods for Discrete Response, Time Series, and Panel Data)、可扩展的机器学习(Machine Learning at Scale)、基于深度学习的自然语言处理(Natural Language Processing with Deep Learning)以及数据可视化与沟通(Data Visualization and Communication)。除了基础课程和高级课程,该学校还开设一门综合训练课程(Synthetic Capstone),培 养学生综合运用所学专业知识及解决现实问题的能力。

    从总体上看,人才培养定位在培养数据科学领域的领导者,侧重培养学生的运用新工具和新方法,从现实数据中获得洞见( Insights )以及如何有效地沟通与阐释自己的研究发现,进而改变他人行动和思想的能力。 该学校的数据科学专业的人才培养具有如下几个特点 :

    强调数据科学的多学科交叉特点 ,将社会科学,计算机科学,统计学,管理学和法学等多学科知识融入具体课程之中;

    凸显数据科学本身的讲解 ,注重提升学生的基于数据提出好问题的能力以及面向数据科学的研究设计、数据清理、存储与检索、交流与沟通、统计分析、道德与隐私、数据可视化以及数据挖掘与探索等关键技能;

    引入基于项目的学习方法 ,借鉴本校信息学院其他专业的培养经验,通过基于项目的教学方式,鼓励学生综合运用多种不同的工具和方法来解决复杂问题;

    强调动手实践能力的培养,为学生提供亚马逊 Web 服务和 IBM 大数据平台等实践平台。

    1.2 约翰 · 霍普金斯大学

    该学校的怀廷工程学院( Whiting School of Engineering )开设名为数据科学( Data Science )的新专业,授予的学位为数据科学理学硕士( Master of Science in Data Science )。

    该专业的课程体系包含先修课程( Prerequisite Courses )、基础课程( Foundation Course )、必修课程( Required Courses )、选修课程( Electives )以及独立学习( Independent study )课程等近 60 门课程 [13] 。 基础课程有 2 门,即算法基础( Foundations of Algorithms )和统计方法与数据分析( Statistical Methods and Data Analysis );必修课程包括数据库系统原理、数据科学、数据可视化、优化导论( Introduction to Optimization )、统计模型与回归、计算统计学;选修课分为机器学习和统计学两个大方向,共有 14 门主要课程,均为较为常见课程。 值得一提的是,该专业另提供了近 30 门扩展选修课程( Additional Selections ),供学生用于置换同一个领域的必须 / 选修课程,这些扩展课程均为统计学和计算机科学与技术专业常见课程。 独立学习( Independent study )课程主要包括独立动手实战( Capstone 项目)和独立学习( Independent Study )。

    从总体上看, 该学校的数据科学专业的人才培养具有如下几个特点 :

    从人才培养的目的看,专业旨在培养“有竞争力”的数据科学家,要求学生具备三方面的能力:综合运用计算机科学和应用数学的知识,分析与处理大规模数据集的能力;从复杂数据中快速洞察到有价值信息的能力和从信息中发现相关关系的能力;基于规范的技术和抽象的方法以及面向现实世界中的具体问题的建模能力[14]。

    强调学生对数据科学的理论基础的掌握程度,突出了三个主要领域:计算机科学与技术、统计学与应用数学。其中,对应用数学的重视是该学校数据科学专业的一大特色。

    从课程设计及内容选择看,该专业鼓励在每一门课程中引入来自现实世界的具体问题作为例题和主要关注点。例如,独立学习(Independent Study)课程中强调对具体行业中实际问题的处理能力。

    强调培养学生的数据全生命期管理、统计 分析和故事化描述能力。

    1.3华盛顿大学

    整合自己的应用数学系、生物统计学系、 Paul G. Allen 计算机科学与工程学院、以人为本的设计与工程系、统计系、信息学院 6 大院系以及电子科学研究所的资源,开设出了一种面向在职人员的夜大类数据科学专业项目,所授予的学位为数据科学理学硕士( Master of Science in Data Science )。该专业的课程设计较为简洁,包括 8 门核心课程以及 1 个 Capstone 项目。其中, 8 个核心课程分别是统计与概率论( Introduction to Statistics & Probability )、信息可视化( Information Visualization )、应用统计与试验设计( Applied Statistics & Experimental Design )、面向数据科学的数据管理( Data Management for Data Science )、数据科学家常用的统计机器学习( Statistical Machine Learning for Data Scientists )、面向数据科学的软件设计( Software Design for Data Science )、可扩展的数据系统与算法( Scalable Data Systems & Algorithms )和以人为中心的数据科学( Human-Centered Data Science )。 Capstone 项目要求学生自...

  • ?

    就业前景极好的大数据专业,你了解吗?

    不见

    展开

    当下,人工智能、大数据等热门词汇频频出现在人们的视野中。作为万物分析的大数据更是站在互联网的风口浪尖上,直接催热了大学里的大数据专业。

    从IT时代进入DT时代,高校在大数据方向上设置了什么专业,具体学什么,就业怎么样,作为新兴专业,考生如何报考?今天,就来谈一谈这个大家关注的热门专业。

    1.什么叫大数据?

    进入互联网时代,中国的网民人数已超7亿,大数据的应用涉及到生活的方方面面。例如,你在网站上买书,商家就会根据你的喜好和其他购书者的评价给你推荐另外的书籍;手机定位数据和交通数据可以帮助城市规划;甚至用户的搜索习惯和股市都有很大关系。

    在谈到大数据的时候,人们往往知道的就是数据很大,但大数据≠大的数据。大数据,就是存储在各种存储介质中的海量的各种形态数据,具有5V特点,即:Volume(大量)、Velocity(高速)、Variety(多样)、Value(价值密度)、Veracity(真实性)。大数据之“大”,不仅在于其“大容量”,更在于其“大价值”,并已成为除人力、土地、财务、技术之外的另一种重要的基础资源。对各种存储介质中海量信息的采集、存储、分析、整合、控制而得到的数据就是大数据。大数据技术的意义不在于掌握庞大的数据信息,而在于对这些数据进行专业化处理,通过“加工”实现数据的“增值”,更好地辅助决策。

    2.数据科学与大数据技术专业

    本科专业中和大数据相对应的是“数据科学与大数据技术”专业,它是2015年教育部公布的新增专业。2016年3月公布的《高校本科专业备案和审批结果》中,北京大学、对外经济贸易大学和中南大学3所高校首批获批开设“数据科学与大数据技术”专业。随后第二年又有32所高校获批“数据科学与大数据技术”专业。两次获批的名单中显示,该专业学制为四年,大部分为工学。

    数据科学与大数据技术是个交叉性很强的专业,很难说完全归属于哪个独立的学科。所以,不同的学校有的是信息学院申报,有的是计算机学院牵头申报,有的设在统计学院,还有的在经管学院。像北京大学这个专业是放在理学下,授予理学学位。大多数是设在工学计算机门类下,授予的是工学学位。数据科学很早就存在,是个比较经典的学科,现在和大数据技术结合形成了这个专业。目前教育部设定的本科专业名称为“数据科学与大数据技术”,专科名称是“大数据技术与应用”。

    3.数据科学与大数据技术学什么?

    以对外经济贸易大学该专业为例,专业知识结构包括数学、统计、计算机和大数据分析四大模块,具体课程设置如下:

    数学:数学分析一、数学分析二、高等代数、离散数学。统计学:概率论与数理统计、多元统计分析、随机过程。计算机:数据机构、计算机组成原理、操作系统、数据库系统原理、C++程序设计、Java程序设计、Python与大数据分析、科学计算与Matlab应用、R语言等。大数据分析:数据科学导论、机器学习与数据挖掘、信息检索与数据处理、自然语言处理、智能计算、推荐系统原理、大数据分析技术基础、数据可视化、大数据存储与管理、大数据分析实践等课程。

    数据科学与大数据技术是一门实践性很强的新兴交叉复合型学科:以统计学、数学、计算机为三大支撑性学科;生物、医学、环境科学、经济学、社会学、管理学为应用拓展性学科。此外还需学习数据采集、分析、处理软件,学习数学建模软件及计算机编程语言等,知识结构是二专多能复合的跨界人才(有专业知识、有数据思维)。根据各校偏重的专业方向,课程设置有所差异,感兴趣的同学可以具体查看各校的专业和课程设置情况。

    1.行业增速快 人才缺口大

    随着移动互联网和智能终端的普及,信息技术与经济社会的交汇融合,引发了数据迅猛增长。新摩尔定律认为,人类有史以来的数据总量,每过18个月就会翻一番。而海量的数据蕴含着巨大生产力和商机。

    2011年至2014年四年间,我国大数据处于起步阶段,每年均增长在20%以上。2015年,大数据市场规模已达到98.9亿元。2016年增速达到45%,超过160亿元。预计2020年,我国大数据市场规模将超过8000亿元,有望成世界第一数据资源大国。但数据开放度低、技术薄弱、人才缺失、行业应用不深入等都是产业发展中亟待解决的问题。

    根据领英发布《2016年中国最热职位人才报告》显示,有六类热门职位的人才当前都处于供不应求状态,稀缺程度各有不同,其中,数据分析人才的供给指数最低,仅为0.05,属于高度稀缺。

    目前的当务之急是解决大数据人才瓶颈问题,相关调查显示,未来3-5年大数据人才缺口达到150万之多。,但截至目前,中国大数据从业人员只有约30万人。同时,大数据行业选才的标准也在不断变化。初期,大数据人才的需求主要集中在ETL研发、系统架构开发、数据仓库研究等偏硬件领域,以IT、计算机背景的人才居多。随着大数据往各垂直领域延伸发展,对统计学、数学专业的人才,数据分析、数据挖掘、人工智能等偏软件领域的需求加大。

    数据分析师现在需求就很旺盛了,2年工作经验的月薪可达到8K,硕士学历的数据分析师月薪可达到12K,5年工作经验的可达到40万至60万元。

    2.大数据主要就业方向

    2015年9月国务院印发《促进大数据发展行动纲要》,系统部署大数据发展工作。《纲要》明确提出了七方面政策机制,其中第六条就是加强专业人才培养,建立健全多层次、多类型的大数据人才培养体系。目前,大数据主要有三大就业方向:大数据系统研发类、大数据应用开发类和大数据分析类。具体岗位如下:

    1.大数据系统架构师

    大数据平台搭建、系统设计、基础设施。

    2.大数据系统分析师

    面向实际行业领域,利用大数据技术进行数据安全生命周期管理、分析和应用。

    3.hadoop开发工程师。

    解决大数据存储问题。

    4.数据分析师

    不同行业中,专门从事行业数据搜集、整理、分析,并依据数据做出行业研究、评估和预测的专业人员。在工作中通过运用工具,提取、分析、呈现数据,实现数据的商业意义。

    作为一名数据分析师,至少需要熟练SPSS、STATISTIC、Eviews、SAS、大数据魔镜等数据分析软件中的一门,至少能用Acess等进行数据库开发,至少掌握一门数学软件如matalab、mathmatics进行新模型的构建,至少掌握一门编程语言。总之,一个优秀的数据分析师,应该业务、管理、分析、工具、设计都不落下。

    5.数据挖掘工程师

    做数据挖掘要从海量数据中发现规律,这就需要一定的数学知识,最基本的比如线性代数、高等代数、凸优化、概率论等。经常会用到的语言包括Python、Java、C或者C++,我自己用Python或者Java比较多。有时用MapReduce写程序,再用Hadoop或者Hyp来处理数据,如果用Python的话会和Spark相结合。

    6.大数据可视化工程师

    随着大数据在人们工作及日常生活中的应用,大数据可视化也改变着人类的对信息的阅读和理解方式。从百度迁徙到谷歌流感趋势,再到阿里云推出县域经济可视化产品,大数据技术和大数据可视化都是幕后的英雄。

    1.院校开设情况

    大数据人才的典型胜任特征:善于做需求分析、写代码;善于与人沟通,喜欢探索未知;需要根据数据推演、分析、提出解决方案,有数据思维;需要持续保持学习状态;内性格上能动能静。

    不同办学层次的院校开设此专业,培养模式会有差异。例如,高职类院校学生由于数学基础相对薄弱,会跟多偏向于工具的使用,如数据清洗、数据存储以及数据可视化等相关工具的使用;本科院校会倾向于大数据相关基础知识全面覆盖性教学,在研究生段则会专攻某一技术领域,比如数据挖掘、数据分析、商业智能、人工智能等。

    在“教育部2015年度普通高等学校本科专业备案和审批结果”中北京大学、中南大学、对外经贸大学成为首批开设 “数据科学与大数据技术”本科专业的高校,随后中国人民大学、北京邮电大学、复旦大学等32所高校成为第二批成功申请该专业的高校。至去年上半年,我国已有35所高校获批“数据科学与大数据技术”本科专业。经过一年的发展,申请院校成井喷式的增长,全国高校大数据教育联盟通过教育部公示的申请2017年“数据科学与大数据技术”专业的院校来看,2017年申请院校高达263所,其中工学190所,理学73所。

    数据科学与大数据技术是个交叉性强、跨学科的专业,很难说是完全归属与那个独立的学科。高校牵头申报的学院不同,培养重点和授予的学位可能不一样。因为课程来自于不同的学院,也有高校是联合一些学院单独成立机构来申报。从名单可以看出,在大部分开设院校中该专业都属于工学类,有个别院校将其归属在理学门类,授予理学学位。

    有志于学习数据科学与大数据技术专业的学生,可以从大学的传统优势领域和行业背景考虑选择。比如,复旦大学的大数据技术本科专业是设在大数据学院下;北京大学是在数学院开设了该专业,偏数学的内容更多一些。对外经济贸易大学该专业设在信息学院,因为财经是学校传统优势,专业还会偏重经济、金融等相关学科领域的知识。

    2.报考注意事项

    了解了大数据行业和大数据专业后,对于考生填报与大数据相关的热门专业,需要注意以下几点:

    1.报考热门专业和就业热的专业并不一定是重合的,比如软件、计算机、金融,这些专业的就业率实际并没有那么高,地质勘探、石油、遥感等专业,虽然报考时是冷门,但行业需求大,就业率更高。

    2.选择热门专业,更需要考虑就业质量。专业就业好,是统计学意义,指的是平均收入水平高,比如金融专业的收入,比其他纯文科专业的平均收入较高,但落实到个体层面,就业情况就不一样了,尤其像金融专业是典型的名校高学历好就业,但对于考试成绩较低的同学来说,如果去一些普通院校、专科院校学习金融,最后就业情况可能还不如会计专业。

    3.志愿填报,除了专业,城市因素也很重要:如果想从事金融、互联网的工作,更适合去一线城市,如果是去三、四线大学的学生可以考虑应用面比较广的专业,就是各行各业都能用到的专业,比如会计专业,专科层次的会计和985层次的会计都有就业渠道。如果先选择报考城市,也可以针对所在城市的行业特点选择专业,比如沿海城市外贸相对发达,选择国际贸易、外语类专业就业情况更好,比如武汉有光谷,选择光电类专业更好就业。

    4.最终家长和考生更需要考虑个人与专业匹配的问题,金融、计算机等热门专业不是所有人都适合学,好专业不见得对所有个体都是好的。

    5.最后,考生报考时要注意,有的高校大数据专业是按大类招生,即按计算机大类,且只招理科生。

    下面是人大、北邮、中南大学三校2017年数据科学与大数据技术专业在五个省市的录取数据。其中,人大的大数据专业归统计学大类;北邮的大数据专业归计算机大类。

  • ?

    GFD课堂 03 人工智能崛起的三大基石:大数据+计算能力+深度学习算法

    Galina

    展开

    首先,人工智能对计算能力的要求很高,而以前研究人工智能的科学家往往受限于单机计算能力,需要对数据样本进行裁剪,让数据在单台计算里进行建模分析,导致模型的准确率降低。伴随着云计算基数和芯片处理能力的迅速发展,可以利用成千上万台的机器进行并行计算,尤其是GPU\FPGA以及人工智能专用芯片的发展为人工智能落地奠定了基础计算能力,使得使用类似于人类的深层神经网络算法模型的人工智能应用称为现实;

    第二是便随着互联网的飞速发展,在线数据变得异常丰富,多来源、实时、大量、多类型的数据可以从不同的角度对现实进行更为逼真的描述,而利用深度学习算法可以挖掘数据之间的多层次关联关系,为人工智能应用奠定了数据源技术。正如阿里巴巴集团技术委员会主席王坚博士的观点所述,人工智能是互联网驱动下的一个重要领域,能够发展到今天,不是靠着自身内部的驱动力,而是因为互联网在不断完善,数据变的随处可得,所以,人工智能的进步来源于互联网基础设施的不断进步,离开互联网鼓励的来看人工智能,是没有意义的。

    格分维-人工智能

    第三是算法的发展尤其是Geoffrey Hinton教授2006年发表的论文,开启了深度学习在学术界和工业界的浪潮,以人工神经网络(ANN)为代表的深度学算法成为了人工智能应用落地的核心引擎。

    计算能力+大数据+深度学习犯法三者相辅相成、相互依赖、相互促进,使得人工智能有机会从专业的技术成为通用的技术,融入到各行各业之中。

    维成机器人教育体系

    机器人爸爸陈志成

    维城教育5大特点

    1、名师教授:国内知名院校专家教授亲临现场授课,体验名师风采;

    2、科技实践:体验式教学,动手开发机器人,提高科技创新能力;

    3、创新设计:机器人像真人一样灵活,可以自行设计动作和外观;

    4、竞赛选拔:让学生参加国内国际机器人大赛,选拔晋级;

    5、优才推荐:培养优秀科技创新人才,助力优秀学生升学留学。

    国家领导参观“维维”格分维机器人

    北京政协委员、智造大街程总亲自讲解格分维机器人

  • ?

    大数据专业《数据科学与大数据技术》介绍

    语兰

    展开

    根据教育部相关规定,《数据科学与大数据技术》本科专业代码:080910T,《大数据技术与应用》高职专业代码:610215。

    2017年3月,教育部公布第二批“大数据专业”获批高校,第一批3所,第二批32所,两批共35所。

    第一批为北京大学、对外经济贸易大学、中南大学3所

    第二批:中国人民大学、北京邮电大学、复旦大学、华东师范大学、电子科技大学等32所,具体名单如下: 中国人民大学 北京邮电大学 复旦大学 华东师范大学 电子科技大学 北京信息科技大学 中北大学 晋中学院 长春理工大学 上海工程技术大学 上海纽约大学 浙江财经大学 宿州学院 福建工程学院 黄河科技学院 湖北经济学院 佛山科学技术学院 广东白云学院 北京师范大学-香港浸会大学联合国际学院 广西科技大学 重庆理工大学 成都东软学院 电子科技大学成都学院 贵州大学 贵州师范大学 安顺学院 贵州商学院 贵州理工学院 昆明理工大学 云南师范大学 云南财经大学 宁夏理工学院

    需要同学们注意的是,大多数专业为理科、工科,对数学不感兴趣的同学慎重啊。

    大数据本科阶段课程体系目前没有统一的标准,但总的来看,包括以下课程:

    大数据数据采集:Python、Scala

    大数据存储:hbase、hive、sqoop

    大数据实时计算:Mahout、Spark、storm、

    大数据分析:python,R

    根据LinkedIn发布的《2016年中国互联网最热职位人才报告》显示,运营和数据分析是当下中国互联网行业需求最旺盛的六类人才职位。有数据称,未来几年需要大数据相关人才150万,可谓前途光明。

  • ?

    快速“吞吐”大数据——前瞻计算机“高通量”时代

    多假

    展开

    新华社杭州10月26日电 题:快速“吞吐”大数据——前瞻计算机“高通量”时代

    新华社记者 董瑞丰、朱涵

    大数据与日俱增,计算机的“运力”能否跟上步伐?

    25日至27日在浙江杭州举办的中国计算机大会上,专家们探讨一种名为“高通量计算”的新生力量,描绘了未来计算世界的一幅新图景。

    新技术:天生擅长“吞吐”大数据

    什么是高通量计算?专家解释,就是同等时间内处理更多数据。简单来说,高通量计算擅长“并行”和“不规则运算”,能更好地应对海量数据。

    人类产生的数据量正以惊人速度递增。专业报告预测,从2016年到2025年,全球数据量将出现10倍的增长。中科院计算所高通量中心主任、中科睿芯董事长范东睿说,未来的计算机如果不能瞬时“吞吐”数据,人类将淹没在数据之中。

    “高通量计算擅长让数据在‘流动’中被处理,有效避免了反复访问带来效率与能耗上的损失,天生适合‘吞吐’大数据。” 范东睿说。

    中国科学院计算技术研究所所长孙凝晖认为,在未来的计算世界,两条技术路线将融合发展:一条是以传统高性能计算为核心的智能超算路线,一条是以高通量计算为核心的流式大数据路线,面对不同场景、解决不同问题,共生互补。

    新理念:计算机从“求快”转向“求多”

    有这样一个场景:把整个城市的交通红绿灯与摄像头联网,实时监测各路段的车流情况,随时调整红绿灯的时长,可以让道路更加通畅。

    要实现这一目标,对计算机的性能要求不见得很高,但需要计算机瞬时处理海量数据。从社交媒体到网络购物,从安防监控到无人驾驶,类似的场景未来将比比皆是。

    “计算机的大量任务正从‘求快’转向‘求多’。”范东睿说,“求多”不能仅靠设备堆积,大数据处理核心引擎上相应需要做出结构性的调整。

    国家计算机网络应急协调中心教授级高工包秀国认为,5G和物联网结合的时代临近,全社会的数据量将急剧增长,同时面临更实时的数据处理需求。在这种情况下,格外需要功能强大的、价格低廉的数据处理设备。

    “越来越多数据汇集到云端,高通量计算机变得非常有用。”腾讯云副总裁王龙说。

    新挑战:建设“信息高铁”

    在孙凝晖看来,高性能超级计算机好比飞机,速度快,但机场“吞吐”能力相对低;云计算中心则类似于公路,“吞吐量”大,但速度相对较慢。他把高通量计算机比作信息领域的高铁,既可以大量“吞吐”,又能快速运行。

    但如何平衡“吞吐量”、计算力和功耗之间的矛盾?专家指出,要用“异构计算”去解决这一问题,这涉及到全新的芯片结构和系统软件,非一日之功。

    中科院计算所于2005年在国内最早提出高通量计算的概念,经过10多年的前沿技术研究,才完成“低延迟、高通量、高确定性”的计算机原型系统研制。

    目前,高通量计算机正在针对深度学习、高通量音视频处理、科学大数据处理、信息安全检测、生物信息处理、大规模图数据处理等典型场景开展示范应用。

    责任编辑: 程瑶

  • ?

    “数据科学与大数据技术”专业(专业代码080910T)课程体系

    程一凤

    展开

    2016年2月,教育部公布新增“数据科学与大数据技术”本科专业,首批北京大学、对外经济贸易大学和中南大学获批。

    “数据科学与大数据技术”专业(专业代码080910T)强调培养具有多学科交叉能力的大数据人才。该专业重点培养具有以下三方面素质的人才:一是理论性的,主要是对数据科学中模型的理解和运用;二是实践性的,主要是处理实际数据的能力。三是应用性的,主要是利用大数据的方法解决具体行业应用问题的能力。

    该专业包括基础课程、核心课程及选修课程三大模块。其中专业基础课程涵盖了数学、统计学、计算机科学等理论知识。专业核心课程侧重数据分析、计算、计算机技术以及大数据应用等方面的内容,包括了《数据科学导引》、《数据采集》及《大数据应用导论》等课程。专业选修课程在专业核心课程的基础上深入学习,包括《深度学习》、《大数据分析的算法》、《云计算与大数据平台》等,同时也在应用方面开设了新兴的行业课程,例如《金融大数据应用》、《健康医疗大数据:理论与应用》、《交通大数据:理论与应用》等。

    培养目标:

    “数据科学与大数据技术”专业,培养德、智、体、美全面发展,掌握数据科学的基础知识、理论、及技术,包括面向大数据应用的数学、统计,计算机等学科基础知识,数据建模、高效分析与处理, 统计学推断的基本理论、基本方法和基本技能。对自然科学和社会科学等应用领域中大数据的了解,具有较强的专业能力和良好外语运用能力,能胜任数据分析与挖掘算法研究和大数据系统开发的研究型和技术型人才。

    “数据科学与大数据技术”课程体系

    2016年9月,教育部公布新增“大数据技术与应用”专科专业

    “大数据技术与应用”专业(专业代码610215)强调培养具有大数据实践能力的大数据人才。该专业重点培养具有以下两方面素质的人才:一是工具的掌握,掌握数据采集和数据分析的基本工具;二是数据分析能力,掌握实用数据分析和初步数据建模能力。

    该专业包括基础课程、核心课程及选修课程三大模块。其中专业基础部分侧重为语言和专业基础方面的课程,包括《大数据的Python基础》、《Linux系统基础》、《大数据的统计基础》等。专业核心部分涵盖了数据采集、存储与处理方面的内容,包括《数据存储(MySQL)》及《数据清洗》等课程。专业选修部分以大数据分析、开发及应用为重点,开设包括《数据分析导论》、《大数据行业应用导论》、《数据可视化》、《Hadoop大数据平台基础》等课程。

    “大数据技术与应用”专业,培养掌握数据科学的基础知识及大数据相关技术,掌握大数据清洗和分析常用工具的使用,具有卓越的实践能力,能胜任数据清洗、数据存储、数据分析与挖掘、大数据系统开发与构建等工作的专业应用型人才。

    “大数据技术与应用”专业课程体系

    目前全国各类高校、高职院校已陆续开始围绕大数据专业建设展开研究并申报大数据专业。

    作为交叉型学科,大数据的相关课程涉及数学、统计和计算机等学科知识,需要系统的大数据专业教材讲义支撑教学。

    博雅大数据学院编写了《大数据分析的Python基础》《数据清洗》《数据科学导论》《数据采集与网络爬虫》《大数据应用导论》《金融征信》《大数据的数学基础》《数据可视化》《深度学习:算法与应用》《健康医疗大数据:理论与应用》《交通大数据:理论与应用》等课程。

    由欧高炎、朱占星、董彬和鄂维南合著的《数据科学导论》即将由高等教育出版社出版。

    由陈永东撰写的《赢在新媒体时代:内容、产品、市场与管理的革命》已由人民邮电出版社出版,由陈永东与赵旭隆合编的《智能营销:数字生态下的营销革命已出版。

    由阳翼撰写的《大数据营销》一书也于近期出版。

  • ?

    数据科学与大数据技术专业各大高校都在开,真的很好吗?

    亚瑟

    展开

    教育部近日公布的2017年度普通高等学校本科专业备案和审批结果显示,250所高校新增了“数据科学与大数据技术”专业,可以说是全面铺开了,这个专业真的很好吗?

    一定要根据自身情况保持耐心去了解去分析,一心想要直接答案的最容易被忽悠

    数据科学与大数据技术专业剖析

    同样,这个专业也是属于顺应时代发展,抢占市场先机的“投机”行为,作为新兴的、交叉的专业,不可能有成熟的概念、培养方案,各高校都是在黑暗中摸索前行,培养方案也是五花八门,但无论怎样变都是统计学、数学、计算机、软件工程等专业的“大杂烩”,核心是统计学+计算机。

    看一看相关介绍就知道了:数据科学与大数据技术专业毕业生通过掌握计算机理论和大数据处理技术,从大数据应用的三个主要层面(即数据管理、系统开发、海量数据分析与挖掘)系统地培养学生掌握大数据应用中的各种典型问题的解决办法,将领域知识与计算机技术和大数据技术融合、创新,从事大数据研究和开发应用。 也是很笼统很空虚,为什么?因为新啊,前无古人啊,没有经验可遵循啊。

    再看一下主要课程:数学、C程序设计、数据结构、数据库原理与应用、计算机操作系统、计算机网络、Java语言程序设计、Python语言程序设计,大数据算法、人工智能、应用统计(统计学)、大数据机器学习、数据建模、大数据平台核心技术、大数据分析与处理、大数据管理、大数据实践等课程。

    统计学知识和计算机知识是核心点,加一点数学、数据科学课程。

    真的很好吗?

    任何专业都有优缺点,好不好都是相对的,如果你喜欢,也做好了努力的准备,那就尽管去努力吧,但一定要不讨厌统计学和计算机,不要因为名字的高大上就忽视了自己的能力。专业名字再高大上,课程如何搭建,教师的水平和资源问题解决不了也是白扯。

    电子商务等就是个案例,从高大上到烂大街没几年时间,当然不是说这个专业也会像电子商务那样很快泛滥成灾,只是告诉大家不要有急功近利的蹭热点的心理。

    想做相关工作,学什么专业不是最重要的,怎么学才是,学计算机、统计学、数学都可以从事大数据工作,用人单位不会因为你专业名字高大上高看你一眼,还得看真本事(学校学历也很重要)。

    照这样下去,不排除将来会出现云计算、区块链等令人哭笑不得的专业

    哪些学校好?

    这个没有喜欢资料,也没有参考,凡是计算机、统计学不错的学校都可以考虑。

    开设该专业的的大学名单

    第一批(3所):北京大学、对外经济贸易大学、中南大学;

    第二批(32所):中国人民大学、复旦大学、北京邮电大学、华东师范大学、电子科技大学、北京信息科技大学、中北大学、长春理工大学、上海工程技术大学、上海纽约大学、浙江财经大学、广西科技大学、昆明理工大学、云南师范大学、云南财经大学、重庆理工大学、晋中学院、福建工程学院、黄河科技学院、湖北经济学院、佛山科学技术学院、广东白云学院、北京师范大学-香港浸会大学联合国际学院、成都东软学院、电子科技大学成都学院、贵州大学、贵州师范大学、安顺学院、贵州商学院、贵州理工学院、宁夏理工学、宿州学院。

  • ?

    名师说专业|信息与计算科学:大数据时代大有作为

    侯海云

    展开

    万物皆数据, 信息藏其中挖掘需技术,“信计”显神功

    专业基本情况介绍

    依托强势学科,数学类专业设有数学与应用数学和信息与计算科学两个专业方向。根据2016《中国大学及学科专业评价报告》,信息与计算科学专业为A+类专业,全国排名第20名,在武书连版2017年《中国大学评价》全国448个信息与计算科学参评专业中位列第20名,等级为A+级,排位比达4.46%,在省属高校同类学科稳居第一。

    我院数学学科进入全球ESI排名前1%(国内共有27个高校数学学科),在美国著名的USNews学科排名中位居全球数学学科排行榜第166位(在上榜的国内高校中位列第25位);“图与网络优化创新引智基地”获批全国首批地方高校“111计划”引智基地。

    图与网络优化创新引智基地揭牌。

    田刚院士做客“尖峰论坛”第93讲。

    培养目标

    培养具有扎实的数学基础、基本理论和基本技能,掌握统计、信息与计算科学的基本理论和方法,具有良好科学素养和创新实践能力,在数据统计分析、信息分析处理和计算机软件编程方面受到比较系统扎实的科学实践训练的复合型人才。

    培养特色及办学成果

    学生创新能力强、人才培养质量高

    人才培养质量高——先后培养了400余名优秀本科毕业生,为我省基础教育和国内外的高校、科研机构、企事业单位输送大批拔尖创新型人才,许多同学进入著名IT企业、银行、高校科研机构任职,得到了广大用人单位的好评。

    核心课程

    平台课程:数学分析、高等代数、解析几何。

    核心课程:C++程序设计、复变函数与积分变换 、概率论、 数据结构、 最优化理论与算法、 数理统计、 矩阵论与数值代数、 多元统计分析方法、 大数据系统基础。

    部分自编教材和专著。

    办学条件

    师资队伍强

    教授介绍

    朱绪鼎,教授,国家“千人计划”入选者。

    郑方阳,教授,国家“千人计划”入选者。

    魏达思 (Douglas B. West),教授,国家“外专千人计划”入选者,国际著名图论与离散数学

    陈杰诚,杰出教授,浙江省“钱江学者”特聘教授,入选国家首批百千万人才工程,兼任国务院学科评议组成员和教育部数学教指委成员

    周盛凡,教授,浙江省“钱江学者”特聘教授。

    王维凡,教授,浙江省科技进步奖获得者。

    张雪娟,教授,全国百篇优秀博士论文获得者。

    优秀班主任

    杨敏波,副教授,数学系副主任,浙江省高校中青年学科带头人。

    陈敏,副教授,数学系副主任,连续4次获评“优秀班主任”,连续2次获评 “我心目中的好老师”;带领班级荣获“学风特优班金奖”(全校唯一)。

    吕新忠,教授,大学生数学建模竞赛金牌教练,指导学生获国际金奖10余项、银奖8项,国家一等奖15项;带领班级荣获“学风特优班银奖”。

    教科研水平高

    出版教学、科研专著多部;发行《中学教研(数学)》,是浙江中学数学教师的主要投稿期刊。

    就业前景

    毕业生能在信息与互联网行业、金融行业、行政事业单位等从事大数据处理、分析及预测等工作,也可在企事业单位从事与应用数学、统计学、信息科学、计算科学和管理科学等相关领域的建模、软件开发和数据分析等工作,还可报考高等院校或科学研究机构相关专业的硕士研究生,或在各级各类学校从事数学、统计学和计算机软件相关的教学工作。

    优秀毕业生

    唐积强,2002级,现为高级工程师,互联网金融安全工信部重点实验室研发部负责人,曾承担5项国家242信息安全专项、参与1项国家科技支撑计划项目、并以第一作者身份发表SCI\EI期刊论文6篇、授权国家专利2项。

    樊迪,2006级,2014年北京大学读研,现就职于江苏银行北京分行。

    沈梁,2012级,华东师范大学读研

  • ?

    大数据十大经典算法

    克莱门特

    展开

    最早提出“大数据”时代到来的是全球知名咨询公司麦肯锡,麦肯锡称:“数据,已经渗透到当今每一个行业和业务职能领域,成为重要的生产因素。人们对于海量数据的挖掘和运用,预示着新一波生产率增长和消费者盈余浪潮的到来。”

    “大数据”在物理学、生物学、环境生态学等领域以及军事、金融、通讯等行业存在已有时日,却因为近年来互联网和信息行业的发展而引起人们关注。大数据作为这个信息时代的产物,我们可能无法掌握这些数据的算法,但是可以了解一下大数据都有哪些算法!

    今天,来为大家详细介绍大数据十大经典算法!

    一、C4.5算法

    C4.5,是机器学习算法中的一个分类决策树算法,它是决策树(决策树也就是做决策的节点间的组织方式像一棵树,其实是一个倒树)核心算法ID3的改进算法,所以基本上了解了一半决策树构造方法就能构造它。决策树构造方法其实就是每次选择一个好的特征以及分裂点作为当前节点的分类条件。

    C4.5相比于ID3改进的地方有:

    1、用信息增益率来选择属性。ID3选择属性用的是子树的信息增益,这里可以用很多方法来定义信息,ID3使用的是熵(entropy,熵是一种不纯度度量准则),也就是熵的变化值.而C4.5用的是信息增益率。对,区别就在于一个是信息增益,一个是信息增益率。

    一般来说率就是用来取平衡用的,就像方差起的作用差不多,比如有两个跑步的人,一个起点是10m/s的人、其10s后为20m/s;另一个人起速是1m/s、其1s后为2m/s。如果紧紧算差值那么两个差距就很大了,如果使用速度增加率(加速度,即都是为1m/s^2)来衡量,2个人就是一样的加速度。因此,C4.5克服了ID3用信息增益选择属性时偏向选择取值多的属性的不足。

    2、在树构造过程中进行剪枝,在构造决策树的时候,那些挂着几个元素的节点,不考虑最好,不然容易导致overfitting。

    3、对非离散数据也能处理。

    4、能够对不完整数据进行处理。

    二、The k-means algorithm 即K-Means算法

    k-means algorithm算法是一个聚类算法,把n的对象根据他们的属性分为k个分割(k

    三、 Support vector machines

    支持向量机,英文为Support Vector Machine,简称SV机(论文中一般简称SVM)。

    它是一种监督式学习的方法,它广泛的应用于统计分类以及回归分析中。支持向量机将向量映射到一个更高维的空间里,在这个空间里建立有一个最大间隔超平面。

    在分开数据的超平面的两边建有两个互相平行的超平面,分隔超平面使两个平行超平面的距离最大化。假定平行超平面间的距离或差距越大,分类器的总误差越小。一个极好的指南是C.J.C Burges的《模式识别支持向量机指南》。van der Walt 和 Barnard 将支持向量机和其他分类器进行了比较。

    四、The Apriori algorithm

    Apriori算法是一种最有影响的挖掘布尔关联规则频繁项集的算法。其核心是基于两阶段频集思想的递推算法。该关联规则在分类上属于单维、单层、布尔关联规则。在这里,所有支持度大于最小支持度的项集称为频繁项集,简称频集。

    五、最大期望(EM)算法

    在统计计算中,最大期望 (EM,Expectation–Maximization)算法是在概率(probabilistic)模型中寻找参数最大似然估计的算法,其中概率模型依赖于无法观测的隐藏变量(Latent Variabl)。最大期望经常用在机器学习和计算机视觉的数据集聚(Data Clustering)领域。

    六、 PageRank

    PageRank是Google算法的重要内容。2001年9月被授予美国专利,专利人是Google创始人之一拉里佩奇(Larry Page)。因此,PageRank里的page不是指网页,而是指佩奇,即这个等级方法是以佩奇来命名的。PageRank根据网站的外部链接和内部链接的数量和质量,衡量网站的价值。

    PageRank背后的概念是,每个到页面的链接都是对该页面的一次投票,被链接的越多,就意味着被其他网站投票越多。这个就是所谓的“链接流行度”——衡量多少人愿意将他们的网站和你的网站挂钩。PageRank这个概念引自学术中一篇论文的被引述的频度——即被别人引述的次数越多,一般判断这篇论文的权威性就越高。

    七、AdaBoost

    Adaboost是一种迭代算法,其核心思想是针对同一个训练集训练不同的分类器(弱分类器),然后把这些弱分类器集合起来,构成一个更强的最终分类器 (强分类器)。其算法本身是通过改变数据分布来实现的,它根据每次训练集之中每个样本的分类是否正确,以及上次的总体分类的准确率,来确定每个样本的权值。将修改过权值的新数据集送给下层分类器进行训练,最后将每次训练得到的分类器融合起来,作为最后的决策分类器。

    八、KNN: k-nearest neighbor classification

    K最近邻(k-Nearest Neighbor,KNN)分类算法,是一个理论上比较成熟的方法,也是最简单的机器学习算法之一。该方法的思路是:如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别,则该样本也属于这个类别。

    九、 Naive Bayes

    在众多的分类模型中,应用最为广泛的两种分类模型是决策树模型(Decision Tree Model)和朴素贝叶斯模型(Naive Bayesian Model,NBC)。 朴素贝叶斯模型发源于古典数学理论,有着坚实的数学基础,以及稳定的分类效率。同时,NBC模型所需估计的参数很少,对缺失数据不太敏感,算法也比较简单。

    理论上,NBC模型与其他分类方法相比具有最小的误差率。但是实际上并非总是如此,这是因为NBC模型假设属性之间相互独立,这个假设在实际应用中往往是不成立的,这给NBC模型的正确分类带来了一定影响。在属性个数比较多或者属性之间相关性较大时,NBC模型的分类效率比不上决策树模型。而在属性相关性较小时,NBC模型的性能最为良好。

    十、 CART: 分类与回归树

    CART, Classification and Regression Trees。在分类树下面有两个关键的思想:第一个是关于递归地划分自变量空间的想法;第二个想法是用验证数据进行剪枝。

    看完之后,哪位小伙伴会其中的1-2个算法的,说出来让小编崇拜一下。

    注:算法来源于网络,本文不作为商业价值,仅供学习参考,如侵犯著作权,请联系作者删除。

大数据科学计算

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP