中企动力 > 商学院 > 大数据怎么
  • ?

    什么叫大数据?它怎么影响我们的生活?

    Havre

    展开

    大数据一词火了几年,但何为大数据呢?大数据指的是数据量的大多吗?如果仅仅是这个意思,那纵观我们社会,自古至今,无处不存在大量的数据,因此,显然可见,大数据并非指数据量大小,其核心在于存在大的价值,我们所说的大数据时代,应该是不同领域 数据交叉贡献,达到一个量变与质变的效应,通过分析预测算法来让获取到的数据产生更大的价值。

    我们通常所说的数据平台又来源于哪些呢?在企业中,本身内部就存在着很多数据,比如财务数据、HR数据以及供应链数据;而在企业外部存在着更大的数据仓库,而如何去获取到这些外部数据呢?这些数据我们又可以从哪些地方获取到?毋庸置疑,在中国传统产业公司,如电信运营商、金融行业、BAT等大型互联网公司等本身数据量就很大。而基于这个时代的发展,如今已出现数据联盟型企业专门来集合多方数据,以减少企业成本和增强其数据的稳定性。中国企业,诸如服装、旅游、健康、金融、媒体、房产以及线下零售。在这一过程中,要做些什么呢?首先应该是搭建自身数据平台,加强数据整合和管理,建立顾客标签和商品标签,让其产生更大的价值。

    基于大数据本身的特性,诸如消费量大、提供产品和服务的企业、“客群”庞大的企业以及我们目前迫切转型的传统行业,都能在大数据时代大显身手。

  • ?

    大数据前景怎么样?成都大数据薪资水平怎么样?

    Wharf

    展开

    最近,有不少人向达妹咨询达内的大数据课程。因为现在大数据可以说是非常火了,而在成都开设大数据的机构却十分少!

    除此之外,达内大数据学员的高薪也让不少人羡慕,因此,今天达内就和大家一起来看看达内的大数据课程,分析一下达内才高大数据的学员为什么能拿如此高的薪资!

    大数据本身“钱”景无限

    1、行业需求大

    达妹今天在某招聘网站搜索大数据相关岗位,搜索结果一共有66275个,而且薪资基本上都是在10000以上。

    前段时间,全球最顶尖管理咨询公司麦肯锡(McKinsey)出具的一份详细分析报告显示,预计到2018年,大数据或者数据工作者的岗位需求将激增,其中大数据科学家的缺口在14万到19万之间,对于懂得如何利用大数据做决策的分析师和经理的岗位缺口则将达150万!

    2、就业薪资高

    成都大数据开发平均工资: 30230元/月

    数据分析师

    成都数据分析平均工资: 11130元/月,取自 15526 份样本,较 2016 年,增长 9.4%。

    Hadoop开发工程师

    成都hadoop平均工资: 20130元/月,取自 1734 份样本。

    数据挖掘工程师

    成都数据挖掘平均工资: 21740元/月,取自 3449 份样本,较 2016 年,增长 20.3%。

    达内课程设置

    达内才高大数据课程大概可以分为两个阶段,第一阶段学习JavaEE,第二阶段学习大数据,而零基础的学员还需要多一个阶段,在学习JavaEE之前,还需进大数据预科班免费学习Java语言的基础知识。

    达内才高大数据课程不仅要让学生掌握如何使用框架开发系统,而且要深入框架内部源代码,这样的做法为学生后续在企业通往架构师的道路上做了很好的铺垫,学生可以更加自信的进入企业工作。

    在这个互联网的时代,每一个软件公司都在往互联网化的方向发展,所以掌握了互联网架构的内容等于紧跟时代,做公司最出色的程序员。

    达内才高大数据课程体系在互联网架构方面设计比较全面,学完这些课程以后,学员就能对互联网架构有一定实操和熟练!

    大数据方面,达内课程包括分布式高并发计算,Hadoop离线分析,数据可视化,Storm实时分析等。为了更好的进行数据的收集,储存,才高大数据课程还将学习Python爬虫,数据仓库,数据挖掘,算法,R语言等方面的知识。

    达内项目设置

    达内才高大数据的项目是贯穿整个学习过程的,在学习JavaEE阶段,学员将学习建设电商网站,而在大数据阶段进行行为日志的收集,及数据的分析!

    达内大数据学员专享项目峰会

    达内大数据学员专享项目峰会是一个针对学员进行的项目实战,旨在提高学员的自主研发能力,通过老师布置的实战项目,学员选择项目并进行实战,学员通过各种方式方法独立完成项目的实战课题研究,从而加强对大数据相关技术理解的深度,同时增强自主学习、研发、实践能力!

    大数据峰会四大优势

    达内才高大数据师资

    达内贯彻专家组合授课,秉承“名师出高徒、高徒拿高薪”的教学理念,是达内公司确保教学质量的重要环节。作为美国上市的职业教育公司,公司通过现金+期权的模式高薪吸引业内优秀人才担任达内的培训讲师。

  • ?

    什么是大数据?如何成为大数据的技术大牛?

    Said

    展开

    其实大数据并不是一种概念,而是一种方法论。简单来说,就是通过分析和挖掘全量的非抽样的数据辅助决策。大数据可以实现的应用可以概括为两个方向,一个是精准化定制,第二个是预测。比如像通过搜索引擎搜索同样的内容,每个人的结果却是大不相同的。再比如精准营销、百度的推广、淘宝的喜欢推荐,或者你到了一个地方,自动给你推荐周边的消费设施等等。

    目前市场对大数据相关人才的需求与日俱增,岗位的增多,也导致了大数据相关人才出现了供不应求的状况,从而引发了一波大数据学习的浪潮。大家可以先了解一下关于大数据相关的岗位分类,以及各个岗位需要掌握那些相对应的技能,并想清楚自己未来的发展方向,再开始着手针对岗位所需的技术进行学习与研究。所谓知己知彼,才能更好的达成目标嘛。

    大数据处理技术怎么学习呢?在做大数据开发之前,因为Hadoop是高层次的语言开发,需要懂得Java或者Python,很快的就能上手。所有的大数据生态架构都是基于linux系统的基础上的,所以你要有Linux系统的基本知识。如果你不懂Java或者Python还有Linux系统,那么这都是你必学的知识(Java或者Python可二选其一)。

    第一阶段

    Linux系统:因为大数据相关软件都是在Linux系统上运行的,所以Linux要学习的扎实一些,学好Linux对你快速掌握大数据相关技术会有很大的帮助,能让你更好的理解hadoop、hive、hbase、spark等大数据软件的运行环境和网络环境配置,能少踩很多坑,学会shell就能看懂脚本这样能更容易理解和配置大数据集群。还能让你对以后新出的大数据技术学习起来更快。

    鸟哥的Linux私房菜 是一本公认的Linux的入门书籍。

    第二阶段

    Python:Python 的排名从去年开始就借着人工智能持续上升,现在它已经成为了语言排行第一名。

    从学习难易度来看,作为一个为“优雅”而生的语言,Python语法简捷而清晰,对底层做了很好的封装,是一种很容易上手的高级语言。在一些习惯于底层程序开发的“硬核”程序员眼里,Python简直就是一种“伪代码”。

    在大数据和数据科学领域,Python几乎是万能的,任何集群架构软件都支持Python,Python也有很丰富的数据科学库,所以Python不得不学。

    第三阶段

    Hadoop:几乎已经成为大数据的代名词,所以这个是必学的。 Hadoop里面包括几个重要组件HDFS、MapReduce和YARN。

    Hadoop的核心就是HDFS和MapReduce,而两者只是理论基础,不是具体可使用的高级应用,通俗说MapReduce是一套从海量源数据提取分析元素最后返回结果集的编程模型,将文件分布式存储到硬盘是第一步,而从海量数据中提取分析我们需要的内容就是MapReduce做的事了。当然怎么分块分析,怎么做Reduce操作非常复杂,Hadoop已经提供了数据分析的实现,我们只需要编写简单的需求命令即可达成我们想要的数据。

    记住学到这里可以作为你学大数据的一个节点。

    Zookeeper:是一个分布式的,开放源码的分布式应用程序协调服务,也是个万金油,安装Hadoop的HA的时候就会用到它,以后的Hbase也会用到它。它一般用来存放一些相互协作的信息,这些信息比较小一般不会超过1M,都是使用它的软件对它有依赖,对于我们来讲只需要把它安装正确,让它正常的跑起来就可以了。

    Mysql:大数据的处理学完了,那么接下来要学习小数据的处理工具Mysql数据库,因为装hive的时候要用到,Mysql需要掌握到什么层度呢?你能在Linux上把它安装好,运行起来,会配置简单的权限,修改root的密码,创建数据库就可以了。这里主要的是学习SQL的语法,因为hive的语法和这个非常相似。

    Sqoop:这个是用于把Mysql里的数据导入到Hadoop里的。当然你也可以直接把Mysql数据表导出成文件再放到HDFS上也是可以的,但是生产环境中使用要注意Mysql的压力。

    Hive:这个东西对于会SQL语法的同学们来说就是神器,它能让你处理大数据变的很简单、明了,不会再费劲的编写MapReduce程序。有的人说Pig那?它和Pig相似掌握一个就可以了。

    Oozie:既然学会Hive了,我相信你一定需要这个,它可以帮你管理你的Hive或者MapReduce、Spark脚本,还能检查你的程序是否执行正确,如果出错给你发出报警并能帮你重试程序,最重要的是还能帮你配置任务的依赖关系。我相信你一定会喜欢它的,不然你看着那一大堆脚本,和密密麻麻的crond是不是有种“即将崩溃”的感觉。

    Hbase:这是Hadoop生态体系中的NOSQL数据库,他的数据是按照key和value的形式存储的并且key是唯一的,所以它能用来做数据的排重,它与MYSQL相比能存储的数据量大很多。所以他常被用于大数据处理完成之后的存储目的地。

    Kafka:这是个比较好用的队列工具,队列是干什么的?排队买票你知道不?数据多了同样也需要排队处理,我们可以利用这个工具来做线上实时数据的入库或入HDFS,这时你可以与一个叫Flume的工具配合使用,它是专门用来提供对数据进行简单处理,并写到各种数据接受方的。

    Spark:它是用来弥补基于MapReduce处理数据速度上的缺点,它的特点是把数据装载到内存中计算而不是去读硬盘。特别适合做迭代运算,所以算法流们特别喜欢它。它是用scala编写的。Java语言或者Scala都可以操作它,因为它们都是用JVM的。

    这些东西你都会了就成为一个专业的大数据开发工程师了,月薪3W都是毛毛雨啦。

    后续提高

    大数据结合人工智能达到真正的数据科学家,打通了数据科学的任督二脉,在公司是技术专家级别,这时候月薪再次翻倍且成为公司核心骨干。

    机器学习:是一门多领域交叉学科,涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科。它是人工智能的核心,是使计算机具有智能的根本途径,其应用遍及人工智能的各个领域,它主要使用归纳、综合而不是演绎。机器学习的算法基本比较固定了,学习起来相对容易。

    深度学习:深度学习的概念源于人工神经网络的研究,最近几年发展迅猛。深度学习应用的实例有AlphaGo、人脸识别、图像检测等。是国内外稀缺人才,但是深度学习相对比较难,算法更新也比较快,需要跟随有经验的老师学习。

    最快的学习方法,就是师从行业专家,学习老师多年积累的经验,自己少走弯路达到事半功倍的效果。自古以来,名师出高徒。

    分享 IT 技术和行业经验,请关注-技术学派。

  • ?

    大数据初学者怎样学习 或Java工程师怎么转大数据?

    裴冰萍

    展开

    最近好多人都在问我,大数据怎么学,java怎么转大数据,今天就给大家分享一下。

    大数据初学者怎样学习 或Java工程师怎么转大数据

    大数据现在很火很热,但是怎么学习呢?下面我给大家分享一下:

    首先给大家普及一下大数据相关知识大数据的4大特征:

    1.数据在体量方面很大,比如说文字,有各种各样的来源,有电子书|实体书|杂志|报刊等,它们的数据大吧。

    2.数据的类型多种多样,有些是结构化的数据,像存在Oracle,MySQL这些传统的数据库里的数据,一般都是结构化,可以是还有非结构化,比如HTML,WORD,execl等格式。

    3.它们的价值密度低,这样说吧,你比如说观看一条数据好像价值也不大,但是分析所有的数据之后呢?总会挖掘出一些 重要的东西。

    4.处理这些数据的速度要快。比如像Hadoop技术的MapReduce计算框架,相比传统的数据库处理速度要快,它的吞吐量 特别的大,再比如Spark,Spark在内存方面计算比Hadoop快100倍,在磁盘方面计算快10倍。

    大数据的方向的工作有 大数据运维工程师、大数据开发工程师、数据分析、数据挖掘、架构师等。

    大数据的技术有

    Hadoop HDFS文件系统 MR计算模型Hive数据仓库HBase数据库Flume日志收集Kafka消息系统Storm流式计算Spark生态圈:Spark Core、Spark SQL、Spark Streaming、MLLib和GraphXZookeeper协调系统NOSQL数据库:Redis、MongoDB机器学习:Mahout看到这么多技术是不是有点晕呢?该怎么学习呢?

    先学Hadoop Hadoop框架中由两大模块组成,一个HDFS(Hadoop Distributed File System),是用来存储需要处理的数据,另外一个是MapReduce,是Hadoop的处理数据的计算模型。学习一门数据库,像MySQL学点SQL吧Hive 只要你会SQL,你就会使用它。hive是基于Hadoop的一个数据仓库工具,可以将结构化的数据文件映射为一张数据库表,并提供简单的sql查询功能,可以将sql语句转换为MapReduce任务进行运行。HBase HBase即Hadoop DataBase,Hadoop的数据库,HBase是一种 "NoSQL" 数据库,即不是RDBMS ,不支持SQL作为主要访问手段。Sqoop Sqoop是迁移数据工具,可以在很多数据库之间来迁移,Flume Flume是一个分布式的海量日志采集和传输框架,一个高可用的,高可靠的,分布式的海量日志采集、聚合和传输的系统,Flume支持在日志系统中定制各类数据发送方,用于收集数据;同时,Flume提供对数据进行简单处理,并写到各种数据接受方(可定制)的能力。Kafka 使用Kafka完成数据的一次收集,多次消费。它是一个分布式、支持分区的(partition)、多副本的(replica),基于zookeeper协调的分布式消息系统。Spark基于内存计算的框架 Spark Core最为重要再学SparkSQL、Spark Streaming、图计算、机器学习Storm实时的流计算框架。后期可以学习机器学习Mahout

    基本就是这样的学习顺序。加油学习吧。

    喜欢就分享给大家吧。。。。

  • ?

    都在说大数据好,带你看看大数据到底怎么样?

    Sue

    展开

    近几年,大数据这个词突然变得很火,不仅纳入阿里巴巴、谷歌等互联网公司的战略规划中,同时也在我国国务院和其他国家的政府报告中多次提及,大数据无疑成为当今互联网世界中的新宠儿。

    而近期朋友圈疯转的“马云无人超市迎客,再不努力你将无工可打”,“看李彦宏如何谈AI”等新闻热点,无不展示着人工智能的快速发展,但在直木看来,人工智能之所以能取得突飞猛进的进展的背后,不能不说这些年来大数据长足发展的结果。

    人工智能和大数据有什么关系呢?

    如果我们把人工智能看成一个嗷嗷待哺拥有无限潜力的婴儿,某一领域专业的海量的深度的数据就是喂养这个天才的奶粉。奶粉的数量决定了婴儿是否能长大,而奶粉的质量则决定了婴儿后续的智力发育水平。

    据数联寻英发布《大数据人才报告》显示,目前全国的大数据人才仅46万,未来3-5年内大数据人才的缺口将高达150万,越来越多人加入到大数据培训,都希望在大数据培训机构中学习最前沿的知识,找一份不错的工作。

    本文从4个方向让大家充分了解大数据,望对同学们的大数据从业有帮助:

    大数据就业前景

    大数据就业方向

    大数据就业薪资

    大数据职业发展

    一、大数据就业前景

    据职业社交平台LinkedIn发布的《2016年中国互联网最热职位人才报告》显示,研发工程师、产品经理、人力资源、市场营销、运营和数据分析是当下中国互联网行业需求最旺盛的六类人才职位。其中研发工程师需求量最大,而数据分析人才最为稀缺。领英报告表明,数据分析人才的供给指数最低,仅为0.05,属于高度稀缺。数据分析人才跳槽速度也最快,平均跳槽速度为19.8个月。根据中国商业联合会数据分析专业委员会统计,未来中国基础性数据分析人才缺口将达到1400万,而在BAT企业招聘的职位里,60%以上都在招大数据人才。

    二、大数据就业方向

    大数据领域三个大的技术方向,这些不同的技术方向,对应企业的哪些招聘岗位?

    1. Hadoop大数据开发方向

    市场需求旺盛,大数据培训的主体,目前IT培训机构的重点

    对应岗位:大数据开发工程师、爬虫工程师、数据分析师 等

    2. 数据挖掘、数据分析&机器学习方向

    学习起点高、难度大,市面上只有很少的培训机构在做。

    对应岗位:数据科学家、数据挖掘工程师、机器学习工程师等

    3. 大数据运维&云计算方向

    市场需求中等,更偏向于Linux、云计算学科

    对应岗位:大数据运维工程师

    精通任何方向之一者,均会 “ 前(钱)”途无量。

    三个方向中,大数据开发是基础。以Hadoop开发工程师为例,Hadoop入门月薪已经达到了 8K 以上,工作1年月薪可达到 1.2W 以上,具有2-3年工作经验的hadoop人才年薪可以达到 30万—50万,一般需要大数据处理的公司基本上都是大公司,所以学习大数据专业也是进大公司的捷径。

    三、大数据就业薪资

    1、基础人才-数据分析师

    北京数据分析平均工资: 10630/月,取自 15526 份样本,较 2016 年,增长 9.4%。

    2、大数据开发工程师

    北京大数据开发平均工资:30230/月。

    3、Hadoop开发工程师

    北京hadoop平均工资: 20130/月,取自 1734 份样本。

    4、数据挖掘工程师

    北京数据挖掘平均工资:21740/月,取自 3449 份样本,较 2016 年,增长 20.3%;

    5、算法工程师

    北京算法工程师平均工资: 22640/月,取自 10176 份样本。

    四、大数据职业发展

    最后一个问题,到底哪些公司需求大数据人才?

    事实上,大到世界500强,BAT这样的公司,小到创业公司,他们都需求数据人才。

    目前,大数据人才数量较少,因此大多数公司的数据部门一般都是扁平化的层级模式,大致分为数据分析师、资深研究员、部门总监3个级别。、

    大公司可能按照应用领域的维度来划分不同团队,而在小公司则需要身兼数职。有些特别强调大数据战略的互联网公司则会另设最高职位—如阿里巴巴的首席数据官。这个职位的大部分人会往研究方向发展,成为重要数据战略人才。另一方面,大数据工程师对商业和产品的理解,并不亚于业务部门员工,因此也可转向产品部或市场部,乃至上升为公司的高级管理层。

    马云说“我们已从IT时代进入了DT时代,未来我们的汽车、电灯泡、电视机、电冰箱等将全部装上操作系统,并进行数据集成,数据将会让机器更“聪明”。DT时代,数据将成为主要的能源,离开了数据,任何组织的创新都基本上是空壳。”

    我们从大哥大,小灵通,到诺基亚塞班,到今天的人手一部智能手机,每天各大企业会收到多少数据,如何从这些数据里面分析础客户的需求,这都是企业所要做的事,总之,数据,是未来的一切。

  • ?

    要玩大数据,没有数据怎么玩?

    崔虔纹

    展开

    现在这个时代,互联网技术大发展,可以说有互联网就有爬虫,如今爬虫遍布各个角落,因为各种互联网企业相继创立,需要爬虫抓取的公司也越来越多。事实上,我们平时使用的各种搜索引擎,求其根本,就是一个个巨大的爬虫程序。

    网络爬虫可以自动获取网页内容,是搜索引擎的一个重要组成部分,通俗一点说,爬虫的本质是采集程序,然后编写爬虫的人会设计采集规则和目的,爬虫是从一个初始地址开始,然后不断从新的地址中获取需要的信息,直到目的达到才会停止运行。其实可以毫不夸张的说,会编写爬虫程序会有很大的发展前景。

    但是编写爬虫程序十分复杂,先不说后期的优化维护,单是前期编写程序好肥的时间和精力就数不胜数,而且现实中很多网站就只有站长一个人在运营,这种情况下,自己编写程序就显得不大现实,还有很多网站信息会有防爬设置,这样就对程序的要求更高。

    太阳HTTP代理解决前期撰写程序的繁杂过程,而且,被抓取过的网页也会被贮存,进而进行一定的分析,以方便以后你的再次利用,无形之中提高你的工作效率,节省你的时间。

    想要玩转大数据时代,手里没有数据你怎么玩?

  • ?

    怎么学大数据?该从哪学起?

    花雨黯

    展开

    大数据应该学什么?如果是有基础就根据个人情况来定,如果是零基础想学习大数据,大数据应该学什么?大数据要学的东西有很多,下面列举了一些学习大数据就该学习的技术,许多想学习大数据不知道大数据应该学什么的,可以参考一下。

    首先学习大数据,先了解什么是大数据,了解大数据大概的运用,自己是否对大数据感兴趣,因为学门技术刚开始不是一件易事,需要有足够的决心和毅力,要知道半途而废,这样浪费时间精力、还浪费金钱。所以想学大数据,就需要对大数据有一个大概的认识。

    第一阶段

    对于零基础的朋友,一开始入门可能不会太简单。因为需要掌握一门计算机的编程语言,计算机编程语言有很多,Java是目前使用最为广泛的网络编程语言之一。大数据技术学习前需要一定的Java技术作为基础支持,Java只需理解一些基本的概念,就可以用它编写出适合于各种情况的应用程序。在学习Java的时候,我们一般需要学习这些课程: HTML&CSS&JS,java的基础,JDBC与数据库,JSP java web技术, jQuery与AJAX技术,SpringMVC、Mybatis、Hibernate等等。这些课程都能帮助我们更好了解Java,学会运用Java。

    第二阶段

    学完了编程语言之后,一般就可以进行大数据部分的课程学习了。一般来说,学习大数据部分的时间比学习Java的时间要短。大数据课程,包括大数据技术入门,海量数据高级分析语言,海量数据存储分布式存储,以及海量数据分析分布式计算等部分,Linux,Hadoop,Scala, HBase, Hive, Spark等等专业课程。如果要完整的学习大数据的话,这些课程都是必不可少的。

    这是智汇云校率先通过HCIE大数据的张润泽老师对大数据学习的一些建议:

    HCNA预备课程

    (1)数通预备课(vlan概念、vlan间路由等)

    (2)存储预备课(RAID技术、EC技术、动态子树等)

    HCNP预备课程

    (1)Java预备课

    (2)数据库预备课

    (3)脚本预备课

    (4)操作系统预备课

    (5)软件工程预备课

    HCIE预备课程

    (1)概率论、离散数学、统计学、线性代数、高等数学

    (2)机器学习导论

    (3)数据仓库知识

    (4)HCNA大数据课程

    率先通过HCIE大数据的张润泽老师

    学习大数据专业性较强,刚开始比较艰辛,自学的话会比较艰难,在学习的过程中,投入时间和精力,以兴趣来驱动学习,只要努力咬咬牙坚持学习到最后,相信所付出的就会有回报的,学习大数据毕业实习最低7000往上的薪水,之后再加上一些项目经验的积累,拿高薪工资就可想而知了。

    智汇云校大数据,聘请专业的大数据领域知名讲师,确保教学的整体质量与教学水准。讲师团及时掌握时代潮流技术,将前沿技能融入教学中,确保学生所学知识顺应时代所需。通过深入浅出、通俗易懂的教学方式,指导学生更快的掌握技能知识。

  • ?

    大数据专家告诉你:大数据前景到底怎么样?

    燕汲

    展开

    大数据作为一个新兴行业,这两年很是火热。我们进场在网上看到一些数据,比如下面这些:

    1.据数联寻英发布《大数据人才报告》显示,目前全国的大数据人才仅46万,未来3-5年内大数据人才的缺口将高达150万。2.根据中国商业联合会数据分析专业委员会统计,未来中国基础性数据分析人才缺口将达到1400万,而在BAT企业招聘的职位里,60%以上都在招大数据人才。

    以上是各类分析大数据行情的文章中经常见到的数据,那么光从这些数据来断定大数据的发展前景是不是靠谱?大数据的真实的前景到底是怎么样的?

    想必是很多想要从事大数据或者对大数据感兴趣的朋友们最关心的问题之一。

    本周四晚上,我们准备了一场关于大数据行业发展前景深入剖析的公开课,一位资深大数据行业的专家,将为大家进行一场关于大数据行业发展前景的深度剖析。将为大家一一讲解大数据目前的发展现状以及后期发展的大趋势。

    分享嘉宾介绍:

    杨老师

    前全球十大咨询公司ESG亚太区分析师,对云计算、大数据有深入研究,曾为IBM、DELL、HP、EMC等厂商提供产品测评报告,并为国内企业华为、联想、浪潮、曙光等企业的业务现状和发展方向提供战略咨询服务。是最早接触大数据的一批人,在国外多年的大数据相关工作经验,让他对于国内大数据发展的路线和前景有着比一般人更深的理解。

    时间:2017年11月9号,本周四晚上

    大数据的发展现状如何?后期的发展前景到底好不好?让我们本周四晚上,一起听专家深度的剖析大数据行业的发展。

    大家可以进群,提前了解本次公开讲座的更多信息。

  • ?

    大数据是怎么毁掉你的生活的?

    宓问蕊

    展开

    本文选自中信书院阅读时差栏目。阅读时差动态实时同步全球前沿新知,为你打破知识的国界。

    本期阅读时差为你分享的这本书是《大数据的真相》。

    透过书名不难看出,本书的目的就是让读者看清楚大数据的暗黑面,从而对大数据保持清醒、客观的认识。在今天,大数据已经不再是陌生的事物,从上网购物的广告精准投放,再到驾车出行的路线规划,都可以看到大数据的身影。在大数据的支持下,人们的生活越来越便捷,越来越智能。

    但是大数据的背后同样也隐藏着不为人知的阴暗面。因为大数据是依靠算法模型得来的,而算法模型是由人来设计的。所以,只要有人的参与,就势必会掺杂个人情感或认知偏见,导致得出的结论也难免会有失公允甚至还可能会带来歧视、扭曲事实、失去正义,造成不公平泛滥。

    所以,如果不能对大数据加以正确的引导,则可能会带来歧视、扭曲事实、失去正义,造成不公平泛滥。只有明确地将更好的价值观加入到大数据的算法中,我们才能创造出符合道德准则的大数据模型,从而更好地为人类服务。

    全文提纲

    围绕算法模型中存在的阴暗面,我们来分享一下大数据滥用的“四宗罪”:

    首先是偏见,看看大数据是怎样用技术包装偏见的;

    第二是逐利,看看掠夺式广告是怎样兜售虚假或高价承诺的;

    第三是剥削,分析大数据对底层人民的压榨式调度;

    最后一个是歧视,揭露大数据是如何给民众带来不公平待遇的。

    1

    偏见,大数据用技术包装偏见

    首先来看第一个重点内容:偏见,看看大数据是怎样用技术包装偏见的。

    我们知道,大数据的基础在于数据和模型,其中模型处于主导地位,能够从海量的数据中抽离出相对有用的部分,对外部环境进行抽象概括,从而得出结论指导现实。值得注意的是,模型的本性就是简单化,不可能囊括现实世界的复杂性或者人类交流的细微差别。在人的设置和干预下,有些信息不可避免地会被遗漏或突出,从而体现为偏见。这种偏见在大数据出现之前,是体现在过程之中,而大数据出现之后,偏见就提前埋伏在算法模型里了。因此,冰冷的计算机和数据化风险模型得出的结论,虽然看起来就是一副公正无私的样子,其实是把偏见隐藏在了更深的地方。

    来看一个带有种族偏见的数据模型。长期以来,种族是美国审判的一个主要因素。研究表明,在休斯顿市,对于同样罪行的犯人,检察官判非裔美国人死刑的几率比白人高三倍,判西班牙裔美国人死刑的几率比白人高四倍。为改变这种情况,美国有24个州的法院采用了一种再犯模型,帮助法官评估每一个罪犯构成的危险,减少法官的情绪和偏见所带来的影响。其中,一个叫做LSI–R的普及模型应用最为广泛。这个模型要求罪犯填写冗长的问卷调查。比如“你之前犯罪次数是多少?”“其他人对这次犯罪起了多大的作用?毒品和酒精对于你犯罪起了多大作用?”等等。

    这些问题看起来很正常,没毛病,但在实际操作中却存在问题。来自有特权背景的罪犯和来自治安差的平民街区的罪犯,答案肯定不一样。

    比如,同样问“你第一次遭遇警察”的原因,在舒适郊区长大的罪犯也许会告诉你这是第一次入狱,而来自平民街区的年轻的黑人男性很可能已经被警察多次拦截,即使他们什么错事也没做。

    研究报告显示,14-24岁的黑人男性和拉丁美洲男性仅占该市总人口的4.7%,但他们占被警察拦截盘查总人数的40.6%。而且,那些被盘查的人中90%多都是无辜的。然而根据模型统计,经常被拦截的嫌犯判分更高,更容易被模型分类为高风险等级,从而误导法官量刑。

    更严重的是,罪犯还会被问到出生和成长的环境,他们的朋友和亲戚是否有过犯罪记录等等。事实上,法官应该对所做的事情进行审判,而不是对嫌犯的身份进行审判。这些细节不应该和刑事案件或者量刑相关。

    然而,在LSI-R这样的数据模型下,原本身处底层社会的有色人种受到了更加严重的种族问题。“高风险”得分等级的人很可能是失业人员,而他的许多朋友和家人都触犯过法律。而且多年和一群罪犯关在一起,又增加了他再次犯罪的可能性。等他出狱时会回到同样的贫穷社区,有了犯罪记录,找工作就更难。如果他再犯罪,再犯模型又一次成功验证。事实上,正是这一模型导致了恶性循环,且一再地自行巩固。

    面对真实现状,作者禁不住提出疑问,我们是利用大数据彻底根除了人类偏见,还是只是用技术包装了人类偏见?答案其实就在眼前。

    2

    逐利,掠夺式广告通过大数据兜售虚假承诺

    说完偏见的问题,再来看看大数据的第二宗罪,逐利,来看看掠夺式广告,怎样通过大数据精确找出弱势群体,兜售虚假或高价承诺的。

    经常网上购物的朋友会发现,互联网会利用我们点击、阅读的习惯,确定偏好和模式,为我们在数百种模型中进行排名、分类以及评分。这为合法的广告奠定了强大的基础,但同时也助长了掠夺式广告的泛滥。

    掠夺式广告是什么呢?

    打个比方,如果人们缺钱,就提供大量高息发薪日贷款;如果他们的电脑运转缓慢,那它可能中了一个掠夺式广告携带的病毒,然后广告商提供修理服务。总的来说,在人们既有需求又很无知的任何地方,你都能看到掠夺式广告。

    掠夺式广告发现不平等,并大肆利用,最终的结果是巩固了现存的社会分层,加速对穷人的掠夺。

    作者认为,美国的营利性大学之所以如此繁荣,就是掠夺式广告的功劳。这些营利性大学就像江湖骗子一样,倾向于锁定最贫困地区的人,尤其是特别关注那些点击过贷款广告的人,然后利用他们的私密信息攻击他们。他们是怎样找到这些私密信息的呢?很多人在Google上搜索答案或者在填写问卷时,不知不觉中就暴露了自己的隐私。

    2010年,一条引人注目的广告刊登了奥巴马总统的照片,广告词为:“奥巴马呼吁妈妈们回到学校:完成你的学位,把助学金给有资格的人。”这则广告暗示,总统签署了一项旨在让母亲重返校园的新法案。但这是一个谎言。当消费者点击这个广告时,会被问到几个问题,包括年龄和电话号码,然后就会接到一所营利性学校的电话,主动提出帮她借钱申请入学。据报道,营利性大学20%-30%的广告预算都用于开发潜在客户。大学每收到一个最有希望的学生,就支付给提供者高达150美元的费用。

    美国底层40%的人口没有财富,普通家庭的负债平均为14800美元,其中大部分是利率过高的信用卡账户。而他们一直被灌输“赚钱的关键是接受教育”这样的理念。这些以盈利为目的的大学就通过大数据的模型,筛选出这些弱势群体,然后向他们承诺,只要接受教育就能够给他们一个美好未来。然而当学生入校之后,就会告知要通过各种贷款来解决学费问题,从而增加更多的债务。贫穷学生因此变得无望、绝望,怀疑教育的价值,加剧美国的贫富差距。

    不幸的是,除了营利性大学,还有很多利用掠夺式广告的公司。你只需要想一下人们的痛点在哪里,就会发现广告商在哪里使用掠夺性模型。数据支持的模型在不断地筛选我们的数据,搜寻我们的习惯、意愿、忧虑和渴望,推送的每一条广告都能够锁定最有效的信息,在对的时间出现在潜在客户眼前。

    精准信息触发顾客决定,从而成功地拖住又一个付费客户,使得掠夺者所花的每一分钱都能产生最大的效益。所以,站在掠夺式广告商的角度来看,穷人在搜索引擎上的查询和点过的优惠券,实际上是在呼叫特别关注。

    3

    剥削,大数据对底层人民的压榨式调度

    大数据模型不但干预生活,还能够给工作带来重大影响,有些负面影响甚至比周扒皮的半夜鸡叫有过之而无不及。这就是大数据的第三宗罪:剥削,来看看大数据对底层人民的压榨式调度。

    这主要体现在人力调度软件上。这种软件可以利用大数据分析顾客流量,精确计算出每一天、每小时他们需要多少人力,从而降低人力资源成本。比如,某天中午下雨,公园里的人可能会跑进咖啡店;每周五晚上大街上将出现更多的行人等等。软件能够根据这些情况变化合理配置人力,来匹配不断波动的需求。乍看之下,你会觉得这套机制很先进,但事实上却是一种赤裸裸的压榨。

    在低效率的经营模式下,职员有可预测的工作时间和固定的闲暇时间。有些人可以在工作时间读书,甚至做研究。现在,由电脑程序进行人力配置,职员每一分钟都很忙,几乎连个人时间也都被压榨一空。2014年,《纽约时报》报道过一个单亲妈妈简奈特·纳薇欧的遭遇,她的生活被大数据监控并影响。她一边努力读大学,一边在星巴克担任咖啡师,同时还得照顾她四岁的孩子。大数据指导下的工作调整,让纳薇欧的生活陷入混乱,无法安排固定的托儿服务,只好暂停学业。

    《纽约时报》这篇文章报道后几周内,遭到点名的大公司宣布将调整这种调度方式。但追踪报道显示,这些公司压根就没有信守承诺。归根结底,还是利润在作怪,像星巴克这种上市公司的商业模型,都是以提高盈利为目的的。

    人力调度软件对社会同样造成了极大的影响。像纳薇欧这样的群体,因为工作时间非常不稳定,不可能回学校念书,而这又损害了她的就业前途,只能当一名供大于求的低薪劳工。于是他们会格外焦虑,睡眠不足,继而产生剧烈的情绪波动。据统计,美国死在公路上的人估计有13%是因为睡眠不足。更糟糕的是,因为这种软件是来替企业省钱的,它们往往会将员工每周工作时间限制在30小时之内,这样公司就不必为他们提供医疗保险。在这种情况下,低薪劳工永无出头之日。

    4

    歧视,大数据给民众带来不公平待遇

    大数据不但成为资本家为虎作伥的帮凶,甚至还会加剧社会的不公。这就是大数据的第四宗罪:歧视,我们来看看大数据是如何给民众带来不公平待遇的。

    现在,大多数人都相信,数据越多越好。对于大数据来说确实如此。如果只关注很少的数据,那么只能呈现出相互独立、毫无关联的点;而将更多的数据纳入模型,就能够构建出事物的整体面貌。但同时,这些大量的数据来源于规模巨大的群体,忽略了相对较少的个体。而且,这种模型使用频率越高、数据量越大,越能够增加这种不公平的待遇。

    我们来看暴力犯罪的大数据模型案例。有一款软件叫做“预防政策”,原本这是一个地震预测软件,但应用到犯罪预测领域,不但能够定位犯罪最有可能发生的地方,还能预测连续犯罪。这主要是源于警察局把“轻微犯罪”的数据纳入“预防政策”这个软件中。这些数据包括天天发生的商店行窃、小额欺诈,甚至是违规停车。

    英国肯特郡警察局在2013年尝试使用“预防政策”软件,确实奏效了。根据“预防政策”的指引,在指定广场巡逻的效率是随机巡逻的十倍,精确度是警方情报分析的两倍。那么,模型最擅长预测的是什么类型的犯罪呢?答案是包括随意大小便的醉汉、小偷小摸的偷车贼等等的轻微犯罪。

    但最令人可悲的是,大数据勾勒出的犯罪地图证实,大部分罪行都是穷人干的。为什么会得出这样的结论呢?这里面固然有穷人的比例远高于富人的原因,同时也有数据模型和警察的原因。为了支撑大量的数据,警察就会把各种轻微犯罪录入模型,而模型又反馈出穷人犯罪的高概率。

    反过来看,那些富人实施的犯罪行为都哪去了?是他们奉公守法吗?当然不是。作者写道,在本世纪头十年,金融大亨通过撒谎、欺诈几乎摧毁了全球经济,使得数以百万计的人失去了家园、工作和医疗保障,犯下了滔天罪行。但是,联邦调查局和证券交易委员会的调查人员却拿他们没有任何办法。富人们在政治家身上投入了大量资金,而且他们经营的银行直接影响到国家经济,因此受到了保护。除了一些像庞氏骗局操作者伯纳德·马多夫这样的极端犯罪,金融家不会被逮捕。更何况这个群体在2008年的市场崩盘中几乎毫发无损,现在依然逍遥法外,享受特权。

    在这种情况下,尽管“预防政策”是一个非常有益、甚至高尚的软件工具,但它也成为了数学毁灭武器。“预防政策”软件授权警察局锁定穷人,拦截更多穷人,逮捕一部分穷人,把一些穷人罪犯关进监狱。现在,有了大数据的支持,警方更加捍卫了他们在这一行为的合法性,与此同时增加了办案的精确性和“科学性”。结果是,我们把贫困看作是犯罪,相信我们的工具既科学又公平。

    这突出了数学毁灭武器的另一个常见特征,即往往惩罚穷人。部分原因是数学模型是用来评估数量多的人群。相反...

  • ?

    如何进入大数据行业?

    雨寒

    展开

    身边很多朋友提过或者是想要走进大数据这个行业

    每个人的Background不一样,能力,擅长的领域都不一样

    卡里有一句发自肺腑的话要说给大家听

    不是热门的,薪水高的,所谓好找工作的专业就值得去学;

    真正值得学的是你理性地衡量了所有标准以后,最适合自己的,才是值得你学的

    作为大家的小超人

    卡里今天要给大家写一篇很长很长很长的文章

    你可以选择 现在就滑出去 不看

    然后卡里从此跟你老死不相往来

    或者你可以继续读下去

    然后卡里仙女可以用仙气笼罩你

    首先,卡里给你准备了一篇很优秀的文章里的几句话

    这篇文章叫做:在你想要读数据科学的学位前,你需要知道的五件事

    1

    你不一定非得读一个数据的学位;你可以自学,或者去一个boot camp。

    不讲笑:此刻你可能需要一个网站

    dataapplab

    2

    数据科学从来就不仅仅是数据,它牵扯了无数个不同的领域。

    3

    如果有一个专业或者项目提供的课程只是简单地把各种别的相关课程包装一下,别去。

    4

    理论之上还有不同的理论要去学习,好好掌握基本的理论

    5

    无论你读不读一个学位,你都要稳步提升自己的软实力。

    每个小仙女在成为大仙女之前都得知道自己的能力条可以发展到哪里,然后为之努力。

    卡里就早早知道自己是不能靠脸吃饭的仙女,于是决定做一只才华仙女。

    (有一丢不要脸)

    理性,合理,不违背真心地衡量自己是你做出人生重大决定的第一要义。

    让我们来举一个可爱的

    布吉岛大家还记不记得当年火遍全球的

    Pokemon GO!

    如果你是一只Pidgey,那你就特别特别努力地进化自己,然后变成一只Pidgeotto,然后再继续努力,变成一只厉害的Pidgeot。你可以做你擅长的领域的大牛,或者你可以做你擅长的领域的数据师,毕竟数据从来都不仅仅是数据。

    如果你是一只Eevee,那你可以努力看看,看看自己会变成哪种小精灵。是数据科学家,商业分析师,还是数据工程师?

    如果你是一只 Jigglypuff,Clefairy 或者 Pikachu,

    请乖乖做一只小可爱好么?

    当然你也可以是会数据分析的小可爱。

    如果你是一只Magikarp,请认识到自己的潜力,你,就是下一个吴恩达。

    好啦 让我们回到正文

    【本科篇】

    本科的专业相比于研究生,可能课程更具多样性。和别的专业的学生一样,都要修一些General Education,不同领域各种门类的普遍性教育课。然后专业课的部分更多的是对于基础性教育课一层一层的积累,所以相比于研究生再转进去读的同学来说,本科开始读可能基础会更扎实一些。然而,本科的数据专业并不多,而且都很新,加上正规的不正规的,大概齐是有六十个左右的学校开设了本科的数据科学专业。

    卡里从中选择了4个项目来跟大家分享。

    【Columbia University -- B.A in Data Science】

    一个综合排名贼高的藤校,本科设立了一个数据科学的专业,计算机院的专业。

    官网上稳准狠地说明了Data Science的本质,不过就是学好了计算机和统计。

    从官网的课程设置来看,还是对于学生的计算机和统计功底要求都很高。这对于一部分还没有决定是不是要走数据科学走到黑的人来说是好的,研究生可以重新回到计算机科学的回报或者去做个统计学大牛也不是不可以。

    核心课程

    Probability Theory

    概率论

    Statistical Inference

    统计推断

    Linear Regression Models

    线性回归模型

    Statistical Machine Learning

    统计机器学习

    Introduction to Computer Science

    计算机科学

    Data Structures

    数据架构

    Discrete Math

    离散数学

    Analysis of Algorithms

    算法分析

    看了这些,你是不是有一丢心动?

    卡里告诉你:请安抚好你的小心心别乱动,哥大不是你想考想考就能考。

    【University of Rochester - B.A / B.S in Data Science】

    这个大学是厉害的,同一个专业,你可以选择以BA毕业也可以选择以BS毕业,你要是想以BS毕业,你就得多读几节课。官网里说了,BA呢更自由一些,一般是你想要双专业毕业的话会更合适一些。如果你想深度了解数据,那就选择BS的课程。

    对于这个专业设置,卡里觉得是厉害的,

    给你,你想要的全部自由,非常适合射手座的一个学校(微笑)。

    核心课程

    Discrete Mathematics

    离散数学

    The Science of Programming

    编程

    The Science of Data Structures

    数据架构

    Linear Algebra with Differential Equations

    线性方程

    Ordinary Differential Equations

    常微分方程

    Computational Introduction to Statistics

    计算机统计

    Elements of Probability and Mathematical Statistics

    概率论与数理统计

    Applied Statistics for the Biological and Physical Sciences

    生物与物理统计

    Intermediate Statistical and Computational Methods

    中级统计与计算机方法

    如果大家有幸被录取到了这所美丽的学校,可以考虑跳进数据科学的大坑。

    【Ohio State University - B.S Data Analytics】

    曾经年幼无知的卡里以为OSU只有商学院厉害,后来卡里的老铁去OSU读了Data Analytics,卡里发现,咦,技术也是挺厉害的。介绍它的原因呢是因为它这个专业下有几个很有趣的分支,我觉得作为本科的专业,这一点是比较难得的。因为相比于别的传统专业,数据科学已经是非常细化的专业了,能够分出一定的师资在专业下开设分支以便学生学习不同领域的数据是难得的。

    核心课程也没有什么可惊喜的 所有学校都大同小异

    Calculus and linear algebra

    微积分和线性代数

    Data mining and statistical learning

    数据挖掘和统计

    Database design and cloud computing

    数据库设计和云计算

    Optimization (这个课是有一丢厉害的,一般研究生的program里才会出现)

    最优化

    Probability and statistical inference

    概率与统计推断

    Regression modeling and statistical decision making

    线性回归和统计决策

    Software design and programming

    软件编程

    Visualization (这个课也是有一丢重要和厉害的)

    可视化

    每个学生从下面四个里面选择一个方向专攻,看上去都是厉害的不得了的方向

    但基于卡里作为一个本科生 对 本科生群体的了解

    选的最多的应该还是Business Analytics 和 Computational Analytics

    Biomedical informatics

    生物信息学

    Business analytics

    商业分析

    Computational analytics

    计算机分析

    Social science analytics

    社会科学分析

    【University of California, Irvine - B.S Data Science】

    最重视的当然要放在最后,这是卡里的母校,DS也是卡里当年心心念念的专业。这个专业比较新开设的较晚,它出现的时候卡里已经没有机会转进去了。

    毕竟,得不到的就成了卡里心尖尖上的朱砂痣和明月光

    当然,也希望得到了的幸运的小朋友们不要觉得这个可爱的专业是蚊子血和饭米粒

    好的让我们来看看这个专业的

    核心课程

    Introduction to Programming

    编程

    Programming with Software Libraries

    进阶的编程

    Intermediate Programming

    最厉害的编程

    Introduction to Writing and Rhetoric

    写作和修辞学

    Critical Reading and Rhetoric

    批判性阅读和修辞

    Seminar in Data Science

    数据科学研讨会

    Calculus

    微积分

    Statistics

    各种统计课

    Machine Learning and Data-Mining

    机器学习 & 数据挖掘

    Design and Analysis of Algorithms

    算法的艺术

    Information Visualization

    信息可视化

    UCI 最引以为豪的writing program也是特色之一,在我司之前做的各高校数据项目分析里,Communication and Story Telling也是极其重要的一点,所以UCI在这件事情上是完胜的。其他的呢,公正地说其实和各个program的差距不大,都是以编程和统计为主,然后上一些高阶的计算机课。但Irvine真的是个太好的地方,如果你还在纠结要去哪里读数据科学,Welcome to Irvine!

    【研究生篇】

    研究生的数据科学Program可就是百花齐放了,要是选起来卡里能选一天一夜,所以卡里先简要地给大家介绍几个厉害出名的Program,然后再说几个比较常见的项目,让大家能够对研究生项目的有所了解。

    首当其冲地,让我列出一溜全美最6的数据类研究生项目,

    # 排名不分先后,这只是卡里看了一堆文章以后罗列出来的,没有学校塞钱给我好么?

大数据怎么

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP