中企动力 > 商学院 > 云计算大数据入门
  • ?

    大数据与云计算分析

    少女梦

    展开

    大数据:藏在啤酒和尿布背后的秘密; 云计算:物联网的隐形大脑

    我们提到物联网,就不得不把它与现在非常火热的另一个概念联系起来,那就是“大数据”。

    大数据是怎么一回事呢?有一个为人津津乐道经典案例,就是啤酒与尿布的例子。一家美国超市把尿布与啤酒这两种风马牛不相及的商品居然摆在一起,但这一奇怪的举措居然使尿布和啤酒的销量大幅增加了。原来,美国的妇女通常在家照顾孩子,所以她们经常会嘱咐丈夫在下班回家的路上为孩子买尿布,而丈夫在买尿布的同时又会顺手购买自己爱喝的啤酒。

    在这个案例里面,丈夫的行为被预测出来,其预测的依据是根据长期经验所得的。假定不在尿布旁边放啤酒,爱喝酒的丈夫可能也会去买,但嫌麻烦或者酒瘾不那么大的丈夫可能就只会买了尿布就走,而想不到去买啤酒。因而,大数据就此产生了经济价值。当然,这背后基本是一个零和游戏,这家超市的啤酒销售得多了,别家超市卖得就少了。

    腾讯的QQ我们都用过,它能够把我们久未联系的老同找出来,推荐给我们去联系,但也会把你的前女友推荐给你的未婚妻认识。而淘宝在我们买东西的时候会把相关产品推荐给我们,还会告诉我们诸如某省狮子座最败家、某省水瓶座最花心、某省天蝎座最抠门这样的信息。而百度则会对人们使用关键字搜索进行排名,从而让更多人知道最近大家的关注点在哪里。

    显然,这些数据或多或少已经开始影响我们的生活。而在未来,万物联网产生的数据量与现在人们通过互联网活动产生的数据量不可同日而语,开发的价值也会更加巨大。比如我们现在的手环、手表读取我们的心率、运动量等数据,仅仅是反馈给我们让我们管理自身健康。而未来随着大数据的分析能力增强,加上能够互动的设备增多,那么这些数据就变成了健康服务,甚至能提前预防疾病发生。

    反过来,大数据的处理能力能力会反过来帮助物联网实现智能控制和产品改进。比如,我们的智能家居的学习功能,可以看做是对用户一段时间的行为数据的收集,然后通过特定算法得出主人的喜好从而自己完成对家庭环境的控制。

    前面讲了大数据,那么还有另一个大数据的亲兄弟不得不讲,那就是云计算。从成本和实际效果来考虑,其实很多物联网设备并不需要太多的计算能力,只要能够取得数据并反馈给上层具有计算能力的数据处理中心就好了,多一点的还有能够通过从计算中心获取的指令完成某些活动就可以了。

    那么,这些数据谁谁在处理呢,他们又是怎么处理的呢,这里就要提到云计算的概念。云计算被认为是一种革命性的计算方法,是继大型计算机到客户端-服务器的大转变之后的又一关于计算方式的重大转变。

    举一个不那么恰当但比较好理解得例子。使用过QQ远程助手的朋友大概可以体验云计算,你在QQ提供的界面里面访问对方的电脑,使用对方的软件。云计算大概也可以看做这么种方式,不过对方的电脑变成了处理能力超强的云计算中心,而处理方式更加复杂一些。

    云计算给我们带来了全新的解决思路。由于通讯技术的不断发展,我们的计算不一定要在本地进行。比如,在远程操作的例子,哪怕你的电脑没有安装一个程序,你仍然能够获得这个程序的使用结果。而我们平时收发邮件,这些邮件存储在我们的邮箱里,而不是在我们的电脑上,这其实可以视作早期的云服务。这种理念,简单概括起来就是“网络即电脑”。只要有网络,我们就能获得更高的运算能力。

    目前云计算还处于基础阶段,现在的云计算被分为三层:基础设施即服务(IaaS),平台即服务(PaaS)和软件即服务(SaaS)。基础设施可以看做是我们的电脑主机,其实质是大规模的主机集群。平台的地位大致相当于我们的计算机系统,类似于windos,是开发和运行程序的基础。软件服务我们就明白多了,微信、游戏客户端、美图秀秀这样的都是软件。

    借助云计算,企业的管理成本将降低。由于云计算的作用,一些企业不用浪费金钱和精力建立自己的数据处理中心,而将自己的一些数据和企业管理软件放在公共的云服务器上;而另一些企业对于数据的安全性和专业性等要求较高,于是自建云服务器,于是有了公有云、私有云、的概念之别;有一些私有云并不能满足企业的运算需求,向公有云服务器寻求支持,于是就有了混合云的提法。

    同时,云计算中心能够根据实际需求来安排服务器的运算,让整个计算中心保持高效的运作,避免了运算资源的浪费。除此之外,云计算的好处在于按使用付费。这就是说,你可以按照实际需要的存储空间或者运算能力购买云服务。这是云服务诞生之初的“电厂模式阶段”就提出的理念,即把计算能力当做像水、电这样的产品来出售。现在基本已经变成现实,而在未来,个人用户也将慢慢感受到这种全新方式给生活带来的改变。

    讲了这么多云计算,那么云计算和物联网是是怎么结合起来的呢?前面我们已经提到,我们的物联网设备只需要能够联网,云计算就能够通过网络为我们的设备提供数据处理能力。其次,大数据的运用对物联网来说十分重要,而云计算和大数据分析就像一枚硬币的两面密不可分。

    比如智能家居系统,其一部分运算其实就是依托云服务器,因为我们的家里面的数据处理中心(电脑或手机)没有必要一直保持开机状态。而更多的诸如交通系统、工厂制造系统、社区服务系统等等都将依托于私有云或者公有云的服务。除了这些,我们前面提到云计算还是打通各种物联网标准的有效手段,两个采用不同技术标准的设备也具有了互相交换数据的可能,简单说来,就像你在网上和一个外国人聊天,哪怕你不懂他的语言,只要通过相应的翻译软件,就能够理解对方的意思了。

  • ?

    云计算和大数据哪个发展前景好?

    维他命

    展开

    云计算和大数据哪个发展前景好?

    说实在话,二者之间都是未来的发展趋势,没有说那种好或者不好,根据你的兴趣,你未来的发展方向,来判断你想走那条路!

    大数据相当于海量数据的“数据库”,而且通观大数据领域的发展也能看出,当前的大数据处理一直在向着近似于传统数据库体验的方向发展,Hadoop的产生使我们能够用普通机器建立稳定的处理TB级数据的集群,把传统而昂贵的并行计算等概念一下就拉到了我们的面前,但是其不适合数据分析人员使用(因为MapReduce开发复杂),所以PigLatin和Hive出现了(分别是Yahoo!和facebook发起的项目,说到这补充一下,在大数据领域Google、facebook、twitter等前沿的互联网公司作出了很积极和强大的贡献),为我们带来了类SQL的操作,到这里操作方式像SQL了,但是处理效率很慢,绝对和传统的数据库的处理效率有天壤之别,所以人们又在想怎样在大数据处理上不只是操作方式类SQL,而处理速度也能“类SQL”,Google为我们带来了Dremel/PowerDrill等技术,Cloudera(Hadoop商业化最强的公司,Hadoop之父cutting就在这里负责技术领导)的Impala也出现了。

    整体来看,未来的趋势是,云计算作为计算资源的底层,支撑着上层的大数据处理,而大数据的发展趋势是,实时交互式的查询效率和分析能力,借用Google一篇技术论文中的话,“动一下鼠标就可以在秒级操作PB级别的数据”难道不让人兴奋吗?

    在谈大数据的时候,首先谈到的就是大数据的4V特性,即类型复杂,海量,快速和价值。IBM原来谈大数据的时候谈3V,没有价值这个V。而实际我们来看4V更加恰当,价值才是大数据问题解决的最终目标,其它3V都是为价值目标服务。在有了4V的概念后,就很容易简化的来理解大数据的核心,即大数据的总体架构包括三层,数据存储,数据处理和数据分析。类型复杂和海量由数据存储层解决,快速和时效性要求由数据处理层解决,价值由数据分析层解决。

    数据先要通过存储层存储下来,然后根据数据需求和目标来建立相应的数据模型和数据分析指标体系对数据进行分析产生价值。而中间的时效性又通过中间数据处理层提供的强大的并行计算和分布式计算能力来完成。三层相互配合,让大数据最终产生价值。

    传统的BI分析通过大量的ETL数据抽取和集中化,形成一个完整的数据仓库,而基于大数据的BI分析,可能并没有一个集中化的数据仓库,或者将数据仓库本身也是分布式的了,BI分析的基本方法和思路并没有变化,但是落地到执行的数据存储和数据处理方法却发生了大变化。

    谈了这么多,核心还是想说明大数据两大核心为云技术和BI,离开云技术大数据没有根基和落地可能,离开BI和价值,大数据又变化为舍本逐末,丢弃关键目标。简单总结就是大数据目标驱动是BI,大数据实施落地式云技术。

  • ?

    大数据工程师零基础小白学习路线纯干货分享

    元菱

    展开

    大数据已经被炒的很热了,但通过我多年从事数据相关工作的经验,这个行业目前已经逐渐成熟了,每天我们在互联网都要存留大量的信息,但如何收集、整理这海量的信息,并产生价值,已经是各行各业都在探索的重要课题,且不说在海量数据中挖掘用户需求,预测未来的市场导向,就连政府的政务数据也要云计算、大数据。但是目前大数据工程师的人才缺口非常大,现在投身大数据领域绝对是绝佳的时机。但但从技术角度来看,有一定难度,大数据需要很多种基础理论知识与编程框架、分布式服务器等来支撑,这也是使得一个大数据工程师的人才要比做应用开发、做业务系统编程的人才缺的多。所以我们通过多年的经验,来设置大数据工程师学习路线,希望能让童鞋们更容易的踏上这条路!

    如果有编程背景这是最好的了,会节省很多学习时间,更容易理解。因为大数据环境比较复杂,并不像学习编程软件一样,机器安装一下,跟老师敲几行代码就可以了,但大数据可就要麻烦多了,至少要准备好虚拟化的集群环境,然后又要安装部署各种计算框架,所以需要有耐心,有一定解决问题的能力,坚持不懈,才有可能学好大数据。我推荐的学习步骤是:打好基础,理解为主。多动手实践,一定自己搭建出编程环境。后面再不断的学习spark、python、storm、云计算等相关课程,慢慢自己的头脑中会形成一套知识体系,对大数据的理解也会越来越透彻!

    首先是基础入门,大数据包含的知识面非常广泛涉及很多技术,我根据自己多年工作经验与自己收集整理的课程做的设置。基础进阶,重点是从Java语言学起,然后是对Linux的学习,统计学的学习。大数据包含几个部分一是数据的采集与处理,二是大数据的应用,第一部分依靠分布式、云计算与一些处理特殊情况,数据处理的技术框架组成,这里重点是hadoop分布式框架,spark框架。分别解决大数据存储问题。同时对于关系数据库对大量数据的处理也需要学习,毕竟很多大型商业系统的业务数据还是由传统的关系数据库进行管理的。最后,再linux与java上我也加入了深入学习的课程。供同学提高编程能力与水平。这套课程比较适合伴随职业生涯慢慢学。不适合填鸭式学习。不能当电视剧看,没意义。

    大数据的Java基础 14课

    大数据的linux基础 21课

    大数据的统计学基础 15课

    Hadoop数据分析平台 17课

    Hadoop2.X大数据平台 14课

    Scala语言入门 5课

    大数据平台Spark入门与精通 10课

    Maven教程 15课

    Linux文本编辑器VIM 6课

    Git权威指南 8课

    大数据平台Storm入门到精通 15课

    大数据C、C++基础 14课

    Linux运维 56课

    MYSQL高级性能优化与架构 16课

    Oracle11g海量数据架构设计 13课

    javaEE+Hadoop大数据

    中级进阶这部分重点在于大数据的数据处理的技术应用,storm对于大数据的实时数据分析,像微博实时榜单这种应用,需要storm。etl工具可以从多种数据源,大数据、关系库、文本等多种数据源抽取数据并统一加载。同时学习数据仓库架构与研发流程的课程,学习数据仓库的技术,对数据的整理与应用提出了一套方法论,通过OLAP的维度模型来处理各种数据应用需求,BI与数据接口等。同时学习mahout是做数据挖掘应用的深度学习的框架。还有Nosql的数据库,Redis与Mongodb技术,用于第三方数据抓取的编程语言Python,与分布式内存处理技术的spark框架与scala语言。并且设置的一些实战课程。未来课程内容也会不断更新

    Python网络程序开发 12课

    Storm大数据开发 8课

    Storm应用实战18课

    Hadoop应用开发实战案例 15课

    数据仓库全流程开发详解 15课

    ETL开发之Kettle 15课

    NoSQL与NewSQL数据库引航 19课

    MySQL数据库运维 15课

    大数据之Scala语言 5课

    Redis技术详解 26课

    Mongodb技术详解 18课

    Oracle职业直通车 26课

    Mahout数据挖掘 28课

    Docker大讲坛指引未来的云计算 10课

    Spark纯实战大讲坛 5课

    高级实战这个阶段的重点是深入学习、源码解析与实战,源码解析是希望能更深入的理解开源框架对解决实际问题的编程模型,同时很多大公司在对这些开源框架的应用上并不是直接拿来使用,因为标准版本可能无法解决这种大公司的一些特殊业务需求,都是对源代码进行二次开发,升级改造,重写等来满足自己的业务需要,所以大牛是要有改编能力的。百度就是这样干的,最好的例子就是咱们发货用的云盘,就是。同时数据挖掘、机器学习也是非常重要的大数据应用,阿尔法狗就是利用这个技术打败李世石的。openstack企业私有云是很多大企业内部都要用到的云服务技术,企业的内部应用目前也都是奔着SAAS,软件及服务的方式来实现,所以企业内部的大数据技术也是非常必要的。

    Hadoop源码解析与开发实战 43课

    大数据HBase源码解析与开发实战 26课

    大数据Hive源码解析与开发实战 24课

    大数据Hadoop数据挖掘实战

    Zookeeper入门到精通 8课

    Flume应用开发实战 12课

    Mahout入门与项目实战 20课

    大数据之机器学习 11课

    大数据之Linux内核探秘 13课

    深入浅出Hive企业级架构优化 7课

    Storm的集群搭建实战 8课

    OpenStack企业私有云实战培训课程 12课

    Nutch相关框架 20课

    基于大数据的推荐系统设计 9课

    大数据挖掘下的机器学习 11课

  • ?

    云计算和大数据好好学 就业前景如何

    吕振家

    展开

    云计算的核心思想,是将大量用网络连接的计算资源统一管理和调度,构成一个计算资源池向用户按需服务。云计算的基本原理是,通过使计算分布在大量的分布式计算机上,而非木地计算机或远程服务器中完成目标任务。企业数据中心的运行将更与互联网相似。这使得企业能够将资源切换到需要的应用上,根据需求访问计算机和存储系统。

    对此有网友表示称,那大数据好不好学呢?其实所谓大数据,就是由很多小数据汇聚而成的,我们本身就是一个数据,比如我们的通讯信息、我们的路线信息、我们浏览网页的信息等等,都是一个个活生生的数据,而正是这一个个精确的数据组成了我们口中的大数据。什么叫做大数据?说白了就是一台机器干不完,大家一起干。可是随着数据量越来越大,很多不大的公司都需要处理相当多的数据,这些小公司没有这么多机器可怎么办呢?

    说到这里,大家想起云计算了吧。当想要干这些活时,需要很多的机器一块做,真的是想什么时候要就什么时候要,想要多少就要多少。大数据和云计算其实并不难学,一般4到5个月的培训就能找工作了。

    只需自己想学,感兴趣的话,不管什么根底都能够学,仅仅要比他人更努力的去学了。柠檬学院大数据,注册就能学习大数据了,一起还有大数据的根底课程java,linux,mysql等。好多机构,也是有各种活动的啊。肯定要必定的根底,仍是挺轻松的,去大讲台看看,推出在线运用科学混合式自适应学习体系安排线上教育,运用大数据可视化的在线实训体系安排实战练习。

  • ?

    一文看懂云计算和大数据的投资逻辑

    采蓝

    展开

    为什么说现在是投资云计算和大数据的最好时机?云计算具体指什么?为什么企业云服务是未来的发展重点?云计算和大数据的未来发展趋势又如何?

    本文为天鹰资本合伙人陈越在6月17日由天鹰资本和国际前瞻基金会联合主办的“硅谷人工智能与创新文化分享会”上作的主题演讲《关于技术投资的几点思考》。创客猫受邀作为合作媒体到场进行图文直播及报道。本文经创客猫整理精编,有删减,如有转载请注明来源。

    天鹰资本合伙人陈越

    我在天鹰资本这边主要做技术投资和早期投资。今天我主要讲下我们在云计算和大数据里面的一些思考逻辑。

    云计算两大特点:按需来取、弹性大

    云计算,可能大家经常听到有人在说云计算相关的东西,但是云计算是什么?“云计算”的概念最早是由google提出的,它是一种网络应用的模式。其实很简单,我们每个人都会有微信,微信就是云计算的一种体现。

    也就是说你在手机里面有APP,但是APP里面有很多的东西,比如说有存储的数据,它的信息不是实时放在你手机里面,而是从云端请求,它从云端把信息拿到手机上面来,所以这是云计算的一种表现形式。

    再比如有时候我们攒一个电脑,大学时候大家都愿意去攒电脑,攒电脑时就要到中关村买硬盘、内存这类的东西。现在有可能就不需要了,在云端就能完成。现在大家有可能不再需要用很大的硬盘,我们也可以用百度的网盘,这些主要是把一些计算机或者网络里面相互调用的资源放在云端,这基本上就算是云计算的服务。

    这个服务,举一个例子,它特别像电厂。比如说电厂生产出来的电,通过电线传输到家庭里面,电灯就可以用了。每个用户其实他并不关心你电怎么生产,我只要想用电的时候有电就可以了,你用的电越多付的钱越多,用的电越少付的钱越少。所以云计算其实就是一个电厂的模式,电厂负责生产,用户只要用的时候按照需求来付费。

    因此云计算有两个大的特点,第一个是按需,也就是说你需要多少就用多少。第二个大的特点,它是弹性的,比如一个公司需要电脑设备,这个时候它的业务量很小,所以只需要很少的设备。但是如果它一旦遇到大的突发事件,比如双十一,需要很多资源,这个时候如果原来的模式,他只能是买很多冗余的硬件资源,这时候对他来说是一种浪费,因为他通常用不到那么资源,所以他的需求是弹性的。这时候云计算提供了非常好的途径,也就是说他需要多的时候多用,不需要的时候就少用。所以这就是云计算大致的概念,它有两个特点,一个是按需来取同时又很大的弹性。

    云计算的三个种类:IaaS、SaaS、PaaS

    云计算我们做几种分类,比如我是一个房东,我有这个房子,这个房子我要租出来给大家用,其实是有几种收费模式。

    第一种收费模式就提供了一个房子,你们谁都可以用,做什么都可以。这个房子里面你如果愿意把它装修成咖啡馆那就装修成咖啡馆,如果想装修成健身房那就是健身房,所以我不在乎你到底怎么用,这个状态我就提供基础设施,只是一个房子而已。

    在这之上我还可以提供另外一个服务,比如把房间装修成咖啡馆,租户要来租的时候你就租自己的配源,这个时候我的房子就做成品牌的模式,就是做成咖啡馆,谁来做都可以,可以变成星巴克咖啡馆,也可以变成一个zone咖啡馆。这是一种平台的模式。

    再往上走就是我自己配备服务员,把它变成一个进来就可以买咖啡的状态,这时候我收取的是对买咖啡这些人所服务的费用。

    其实这三种模式恰恰就形成了云计算的三个种类,或者说三个层级。第一层级叫硬件级服务,这叫IaaS,它是为企业提供基础服务,比如说企业原来需要自己买硬盘、服务器,现在不需要,只要在云端就可以。

    往上层级是paas平台级的服务,提供一个开发服务,所有人想开发系统在我平台上开发就可以了。

    再往上就是SaaS,是一种通过网络提供软件服务的模式,云服务提供商提供在云端的软件,大家都使用这个软件就可以,你不用在电脑里面装,也不用在手机里面装过多的东西,只要一些很简单很便捷的安装就可以完成服务的驱动。这是云计算大概的分类,IaaS、SaaS、PaaS。

    企业云服务是未来发展的重点

    接下来讲讲云计算市场的规模。为什么大家对云计算这么关注,因为它的市场规模还是非常大的。当然对于云计算市场规模每一家都有自己的计算方式和口径,差别还是挺大。但至少都说明一个问题,中国云计算市场的规模是以每年60%的速度在往上增长,增长速度非常惊人,也就是说这是未来非常好的投资方向。不论从宏观还是微观的调研看这都是个上千亿规模的市场。

    另外我们刚刚说到大部分的云计算,其实我们在概念里面提到的都是针对于企业的云计算,为什么我们认为企业云服务是未来发展的重点?首先解释一下企业云服务,企业云服务是客户和应用场景是为企业提供的云计算服务,或者我们在行业说的比较多的就是to B的云服务。因为我们整个把云服务分成两个场景,一种是to C,比如说微信,这是最好的例子。to B比如阿里丁丁、销售易、纷享销客,我们都把它叫做to B的云服务。

    为什么我们说to B是未来非常大的前景,我们可以做一个比较,中美企业服务市场的比较,在美国和中国大概提供的云服务的主要厂商里,不管亚马逊还是ebay还是阿里巴巴还是京东,他们提供的可能更多是to C服务。而提供toB的服务,比如有Sosbof、oracle、IBM,在国内是用友和金碟。我们来比较一下他们公司的市值,to C的在美国大的几个公司它的市值可能加起来是5000、6000亿美元,在中国是4000多亿。也就是说不管在美国或者是在中国,提供to C云服务的厂商大概市场规模都差不多,都是4000、5000、6000亿,差异不是特别大。但是我们看企业应用,美国to 企业应用市值和to C市值差不多,都是4000、5000亿。但中国的用友和金碟的市值规模加起来非常小,从这个角度上来讲中国的to B应用还有很大的空间。

    但是有人会觉得是不是中国和美国的市场规模不一样,美国的企业数一共是2700万家,这是一个券商的数据,中国的企业是2200万家,其实没有差很多。为什么中国和美国的企业云服务差别会这么大?我觉得这里面可能有它整个云服务市场在云计算方面发展技术上的时间差。

    美国大概是在2011年之后从企业到公众都开始使用云服务,中国基本上是从2015年才开始广泛使用。所以我们认为,从云服务角度来讲,云计算美国的今天就是中国的明天,如果中国跑的快一点,可能美国的今天就是中国的今天晚上。所以企业云服务未来会有非常大的爆发空间。

    中国已经具备了基础设施硬件的条件,所以已经有比较成熟的技术,所以这个产业一定是处在爆发的前列。另外中国的企业有可能不会经历像美国企业那么长时间的发展就可以达到很好的状况,因为技术已经很成熟了。所以我们认为企业云服务是未来非常大的前景。

    云计算未来发展趋势:呈现“BEAT”

    这是云计算的发展趋势,我们总结了四个字母,就是“BEAT”,我们认为它是未来云的发展趋势,BEAT在英文里面是节奏的词儿,所以我们认为按照这个趋势来做投资一定会踩在云计算投资的点上。

    “B”是什么意思?就是大客户。我们认为现在云计算的重点正在逐渐从中小型客户变成中大型客户。原来大家觉得云服务是小公司用的比较多,因为它便宜。但是现在看起来不是这样,越来越多的大公司会转向云架构软件需求,所以它未来一定是以大客户为主,是云计算大的趋势。

    “E”是生态化。所以现在云计算不再是每一个小公司在单打独斗自己做业务,一定是联合起来做。生态化,又分两个方向,合纵连横。合纵意思是说很多小公司把自己的特点结合起来,有互补性,他给大公司提供综合性、打包性的云服务的特点。还有一个特点就是连横,以大企业为核心,把自己做成很大的体系平台,众多的企业在这个平台上面为大家提供各种各样的服务,所以这是生态化的具体体现。

    “A”的意思就是融合。融合这块相对来说比较技术,大概的意思就是它从Saas到Iaas到paas,几个层级的界限越来越混合,不会有特别明显的界限,同时它会把各种各样的技术要素放在里面。

    最后“T”的意思就是T型化的战略。这是比较技术的说法,一横是管理型SaaS会做平台化的运作,平台搭起来,让大家都来用。同时一竖是行业SaaS服务垂直化,比如行业的医疗客户,因为别的用户做不了医疗行业,大概是这样一横一竖的战略。

    所以BEAT是我们认为未来云计算整个的发展趋势。

    为什么说现在是投资大数据的好时机

    大数据,其实也是谈了很多年,具体是什么,大家可能基本上都有一些了解和认识。比如你的消费、你的行为、你的位置等各种各样的信息可能都汇聚在某些地方,把这个价值体现出来,其实就是很多的数据。

    大数据已经渗透到我们日常生活中每一个人的身边,比如马云他说互联网已经从IT时代变成DT时代,IT就是信息技术,DT就是数字技术,所以他认为数据将取代石油,成为未来制造业最大的能源。我觉得这是非常前瞻性和非常现实的说法。

    大数据虽然已经渗透到我们生活中每一个地方,但是它却是从一个地方消失掉了,从哪儿消失了?它在技术曲线上消失了。我大概解释一下,这个技术曲线是gartner技术成熟度曲线。比如新的技术从曲线上某点(这儿)出现,大家开始炒作,炒作到顶点它就下去了,因为炒作得太多但技术又跟不上整个市场的发展,就会进入原来幻想破灭的阶段,破灭之后,等到一定阶段技术会重新进入比较成熟和正常的发展阶段再起来。

    2015年度新兴技术成熟度曲线 来源:gartner

    2016年新兴科技技术成熟度曲线 来源:gartner

    我们看gartner2015年的曲线,这时候我们发现大数据在曲线上已经从最热的地方掉下去了。到2016年时,后来发现大数据已经从技术曲线里面消失了,说明什么?说明大数据已经不是前瞻性的技术了吗?我们不这样想,其实说明了大数据已超越了炒作的概念,实实在在进入向生态的方向演进的阶段。

    从我们投资角度来讲,如果我们在炒作最高点的时候投资,那就比较被动。而在要进入低谷的时候投资,我觉得恰恰是比较好的状态,因为它会进入低谷,但是它又是未来比较长足的发展和比较强劲的增长空间,所以这是我们认为现在大数据是非常好的投资方向的原因之一。也就是说炒作已经结束了,基本上尘埃已经落定,这时候真真正正可以做一些实业的发展,去做不能说是长期投资,可以是中期非常好的标的。

    另外,大数据市场概况我们多少看一下,一个是全球大数据市场规模,今年大概是1800亿美元的概念。中国2017年,我们预计是358亿大数据的市场规模。我们可以看到中国大数据市场占据非常重要的地位,同时另外一个非常重要的事情,也可以看到中国的大数据市场增长速度远远高于全球的增长速度,这也是我们为什么觉得在国内大数据是一个非常好的投资方向的重要的原因。

    天鹰资本的投资逻辑

    我们在做早期投资的时候其实有一些标准,这个标准是“三长一短”。

    “长”也可以说是“高”或者是比较“强”,我们认为投资一定要投市场空间非常大,这时候尤其是以蓝海市场为主,如果有这样一些市场我们会非常重点的来看。所以市场空间首先要大。

    另外投资标的壁垒要高,这个壁垒有可能是它占据的资源、有可能是他的团队,有可能是他的技术。

    第三个高是成长性,因为市场空间大、壁垒高,同时就形成比较强的成长性。这时候我们需要它的商业模式是比较确定的商业模式,我们给他注入资金和资源时,它的发展速度就会非常快。

    一“短”是,我们希望退出的时间短。为什么我们投资的时候不希望投一些特别前沿的技术,因为特别前沿的技术发展起来时间太长了,未来我们可能会投,但是现在我们还是希望在中短期内给投资人比较好的财务回报,这些才能形成比较高的回报状况。

    这是我们在这个领域的投资标准,也会是我们在其他领域的投资标准。

    (以上为创客猫现场原创报道,如有转载请注明来源)

  • ?

    云计算好学么?大数据云计算学习路线

    残留

    展开

    云计算好学么?其实,小马过河的故事大家都读过,这云计算好不好学,还得看自身。有人说了,你这不是废话么?还真不是。其实我们不妨看看云计算到底是个什么东西。如今,云计算频繁出现在我们的视野,他是一种经由网络统一组织和灵活应用各种信息,通信,技术资源,来实现大规模计算的信息处理方式。

    云是网络、互联网的一种比喻说法。过去在往往用云来表示电信网,后来也用来表示互联网和底层基础设施的抽象。狭义云计算指IT基础设施的交付和使用模式,指经由网络以按需、易扩展的方式获得所需资源;广义云计算指服务的交付和使用模式,指经由网络以按需、易扩展的方式获得所需服务。这种服务可以是IT和软件、互联网相关,也可是其他服务。它意味着计算能力也可作为一种商品经由互联网进行流通。

    经由使计算分布在大量的分布式计算机上,而非本地计算机或远程服务器中,企业数据中心的运行将与互联网更相似。这使得企业能够将资源切换到需要的应用上,根据需求访问计算机和存储系统。好比是从古老的单台发电机模式转向了电厂集中供电的模式。它意味着计算能力也可以作为一种商品进行流通,就像煤气、水电一样,取用方便,费用低廉。不同在于,它是经由互联网进行传输的。辨析云计算常与网格计算、效用计算、自主计算相混淆。

    还是没有明白?没关系,打个比方,如果我们想在办公室或者公司的网站上运行一些企业应用,传统的方式是去租用一些服务器,存储设备,在上面部署操作系统,最后在上面部署应用,这种方式就是好像吃烧烤的时候,自己准备烤炉,木炭,酱料串好食材,动手烧烤,这样比较费力。

    实际上,我们在吃烧烤时,一般经由以下途径,第一种方法是串好串串去野营地租用烧烤炉子自己烤,这就像IAAS服务一样,直接使用商家提供的基础设施。第二种方法是到自助烧烤店里面,商家为你准备好烤炉和烤串,只需要你动手自己烤,这就好像PAAS服务一样,利用商家的平台。第三种方法是坐在餐馆点菜,这就好像SAAS服务一样,直接使用云服务商提供全套服务。这就是常见的云计算模式。

  • ?

    大数据培训学习之云计算大数据分析该怎么学?

    鲍梦琪

    展开

    当下的互联网领域,云计算、大数据、人工智能成为最热词汇。互联网da咖阿里云“为了无法估算的价值”将中国的计算触角伸向海外,百度首次向外界展示“百度大脑”的科技成果。移动互联网利用人口红利带来的增长已经逐渐见顶,互联网正在进入“下一幕”智能时代,科多大数据带大家来看看,云计算、大数据、人工智能将怎么使全社会迎来变革性的发展。

    无论是计算机行业,还是汽车领域,技术形态的成熟是一个必然的要素。如果某个所谓的时代在技术上、硬件上没有达到产业的要求,数据库和平台都是非完整和非稳定的,时代的产业基础也就十分薄弱。从产业的政策角度分析,当技术累积到一定层次,产业政策的出台是必然的。为了激活云计算的发展,国务院在2015年就出台了《关于促进云计算创新发展培育信息产业新业态的意见》、《云计算白皮书2016》等,这些政策的出现并非偶然,在其背后有很多云计算服务商多年默默的技术耕耘。

    技术和政策的形态达到一定的地步,真正的产业化和市场化是否也已经达到?

    等待入局者必须考虑几个重要因素:

    一、目的是什么(为了降低成本、提高效率,还是在渠道上更接近用户);

    二、企业是否愿意使用(产品同质化严重,如何体现差异化);

    三、是否有助于提高社会福利(消费者福利、管理效率)。

    如果这些问题得到肯定的答案,云计算与时代的发展需求相契合,真正的时代大门就会开启。

    大数据本身除了要有数据、采集、汇聚一定量的数据之外,更重要的是数据的处理、挖掘、分析、可视化、应用这样一整套的过程。

    关于大数据的话题,基本围绕三个问题展开:

    一是数据从哪里来;

    二是数据如何进行分析;

    三是数据如何进行商品化。

    任何大数据都是以应用为主的,在未来,通过多维度、多复合的大数据的精准挖掘,最终提供出优质的商务解决方案才是最关键的。

    数据的三个来源分别是政府、企业行业和个人消费。

    政府数据做了授权,但由于法律和其他方面的不健全,政府数据被滥用。消费者数据来源于电信、金融或类似BAT大企业,流量入口处的数据将被自动抓取,数据提供商可以提供所有维度的数据,但每一个都是局部。数据优化商在大数据产业链里要想长久发展,必须精通大数据的模型、算法以及数据特征,同时对行业及生态要有明显的敏感性。而算法提供商如果仅仅依赖单纯算法,未来将成为成长软肋。应用提供商最贴近客户、最熟悉客户需求,同时做的是最后的数据整合,在产业链上可能发展空间更大。

    中国具有高达7.22亿的大规模网民群体,目前国内仅有3万个机柜,对比美国的3亿群体2.4万个机柜可以看出,中国的数据市场规模还远未达到平衡点,未来将保持高速增长的态势。另一个方面,由于企业客户运营模式的改革,企业的云化增加了对大数据及专业数据中心的需求。

    未来云计算产业和大数据产业将呈现规模化发展趋势,市场红利可观,创新、服务、合作、技术将推动互联网科技企业走得更高、更远。大数据时代已经到来,想要快速掌握这门高薪前景的技术该如何学习呢?

    Linux基础和分布式集群技术

    学完此阶段可掌握的核心能力:熟练使用Linux,熟练安装Linux上的软件,了解熟悉负载均衡、高可靠等集群相关概念,搭建互联网高并发、高可靠的服务架构;学完此阶段可解决的现实问题:搭建负载均衡、高可靠的服务器集群,可以增大网站的并发访问量,保证服务不间断地对外服务;学完此阶段可拥有的市场价值:具备初级程序员必要具备的Linux服务器运维能力。

    学习大数据处理需要的语言:

    javaMR语言这种语言产生很早了,大家也或多或少的接触过,但是在大数据中使用已经有的原型进行构建庞大系统,是一种基本的选择。

    Scala语言以java为基础的语言,和java很像,对任何想要进行大规模的机械学习或是建立高阶的算法,Scala是逐渐兴起的工具,善于呈现且拥有建立可靠系统的能力。

    Hadoop在以java为基础的大数据处理当中,Hadoop为作一批数据处理,发展以java为基础的架构关键。相对于其他处理工具而言,Hadoop慢许多,但是无比的准确可被后端数据库分析广泛使用。

    Kafka andStorm它是一个特别快速的查询信息系统,但是因为太快了在实施操作时会犯错,有时候会漏掉东西。

    Pythom语言Python拥有R语言处理复杂数据的能力及更务实的语言特质,更简单和直观,在近几年的成长很快。在数据处理范畴内,通常在规模与复杂之间要有个选择,Python无疑当选。

    学习一门课程,掌握好的学习方法至关重要,大数据云计算发展趋势非常好,现在学习好这门技术,未来的就业和选择会更多。

  • ?

    云计算是什么?云计算与大数据要学啥?

    冥王

    展开

    云计算是什么?云计算与大数据要学啥?云计算的虚拟空间无限大,物联网和互联网产生的大量数据,要找一个地方集中存储和处理,就要用云来存储。比如我们平时手机或电脑存储空间不够的情况下,会把一些图片及视频存在云盘,云端。

    云计算,简单说就是把你自己电脑里的或者公司服务器上的硬盘、CPU都放到网上,统一动态调用,现在最有名的云计算服务商是亚马逊的AWS。以前你要玩最新的大型3D游戏或者做了个大型3D动画需要渲染,首先想到的都是重新买一台更高配置电脑或者换个显卡等;

    有了云计算之后,你只需要一台显示器,连到服务商的云计算平台上,如果想玩两天新游戏,就单独购买这两天的高配CPU和显卡,只付两天的钱,玩腻了就恢复成普通的配置;如果你今晚要做大量渲染,就买今晚几个小时的高配,第二天早上拿到成片,就可以恢复原来的配置。所有这些计算和渲染工作都在云计算服务商的数据中心统一完成,你只需要按小时甚至按分钟计费,不用再自己买电脑和服务器了。做云计算的服务商都会自建数据中心。

    大数据,简单说,就是把所有的数据放到一起分析,找到关联,实现预测。这里的所有数据对应的是之前的抽样调研取得的部分数据。比如传统的市场调研方法,就是去大街上或者网上发问卷,能得到成百上千份结果就很不错了,或者邀请几个典型用户到会议室访谈一下;大数据的做法是把收集所有人的数据进行分析,把每个人都当做独立个体进行分析,而不是找群体特征。大数据的结果就是更精准,更细致,更个性化。

    再比如我们经常会看一些现代谍战片,侦察部如何找到罪犯?就是通过全城监控录像,在海量数据中搜索一个人的面孔,犯罪分子只要出现在监控中都会保留一条数据及位置,从而更好地实施下一步方案,大大提高破案效率。这也是企业为什么在极力追捧云计算大数据技术。再比如京东、淘宝、今日头条、新浪、百度、网易、等购物网站,就是采用这种技术。今天看过或搜过的,下次再打开就会主动推送什么类型的文章。

    简单的说大数据就是超级存储的意思,海量数据上传到云平台后,大数据就会对数据进行深入分析和挖掘。在在各行各业均存在大数据。比如天气预报,气象中心会通过卫星发送回气象局无数条关于空气温度、湿度、密度、空气微粒等的数据,运用大数据技术,从而分析判断出这些数据。得出天气状况、空气质量、温度及风量。再比如将几千辆车的数据位置信息综合起来分析出某条路的拥堵状况。大数据必须有云作为它的基础架构,才可以推广并体现出强大的实用价值。云计算和大数据是相辅相成的。

  • ?

    大数据的入门级学习

    鄂黎昕

    展开

    1.Linux基础和分布式集群技术

    学完此阶段可掌握的核心能力:

    熟练使用Linux,熟练安装Linux上的软件,了解熟悉负载均衡、高可靠等集群相关概念,搭建互联网高并发、高可靠的服务架构;

    学完此阶段可解决的现实问题:

    搭建负载均衡、高可靠的服务器集群,可以增大网站的并发访问量,保证服务不间断地对外服务;

    学完此阶段可拥有的市场价值:

    具备初级程序员必要具备的Linux服务器运维能力。

    1.内容介绍:关注作者:需要大数据学习视频资料可以加我QQ群,此文里面连起来的数字,你会找到我的

    在大数据领域,使用最多的操作系统就是Linux系列,并且几乎都是分布式集群。该课程为大数据的基础课程,主要介绍Linux操作系统、Linux常用命令、Linux常用软件安装、Linux网络、防火墙、Shell编程等。

    2.案例:搭建互联网高并发、高可靠的服务架构。

    2.离线计算系统课程阶段

    1. 离线计算系统课程阶段

    Hadoop核心技术框架

    学完此阶段可掌握的核心能力:欢迎加入722680258零基础到项目实战

    1、通过对大数据技术产生的背景和行业应用案例了解hadoop的作用;2、掌握hadoop底层分布式文件系统HDFS的原理、操作和应用开发;3、掌握MAPREDUCE分布式运算系统的工作原理和分布式分析应用开发;4、掌握Hive数据仓库工具的工作原理及应用开发。

    学完此阶段可解决的现实问题:

    1、熟练搭建海量数据离线计算平台;2、根据具体业务场景设计、实现海量数据存储方案;3、根据具体数据分析需求实现基于mapreduce的分布式运算程序;

    学完此阶段可拥有的市场价值:

    具备企业数据部初级应用开发人员的能力

    1.1 HADOOP快速入门

    1.1.1 hadoop知识背景

    什么是hadoop、hadoop产生背景、hadoop在大数据云计算中的位置和关系、国内hadoop的就业情况分析及课程大纲介绍

    国内外hadoop应用案例介绍

    分布式系统概述、hadoop生态圈及各组成部分的简介

    1.1.2 HIVE快速入门

    hive基本介绍、hive的使用、数据仓库基本知识

    1.1.3 数据分析流程案例

    web点击流日志数据挖掘的需求分析、数据来源、处理流程、数据分析结果导出、数据展现

    1.1.4 hadoop数据分析系统集群搭建

    集群简介、服务器介绍、网络环境设置、服务器系统环境设置、JDK环境安装、hadoop集群安装部署、集群启动、集群状态测试

    HIVE的配置安装、HIVE启动、HIVE使用测试

    1.2 HDFS详解

    1.2.1 HDFS的概念和特性

    什么是分布式文件系统、HDFS的设计目标、HDFS与其他分布式存储系统的优劣势比较、HDFS的适用场景

    1.2.2 HDFS的shell操作

    HDFS命令行客户端启动、HDFS命令行客户端的基本操作、命令行客户端支持的常用命令、常用参数介绍

    1.2.3 HDFS的工作机制

    HDFS系统的模块架构、HDFS写数据流程、HDFS读数据流程

    NAMENODE工作机制、元数据存储机制、元数据手动查看、元数据checkpoint机制、NAMENODE故障恢复、DATANODE工作机制、DATANODE动态增减、全局数据负载均衡

    1.2.4 HDFS的java应用开发

    搭建开发环境、获取api中的客户端对象、HDFS的java客户端所具备的常用功能、HDFS客户端对文件的常用操作实现、利用HDFS的JAVA客户端开发数据采集和存储系统

    1.3 MAPREDUCE详解

    1.3.1 MAPREDUCE快速上手

    为什么需要MAPREDUCE、MAPREDUCE程序运行演示、MAPREDUCE编程示例及编程规范、MAPREDUCE程序运行模式、MAPREDUCE程序调试debug的几种方式

    1.3.2 MAPREDUCE程序的运行机制

    MAPREDUCE程序运行流程解析、MAPTASK并发数的决定机制、MAPREDUCE中的combiner组件应用、MAPREDUCE中的序列化框架及应用、MAPREDUCE中的排序、MAPREDUCE中的自定义分区实现、MAPREDUCE的shuffle机制、MAPREDUCE利用数据压缩进行优化、MAPREDUCE程序与YARN之间的关系、MAPREDUCE参数优化

    通过以上各组件的详解,深刻理解MAPREDUCE的核心运行机制,从而具备灵活应对各种复杂应用场景的能力

    MAPREDUCE实战编程案例:通过一个实战案例来熟悉复杂MAPREDUCE程序的开发。该程序是从nginx服务器产生的访问服务器中计算出每个访客的访问次数及每次访问的时长。原始数据样例如下:

    通过一系列的MAPREDUCE程序——清洗、过滤、访问次数及时间分析,最终计算出需求所要的结果,用于支撑页面展现:

    1.4 HIVE增强

    1.4.1 HIVE基本概念

    HIVE应用场景、HIVE内部架构、HIVE与hadoop的关系、HIVE与传统数据库对比、HIVE的数据存储机制、HIVE的运算执行机制

    1.4.2 HIVE基本操作

    HIVE中的DDL操作、HIVE中的DML操作、在HIVE中如何实现高效的JOIN查询、HIVE的内置函数应用、HIVE shell的高级使用方式、HIVE常用参数配置、HIVE自定义函数和TRANSFORM的使用技巧、HIVE UDF开发实例

    1.4.3 HIVE高级应用

    HIVE执行过程分析及优化策略、HIVE在实战中的最佳实践案例、HIVE优化分类详解、HIVE实战案例--数据ETL、HIVE实战案例--用户访问时长统计

    HIVE实战案例--级联求和报表实例:

    离线数据挖掘系统

    学完此阶段可掌握的核心能力:

    1、通过对数据仓库知识的加强初步掌握数据仓库的核心概念和设计流程;2、通过对HADOOP生态圈关键辅助工具的学习掌握hadoop分析系统的整合能力;3、通过电商系统点击流日志数据挖掘系统实战项目,掌握hadoop离线数据挖掘系统从数据采集、入库、分析及报表展现的整套流程

    学完此阶段可解决的现实问题:

    1、可根据企业具体场景设计海量数据分析系统的通用架构2、根据具体场景的特点有针对性地调整数据分析各环节的技术选型;3、根据具体需求搭建起整套离线数据分析系统;4、简单数据仓库模型的设计和架构5、各环节具体功能模块的开发实现

    学完此阶段可拥有的市场价值:

    具备企业数据部中高级应用开发和初级架构师能力

    2.1 数据仓库增强

    2.1.1 数据仓库及数据模型入门

    什么是数据仓库、数据仓库的意义、数据仓库核心概念、数据仓库的体系结构

    2.1.2 数据仓库设计

    建立数据仓库的步骤、数据的抽取、数据的转换、数据的加载、什么是数据模型、数据模型的常见类型、如何设计数据模型、如何选择数据建模的架构

    典型数据模型——星型建模实例

    2.1.3 数据仓库建模样例

    业务建模、领域建模、逻辑建模、物理建模

    web点击流日志分析系统数据仓库设计实战:

    通过对数据特点和业务需求的分析,关系梳理,设计出一个主题明确、层次合理的数据模型

    2.2 离线辅助系统

    2.2.1 数据采集系统

    数据采集概念介绍

    FLUME日志采集框架介绍、FLUME工作机制、FLUME核心组件、FLUME参数配置说明、FLUME采集nginx日志实战案例

    2.2.2 任务调度系统

    任务调度系统概念介绍、常用任务调度工具比较、OOZIE介绍、OOZIE核心概念、OOZIE的配置说明、OOIZE实现mapreduce/hive等任务调度实战案例

    2.2.3 数据导出

    数据导出概念介绍、SQOOP基础知识、SQOOP原理及配置说明、SQOOP数据导入实战、SQOOP数据导出实战、SQOOP批量作业操作

    2.3 web点击流日志分析系统实战项目

    2.3.1 项目介绍

    1. 在PC时代,营销的核心是购买,在移动互联网时代,其核心是如何实现用户个性化互动,对用户传播更为精准化的内容,而实现这一核心的基础就是对数据的管理和分析——数据驱动型商业模型。

    2. 各类互联网服务产品(如网站、APP)都可以通过前端技术获取用户的详细行为数据(如访问的页面,点击的区域、登陆的频次、注册行为、购买的行为等),将这些点击流日志数据与后台商业数据综合起来,就可以挖掘对公司运营决策意义非凡的商业价值。

    3. 本项目则是一个用大数据技术平台实现的点击流日志分析数据挖掘系统,项目内容涵盖一个典型数据挖掘系统中,包括需求分析、数据采集、数据存储管理、数据清洗、数据仓库设计、ETL、业务模型统计分析、数据可视化的全部流程。

    2.3.2 需求分析

    什么是点击流日志、点击流日志的商业价值、点击流日志分析需求

    业务模型指标体系设计——流量分析、来源分析、受访分析、访客分析、转化率分析

    2.3.3 系统设计及开发

    1. 系统架构设计

    2. 数据采集设计及开发——数据格式、数据内容分析、数据生成规律、采集系统技术选型解析、FLUME采集系统实现

    3. 数据存储设计及开发——存储技术选型、存储业务流程解析、存储目录规划及文件命名规则、小文件合并实现

    4. 数据统计设计及开发——数据预处理、数据加载、原始数据表的创建、数据入库、数据ETL

    5. 报表统计设计——数据模型设计、事实表设计、维度表梳理

    6. 业务指标设计及开发——PV统计(时间维度、终端维度、地域维度)、来访次数统计(时间维度、地域维度、终端维度)、独立访客统计(时间维度、终端维度、地域维度)、受访页面统计(时间维度、栏目维度)、页面热点图、转化率分析、来源关键词分析、来源搜索引擎分析、来源广告推广分析

    2.3.4 任务调度系统设计实现

    任务调度单元实现、各环节任务运行频次及依赖关系梳理、工作流设计及实现、工作流定义配置上传部署、工作流启动即状态监控

    2.3.5 数据可视化——结果报表展现

    1. hive分析结果使用sqoop导出到msyql数据库

    2. 报表展现系统技术选型:

    后台使用spingmvc + spring + mybatis

    前端页面使用全静态异步刷新技术jQuery + Echarts

    3. web展现程序架构搭建,使用maven构建项目工程

    4. web展现程序页面设计开发:原型页面设计、js代码开发

    5. 最终实现以下数据可视化效果:

    (1)流量概况可视化效果:

    (2)来源地域分析可视化效果:

    (3)来源类型分析可视化效果:

    3.Storm实时计算部分阶段

    实时课程分为两个部分:流式计算核心技术和流式计算计算案例实战。

    1.流式计算核心技术

    流式计算核心技术主要分为两个核心技术点:Storm和Kafka,学完此阶段能够掌握Storm开发及底层原理、Kafka的开发及底层原理、Kafka与Storm集成使用。具备开发基于storm实时计算程序的技术能力。

    学完此阶段可掌握的核心能力:

    (1)、理解实时计算及应用场景

    (2)、掌握Storm程序的开发及底层原理、掌握Kafka消息队列的开发及底层原理

    (3)、具备Kafka与Storm集成使用的能力

    学完此阶段可解决的现实问题:

    具备开发基于storm的实时计算程序的能力

    学完此阶段可拥有的市场价值:

    具备实时计算开发的技术能力、但理解企业业务的能力不足

    1.1、流式计算一般结构

    2011年在海量数据处理领域,Hadoop是人们津津乐道的技术,Hadoop不仅可以用来存储海量数据,还以用来计算海量数据。因为其高吞吐、高可靠等特点,很多互联网公司都已经使用Hadoop来构建数据仓库,高频使用并促进了Hadoop生态圈的各项技术的发展。一般来讲,根据业务需求,数据的处理可以分为离线处理和实时处理,在离线处理方面Hadoop提供了很好的解决方案,但是针对海量数据的实时处理却一直没有比较好的解决方案。就在人们翘首以待的时间节点,storm横空出世,与生俱来的分布式、高可靠、高吞吐的特性,横扫市面上的一些流式计算框架,渐渐的成为了流式计算的首选框架。如果庞麦郎在的话,他一定会说,这就是我要的滑板鞋!

    上图是流式分析的一般架构图,抽象出四个步骤就是数据采集、数据缓冲、数据处理、数据输出。一般情况下,我们采用Flume+kafka+Storm+Redis的结构来进行流式数据分析。实时部分的课程主要是针对Kafka、Storm进行学习

    1.2、流式计算可以用来干什么

    一淘-实时分析系统:实时分析用户的属性,并反馈给搜索引擎。最初,用户属性分析是通过每天在云梯上定时运行的MR job来完成的。为了满足实时性的要求,希望能够实时分析用户的行为日志,将最新的用户属性反馈给搜索引擎,能够为用户展现最贴近其当前需求的结果。

    携程-网站性能监控:实时分析系统监控携程网的网站性能。利用HTML5提供的performance标准获得可用的指标,并记录日志。Storm集群实时分析日志和入库。使用DRPC聚合成报表,通过历史数据对比等判断规则,触发预警事件。

    一个游戏新版本上线,有一个实时分析系统,收集游戏中的数据,运营或者开发者可以在上线后几秒钟得到持续不断更新的游戏监控报告和分析结果,然后马上针对游戏的参数和平衡性进行调整。这样就能够大大缩短游戏迭代周期,加强游戏的生命力。

    实时计算在腾讯的运用:精准推荐(广点通广告推荐、新闻推荐、视频推荐、游戏道具推荐);实时分析(微信运营数据门户、效果统计、订单画像分析);实时监控(实时监控平台、游戏内接口调用)

    为了更加精准投放广告,阿里妈妈后台计算引擎需要维护每个用户的兴趣点(理想状态是,你对什么感兴趣,就向你投放哪类广告)。用户兴趣主要基于用户的历史行为、用户的实时查...

云计算大数据入门

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP