- ?
大数据到底是什么?1个案例,5分钟,让你读懂大数据
Maxine
展开
快滴、滴滴为了抢客户,狂烧几十个亿,前不久,顺丰和菜鸟撕逼又言和,
大佬们的恩怨情仇,其实都是为了——流量和数据
大数据的火烧了两三年,马云天天在网上叫喊大数据时代的来临
大数据,到底是个什么东西?
在引出数据这个概念之前,,必须先要解释一下什么叫“流量”。
一、什么是流量
所谓流量,是指单位时间内流经封闭管道或明渠有效截面的流体量,又称瞬时流量——这是百度百科对流量的定义。
大哥,拜托讲人话好吗?
浅显地讲,比如你开了家化妆品店,周一晚上,有100个顾客去你店里了,不管他们买没买,
这100个人就是流量。
好,理清了流量之后,那流量跟数据又是什么关系。
二、流量跟数据的关系
当这100个顾客走进你店里,可能有50个人买了东西
此时你可以通过办会员立减10元等方式记录下:
这50个人是男是女、买了什么东西、花了多少钱、几号来买的东西、手机号码、邮箱是多少等等信息,
而这些用户信息就是数据。
那这些看似没用的数据又有什么用呢?
三、数据到底有什么用
通过这些数据,我们就可以知道:
比如顾客小王、女、7月7号晚上消费了一管洗面奶、洗面奶的价格80元。
当我们了解这些数据之后,就可以做到精准的内容投放。
比如针对顾客小王,就可以在8月7号,估计她差不多用完一管洗面奶的时候,
向她推送一条关于店里优惠活动的短信:
“本店夏日巨惠:护手霜、洗面奶、沐浴露等洗护用品,全场满30-10,活动只限7月7日--7月10日哟。”
这样你的短信是不是对顾客小王非常具有吸引力?
如果你对50个小王都推送此类针对性内容呢?
是不是看到大把大把的钱向你走来?
说了这么多,数据的作用就是做用户分析,对不同的用户做针对性的营销活动。
此外,高流量大数据还有承接广告,资本估值,异业合作等作用。
四、重中之重,如何用高流量构筑数据库?
流量产生数据,数据转化为业绩。流量是敲开业绩大门的敲门砖。
那么,怎么样才可以把人都吸引到你店里来,产生高流量呢?
来看几个例子:
有一家化妆品企业,单月增粉47W,连带业绩200w+,它叫林清轩。
有一颗柚子,3个小时卖了10000颗,每颗40块,它叫丹霞谢柚。
有一家便利店,8个月引流到店200w+人次,它叫美宜佳。
不同地域、不同营销手段、不同行业,
但他们通通在互联网转型期顺利转型业绩升天,
并在后期持续享受高粉丝带来的红利。
- ?
mysql数据库和oracle数据库有什么区别,哪个好?
幻珊
展开
mysql数据库和oracle数据库有什么区别要学习mysql数据库,首先就要了解mysql数据库与其它数据库的区别,以及它的好处优点。今天就来说一说mysql数据库和oracle数据库的区别:
1、规模大小:Oracle是大型的数据库,Mysql是中小型的数据库。
2、安装空间:安装Oracle占3G左右,Mysql安装才占152M左右。使用的时候Oracle占用较大的计算机或服务器内存空间和性能。
3、市场占有率:Oracle市场占有率达40%,Mysql只有20%左右,其它占40%。
4、并发:Oracle支持大并发,大的访问量,是OLTP(联机事务处理)最好的工具,而Mysql不行。
5、价格:Mysql是开源免费,而Oracle价格非常高。
6、当然操作上也有很多不同之处(对Oracle操作不了解,不乱写)
7、相信看了上边的区别,你有了自己的选择。
原文地址:(自学php)http://phpbij/mysql-oracle.html
- ?
浅谈五大常用数据库
戛然
展开
数据库是什么呢?数据库(Database)就是按照数据结构来组织、存储和管理数据的建立在计算机存储设备上的仓库,随着科技进步时代发展出现了现在的云数据库,云数据库是指被优化或部署到一个虚拟计算环境中的数据库,可以实现按需付费、按需扩展、高可用性以及存储整合等优势。
常用数据库但是我们常用的数据一般分为五种:(一)、Access(二)SqlServer(三)MySQL(四)Oracle(五)SQLite,那么用户想要选择一个数据库,什么样的数据库才是最能满足用户自身需求的呢?重庆典名科技阿里云授权服务中心小编就为大家来具体分析分析这五款数据库。第一种:Access Access数据库,这款数据库是由微软发布的,是一款关联式数据序管理型系统的数据库,通常是被用来开发Web 应用程序这些应用程序都利用Asp技术在IIs上运行,但是由于Access 是小型的数据库,在很多的使用上都有着局限性,而且如果过多的数据库访问量还会造成数据库的性能极具下降。第二种:Mysql MySQL数据库,这款数据库是一款小型数据库管理系统的数据库,其开发公司是瑞典MySQLAB公司。MySQL被广泛地应用在Internet上的中小型网站中。由于其体积小、速度快、总体拥有成本低,尤其是开放源码这一特点,许多中小型网站为了降低网站总体拥有成本而选择了MySQL作为网站数据库。第三种:SqlServer SqlServer数据库,这款数据库的特点是真正的客户/服务器体系结构,并且出十是图形化的用户界面,使数据库管理方式更加直观和简单。它还提供了丰富的编程接口工具为用户进行程序设计提供了更大的选择余。在使用上也是非常广泛的。第四种:Oracle Oracle数据库,是一款比较典型的客户/服务器(CLIENT/SERVER)或B/S体系结构的数据库之一。ORACLE数据库是目前世界上使用最为广泛的数据库管理系统,作为一个通用的数据库系统,它具有完整的数据管理功能;作为一个关系数据库,它是一个完备关系的产品;作为分布式数据库它实现了分布式处理功能。但它的所有知识,只要在一种机型上学习了ORACLE知识,便能在各种类型的机器上使用它。第五种:SQLite SQLite数据库,这是一款轻型的数据库,是遵守ACID的关联式数据库管理系统,它的设计目标是嵌入式的,而且目前已经在很多嵌入式产品中使用了它,它占用资源非常的低,在嵌入式设备中,可能只需要几百K的内存就够了。这款数据库的运行处理速度比Mysql、PostgreSQL这两款都要快。文章来源于阿里云代理商023阿里云服务器023
- ?
神问答|到底什么叫大数据?
新瑶
展开
导语:大数据是“大数据”吗?
关于“到底什么叫大数据?”这个问题,小编整理了多个来源的用户回答,供大家更全面的了解。
名为“程序媛不是程序猿”的网友的回答也是很透彻:
大数据在像各个行业渗透,我们通过数据可以解决很多宏观上无法把控的事务,通过数据的收集处理分析可以得到更加科学性的得出一些用肉眼或者意识和思维无法得出的结论。例如,企业可以运用‘大数据’改善决策流程和业务成效的潜能;在医疗中,大数据剖析应用的计算能力可以让我们能够在几分钟内就可以解码整个DNA,而且让我们可以制订出最新的治疗方案,同时可以更好的去理解和预测疾病;在电商行业中,利用大数据进行精准营销,它根据客户的消费习惯提前生产资料、物流管理等,有利于精细社会大生产;在金融行业中,更多应用于交易,现在很多股权的交易都是利用大数据算法进行,这些算法现在越来越多的考虑了社交媒体和网站新闻来决定在未来几秒内是买出还是卖出。在传统领域大数据同样将发挥巨大作用:帮助农业根据环境气候土壤作物状况进行超精细化耕作;在工业生产领域全盘把握供需平衡,挖掘创新增长点;交通领域实现智能辅助乃至无人驾驶,堵车与事故将成为历史;能源产业将实现精确预测及产量实时调控。大数据不但单只是应用于企业和政府,在不久的未来在我们每个人身上会广泛应用。
名为“西线学院”的网友的回答也是很透彻:
大数据作为一个名词其实是晚于Hadoop的,更是晚于MapReduce。曾经有那么一段时间,流行的词语是MapReduce而不是大数据。当然再后来,大数据这个词就流行开了。但是大数据到底是什么,到今天应该还是稀里糊涂的一笔账。话说我做所谓的大数据都不知道多少年了,今天我还是搞不清楚大数据到底是什么。在维克托·迈尔-舍恩伯格及肯尼斯·库克耶编写的《大数据时代》中大数据指不用随机分析法这样捷径,而采用所有数据进行分析处理。我不知道大家是不是读懂了,反正我做大数据这么多年,这段定义我是读不懂。无非是数据和处理数据的工具以及从数据里面提取有用信息变成钱的过程。行为学家Dan Ariely关于大数据的名言,今天我们继续共享一下这段名言:大数据就像青少年性行为:大家都谈论,没有人真正知道怎么做,每个人都认为其他人都在做,所以每个人都声称自己在做。现在我们可以看到各行各业都在谈论大数据。现在大数据都上升到国家高度了。比如说政府办公要上大数据,一个三线城市,放两三台机器搞定的,这数据真的非常的大。如果我们撇开大数据这个概念不谈,自从有了数据以来,人类一直做的事情是什么?以前买Oracle的数据库IBM大型机Teradata的解决方案,贼贵。
来看看网名为“汽车人参考”的网友是怎么说的:
2017年我国汽车保有量已经达到2.05亿辆,而且预计在未来的销量还会增加,到2020年达到3000万辆。汽车的最终目的是为人们提供移动出行的解决方案,对于未来汽车的发展趋势,业界基本上有一个共识,未来的汽车会朝着“电动化,网联化,智能化,共享化”四个方向发展。基于汽车网联化的发展,形成了以用户为中心的生态链,如下图:围绕在车主周围,有不同层级的参与者。传统的主机厂,汽车制造商,硬件供应商,4S店,只是其中很一小部分。还有各种服务商,提供商,开发商,保险公司,传媒,甚至教育机构,也扮演着重要的角色。车联网能够将这些参与者全部连接起来,靠什么?汽车产业数据,驾驶行为数据,汽车感知数据,外部环境数据,还有最重要的人的社会数据,都储存在“庞大的汽车保有量”这个数据库中。围绕着车联网,以上的数据不断地更新,不断地累积,形成了庞大的数据库,可被收集,并进行分析和处理。通过数据处理,得到基于用户里程的分布,轨迹,行驶速度,超速违规事件一系列统计:由此,构建出一个精准的用户画像,做什么,爱好是什么,习惯什么等等。技术·原创·精致·有趣。
名为“先锋原创”的网友的回答也是很透彻:
大数据,这个名称简直是简单粗暴,顾名思义就是大量的数据,不,应该是海量的数据,是互联网发展的产物,互联网这么多年来,数据是呈指数爆炸式增长的。各行各业都有大数据,比如电子商务方面,买家的性别,年龄,联系方式,地址,购买过的产品,消费金额等都被记录下来,当有千万上亿条记录的时候,就是大数据,这些数据有什么用?有大用,宏观上可以给出预测,知道流行趋势,大家喜欢什么样的产品,从而指导生产;微观上可以给具体的消费者推送对应的商品,你对哪些感兴趣,你到处看到的都是这些东西。马云说的现在是data(数据)时代,新零售(消费指导生产)时代,实际上并没有夸张,只是好多人听不懂而已。
名为“草原独狼”的网友的回答也是很透彻:
简单来说,大数据就是大量的信息,尤其指存在于互联网和数字终端中的数字信息。大数据到底有多大?统计数据表明,在一天之中,互联网产生的全部内容可以刻满1.68 亿张DVD。IBM 公司的研究称,在整个人类文明所获得的全部数据中,有90% 是过去2 年内产生的。而到了2020 年,全世界所产生的数据规模将达到今天的44 倍。
- ?
什么叫大数据,通过几个例子简单介绍
残城殇
展开
“大数据”一词时下的热门程度无需赘言,这一两年来互联网相关的任何活动、会议必不可少“大数据”板块。刚刚结束的第13届“中国互联网大会”也专设了大数据论坛。
对于任何一个大数据的从业者或初接触者,或许都会有个共同的感触:大数据很有用!大数据该怎么用?
关于大数据的著作和文章铺天盖地,似乎也共同在传递一个信息:越来越多的行业、人士开始关注并实际探索大数据的应用,我们正在一起描绘着大数据巨大效用的蓝图,但在实践的路上,我们都还在起步阶段小步前行。
大数据时代,几个例子告诉你什么是大数据
工具类厂商蓄意炒作大数据,
以达到售卖产品的目的,
但导致的结果是很多人对大数据这一概念云里
雾里。实际上,大数据就发生在你我身边,虽然你看不到它,但它却时时影响着我们的生活。
现阶段,和大数据相关的企业有三种。一种是工具类公司,他们宣传得最卖力,并且把大数据吹
出了泡沫,原因是它们希望把自己的产品卖给企业;一种是依托于大数据从事咨询服务类的企业;还
有一种就是实实在拥有大数据的公司,它们和我们休戚相关,也就是下面的小故事所要阐述的内容。
第一个故事,百货公司知道女孩怀孕
美国的
Target
百货公司上线了一套客户分析工具,
可以对顾客的购买记录进行分析,
并向顾客进
行产品推荐。一次,他们根据一个女孩在
Target
连锁店中的购物记录,推断出这一女孩怀孕,然后开
始通过购物手册的形式向女孩推荐一系列孕妇产品。
这一作法让女孩的家长勃然大怒,
事实真相是女
孩隐瞒了怀孕消息。
点评:看似杂乱无章的购买清单,经过对比发现其中的规律和不符合常规的数据,往往能够得出
一些真实的结论。这就是大数据的应用。
第二个故事,搜狗热词里的商机
王建锋是某综合类网站的编辑,
基于访问量的考核是这个编辑每天都要面对的事情。
但在每年的
评比中,他都号称是
PV
王。原来他的秘密就是只做热点新闻。王建锋养成了看百度搜索风云榜和搜
狗热搜榜的习惯,所以,他会优先挑选热情榜上的新闻事件来编辑整理,关注的人自然多。
点评:搜狗拥有输入法,搜索引擎,那些在输入法和搜索引擎上反复出现的热词,就是搜狗热搜
榜的来源。通过对海量词汇的对比,找出哪些是网民关注的。这就是大数据的应用。
第三个故事,阿里云知道谁需要贷款
这是阿里人讲述的一个故事。每天,海量的交易和数据在阿里的平台上跑着,阿里通过对商户最
近
100
天的数据分析,就能知道哪些商户可能存在资金问题,此时的阿里贷款平台就有可能出马,同
潜在的贷款对象进行沟通。
点评:通常来说,数据比文字更真实,更能反映一个公司的正常运营情况。通过海量的分析得出
企业的经营情况,这就是大数据的应用。
第四个故事,中移动挽留流失客户
iPhone
进入中国后,
铁杆的移动用户王永铭加入了联通合约机大军。
由于合约机承担了大量通话
内容,王永铭将全球通换成了动感地带。三个月之后,王永铭接到了中国移动的
10086
电话,向他介
绍中移动的优惠资费活动。一位移动的工作人员称,运营商会保管用户数据,如果话费锐减,基本上
就是流失先兆。
点评:给数亿用户建立一个数据库,通过跟踪用户的话费消耗情况,运营商就能知道哪些用户在
流失。这就是大数据的应用。
第五个故事:工薪阶层如何省小钱
上汽通用五菱股份有限公司的肖伟,是个不折不扣的网购专家。区别于菜市场的费力砍价,肖伟
的作法简单多了,登陆各种比价网站,然后选择最便宜的正规店下单。
点评:比价网站通过海量的产品信息抓取,比如抓京东、天猫、易购的数据,然后将价格由低到
高进行排列,这也是大数据的应用。
第六个故事:公关公司的舆情监督
这是一个离职公关人的故事。
她参与和间接参与了很多危机公关事件,
比如雷士照明的创始人股
东之争,比如罗永浩砸西门子冰箱事件。她说,她每天的事情都是上网搜索事件的热度,然后决定下
一步的动作。
点评:实际上你的每一下搜索,都是基于海量数据进行的,这实际上也是大数据的一种应用。
第七个故事:商用社交开始决定百事可乐的营销计划
这年头,广告主越来越精,他们希望花的每一分钱都有所回报。面对五花八门的营销活动,到底
哪一种才是最合适的呢?百事可乐的作法很简单,它们购买了社交信息优化推广公司
SocialFlow
的服
务,对数据进行分析,从而知道何种营销活动的传播效果更好。
点评:
广告主越来越喜欢为类似
SocialFlow
的服务付费,
基于海量数据分析然后得出结论的企业
营销行为,也是大数据应用。
第
8
个故事:每天,我们借助大数据完成微信上的互动
田宇是一个
85
后小姑娘,每天她用微信来记录心情,并且和网友分享图片,此外还有各种语音
聊天。全国有数亿像田宇一样的人在使用微信,每天都有大数据在微信这个平台上跑着。
点评:可能你不知道,但你每天都在使用和大数据相关的工具。
第九个故事:大数据解救了每一个
“
地理白痴
”
李小茗是个
“
地理白痴
”
,所以他下载了一个高德地图。没有安装导航的原因,是因为这一产品付
费,且占据了超过
3G
的内存。只要花一点流量,李小茗就能在地图上查看自己所处的位置,以及周
围的建筑。
点评:虽然李小茗不知道什么是大数据,但每个在他地图屏幕上跳出来的坐标,实际上都是由大
数据堆成的。
- ?
常见数据库有哪些,它们之间有什么区别?
尘小春
展开
常见数据库有哪些,它们之间有什么区别关系型数据库是目前最受欢迎的数据库管理系统,技术比较成熟,常见的关系型数据库有mysql 、SQL Server、Oracle、Sybase、DB2等。
1、MySQL
MySQL是目前最受欢迎开源的SQL数据库管理系统,与其他的大型数据库Oracle、DB2、SQL Server等相比,MySQL虽然有它的不足之处,但丝毫也没有减少它受欢迎的程度。对于个人或中小型企业来说,MySQL的功能已经够用了, MySQ L又是开源软件,因此没有必要花大精力和大价钱去使用大型付费数据库管理系统了。
特点:
1、MySQL是开源免费的。
2、MySQL服务器是可靠的、易于使用的、快速的。
3、MySQL服务器工作在客户/服务器或嵌入系统中。
4、MySQL软件很多。
5、MySQL是一个关系数据库管理系统。
2、SQL Server
SQL Server是由微软公司开发的关系型数据库管理系统,一般用于Web上存储数据。SQL Server 提供了众多功能,如对XML和Internet标准的丰富支持,通过Web对数据轻松安全的访问,具有灵活的、安全的、和基于Web的应用程序管理等,及容易操作的操作界面,受到广大用户的喜爱。
3、Oracle
Oracle在数据库领域一直处于领先地位,由于有先进技术的不断更新,目前Oracle产品覆盖甚广,成为了世界上使用最广泛的关系数据系统之一。
完整的数据管理功能:
1、数据的大量性
2、数据的保存的持久性
4、数据的共享性
5、数据的可靠性
4、Sybase
Sybase美国Sybase公司研制的一种关系型数据库系统,是一种典型的UNIX或WindowsNT平台上客户机/服务器环境下的大型数据库系统。
特点:
1、客户/服务器体系结构
2、真正开放的
3、高性能的
5、DB2
DB2是美国IBM公司开发的一套关系型数据库管理系统,主要应用于大型应用系统,具有较好的可伸缩性。
文章来源:PHP笔记(http://phpbij/)
- ?
什么叫大数据分析
妙风衫
展开
大数据行业发展如火如荼,国家政策利好,互联网大佬纷纷在大数据行业布局,我们想让自己的职业生涯在一个朝阳行业发展,肯定又要学习相关技术,让自己与时俱进,但是难就难在大数据是一个新兴事物,目前我国大学的专业里面还鲜少有这个专业,国家刚批的大数据专业,全国目前35个高校,但是从17年开始招生,2021年才有第一批毕业生进入职场,在四年期间,是大数据行业发展的飞速时期,没有行业发展是等着人才进入的,而是需要要虚位以待、蓄势待发,所以在没有高等教育准备好的大数据教育,如何高效的学习大数据,如何快速的与行业发展想契合,那么需要我们成为第一个吃螃蟹的人,作为一个随着大数据行业成长的职业人,首先要知道大数据是个啥?
大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
那来帮大家分析下:如何高效的学习大数据。
经常有初学者会问,自己想往大数据方向发展,该学哪些技术,学习路线是什么样的,觉得大数据很火,就业很好,薪资很高……首先,如果你确定了想往这个方面发展,先考虑自己的过去从业经历、专业、兴趣是什么。计算机专业——操作系统、硬件、网络、服务器?软件专业——软件开发、编程、写代码?还是数学、统计学专业——对数据和数字特别感兴趣?
那么你能找师傅带吗?
但凡有这种想法的人,或多或少都会存有侥幸之心,或者叫做“天真,单纯”。希望不花一分钱,就能更快速的学到更优质,更实用的技能。
关于这一点,我只想反问一句你:“如果你是大师,你凭什么愿意带我?”
其实这就是想告诉你大数据的三个发展方向,平台搭建/优化/运维/监控、大数据开发/设计/架构、数据分析/挖掘。
先说一下大数据的4V特征:
数据量大,TB->PB
数据类型繁多,结构化、非结构化文本、日志、视频、图片、地理位置等;
商业价值高,但是这种价值需要在海量数据之上,通过数据分析与机器学习更快速的挖掘出来;
处理时效性高,海量数据的处理需求不再局限在离线计算当中。
现如今,正式为了应对大数据的这几个特点,开源的大数据框架越来越多,越来越强,先列举一些常见的:
文件存储:Hadoop HDFS、Tachyon、KFS
离线计算:Hadoop MapReduce、Spark
流式、实时计算:Storm、Spark Streaming、S4、Heron
K-V、NOSQL数据库:HBase、Redis、MongoDB
资源管理:YARN、Mesos
日志收集:Flume、Scribe、Logstash、Kibana
消息系统:Kafka、StormMQ、ZeroMQ、RabbitMQ
查询分析:Hive、Impala、Pig、Presto、Phoenix、SparkSQL、Drill、Flink、Kylin、Druid
分布式协调服务:Zookeeper
集群管理与监控:Ambari、Ganglia、Nagios、Cloudera Manager
数据挖掘、机器学习:Mahout、Spark MLLib
数据同步:Sqoop
任务调度:Oozie
······
第一步:初识Hadoop
1.1 学会百度与Google
不论遇到什么问题,先试试搜索并自己解决。
Google首选,翻不过去的,就用百度吧。
1.2 参考资料首选官方文档
特别是对于入门来说,官方文档永远是首选文档。
相信搞这块的大多是文化人,英文凑合就行,实在看不下去的,请参考第一步。
1.3 先让Hadoop跑起来
Hadoop可以算是大数据存储和计算的开山鼻祖,现在大多开源的大数据框架都依赖Hadoop或者与它能很好的兼容。
关于Hadoop,你至少需要搞清楚以下是什么:
· Hadoop 1.0、Hadoop 2.0
· MapReduce、HDFS
· NameNode、DataNode
· JobTracker、TaskTracker
· Yarn、ResourceManager、NodeManager
自己搭建Hadoop,请使用第一步和第二步,能让它跑起来就行。
建议先使用安装包命令行安装,不要使用管理工具安装。
另外:Hadoop1.0知道它就行了,现在都用Hadoop 2.0.
1.4 尝试使用Hadoop
· HDFS目录操作命令;
· 上传、下载文件命令;
· 提交运行MapReduce示例程序;
· 打开Hadoop WEB界面,查看Job运行状态,查看Job运行日志。
· 知道Hadoop的系统日志在哪里。
1.5了解它们的原理
MapReduce:如何分而治之;
HDFS:数据到底在哪里,什么是副本;
Yarn到底是什么,它能干什么;
NameNode到底在干些什么;
ResourceManager到底在干些什么;
1.6 自己写一个MapReduce程序
仿照WordCount例子,自己写一个(照抄也行)WordCount程序,
打包并提交到Hadoop运行。
不会Java的话,Shell、Python都可以,有个东西叫Hadoop Streaming。
如果能认真完成了以上几步,恭喜你,你的一只脚已经进来了。
第二步:更高效的WordCount
2.1 学点SQL吧
如果不懂数据库的童鞋先学习使用SQL句。
2.2 SQL版WordCount
在1.6中,你写(或者抄)的WordCount一共有几行代码?
如果用SQL的话:
SELECT word,COUNT(1) FROM wordcount GROUP BY word;
这便是SQL的魅力,编程需要几十行,甚至上百行代码,SQL一句就搞定;使用SQL处理分析Hadoop上的数据,方便、高效、易上手、更是趋势。不论是离线计算还是实时计算,越来越多的大数据处理框架都在积极提供SQL接口。
2.3 安装配置Hive
Hive算是数据仓库工具,安装不难,网上有很多教程,配置完成后,可以正常进入Hive命令行。
2.4 试试使用Hive
尝试在Hive中创建wordcount表,并运行2.2中的SQL语句。在Hadoop WEB界面中找到刚才运行的SQL任务。看SQL查询结果是否和1.4中MapReduce中的结果一致。
明明写的是SQL,为什么Hadoop WEB界面中看到的是MapReduce任务?
2.5 学会Hive的基本命令
创建、删除表;加载数据到表;下载Hive表的数据;并学习更多关于Hive的语法和命令。
0和Hadoop2.0的区别
MapReduce的原理(还是那个经典的题目,一个10G大小的文件,给定1G大小的内存,如何使用Java程序统计出现次数最多的10个单词及次数);
HDFS读写数据的流程;向HDFS中PUT数据;从HDFS中下载数据;
自己会写简单的MapReduce程序,运行出现问题,知道在哪里查看日志;
会写简单的SELECT、WHERE、GROUP BY等SQL语句;
Hive SQL转换成MapReduce的大致流程;
Hive中常见的语句:创建表、删除表、往表中加载数据、分区、将表中数据下载到本地;
从上面的学习,你已经了解到,HDFS是Hadoop提供的分布式存储框架,它可以用来存储海量数据,MapReduce是Hadoop提供的分布式计算框架,它可以用来统计和分析HDFS上的海量数据,而Hive则是SQL On Hadoop,Hive提供了SQL接口,开发人员只需要编写简单易上手的SQL语句,Hive负责把SQL翻译成MapReduce,提交运行。
第三步:把别处的数据搞到Hadoop上
此处也可以叫做数据采集,把各个数据源的数据采集到Hadoop上。
3.1 HDFS PUT命令
put命令在实际环境中也比较常用,通常配合shell、python等脚本语言来使用。建议需熟练掌握。
3.2 HDFS API
HDFS提供了写数据的API,自己用编程语言将数据写入HDFS,put命令本身也是使用API。
实际环境中一般自己较少编写程序使用API来写数据到HDFS,通常都是使用其他框架封装好的方法。比如:Hive中的INSERT语句,Spark中的saveAsTextfile等。
可以尝试了解原理,试着写几个Demo。
3.3 Sqoop
Sqoop是一个主要用于Hadoop/Hive与传统关系型数据库Oracle/MySQL/SQLServer等之间进行数据交换的开源框架。
就像Hive把SQL翻译成MapReduce一样,Sqoop把你指定的参数翻译成MapReduce,提交到Hadoop运行,完成Hadoop与其他数据库之间的数据交换。
自己下载和配置Sqoop(建议先使用Sqoop1,Sqoop2比较复杂)。
了解Sqoop常用的配置参数和方法。
使用Sqoop完成从MySQL同步数据到HDFS;
使用Sqoop完成从MySQL同步数据到Hive表;
PS:如果后续选型确定使用Sqoop作为数据交换工具,那么建议熟练掌握,否则,了解和会用Demo即可。
3.4 Flume
Flume是一个分布式的海量日志采集和传输框架,因为“采集和传输框架”,所以它并不适合关系型数据库的数据采集和传输。Flume可以实时的从网络协议、消息系统、文件系统采集日志,并传输到HDFS上。因此,如果你的业务有这些数据源的数据,并且需要实时的采集,那么就应该考虑使用Flume。
下载和配置Flume。使用Flume监控一个不断追加数据的文件,并将数据传输到HDFS;
PS:Flume的配置和使用较为复杂,如果你没有足够的兴趣和耐心,可以先跳过Flume。
3.5 阿里开源的DataX
之所以介绍这个,是因为以前某公司客户目前使用的Hadoop与关系型数据库数据交换的工具,就是之前基于DataX开发的,个人感觉非常好用。现在DataX已经是3.0版本,支持很多数据源。你也可以在其之上做二次开发。
PS:有兴趣的可以研究和使用一下,对比一下它与Sqoop。
至此,你的“大数据平台”应该是这样的:
第四步:把Hadoop上的数据搞到别处去
前面介绍了如何把数据源的数据采集到Hadoop上,数据到Hadoop上之后,便可以使用Hive和MapReduce进行分析了。那么接下来的问题是,分析完的结果如何从Hadoop上同步到其他系统和应用中去呢?
其实此处的方法和第三步基本一致的。
4.1 HDFS GET命令
把HDFS上的文件GET到本地。需要熟练掌握。
4.2 HDFS API
原理同3.2。
4.3 Sqoop
原理同3.3。
使用Sqoop完成将HDFS上的文件同步到MySQL;
使用Sqoop完成将Hive表中的数据同步到MySQL;
4.4 DataX
原理同3.4
此时,“你的大数据平台”应该是这样的:
走完第三步和第四步的流程,那么你应该已经具备以下技能和知识点:
· 知道如何把已有的数据采集到HDFS上,包括离线采集和实时采集;
· 知道sqoop(或者还有DataX)是HDFS和其他数据源之间的数据交换工具;
· 知道flume可以用作实时的日志采集;
至此,对于大数据平台,应该已经掌握如何搭建Hadoop集群,把数据采集到Hadoop上,使用Hive和MapReduce来分析数据,把分析结果同步到其他数据源。
接下来的问题就是,Hive使用的越来越多,你会发现很多不愉快的地方,特别是速度慢,
大多情况下,明明我的数据量很小,它都要申请资源,启动MapReduce来执行。
第五步:快一点吧,我的SQL
其实大家都已经发现Hive后台使用MapReduce作为执行引擎,实在是有点慢。因此SQL On Hadoop的框架越来越多,按我的了解,最常用的按照流行度依次为SparkSQL、Impala和Presto.这三种框架基于半内存或者全内存,提供了SQL接口来快速查询分析Hadoop上的数据。
目前我们的方案使用的是SparkSQL,至于为什么用SparkSQL,原因大概如下:
· 使用Spark还做了其他事情,不想引入过多的框架;
· Impala对内存的需求太大,没有过多资源部署;
5.1 关于Spark和SparkSQL
什么是Spark,什么是SparkSQL。
Spark有的核心概念及名词解释。
SparkSQL和Spark是什么关系,SparkSQL和Hive是什么关系。
5.2 如何部署和运行SparkSQL
Spark有哪些部署模式?
如何在Yarn上运行SparkSQL?
使用SparkSQL查询Hive中的表。
PS:Spark不是一门短时间内就能掌握的技术,因此建议在了解了Spark之后,可以先从SparkSQL入手,循序渐进。
第六步:一夫多妻制
其实我想说的是数据的一次采集、多次消费。
在实际业务场景下,特别是对于一些监控日志,想即时的从日志中了解一些指标(关于实时计算,后面步节会有介绍),这时候,从HDFS上分析就太慢了,尽管是通过Flume采集的,但Flume也不能间隔很短就往HDFS上滚动文件,这样会导致小文件特别多。
为了满足数据的一次采集、多次消费的需求,这里要说的便是Kafka。
6.1 关于Kafka
Kafka是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模的网站中的所有动作流数据。这种动作(网页浏览,搜索和其他用户的行动)是在现代网络上的许多社会功能的一个关键因素。这些数据通常是由于吞吐量的要求而通过处理日志和日志聚合来解决。
6.2 如何部署和使用Kafka
使用单机部署Kafka,并成功运行自带的生产者和消费者例子。
使用Java程序自己编写并运行生产者和消费者程序。
Flume和Kafka的集成,使用Flume监控日志,并将日志数据实时发送至Kafka。
至此,“大数据平台”应该扩充成这样:
这时,使用Flume采集的数据,不是直接到HDFS上,而是先到Kafka,Kafka中的数据可以由多个消费者同时消费,其中一个消费者,就是将数据同步到HDFS。
总结:
为什么Spark比MapReduce快。
使用SparkSQL代替Hive,更快的运行SQL。
使用Kafka完成数据的一次收集,多次消费架构。
自己可以写程序完成Kafka的生产者和消费者。
前面的学习已经掌握了大数据平台中的数据采集、数据存储和计算、数据交换等大部分技能,而这其中的每一步,都需要一个任务(程序)来完成,各个任务...
- ?
都说大数据,你知道到底什么是大数据吗?
海琳
展开
俺黑君够黑,慎关注!
究竟什么是大数据?如何对大数据进行定义?大数据有哪些特征?了解了这些才能更好的知道自己学习是怎样的一门技术,以及它的前景如何。本文达妹就带大家一起了解大数据。
DT时代,人人言必称大数据,所有的新系统几乎都是基于大数据,有人认为用了MongoDB就是大数据,也有人用了Hadoop就是大数据,或者认为数据量大就是大数据。
更有甚者,笔者看到一篇新闻报道,说某企业成功实施大数据项目,结果只是SQL-Server集群……天呐,这可是上世纪的技术了!
说了这么多到底什么是大数据呢,其实大数据并没有教科书式的明确定义,但是却有比较公认的特性描述,符合这些特性的就可以称作大数据,即大数据的4个V。
第一个V——高容量
这个最好理解,数据量一定要大,才好意思称自己为大数据嘛。大到什么程度呢?依目前行情来看,至少也要到TB级,很多案例都是PB甚至更高。但如果是GB级,非说自己是大数据也不是不可以,就是有点无颜见江东父老啊……
第二个V——多样化
这个很关键了!是区别于以往海量数据挖掘的最主要特征。它有两层含义,一是数据来源多样化,系统数据、设备日志、传感器、文件系统等等来源。二是数据结构多样化,这是核心特征!要包含结构化数据、非结构数据(包括所谓半结构化数据)。
总结起来就是,多源异构。这就是为什么有人认为使用NoSQL数据库(如MongoDB)就是大数据了,因为满足了多样化的特征,但其实还不够。
第三个V——高速
即时效性,基本上至少也要达到亿级数据一秒查询,做的比较好的可以达到千亿级数据一秒查询。这个特征几乎决定了传统技术架构无法满足要求,因此Hadoop架构的出现催化了大数据的发展,也是有人认为Hadoop就是大数据的原因。
第四个V——价值
这个很好理解,数据一定要有价值、而后才能产生价值。就好比存商品的叫才能仓库,存垃圾的叫垃圾填满坑一样。没价值的数据就像一个垃圾填满坑,这也是为什么数据治理在大数据实施中非常重要的原因之一。
最后,也是最重要的,以上4个V是逻辑与的关系,即需同时、注意是同时满足上述四个特征,就可以放心的说自己是大数据了!
文版权归原作者所有。转载文章仅为传播更多信息之目的,如有侵权请与我们联系,我们将及时处理。
- ?
到底什么叫大数据?
Xiao
展开
大数据到底是什么,到今天应该还是稀里糊涂的一笔账。
百度百科是这样定义的:
大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。在维克托·迈尔-舍恩伯格及肯尼斯·库克耶编写的《大数据时代》中大数据指不用随机分析法(抽样调查)这样捷径,而采用所有数据进行分析处理。大数据的5V特点(IBM提出):Volume(大量)、Velocity(高速)、Variety(多样)、Value(低价值密度)、Veracity(真实性)。
这个定义最大的特点,和很多红皮书白皮书黑皮书之类的差不多,就是装逼。说白了,不说人话。反正我是没听明白大数据和小数据有什么本质的区别。无非是数据和处理数据的工具以及从数据里面提取有用信息变成钱的过程。曾经我们在做这些事情,现在我们在做这些事情,将来我们也会继续做这些事情。
以前几年国内大数据概念炒上天的情况来看,其实真的谁也不知道大数据是什么,谁也不清楚大数据怎么玩,但是各行各业忽如一夜春风来,冒出无数个大数据公司大数据专家。
现在我们可以看到各行各业都在谈论大数据。从政府到企业,从互联网行业到传统行业,随便写个App背后没有大数据都不能叫好App。现在大数据都上升到国家高度了。比如说政府办公要上大数据,一个三线城市,放两三台机器搞定的,这数据真的非常的大。
如果我们撇开大数据这个概念不谈,自从有了数据以来,人类一直做的事情是什么?这个其实也是今天大数据的背景下大家都在做的事情,概括起来讲:分析数据,产生有价值的信息。
这个事情20年前在做10年前也在做,今天还是在做,其实没什么变化。 那么什么东西发生了变化呢?最大的一个是工具的能力发生了变化。 现在我们可以几千几万台机器一起协同做计算了。其次是性价比的变化。以前买Oracle的数据库IBM大型机Teradata的解决方案,贼贵。现在开源软件一搭,弄些PC机就好。糙一点无所谓,所谓便宜才能普及。
然而本质来讲,大家做的事情并无改变。所以我们不需要去纠结于大数据到底是什么,而是要看清楚具体业务问题是什么,有什么合适的工具去解决。这些工具可能是新的也可能是旧的。我想大数据的所谓发展无非就是工具的进步使得大家能够更有能力去在限定的时间内处理更多的数据,获得更有效的信息。
关注佳源信息,关注更多资讯。
【版权与免责声明】如发现内容存在版权问题,烦请提供相关信息发邮件至jy@jiayuaninfo,我们将及时沟通与处理。
- ?
告诉你什么叫“大数据”,这么说你就懂了
卷毛猪
展开
人工智能,互联网+,VR,量子科技,大数据,这是在科技领域最火的几个名词了。
这里首先先聊聊大数据。
听名字就大气,大数据就是很多的数据,每个人都有一个单独的“大数据库”,这个“大数据库”就存着你的爱好了,性格了,脾气了,身价了,甚至性取向了。
互联网时代,你的这些“大数据库”对于某些高科技公司基本就是公开的,它们有这个世界上几乎每个人的数据库档案。这些高科技公司可以通过对你的“大数据库”进行分析,分析你是一个什么样的人,分析你最近缺什么了,分析你最近想买什么了,分析你最近是不是想什么变态的事了。
分析出来之后,就通过大概率事件,主动向你推荐一些你下一步想要进行的活动。
比如,你再虚拟购物车里存入了充气娃娃了,安全套了等等,它就会认为你即将可能买这方面的东西,于是就根据你选取商品的品质、价格等,主动给你推荐一个可能是你心里最为理想的店铺。
这就是大数据最基础的应用。
大数据不仅仅针对每个人,而是针对这个世界的万事万物。
想想吧,如果一个人的“大数据库”有1亿的数据量,那么这个世界的万事万物将会有多么大的数据。
你用微信来记录心情,并且和网友分享图片,此外还有各种语音聊天。全国有数亿像你一样的人在使用微信,每天都有大数据在微信这个平台上跑着。
你再百度地图定位你的位置,搜寻周围的建筑,每个在百度地图上跳出来的坐标,实际上都是由大数据堆成的。
大数据时代,也得聊聊量子科技,最近中国研发的光量子计算机,就是实现大数据最有效快捷的方式,因为一台量子计算机的运算速度足以秒杀目前世界上所有最先进的计算机的运算速度之和。
也就是说量子计算机用0.0000000..............1秒的时间就能把你分析的透亮。
有点像《鹰眼》里的超级计算机,无论你在世界的哪个角落,我都可以立马找到你,并且用我的牛逼到你无法想象的运算速度,运算并分析出我是不是要毁灭你?用哪种方式毁灭你最便捷?
这就是人工智能发展到失控的时代了!
什么叫大数据库
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并