- ?
大数据时代的数据有多大?
石梦桃
展开
在孟菲斯的郊区,人与各种机器正在来回穿梭,搬运货物。机械臂从传送带上抓取一捆捆塑料薄膜收缩包装的货物,然后由叉车搬到卡车上运往远方。工人们的血肉之躯在力量上比不上各类机械,因此分配给他们的任务是监控货物的流向,驾驶那些叉车与卡车,利用条形码扫描器与发射无线电波的芯片追踪货物上的识别标志。在井然有序的忙碌中,人与机器演奏出一首和谐的工业交响曲。
把这幅略显忙乱但是效率极高的画面呈现在我们眼前的是麦克森(McKesson),一家完成了全美约1/3的药品分销工作的大型公司。公司的各类建筑占地超过8个橄榄球场的面积,形成了麦克森全美分销网络的中枢,各类商品从这里被配送到包括社区药店与沃尔玛超市在内的26 000个客户那里。货物主要由药品构成,每天需要配送大约2.4亿片。药品分销的工作量极大,但是利润空间却非常小。因此,效率是麦克森几十年来孜孜不倦追求的目标。
但是最近几年,麦克森在追求效率的道路上取得了一个令人瞩目的突破,将任意时间的分销网络库存减少了10亿美元。之所以能取得这一成绩,得益于产品、位置及运输数据给麦克森的启示。麦克森利用各种扫描器、传感器收集这些数据,然后运用智能软件从数据中挖掘各种省时减耗的潜在机会。这种通过技术加强经营的观念是一个重大突破,麦克森公司的高级主管唐纳德·沃克尔形容它可以“让一切潜在机会无所遁形”。
镜头切换到亚特兰大。我来到埃默里大学医院的5楼,站在一间玻璃围封的重症监护室外。病房中摆满了密密麻麻、林林总总的医学计算电子设备,包括呼吸机、透析机、输送抗生素与镇痛剂的输液器,以及监控心率、呼吸、血压、血氧饱和度等重要指标的器具。几乎每台机器都配备了电脑平面显示器,电子元件不停地发出“哔哔”的声音和各种警报声。我数了数,大的电脑平面显示器加上跟智能手机差不多的小尺寸的平面显示器,一共有12台。
通常,一个有20张床的重症监护室每秒钟估计可以生成16万个数据点。埃默里大学医院的研究表明,医生与护士每天都要根据这些数据,针对每位病人迅速做出约100个决定。换言之,一个重症监护室全年要做出930多万个跟护理有关的决定,因此,做出错误决定的概率非常高,必须采取某些措施帮助他们摆脱这种困境。目前,有多家医学研究中心正在致力于研究如何利用数据改进成人及新生儿重症监护室的关键性护理工作,埃默里大学医院就是其中的一家。这家医院利用监控病人病情变化的医学设备得到相关数据流,通过软件加以分析,以捕捉代表病情恶化的预警信号。
计算机与软件善于消化大量数据,并从中发现极不明显的规律,在这方面它们的效率高于人类。在埃默里大学医院,负责此项工作的是蒂莫西·布克曼博士。布克曼是一名外科医生、科学家,还是一名经验丰富的飞行员,因此,他用飞行来打比方,向我们解释他的研究目标。如果飞机偏离航向(用布克曼的话说是“偏离轨道”),飞机上的全球定位系统(GPS)位置数据就会转变成图像,显示在空中交通管制员的屏幕上,这项工作在飞机坠毁之前就早已完成。布克曼希望医学上也能建立同样的预警系统,在病人“坠毁”之前,及时捕捉重要指征的某种规律偏离医学轨道的信号。布克曼说:“这就是大数据的意义所在。”
- ?
你了解传统数据和大数据吗?
郦不尤
展开
在我们日益进步的科技生活之中,我们每天都在运用着科技的产物,方便着我们的生活。他们在我们生活中无处不在,可能很多地方你们都没有意识到,但貌似我们现在的生活离不开它。科技的产物。标志着这个时代的进步,也标志着这个时代处在一个什么状态。它不仅丰富了我们的物质生活,对于我们的精神生活也提升了不少。我们的生活离不开科技,我们的时代离不开他的进步,要发展到发达的国家,科技发展应该被重视的一个项目。因此我们国家在尝试着不断创新,鼓励创新,因为创新中永远会有新的东西产生。让所有的不可能变成可能。让所有开始只能在神话里出现的东西变成了现实。我想这就是科技的作用。
这一段时间大数据这个名词显得那么的引人注意,但大数据到底是个什么东西呢?小编也只是有所了解而已。经过了几番查询,大概弄懂了它的基本意思。大数据的基本概念是:大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。总的来说,大数据就是那些用软件和人工一些方法无法统计出来的一些数据的一个总集。而用大数据的方法处理,可以将这些东西一一分析处理出来。觉得小编说了那么多屁话。还是没有说出大数据是什么东西?这可能是一个只可意会不可言传的东西。在教科书上也没有他十分明确的一个定义。但相比之下,他有四个比较重要的特点,人们因此一直在利用了他。因为大数据也没有一个明确的规定。相比之下,只要符合这四个特性,我们就可以称它为大数据。
第一个高容量,敢称为大数据,那么它的大就得有一定的级别了,大容量是它的一个特点。基本上都是TB来开头的,现在很多基本上都是PB级别的,要是用GB去称的话,可能不怎么好意思叫做大数据了,若是硬要说它是的话,那小编也只能笑一下,不说话。因此,大数据离不开那个大,大容量是他的特点之一。
第二个多样化大数据来自很多方面,他要的数据和信息含量是非常庞大的分析的大数据是一般软件和app所不能代替的。要分析的东西量很大。而且不是单一的量。因此他必须有多样化的一个特点。这样才能将数据处理出来,并且完整的整理好。
第三个便是他的高速运行了,既然他的许多方面能高于传统的统计。那么自然有着它的优点。他不仅仅能统计出许多人类想都不敢想了一些庞大数据。人们接受它的另一个特点就是高速。大数据模式里面的高速运算和高速统计的方法使她显得格外的厉害。既然被称作高速,那么它的速度有多快呢?人类的欲望是不止不休的。要满足现在人们的要求那肯定质量不能低了。速度必须达到一秒能处理上亿个数据的速度。意思就是,上亿的东西一秒就能查出来。速度要是再快一点,上千亿的数据也只需要一秒钟就能查询出来。这就是它的高速。
第四个它的价值。既然能被人接受还被那么多人广泛的运用,那么它的价值肯定少不了。就好比一个仓库,只有在里面存了货才能称作仓库。大数据也是这样他们能很清楚的分类。将许多有用的和没用的东西都明确的分出类别来,这个能力也是相当厉害了。若是能将许多有用的有价值的东西全部理出来,那可是一笔不小的功劳。在上亿上乃至上千亿的数据里找到有价值的东西。而且只需要一秒。不知道网友们觉得大数据是不是个十分有用的东西呢?
我想只有具备了以上四个条件的基本特征,才好意思称为大数据吧。他的能力是有目共睹的。小编就将它形象地理解一下。生活中许多地方都运用了大数据这个功能只是大家不知道而已。就像我们身边的淘宝一样马云的团队十分会利用大数据这个东西。当我们想买东西的时候,浏览了一下淘宝网页。我大数据就会开始分析你想要的东西什么类别。在之后你每次登录淘宝之前。他们都会有推荐,推荐的都是你曾经想要的一些东西和你看过的一些东西,很多人都在疑惑他怎么知道我会想要这个,他是怎么做到的?这个就是大数据的功劳,这个对于他们来说大数据宝贝。不光是阿里巴巴。其他许多新闻网页都是这样。就这样抓住了消费,怎么能爱好,就算消费者在不想找,它也会很轻松的把你想要的东西推送到你面前来。就对许多抵不住诱惑的消费者来说又是一波消费了。可谓是大数据对商家们可是有大用处。
这就是科技的产物。数据分析是现在时代的一个走向。若是用好了他,对人类的贡献将是功不可没。好了,小编今天的故事就到这里了,想要获得更多资讯,记得关注小编哦
- ?
大数据是什么(续)
Yun
展开
专业知识,不容错过
━━━━━━
背景
从亚马逊到Facebook,再到谷歌和微软,全球最顶尖、最有影响力的技术公司都将目光转向了人工智能(AI)。本文将介绍AI、机器学习以及深度学习,其中着重介绍深度学习是如何工作的,以及深度学习为何直到今天才开始成熟,最后,介绍开源的深度学习框架。
“人工智能(AI)”这个词由达特茅斯大学助理教授John McCarthy在1956年提出,作为一种统称,AI可用于指代可体现出智能行为的硬件或软件。按照McCarthy教授的说法,这是一种“可以制造出智能的机器,尤其是智能的计算机程序的科学和工程。”
机器学习
机器学习(ML)是AI的一个子集。所有机器学习都是AI,但并非所有AI都是机器学习。当今人们对AI的兴趣主要体现在对机器学习技术的关注中,使得这一技术快速得到显著进步。
机器学习算法可通过训练进行学习。最开始,可以为算法提供输出结果已知的样本数据,并将实际结果与预测结果的差异进行对比,随后对所输出内容的权重进行调优,借此改善预测结果的精确度,知道最终获得优化。因此机器学习算法的界定特征就在于通过经验结果进行改善所取得的质量。我们提供的数据越多就能创建出越好的预测引擎。
目前机器学习方法已经超过15种,每种都可以使用不同的算法结构通过收到的数据对预测进行优化。作为其中的一种方法,“深度学习”在很多全新领域实现了突破性的结果,下文将详细介绍。算法其实还有很多,其他算法虽然不像深度学习那样获得了最为广泛的关注,但也有自己的价值,因为可以使用与更广泛的用例中。除了深度学习,其它最实用的机器学习算法还包括:“Random forests(随机深林)”,通过穿件大量决策树对预测进行优化;“Bayesian networks(贝叶斯网络)”,使用基于概率的方法分析变量和变量之间的关系;“支持向量机(Vector machine)”,可通过多种分类样本并创建模型将新的输入内容分配给某一类。每种方法各有利弊,并能混合使用。针对特定问题选择哪种算法,主要取决于各种因素,包括可用数据集的本质特征等。实际上开发者通常趋向于通过多种实验确定最佳算法。
机器学习技术的用例因具体需求和想象力而各不相同。只要有合适的数据,我们就可以为无数用途构建所需的算法,例如:根据购买记录推荐顾客可能愿意购买的产品,预测汽车组装流水线的机器手什么时候会故障,预测邮件地址是否输入有误,估算某笔信用卡存在欺诈情况的可能性等。
深度学习
深度学习(Deep Learning)的概念由加拿大多伦多大学教授Geoffrey Hinton等人于2006年提出,它本质上是一种神经网络算法,其原理是通过模拟人脑进行分析学习,算法训练时可以不用人工干预,因此它也属于一种无监督机器学习算法。从深度学习的概念提出至今,已历经十年多时间,期间,无论是国际互联网巨头Google、微软、百度,还是全世界各大学术研究机构,都投入了巨大的人力、财力用于理论和工业级应用的探索,并在字符识别(OCR)、图像分类、语音识别、无人自动驾驭、自然语言处理等众多领域内取得了突破性的进展,极大地推动了人工智能(AI)的发展。
2012年斯坦福大学的Andrew Ng和Jeff Dean教授共同主导的Google Brain项目通过使用深度学习让系统能够自动学习并识别猫,这项目研究引起了学术界何工业界极大的轰动,激起了全世界范围研究深度学习的热潮。2016年3月,Google旗下DeepMind公司开发的AlphaGo以4:1的总比分战胜了世界围棋冠军、职业九段选手李世石,这让人们对人工智能(AI)的认知越到一个新的阶段。
深度学习在众多领域的成功应用,离不开学术界及工业界对该技术的开放态度,在深度学习发展初始,相关代码就被开源,使得深度学习“飞入寻常百姓家”,大大降低了学术界研究及工业界使用的门槛。本节对当前主流的开源深度学习框架发展趋势进行分析。
深度学习是如何工作的
鉴于其重要性,我们有必要对深度学习的工作原理进行介绍。深度学习需要使用人造“神经网络”,这是一种相互连接的“神经元”的集合。人造神经元可以接受一种或多种输入。神经元会针对输入结果执行数学运算,并产生可输出的结果。输出的结果取决于每类输入的“权重”以及神经元的“输入-输出函数”配置。输入-输出函数各异。神经元可以是:1.一种线性单位,输出结果与输入总权重成比例;2.一种阈值单位,输出结果为两个级别中的一种,取决于总输入是否高于某一特定值;3. 一种S型代为,输出结果频繁变化,而不像输入那样呈现线性变化的态势。
多个神经元相互连接组成神经网络,一个神经元输出可以成为另一个神经元的输入,如下图所示。
神经网络可通过组织整理呈现为多层神经元(这也是“深度”这个词的由来)。其中“输入层”负责接收由网络处理的信息,例如一组图片。“输出层”负责提供结果。输入和输出层之间还有“隐藏层”,大部分活动均在这一层中发生。通常来说,神经网络上每一层神经元的输出内容均可成为下一层神经元的输入内容之一。如下图所示。
以图像识别算法举例说明。假设要识别图片中的人脸。将数据装入神经网络后,第一层负责识别局部对比模式,例如图片边缘,这是一种底层特征。随着图片在整个网络中流动,逐渐提取出高层特征,例如从边缘到鼻子,再从鼻子到面孔,如下图所示。
在输出层面,根据训练效果,神经网络会就图片是每种特定类型的可能性给出概率(人脸:97%;气球:1%;树叶:2%)。
通常来说,神经网络的训练过程需要大量已经进行过分类的样本。随后算法会通过检测出的错误和神经元之间的连接权重进行调整,借此改善效果。优化过程的重复性极高,训练完成后即可部署系统并对未分类图片进行评估。
上文描述的是一种很简单的神经网络,实际上神经网络的结构可能各异,并且大部分都非常复杂。各种常见变体包括:同层神经元之间的额不同连接,每层神经元数量的变化,以及将神经元的输出结果流向前一层网络(递归神经网络)的连接。
神经网络的设计和完善需要投入相当多的技能。例如针对特定应用调整网络结构,提供事宜的训练数据集,根据进展调整网络结构,以及多种方法的混合使用等。
为何深度学习直到今天才开始成熟
由于新算法的陆续完善,所需要数据的大量丰富,用于训练的硬件日益强大,以及云服务对开发者的逐渐催化,AI的实际应用效果在近些年有了大幅改进。
1. 算法的改进
虽然深度学习算不上一种新技术,早在1965年就有人提出了第一个实际有效的多层神经网络规范,但最近十年深度学习算法的革新催生了截然不同的结果。
识别图像中物体的能力随着卷积神经网络(CNN,Convolutional Neural Network)的发展产生了突飞猛进的提高。受到动物视觉脑皮层工作原理启发设计而来的CNN中,神经网络中的每一层均可从当判断特定模式是否存在所用的刷选器。2015年,微软基于CNN的计算机视觉系统在对图片中物体进行识别方面实现了比人类更高的准确度(计算机:95.1%;人类:94.9%)。
与此同时,随着递归神经网络(RNN,Recurrent Neural Network)的诞生,语音和手写识别方面也取得飞速进展。不同于卷积神经网络仅向下馈送的运作方式,RNN可通过反馈连接让数据呈环路流动。RNN还出现了一种更强大的新类型:长短期记忆(LSTM,Long Short Term Memory)模型。在额外的连接和内存细胞的帮助下,RNN可以记住自己在数前部操作之前看到的数据,并使用这些数据对后续需要关注的内容进行解释:这一特性对语音识别产生了巨大的帮助,因为对下一个词的理解通常会受到之前所处理词汇的影像。从2012年开始,谷歌就在使用LSTM驱动Android中的语音识别系统。
2. 专用硬件
图像处理器(GPU, GraphicsProcessing Unit)是一种特殊设计的电子电路,可大幅缩短为深度学习训练神经网路所需的时间。
现代化的GPU最初诞生于二十世纪九十年代末,当时主要是为了3D游戏和3D开发应用程序进行加速。在3D环境中平移和缩放镜头需要重复用到一种名为矩阵计算的数据运算过程,串行架构的微处理器,包括当今大部分计算机所用的CPU很不适合用来处理此类任务。为了更高效地执行举证计算,GPU通常会使用大规模并行架构来制造(Nvidia M40包含3072个内核)。
神经网络的训练会设计大量矩阵计算。因此人们发现原本针对3D游戏设计的GPU其实很适合用来对深度学习过程加速。这样做获得了巨大的收益:一颗GPU即可让神经网络的训练时间缩短5倍,针对一些较大规模的问题甚至可实现10倍甚至更高的加速。在配合针对深度学习框架进行优化的软件开发工具包之后,甚至还可以进一步加快训练速度。
3. 海量的数据
深度学习所用的神经网络通常需要用大量的数据集进行训练,样本数量从数千起步,甚至可高达数百万。好在数据的创建速度和可用型也经历了指数形式的增长。今天,随着我们大数据时代,人类平均每天会生成2.2EB(23亿GB)数据,全球数据总量中有90%是过去24个月创建的。
4. 云服务
开发者对机器学习的应用还受到云端机器学习基础架构和业界领先云供应商所提供服务的推动。谷歌、亚马逊、微软,以及IBM均提供了云端基础架构,这也是的机器学习能力的开发成本和难度大幅降低。
此外他们还提供了正在飞速发张的一系列云端机器学习服务,开发者可将其(从图像识别语音翻译)直接用于自己的应用程序内。谷歌的机器学习服务针对下列领域提供了易于访问的服务:视觉(物体识别、显性内容检测、人脸检测、图像情绪分析);语音(语音识别和语音到文字转换)文字分析(实体识别、情绪分析、语言检测和翻译);以及职员工作检索(机会呈现和基于资历匹配)。
开源深度学习框架
下面将对目前一些优秀的开源深度学习框架进行介绍,包括基于GPU的单机开源深度学习框架和融合了GPU的开源分布式深度学习框架。
1. 单机开源深度学习框架
目前拥有众多的学术机构如国际顶级名校加州大学伯克利分校,以及互联网巨头如Google、微软等开源的深度学习工具,比较成熟的基于GPU的单机开源深度学习框架有:
Theano:深度学习开源工具的鼻祖,由蒙特利尔理工学院开发于2008年将开源。框架使用Python语言开发。与许多学术界和工业界有影响力的深度学习框架都构建在Theano之上,并逐步形成了自身的生态系统,这其中就包含了著名了Keras,Lasagne和Blocks。
Torch:Facebook和Twitter主推的一款开源深度学习框架,Google和多个大学援救机构也在使用Torch。出于性能的考虑,Torch使用一种比较小众的语言(Lua)作为其开发的语言,目前在音频、图像及视频处理方面有着大量的应用。大名鼎鼎的AlphaGo便是基于Torch开发的,只不过在Google开源TensorFlow之后,AlphaGo将迁移到TensorFlow上
TensorFlow:Google开源的一筐深度学习工具,使用C++语言开发,上层提供Python API。在开源之后,在工业界和学术界引起了极大的震动,因为TensorFlow曾经是著名Google Brain计划的一部分,Google Brain项目的成功曾经吸引了众多科学家和研究人员王深度学习这个“坑”里面跳,这也是当今深度学习如此繁荣的重要原因,足见TensorFlow的影响力。TensorFlow一直在往分布式方向发展,特别是在Spark平台上迁移。
2. 分布式开源深度学习框架
Google研究院JeffyDean在2012发表了一篇《Large Sacle DistributedDeep Networks》 对分布式环境下的深度学习算法设计原理进行了阐述,给出了深度学习在分布式环境下的两种不同的思路:规模并行化(Model parallelism)和数据并行化(Model Parellelism)。模型并行化将训练的模型分割并发送到各Worker节点上;数据并行化数据进行切分,然后将模型副本发送到各Worker节点,通过参数服务器(Parameter Server)对训练的参数进行更新。
目前开源分布式深度学习框架大多数采用是数据并行化的方式进行设计。目前有两大类:框架自身具备分布式模型训练能力:构建在Hadoop生态体系内,通过分布式文件系统(HDFS)、资源调度系统(Yarn)及Spark计算平台进行深度学习模型训练。其中框架自身具备分布式模型训练能力的开源深度学习框架有:
DSSTNE:亚马逊开源的一套深度学习工具,英文全名为Deep Sacalable Sparse Tensor Network Engine(DSSTNE),由C++语言实现,解决稀疏数据场景下的深度学习问题。值得一提的是,亚马逊在是否走开源的道路上一直扭扭捏捏,开源DSSTNE,似乎也是在Google、Facebook等巨头抢占开源深度学习领域高迪之后的无奈之举。
Paddle:百度开源的并行分布式开源深度学些框架,由C++语言实现并提供Pyhton API。Paddle框架已经经过百度内部多个产品线检验,包括搜索光宝中的点击率预估、图像分类、光学字符识别、搜索排...
- ?
所谓大数据,那到底什么才是大数据?
凌晨
展开
世界包含的多得难以想象的数字化信息变得更多更快,从商业到科学,从政府到艺术,这种影响无处不在。科学家和计算机工程师们给这种现象创造了一个新名词:“大数据”。所谓大数据,那到底什么是大数据,他的来源在哪里,定义究竟是什么呢?
一:大数据的定义。
1、大数据,又称巨量资料,指的是所涉及的数据资料量规模巨大到无法通过人脑甚至主流软件工具,在合理时间内达到管理、处理、并整理成为帮助企业经营决策更积极目的的资讯。
2、大数据技术,是指从各种各样类型的大数据中,快速获得有价值信息的技术的能力,包括数据采集、存储、管理、分析挖掘、可视化等技术及其集成。
3、大数据应用,是指对特定的大数据集合,集成应用大数据技术,获得有价值信息的行为。对于不同领域、不同企业的不同业务,甚至同一领域不同企业的相同业务来说,由于其业务需求、数据集合和分析挖掘目标存在差异,所运用的大数据技术和大数据信息系统也可能有着相当大的不同。
二:大数据的类型和价值挖掘方法
1、大数据的类型大致可分为三类:
1)传统企业数据:包括消费者数据,传统的ERP数据,库存数据以及账目数据等。2)机器和传感器数据:包括呼叫记,智能仪表,设备日志,交易数据等。3)社交数据:包括用户行为记录,反馈数据等。2、大数据挖掘商业价值的方法主要分为四种:1)客户群体细分,然后为每个群体量定制特别的服务。2)模拟现实环境,发掘新的需求同时提高投资的回报率。3)加强部门联系,提高整条管理链条和产业链条的效率。4)降低服务成本,发现隐藏线索进行产品和服务的创新。
三:大数据的特点
具体来说,大数据具有4个基本特征:
1、是数据体量巨大
2、是数据类别大和类型多样3、是处理速度快4、是价值真实性高和密度低
四:大数据的作用
1、对大数据的处理分析正成为新一代信息技术融合应用的结点移动互联网、物联网、社交网络、数字家庭、电子商务等是新一代信息技术的应用形态,这些应用不断产生大数据。云计算为这些海量、多样化的大数据提供存储和运算平台。通过对不同来源数据的管理、处理、分析与优化,将结果反馈到上述应用中,将创造出巨大的经济和社会价值。2、大数据是信息产业持续高速增长的新引擎面向大数据市场的新技术、新产品、新服务、新业态会不断涌现。在软件与服务领域,大数据将引发数据快速处理分析、数据挖掘技术和软件产品的发展。3、大数据利用将成为提高核心竞争力的关键因素各行各业的决策正在从“业务驱动” 转变“数据驱动”。对大数据的分析可以使零售商实时掌握市场动态并迅速做出应对;可以为商家制定更加精准有效的营销策略提供决策支持;可以帮助企业为消费者提供更加及时和个性化的服务;4、大数据时代科学研究的方法手段将发生重大改变,抽样调查是社会科学的基本研究方法。在大数据时代,可通过实时监测、跟踪研究对象在互联网上产生的海量行为数据,进行挖掘分析,揭示出规律性的东西,提出研究结论和对策。
五:大数据的商业价值
1、对顾客群体细分
2、模拟实境3、提高投入回报率4、数据存储空间出租5、管理客户关系6、个性化精准推荐7、数据搜索
六:大数据对经济社会的重要影响
1、能够推动实现巨大经济效益2、能够推动增强社会管理水平3、如果没有高性能的分析工具,大数据的价值就得不到释放
- ?
人人都在说的大数据到底是什么?(概念层)
恶天
展开
前沿技术普及系列·写在前面
不知道大家有没有和象牙妹儿一样的感觉,就是最近1年很多AI产品铺天盖地的来到了我们的生活,比如某些家的智能陪伴音响、翻译棒、智能机器人、AR拍照手机等等。
这里面背后的前沿技术大数据、云计算、区块链、物联网、 5G、数字化…前几年甚至现在听着还很遥远,却已有不少在冲击着商业的世界,渗透进我们的生活!
如何拨开层层浓雾,抵达未来的彼岸?如何把握技术的钥匙,启开未来商业世界的大门!
大象互联网圈发起主办的第二届中国【郑州】开发者大会不但关注技术·商业的融合,也关注着前沿技术的分享。
因此,从今天起,大象互联网圈公众号将目光聚焦在大数据、云计算、物联网IOT、人工智能AI、区块链、VR/AR等板块,一一从概念层、目前行业发展状况、企业实际应用层、技术层、岗位前景等为大家带来干货的普及,快来和象牙儿妹一块围观吧!
本文由“壹伴编辑器”提供技术支持
正文
如果你说大数据就是数据大,或者侃侃而谈4个V,也许很有深度的谈到BI或预测的价值,又或者拿Google和Amazon举例,技术流可能会聊起hadoop和Cloud Computing,不管对错,只是无法勾勒对大数据的整体认识,不说是片面,但至少有些管窥蠡测,也许“解构”是最好的方法。
首先,大数据就是互联网发展到现今阶段的一种表象或特征而已,没有必要神话它或对它保持敬畏之心,在以云计算为代表的技术创新大幕的衬托下,这些原本很难收集和使用的数据开始容易被利用起来了,通过各行各业的不断创新,大数据会逐步为人类创造更多的价值。
其次,想要系统的认知大数据,必须要全面而细致的分解它,本系列文章我们着手从概念、技术、实践三个层面来展开,本篇文章我们先介绍概念层。
本文由“壹伴编辑器”提供技术支持
大数据的定义
大数据(Big Data)概念是1998年由SGI首席科学家John Masey在USENIX大会上提出的。他当时发表了一篇名为Big Data and the Next Wave of Infrastress的论文,使用了大数据来描述数据爆炸的现象。但大数据真正得到业界关注,则是其后多年的事情了。
大数据是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。
本文由“壹伴编辑器”提供技术支持
大数据的分类
互联网上的大数据很难清晰的界定分类界限,我们先看看BAT的大数据:
百度拥有两种类型的大数据:用户搜索表征的需求数据;爬虫和阿拉丁获取的公共web数据搜索巨头百度围绕数据而生。阿里巴巴拥有交易数据和信用数据。这两种数据更容易变现,挖掘出商业价值。除此之外阿里巴巴还通过投资等方式掌握了部分社交数据、移动数据,如微博和高德。
腾讯拥有用户关系数据和基于此产生的社交数据。这些数据可以分析人们的生活和行为,从里面挖掘出政治、社会、文化、商业、健康等领域的信息,甚至预测未来。
在信息技术更为发达的美国,除了行业知名的类似Google,Facebook外,已经涌现了很多大数据类型的公司,它们专门经营数据产品,比如:
Metamarkets:这家公司对Twitter、支付、签到和一些与互联网相关的问题进行了分析,为客户提供了很好的数据分析支持。
Tableau:他们的精力主要集中于将海量数据以可视化的方式展现出来。Tableau为数字媒体提供了一个新的展示数据的方式。他们提供了一个免费工具,任何人在没有编程知识背景的情况下都能制造出数据专用图表。
ParAccel:他们向美国执法机构提供了数据分析,比如对15000个有犯罪前科的人进行跟踪,从而向执法机构提供了参考性较高的犯罪预测。他们是犯罪的预言者。
QlikTech:QlikTech旗下的Qlikview是一个商业智能领域的自主服务工具,能够应用于科学研究和艺术等领域。为了帮助开发者对这些数据进行分析,QlikTech提供了对原始数据进行可视化处理等功能的工具。
本文由“壹伴编辑器”提供技术支持
大数据的4V特征
即Variety(多样化)、Volume(大量化)、Velocity(快速化)、Value(价值密度低)。如下图所示。
其中,Variety表示来源多和格式多,数据可以来源于搜索引擎、社交网络、通话记录、传感器等等,这些数据要么以结构化形式存储,要么以非结构化数据存储;Volume表示数据量比较大,从TB级别,跃升到PB级别。
尤其是在移动互联时代,视频、语言等非结构化数据快速增长;Velocity表示数据存在时效性,需要快速处理,并得到结果出来,这一点也是和传统的数据挖掘技术有着本质的区别;Value表示大量不相关信息,不经过处理则价值较低,属于价值密度低的数据。
本文由“壹伴编辑器”提供技术支持
大数据处理流程
都有以下几个过程:数据采集、数据清洗、数据建模、数据加工、数据展现。如下图所示。
举个例子,做饭通常都要包括“买菜~洗菜~配菜~炒菜”这几个必须环节,无论你是开饭店还是家里一日三餐,做饭的规模大小会有不同,但流程却是一样的。而这几个环节其实正好对应了数据人的日常工作内容:买菜(数据采集)~洗菜(数据清洗)~配菜(数据建模)~炒菜(数据加工)-上菜(数据展示)。
在大数据时代,由于数据种类多,数据大,从结构化的数据到非结构化的数据,数据采集的形式也变得更加复杂而多样。
当存储技术的发展变得步履蹒跚,赶不上数据发展的速度时,分布式存储成为了必然选择,非结构型数据也对存储格式提出了新的要求。
层出不穷的数据源也使得数据量产生了井喷似的迅猛增长。此时分布式存储与NoSQL的诞生回应了这样的需求,解决了大数据存储的根本难题。
本文由“壹伴编辑器”提供技术支持
大数据思维
关于大数据思维即我们该如何去理解大数据,十余年潜心研究数据科学的技术权威维克托·迈尔-舍恩伯格认为要注意三点:
需要全部数据样本而不是抽样关注效率而不是精确度关注相关性而不是因果关系。
阿里巴巴的王坚对于大数据也有一些独特的见解,比如:
今天的数据不是大,真正有意思的是数据变得在线了,这个恰恰是互联网的特点非互联网时期的产品,功能一定是它的价值,今天互联网的产品,数据一定是它的价值你千万不要想着拿数据去改进一个业务,这不是大数据,你一定是去做了一件以前做不了的事情
特别是最后一点,我是非常认同的,大数据的真正价值在于创造,在于填补无数个还未实现过的空白。
有人把数据比喻为蕴藏能量的煤矿。煤炭按照性质有焦煤、无烟煤、肥煤、贫煤等分类,而露天煤矿、深山煤矿的挖掘成本又不一样。与此类似,大数据并不在“大”,而在于“有用”,价值含量、挖掘成本比数量更为重要。
本文由“壹伴编辑器”提供技术支持
大数据的价值
如果把大数据比作一种产业,那么这种产业实现盈利的关键,在于提高对数据的“加工能力”,通过“加工”实现数据的“增值”。
Target 超市以20多种怀孕期间孕妇可能会购买的商品为基础,将所有用户的购买记录作为数据来源,通过构建模型分析购买者的行为相关性,能准确的推断出孕妇的具体临盆时间,这样Target就可以有针对的在每个怀孕顾客的不同阶段寄送相应的产品优惠卷。
Wal-Mart作为零售行业的巨头,他们的分析人员会对每个阶段的销售记录进行了全面的分析,有一次他们无意中发现虽不相关但很有价值的数据,在美国的飓风来临季节,超市的蛋挞和抵御飓风物品竟然销量都有大幅增加。
于是他们做了一个明智决策,就是将蛋挞的销售位置移到了飓风物品销售区域旁边,看起来是为了方便用户挑选,但是没有想到蛋挞的销量因此又提高了很多。
这些例子真实的反映在各行各业,探求数据价值取决于把握数据的人,关键是人的数据思维;与其说是大数据创造了价值,不如说是大数据思维触发了新的价值增长。
未来在大数据领域最具有价值的是两种事物:1-拥有大数据思维的人,这种人可以将大数据的潜在价值转化为实际利益;2-还未有被大数据触及过的业务领域。这些是还未被挖掘的油井,金矿,是所谓的蓝海。
本文由“壹伴编辑器”提供技术支持
大数据的风险
提到大数据人们生活造成的干扰,你或许对隐私泄露早有耳闻。当你在不同的网站上注册了个人信息后,可能这些信息已经被扩散出去了。
当你莫名其妙的接到各种邮件,电话,短信的滋扰时,你不会想到自己的电话号码,邮箱,生日,购买记录,收入水平,家庭住址,亲朋好友等私人信息早就被各种商业机构非法存储或贱卖给其它任何有需要的企业或个人了。
更可怕的是,这些信息你永远无法删除,它们永远存在于互联网的某些你不知道的角落。除非你更换掉自己的所有信息,但是这代价太大了。
目前,中国并没有专门的法律法规来界定用户隐私,处理相关问题时多采用其他相关法规条例来解释。但随着民众隐私意识的日益增强,合法合规地获取数据、分析数据和应用数据,是进行大数据分析时必须遵循的原则。
因此在大数据的背景下,很多人都在积极的抵制无底线的数字化,这种大数据和个体之间的博弈还会一直继续下去……
专家给予了我们一些如何有效保护大数据背景下隐私权的建议:
减少信息的数字化隐私权立法数字隐私权基础设施(类似DRM数字版权管理)人类改变认知(接受忽略过去)创造良性的信息生态语境化。
本篇关于大数据的理论层面分析就介绍到这,下一篇我们将对大数据价值体现的手段和前进的基石——大数据技术深入进行展开分析。
END
第二届中国【郑州】开发者大会
线上报名通道全面开放
本次大会将开设从数字化到大数据落地专场,现已开放报名通道,门票分为免费票和VIP票两种,其中VIP票权益非常丰富,票价为199元且仅限200张,下面是两种票的权益对比:
- ?
都说大数据,你知道到底什么是大数据吗?
换裁判
展开
俺黑君够黑,慎关注!
究竟什么是大数据?如何对大数据进行定义?大数据有哪些特征?了解了这些才能更好的知道自己学习是怎样的一门技术,以及它的前景如何。本文达妹就带大家一起了解大数据。
DT时代,人人言必称大数据,所有的新系统几乎都是基于大数据,有人认为用了MongoDB就是大数据,也有人用了Hadoop就是大数据,或者认为数据量大就是大数据。
更有甚者,笔者看到一篇新闻报道,说某企业成功实施大数据项目,结果只是SQL-Server集群……天呐,这可是上世纪的技术了!
说了这么多到底什么是大数据呢,其实大数据并没有教科书式的明确定义,但是却有比较公认的特性描述,符合这些特性的就可以称作大数据,即大数据的4个V。
第一个V——高容量
这个最好理解,数据量一定要大,才好意思称自己为大数据嘛。大到什么程度呢?依目前行情来看,至少也要到TB级,很多案例都是PB甚至更高。但如果是GB级,非说自己是大数据也不是不可以,就是有点无颜见江东父老啊……
第二个V——多样化
这个很关键了!是区别于以往海量数据挖掘的最主要特征。它有两层含义,一是数据来源多样化,系统数据、设备日志、传感器、文件系统等等来源。二是数据结构多样化,这是核心特征!要包含结构化数据、非结构数据(包括所谓半结构化数据)。
总结起来就是,多源异构。这就是为什么有人认为使用NoSQL数据库(如MongoDB)就是大数据了,因为满足了多样化的特征,但其实还不够。
第三个V——高速
即时效性,基本上至少也要达到亿级数据一秒查询,做的比较好的可以达到千亿级数据一秒查询。这个特征几乎决定了传统技术架构无法满足要求,因此Hadoop架构的出现催化了大数据的发展,也是有人认为Hadoop就是大数据的原因。
第四个V——价值
这个很好理解,数据一定要有价值、而后才能产生价值。就好比存商品的叫才能仓库,存垃圾的叫垃圾填满坑一样。没价值的数据就像一个垃圾填满坑,这也是为什么数据治理在大数据实施中非常重要的原因之一。
最后,也是最重要的,以上4个V是逻辑与的关系,即需同时、注意是同时满足上述四个特征,就可以放心的说自己是大数据了!
文版权归原作者所有。转载文章仅为传播更多信息之目的,如有侵权请与我们联系,我们将及时处理。
- ?
大数据时代,掌握大数据等于掌握掌握世界
宁松
展开
什么是大数据?
大数据是指无法在一定时间内用常规软件工具对其内容进行抓取、管理和处理的数据集合。大数据技术,是指从各种各样类型的数据中,快速获得有价值信息的能力。适用于大数据的技术,包括大规模并行处理(MPP)数据库,数据挖掘电网,分布式文件系统,分布式数据库,云计算平台,互联网,和可扩展的存储系统。
大数据有何作用?
第一,对大数据的处理分析正成为新一代信息技术融合应用的结点。移动互联网、物联网、社交网络、数字家庭、电子商务等是新一代信息技术的应用形态,这些应用不断产生大数据。云计算为这些海量、多样化的大数据提供存储和运算平台。通过对不同来源数据的管理、处理、分析与优化,将结果反馈到上述应用中,将创造出巨大的经济和社会价值。大数据具有催生社会变革的能量。但释放这种能量,需要严谨的数据治理、富有洞见的数据分析和激发管理创新的环境(Ramayya Krishnan,卡内基·梅隆大学海因兹学院院长)。
第二,大数据是信息产业持续高速增长的新引擎。面向大数据市场的新技术、新产品、新服务、新业态会不断涌现。在硬件与集成设备领域,大数据将对芯片、存储产业产生重要影响,还将催生一体化数据存储处理服务器、内存计算等市场。在软件与服务领域,大数据将引发数据快速处理分析、数据挖掘技术和软件产品的发展。
第三,大数据利用将成为提高核心竞争力的关键因素。各行各业的决策正在从“业务驱动” 转变“数据驱动”。对大数据的分析可以使零售商实时掌握市场动态并迅速做出应对;可以为商家制定更加精准有效的营销策略提供决策支持;可以帮助企业为消费者提供更加及时和个性化的服务;在医疗领域,可提高诊断准确性和药物有效性;在公共事业领域,大数据也开始发挥促进经济发展、维护社会稳定等方面的重要作用。
第四,大数据时代科学研究的方法手段将发生重大改变。例如,抽样调查是社会科学的基本研究方法。在大数据时代,可通过实时监测、跟踪研究对象在互联网上产生的海量行为数据,进行挖掘分析,揭示出规律性的东西,提出研究结论和对策。
了解了大数据的概念和作用,我们先来看一下商业巨头们如何利用大数据吧。
一、谷歌公司(google Inc)
第一个 :ReCAPTCHA案例。
这个虽然是被谷歌收购的,但是,具有典型的谷歌思维。为了解决垃圾邮件和网络机器人的问题,冯.安发明了验证码的解决方案。如果只限于此,也就没有特别可以称道的,但是他意识到每天有这么多人要浪费10秒钟的时间输入这堆恼人的字母,而随后大量的信息被随意地丢弃时,他开始寻找能使人的计算能力得到更有效利用的方法。 他想到了一个继任者,恰如其分地将其命名为ReCaptcha。和原有随机字母输入不同,人们需要从计算机光学字符识别程序无法识别的文本扫描项目中读出两个单词并输入。其中一个单词其他用户也识别过,从而可以从该用户的输入中判断注册者是人;另一个单词则是有待辨识和解疑的新词。为了保证准确度,系统会将同一个模糊单词发给五个不同的人,直到他们都输入正确后才确定这个单词是对的。在这里,数据的主要用途是证明用户是人,但它也有第二个目的:破译数字化文本中不清楚的单词。ReCaptcha的作用得到了认可,2009年谷歌收购了冯·安的公司,并将这一技术用于图书扫描项目,再后来,谷歌街景也开始使用这项技术。把验证码和OCR需求巧妙结合起来,这展示了思维的威力,实现了ReCaptcha技术提供者和使用者的双赢,技术提供者利用OCR识别获得了自己的受益,使用者不需要任何付费(互联网免费思维),也愿意使用,对于用户其实也没有影响,没有增加额外的工作。上研究生的时候,就研究OCR汉字识别问题,识别率始终是个问题,对于手写就更低了,要花费大量人力来解决,并且,人工识别工作是非常无聊,没有办法来保障质量。再想起12306的验证码,更令人无语了。我们浪费了多少资源?我们有多少资源可用充分来利用?
第二个:拼写检查纠错的案例。
我们都经常使用微软的Word,其中就有拼写检查纠错功能,微软实现这个功能,采用的是传统的软件思维,也就是利用规则和词库来解决,这个需要不断耗费人力进行规则和词库的升级,对于不同的语言,耗费更是巨大。谷歌解决这个方法,用的相对巧妙,在搜索的时候,当你输入一个错误的词时,会给一个提示,要找的是不是建议的词,如果用户确认后,谷歌就进行记录处理,后面,再经过一些算法处理,经过大量的数据学习,各个拼写检查纠错就越来越好,并且,这个后续维护成本很低, 效果越来越好。其实,谷歌翻译也使用了类似的思路,虽然前期算法,包括大数据处理花费了比较多,后续,基本实现了自动化,系统会越来越强,维护升级成本很低,项目就变成可持续发展。
第三个:对流感的预测
2009年,一种新型的流感病毒h1n1在全球迅速传播开来。美国,和世界上所有的国家一样,要求医生们发现案例市告知疾病控制与预防中心。但是,人们并不是在第一时间去医院检查,而是会有一段时间的延迟,消息要传达到疾控中心也要时间,从而造成一定的滞后性。
在该病毒爆发的几周前,谷歌公司的工程师们在《自然》杂志上发表了一篇论文。文中解释了谷歌为什么能够预测冬季流感的传播:不仅是全美范围内,而且具体到特定的地区和州。
谷歌如何做到的呢?数据。
谷歌通过观察人们在网上的搜索记录来完成这个预测,谷歌保存了多年来所有的搜索记录,每天都会超过30亿条的搜索指令。如此庞大的数据资源才能支撑谷歌完成这项工作。
二、facebook。
Facebook(脸书)是美国的一个社交网络服务网站 ,创立于2004年2月4日,总部位于美国加利福尼亚州帕拉阿图,2012年3月6日发布Windows版桌面聊天软件Facebook Messenger ,主要创始人马克·扎克伯格。它是世界排名领先的照片分享站点,截至2013年11月每天上传约3.5亿张照片、截至2012年5月,拥有约9亿用户。Facebook的总部设在硅谷的门洛帕克(Menlo Park)——1 Hacker Way 从2006年9月11日起,任何用户输入有效电子邮件地址和自己的年龄段,即可加入。在2015年8月28日,单日用户数突破10亿。
fancebook,拥有这庞大数据,同时它也不会浪费这些数据。Facebook通过用户社交网络图得知人们的喜好、
说完了,我们转过头看一下我们国内。
大数据现今在国内也是蓬勃发展,让我让数据说话!
大数据企业发展态势
态势一:2017年,我国大数据企业依旧整体呈现“金字塔”状的实力分布,从金字塔上层来看,我国大数据企业发展指数高于50的企业数量占比仅为7.4%,与去年相比,中高区间的龙头企业发展指数均有不同程度的提升,体现出“强者恒强”的发展势头。2017年,随着新晋企业数量增多、初创企业发展活力不断提升,金字塔根基更趋稳固;专精特新的独角兽企业发展势头迅猛,成为我国大数据企业发展的中坚力量。
态势二:2017年,我国大数据企业基础画像指数呈现较为明显的三重集团趋势,可以分为领军企业(数量占比9.23%,指数跨度从62.50到10.46)、中坚企业(数量占比29.49%,指数跨度从9.89到1.00)、上升企业(数量占比为50.16%,指数跨度从0.98到0.001)三类企业。从构成占比上看,2017年,我国大数据领军企业占比基本维持不变,而中坚企业占比显著增加,上升企业比例对比2016年有较为明显的减少。
态势三:2017年,我国大数据企业技术研发指数呈现“龙头领先、中小微主体跟进”总体趋势,技术研发指数超过10的龙头企业数量占比为9.85%,低于10的企业占比达到90.15%。大数据企业技术研发指数平均值为4.06,同比2016增长了3.18%,其中,以华为、中兴等通信企业和BAT等互联网企业为代表的TOP20龙头企业的技术研发指数同比2016年增长了5.73%。
态势四:2017年,我国大数据企业市场拓展指数呈现出“龙头带动、全面壮大”的分布格局,我国大数据企业市场拓展指数小于30的企业数量占到92.88%,指数超过30的大数据企业占比为7.12%。与2016年相比,龙头企业依旧强势引领大数据市场,中间企业及长尾企业亦积极拓展市场版图,行业整体呈稳步发展态势。
态势五:2017年,大数据企业尤其是骨干企业发展集聚态势进一步强化,绝大多数企业集聚在北京、天津、山东、江苏、浙江、上海、广东、福建等东部沿海信息技术产业基础较好的省市。与2016年相比,东北、中西部等重点城市,以及乌鲁木齐、呼和浩特等地的大数据企业集聚化趋势日益明显。
态势六:2017年,我国产业环节大数据企业聚焦数据采集、数据存储、数据预处理、数据分析、数据可视化、数据流通,跨度从19.48到6.87,发展指数相对比较均衡,数据分析环节企业发展指数水平相对突出,发展指数达到19.48,数据大数据分析挖掘环节必将涌现出更多的独角兽企业。与2016年相比,大数据分析环节指数增长3.8,其他环节指数均有不同程度下降。
态势七:2017年,我国重点行业大数据产业企业聚焦政务、工业、健康医疗、交通、农业、金融、教育、能源等17个行业领域,企业平均发展指数为23.36,最高的安防大数据企业发展指数达到35.71,最低的能源大数据企业发展指数为16.89。与2016年相比,主要行业大数据企业平均发展指数同比增加了0.25,大多数行业发展指数都稳中有进,除安防领域初步定型,同比2016年降低了4.01,其他重点行业领域指数均有不同程度上升。
态势八:2017年,我国特色细分领域大数据企业主要分为三大阵营,与2016年相比,三大阵容的特色细分领域发生了明显变化。一是从事人工智能相关的龙头企业处于第一阵营,平均发展指数维持在21左右;二是从事工控安全、数据库、区块链、征信分析、商业智能BI、数据中心IDC、数据营销、基因测序等10类细分领域大数据相关业务的龙头企业处于第二阵营,平均发展指数处于13.97到17.78之间;三是以虚拟现实、开源技术和车联网为代表的第三阵营,整体发展指数相对略低,处于12左右。
进过调研分析,我们可以作出预判
2018年我国大数据产业发展的主要趋势有:
1、产业将持续保持快速增长态势。预计2018年我国大数据核心产业规模将突破5700亿元。
2、融合渗透效应向更深层次延伸。延伸方向既包括经济运行、社会生活等应用领域,也包括物联网、人工智能等关联技术。
3、制造业数字转型作用日益凸显。以大数据驱动制造业数字化转型的新模式、新业态将不断涌现。
4、技术创新仍是产业发展主基调。大数据领域核心关键技术将加速突破,跨学科、跨领域交叉融合技术研究将成为发展重点。
5、产业集聚特色化发展态势逐步显现。国家大数据综合试验区建设的不断深入,一批省级大数据产业集聚区将进一步优化资源配置、形成集聚效应、发挥辐射带动作用。
6、产业生态体系迈入成熟完善阶段。大数据相关政策将加快落地实施,更多创新性政策将加快出台,大数据产业发展环境将进一步优化。
区域大数据产业发展态势:
态势一:2017年,国家大数据综合试验区依然引领产业发展,其所在区域的大数据产业发展总指数在全国大数据产业发展总指数的占比达37.54%。试验区内各省市指数较去年增幅均值为6.23,高于全国增幅均值的5.78,大数据产业发展速度高于全国平均水平。
态势二:2017年,大数据产业集聚发展效应进一步凸显,长三角地区、珠三角地区、中西部地区和东北地区大数据产业集聚发展格局基本形成。
态势三:2017年,北京、江苏、广东、浙江、上海等五省市成为大数据产业发展第一梯队,其大数据发展总指数在全国大数据发展总指数的占比高达26.52%,领先的优势地位明显。浙江省大数据产业发展指数较去年增长12.71,成为全国大数据产业发展指数增幅最高城市。
态势四:2017年,我国东部、西部、中部、东北四个分区产业发展差异化明显。东部地区整体发展水平最高,大数据产业发展指数增幅均值为7.39,远超全国平均水平5.78,天津、河北、海南排名上升;西部地区未来仍有巨大发展空间,重庆大数据产业发展指数较去年增长10.12,增幅仅次于浙江省位列全国第二,宁夏、内蒙古二地成后起之秀;中部地区整体发展速度高于西部和东北,山西发力大数据产业,排名明显提升。东北地区辽宁继续蝉联区域榜首,辐射带动作用逐步凸显。
态势五:2017年,各省市大数据产业发展环境均呈现向好态势,各省市的发展环境平均指数为10.9,较去年提高32.9%,18个省市的发展环境指数高于平均值,占比达到58%,而发展环境指数在去年平均值以上的省市高达30个;同时,江苏、重庆、安徽等地由于组织机制进一步完善、区域信息化水平加速提升等因素影响,较去年排名增速明显。
态势六:2017年,全国各省市大数据产业发展水平均有提升,大数据产业发展总指数为363.9,较去年提升16.8%;
但受数据集聚开放水平、大数据产业规模、大数据企业主体等多种因素共同影响,各省...
- ?
大数据,多大算大?
半烟
展开
提到大数据,就得说这个数据信息量。
字节(Byte)是计算机信息技术用于计量存储容量和传输容量的一种计量单位,一个字节等于8位二进制数,在UTF-8编码中,一个英文字符等于一个字节。
通常我们接触比较多的就是U盘,手机和电脑,这些一般到TB级别就足够用了,大部分是GB。
而大数据时代,数据的量级要提高很多。Google搜索引擎似乎在不顾一切的吞食来自互联网的数据,仅2007年1年它就吞下了约100 Exabytes(1 Exabyte=1000000000 Gigabyte)的数据。1T(太)=1000G,1P(拍)=1000T,1E(艾)=1000P
单纯数据量上看,很大,无法想象。
大数据时代,大数据,多大都不算大。
如果你有工具。你丢给工具一份数据,工具告诉你:
1.这份数据的效果有多好?
2.样本大小与数据效果的关系?
3.什么样本最有用?
4.什么特征最有用?
如此,你便可以继续收集和重要样本类似的样本,继续提取和重要变量相关的变量。
如果我们可以轻而易举地知道什么数据有用,那么,这个大数据就是比较合适的,大数据,多大都不算大。
- ?
什么是大数据和大数据平台?
伍香彤
展开
“大数据”时下一个热门的词语,近几年来,关于大数据的著作和文章铺天盖地,似乎也在共同在传递一个信息:越来越多的行业、人士开始关注并实际探索大数据的应用,我们正在一起描绘着大数据巨大效用的蓝图,但在实践的路上,我们都孩子起步阶段小步前行。
大数据根基于互联网,数据仓库、数据挖掘、云计算等互联网技术的发展为大数据应用奠定基础。对于任何一个大数据的从业者或初接触者,或者都会有个共同的感触:大数据很有用!但大数据是什么呢?
今天就给大家讲解一下:
对于大数据的定义,我们来引用3个比较差用的大数据定义:
1)Gartner:需要信息处理模式才能具有更强的决策力,洞察发现力和流程优化能力的海量、高增长率很多样化的信息资产。
2)IDC:海量的数据规模(Volunme)、快速的数据流转和数据体系(Velocity)、多样的数据类型(Variety)、巨大的数据价值(Value)。
3)Wiki:或称巨量数据、海量数据、大资料,指所涉及的数据量规模巨大到无法通过人工,在合理时间内达到截取、管理、处理、并整理成为人类所能解读的信息。
其他关于大数据的定义也大抵类型,我们可以用几个关键词对大数据做一个界定。
首先,“大规模”,这种规模可以从两个维度来衡量,一是时间序列累积大量的数据,二是在深度上更加细化的数据。
其次,“多样化”,可以是不同的数据格式,如文字、图片、视频等,可以是不同的数据类别,如入口数据,经济数据等,还可以有不同的数据来源,如互联网、传感器等。
最后,“动态化”,数据是不停变化的,可以随着时间快速增加大量数据,也可以是在空间上不断移动变化的数据。
这三 个关键词对大数据从形象上做了界定。
但是还需要一个关键能力,就是“处理速度快”。如果这么大规模、多样化又动态变化的数据有了,但需要很长的时间去处理分析,那不叫大数据。从另一个角度,要实现这些数据快速处理,靠人工肯定是没办法实现的,因此,需要借助于机器实现。
最终,我们借助机器,通过对这些数据进行快速的处理分析,获取想要的信息或者应用的整套体系,才能称为大数据。
我们可以用下面的图示给大数据定义:
这下,就知道什么是大数据了吧
- ?
什么样的数据才算大数据?——大数据的特性
卫松
展开
什么是大数据?大数据就是指在一定时间范围内无法使用传统数据库工具对其进行捕捉、管理、计算、分析和处理的数据集合,大数据有以下四个特性:海量的数据规模(Volumn),数据类型繁多(Variety),数据流转速度极快(Velocity)以及价值密度较低(Value),我们就说说这四大特性。
海量的数据规模
我们接触最多最敏感的数据那就是我们手机所购买的流量,最常见的数据计量单位为K、M和G,他们的关系为1G=1024M,1M=1024KB。也许你也听过TB,1TB=1024G,这个数据单位对我们来世已经相当庞大了,我们的笔记本最大的容量也就在1TB这个级别,但是在大数据眼里最小的数据也得10TB起,比TB级还大的数据计量单位还有吗?有,而且还很多,1PB=1024TB,1EB=1024PB,1ZB=1024EB,1YB=1024ZB......我们已经无法感知这么大的数据量了。截止到2011 年,互联网用户数已达到20 亿; RFID 标签在2005 年的保有量仅有13亿个,但是到2010 年这个数字超过了300 亿;2006 年资本市场的数据比2003 年增长了17.5倍;日前新浪微博上每天上传的微博数超过1 亿条;Facebook 每天处理10TB 的数据;世界气象中心积累了220TB 的Web 数据,9PB 其他类型数据……
极快的数据流转
数据具有一定的时效性,是不停的变化的,可以随时间数据量逐渐增大,也可在空间上不断移动变化的数据。如果我们采集到的数据不经过流转,最终会过期作废。客户的体验在分秒级别,海量的数据,带来的第一个问题就是大大延长了各类报表生成时间,我们能否在极端的时间内提取最有价值的信心呢?数据在1秒内得不到流转处理,就会给客户带来较差的使用体验,若我们的数据处理软件达不到“秒”处理,所带来的商业价值就会大打折扣。
价值密度低
尽管大数据的数据量巨大,但是有价值的信息极少,我们要通过分析才能将大数据从数据到价值的转变,这些工作量极其庞大,所以云计算是一个很好的解决途径。以监控视频为例,一小时的视频,在不间断的监控过程中,可能有用的数据仅仅只有一两秒。
数据种类繁多
数据的格式是多样化的,如文字、图片、视频、音频、地理位置信息等,也可以是不同的数据类别,也可以有不容的来源,如传感器、互联网。首先用户是一个复杂的个体,单一的行为数据是不足以描述用户的各种行为,多元化的信息采集处理就像拼图一样,逐渐勾勒出我们身体的骨架,增添上我们的血肉。我们在淘宝、京东购物时,总会在下面的推荐区推荐我们想要的东西,比如我们去频繁的搜索浏览某件商品,这是他们就会采集我们浏览的数据,从中挖去有价值的信息,推送给我们。所以说这样的模式给一种体验,那就是这些app越来越懂我们的爱好和需求。
大数据未来会渗透在很多领域,大数据与云计算,机器学习与人工智能,物联网,区块链等。
多少数据是大数据
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并