中企动力 > 商学院 > 到底什么是大数据
  • ?

    大数据,到底大在哪里?

    八戒

    展开

    对于经常上网的朋友来说,大数据这个词一定并不陌生,上到国家层面,下到一家小型的创业型公司,对于大数据的关注程度都是一样的高。那么,到底什么是大数据呢?大数据具体又 “大”在哪里呢?

    一、什么是大数据

    大数据( big data ),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    在维克托 · 迈尔 - 舍恩伯格及肯尼斯 · 库克耶编写的《大数据时代》 中大数据指不用随机分析法样捷径,而采用所有数据进行分析处理。大数据的 5V 特点: Volume (大量)、 Velocity (高速)、 Variety (多样)、 Value (低价值密度)、 Veracity (真实性)。

    简而言之,大数据就是可以通过各个不同端口对数据尽兴收集与交互,从而描绘出用户群体的信息汇总,可以准确的将用户的上网习惯,关注领域精准的描绘出来,从而对其进行有针对性的推广。

    二、大数据有什么价值?

    首先是对于商家以及企业来说,大数据的价值体现在以下几个方面:

    1) 对大量消费者提供产品或服务的企业可以利用大数据进行精准营销

    2) 做小而美模式的中小微企业可以利用大数据做服务转型

    3) 面临互联网压力之下必须转型的传统企业需要与时俱进充分利用大数据的价值

    而对于消费者而言,大数据对其价值更多的体现在产品的人性化上面,包括硬件以及 APP ,可以根据大数据来对其最感兴趣的以及最需要的内容进行推送,使其更加人性化,也更具有效率。

    三、大数据的发展趋势

    趋势一:数据的资源化

    有别于传统意义上的资源,在大数据的概念中,数据也是重要的战略资源之一,对于企业来说,如何通过大数据来把我最新的市场动态以及用户动态成为最重要的战略决策因素之一。

    趋势二:与云计算的深度结合

    大数据与云处理是相辅相成的,云处理为大数据提供了基础,是产生大数据的重要平台。自 2013 年开始,大数据技术已开始和云计算技术紧密结合,预计未来两者关系将更为密切。

    趋势三:科学理论的突破

    随着大数据的快速发展,就像计算机和互联网一样,大数据很有可能是新一轮的技术革命。随之兴起的数据挖掘、机器学习和人工智能等相关技术,可能会改变数据世界里的很多算法和基础理论,实现科学技术上的突破。

    趋势四:数据科学和数据联盟的成立

    数据科学将成为一门专门的学科,被越来越多的人所认知。各大高校将设立专门的数据科学类专业,也会催生一批与之相关的新的就业岗位。

    趋势五:数据泄露泛滥

    对于企业来说,未来的数据泄露事件的增长率也许会达到 100% ,除非数据在其源头就能够得到安全保障。可以说,在未来,每个企业都会面临数据方面的攻击,并且都需要重新审视今天的安全定义。

    趋势六:数据管理成为核心竞争力

    数据的收集以及分析能力将直接影响一个企业的发展,在未来数据管理能力将成为企业的核心竞争力。

    四、大数据,大在哪里?

    那么,大数据,到底大在哪里呢?

    首先,大数据的大,最主要指的是数据体量的庞大,相较于传统数据来说,大数据所包括的体量是完全不同于以往传统的数据量的。

    其次,是指数据的类型,所有用户在使用互联网时留下的数据都可以作为大数据的计算内容,因此,各种类型的数据都可以包含其中

    第三,数据计算量庞大,不同于以往传统的数据分析与计算的方式,现在大数据对数据的收集和分析,是配合云计算对所有数据进行的分析与计算,其计算数量也是难以想象的。

    五、大数据如何影响生活?

    那么,仅仅从一个普通的消费者以及网民的角度来说,大数据到底是通过什么样的方式来影响你的生活呢?

    就拿当今的智能手表为例,一个手表如果在加入了大数据这个领域以后,会和以前的传统手表相比产生哪些天翻地覆的变化呢?

    首先,大数据在智能可穿戴领域的运用包括三个主要部分,即 “硬件终端”,“人机交互”以及“云数据”,具体来看就是将智能手表本身作为一个人体数据收集的平台,而收集数据的类型也包括我们生活的方方面面,而在通过 APP 将数据上传到后台云数据服务平台,然后对收集到的数据进行海量分析计算,从而得出实用,符合实际,有用的数据分析报告,再反馈给用户,这样就形成了大数据在智能可穿戴领域的完整产业链与价值闭环。

    今后的未来,大数据的发展会更进一步,而其又会怎样具体的体现到用户硬件实用领域,我们共同期待。

  • ?

    企业大数据到底是什么?如何积累运用?

    June

    展开

    文|帆软数据应用研究院 李向川

    “大数据”这个词,从2012年开始,成了时髦、高端、创新的代名词,一直火到2015年初。2015年开始,“大数据”一边被人耳熟能详,一边又成了让人嗤之以鼻的词汇。如果业内人士,关注 Gartner 的技术成熟度报告的朋友,会有清晰的了解,2015年正是“大数据技术”的泡沫破裂期。从2016年到现在的2017年,厂商和相关技术供应商不断完善自己的产品,加上用户需求的明确,产品在设计和使用场景上趋于成熟,“大数据技术”正在稳步爬升。那么“企业大数据”和“大数据”到底有什么关系?““企业大数据”它从哪里来,这里,我们从这两方面聊聊“企业大数据”。

    1 企业大数据,你到底是什么

    1.1我们先来看看主流的大数据概念。

    IBM提出大数据的5V特点:Volume(大量)、Velocity(高速)、Variety(多样)、Value(低价值密度)、Veracity(真实性)。

    麦肯锡全球研究所给出的定义是:一种规模大到在获取、存储、管理、分析方面大大超出了传统数据库软件工具能力范围的数据集合,具有海量的数据规模、快速的数据流转、多样的数据类型和价值密度低四大特征。

    大数据”(Big data)研究机构Gartner给出了这样的定义。“大数据”是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力来适应海量、高增长率和多样化的信息资产。

    由我们帆软研究院总结来说,大数据一般指数据量级非常大,常规数据处理、数据存储和数据分析能力无法满足要求的数据。同时,“大数据”的“数据处理能力”是相对的,是不断提高的,随着大数据处理技术的发展,今天的大数据会成为明天的小数据。

    1.2 我们的企业大数据,是个什么概念

    前面提到的这些大数据,对大多数企业来说,都是外部大数据。当前大家所说的“利用大数据来做某某事”,一般都指的是利用外部大数据。从帆软研究院的经验来看,当前的大数据应用更多在“富数据”行业:互联网企业、电信企业、电商、金融服务业。而广大非超大型的大中小型企业,并不一定拥有这样的“富数据”的业务机会。但针对企业外部的大数据,有些开放的数据我们还是可以通过技术手段获取和使用的。

    每个企业日常经营和管理中都产生数据。比如考勤数据、销售数据、销售行为数据、生产数据、财务数据、采购数据人力资源数据等等。企业大数据是指全面记录企业经营和管理活动的数据。

    我们这个定义,是从企业实践应用角度出发的,不过分强调数据量,即使数据不多,依然是企业大数据的一个组织部分。我们主要重视数据设计范围的全面性。在企业数据化经营和管理中,只有全面的、相互关联的数据才能发挥作用。

    1.3 再谈谈数据的价值密度概念

    在 IBM 对于大数据的定义“5V”中,有个Value(低价值密度),外部大数据数据量和信息量非常大,但内容不聚焦,对单个企业来讲,价值含量低。而我们的企业大数据每一条记录都和企业高度相关,都可能蕴含巨大信息量,价值密度高,需要企业更加重视。从另一方面来说,企业大数据是我们当前能快速挖掘利用,能高效分析,支撑决策管理的数据;而外部读数据,或许更适合我们发现商机和商业模式,对于企业经营管理,效果不一定可观,甚至难以支撑经营管理决策。

    2 企业大数据,你从哪来

    企业大数据主要来自日常工作活动。企业管理信息系统里,各个岗位管理者都有数据清单。下面是常见部门岗位数据清单举例。我们看到人力资源管理、财务管理、销售管理等业务相关的部门,都有这类数据清单。如果企业不能快速提供这些数据,那就说明这个企业的数据化管理存在严重的数据源管理不足。

    2.2 企业数据源头管理需要系统化

    同行或者潜在市场的相关数据,比如竞品信息、竞争对手活动信息、潜在客户名单、客户内部决策流程等,需要销售人员主动去外部采集。数据的质量和数量完全依赖于销售人员的积极性和主动性。

    企业需要建立管理制度,落实管理流程,来确保相关人员采集数据的积极性和准确性。比如一定程度上关联KPI,或者进行奖励性措施。为什么企业大数据管理不能仅仅依赖于个人的积极性和主动性呢?因为不同的员工基于不同的资源和个人利益,会带来不同的结果。企业要想构建比较完善的企业大数据,必须要系统化地管理。

    企业建立相关管理制度,一方面落实到人,让数据负责人对自己所负责的数据有质量意识;另一方面,在内部管理上,要建立不断完善的活动与数据更新的联动机制。这些需要在内部管理制度、岗位要求、任务说明、流程要求等方面作数据管理的规范性要求。

    一般来说,企业可以先自行建立简略的数据管理的的相关管理制度,也可以咨询帆软数据应用研究院等专业的数据化管理研究机构,提供方法支持和可借鉴的标准化模板,以及借鉴其他成功的数据化管理项目实施案例。

    2.3 企业大数据的分类

    企业大数据更多关注的是企业内部的数据,是指企业自主拥有的,具有“自主产权”的数据,包括企业主动合法采集的、外部采购的、第三方合作的,以及政府等机构公开的、无偿使用的。

    我们从数据所描述的“主体”上,把企业大数据分成两大类。

    第一类,是资源信息数据。资源信息数据是“静态数据”,记录企业相关内外部资源主体的相关信息。企业的资源包括人、财、物和信息四大类资源。举2个资源信息数据的例子。

    第二类,是资源活动记录数据,指得是公司经营管理活动所必然牵动的数据。比如,考勤数据、销售交易数据,这些都是资源活动,具有极强的时效性,我们称之为“动态数据”。举2个资源活动记录数据的例子。

    2.4 企业大数据的六大主要来源

    为了企业构筑更加完整、全面的数据源头,我们从数据描述对象与企业的关系角度,以及动态和静态信息来进行分类,企业大数据的来源主要有六大类。

    企业资源的信息数据(静态数据);

    企业资源活动的记录数据(动态数据);

    企业经营活动所接触外部资源的信息数据(静态数据);

    企业观测到相关资源活动的记录数据(动态数据);

    企业主动采集或者采购的外部数据(静态+动态数据 );

    外部开放数据和公共数据资源(静态+动态数据)。

    如果企业能够坚持3~5年持续收集、处理数据,甚至主动采集市场上的调研数据,那么企业就能不断感知公司内部和外部市场的变化,随时调整公司内部管理,以及产品线、销售策略,品牌策略,让大企业有具有敏锐的感知力和高效的行动力,做到“春江水暖鸭先知”。

    有一类重要的企业大数据来源,不是来自企业经营管理活动,帆软研究院称之为“外部公共开放数据资源”。外部公共开放数据资源,包括政府公布的人口数据、经济数据以及权威机构发布的研究数据等。

    企业制定战略、研究投资等方面是,需要考虑深度分析这些数据。这些数据一般都有固定的开放平台,包括国家统计局网站、权威数据机构网站、官方媒体等。尤其是贵阳大数据中心,有众多公共开放数据资源,同时也有不少可交易的企业数据。其中,人口数据对于大多数公司制定发展战略、确定年度目标有重要参考意义。

    外部公共开放数据虽然在逐年增加,大基本保持平稳,统计方法基本不变。企业如果需要,应该积极主动的去利用这些数据。

    3 我们该怎么做:立即开始积累企业大数据

    从帆软研究院过去3年多的调研来看,企业不舍得投资管理信息系统和数据积累,主因是没有充分认识到这些业务生产、经营、管理的数据的价值,不知道数据有什么用。当前,企业中还是实用主义至上,企业管理者当前看不到数据的价值,就不注重数据的收集和管理。可以说,这是企业管理者“短视”导致的必然结果,同时也为未来企业竞争动力不足留下隐患。

    其实,我们企业不是没有数据,而是没有对数据进行有效管理。我们不可能分析和挖掘没有的数据。现在不积累数据,会陷入“先有鸡还是先有蛋”的怪圈。未来的市场竞争环境完全不同以往,靠经验做决策风险非常高,企业需要积累数据,“以史为鉴”,避免“重蹈覆辙”,做到“心中有数”。

    根据管理学大师彼得·德鲁克的经验,企业最大的经营风险来自于外部和内部环境的不确定性,越是复杂多变的市场环境下,企业要想持续经营就越加需要注重确定性,而提高企业经营和管理确定性的基础就是数据。

    企业数据化管理做不成,是有方法诊断“病因”的,我们主要从“不会”和“不为”两个方面诊断。

    一是:不会。确实,大数据概念太新,相关知识、书籍 、培训课程不足,问题客观存在。同时,我们也应该看到,帆软等大数据分析解决方案服务商,探索在前,有成功经验可以借鉴。

    二是:不为。我们需要绕过最大阻力:“你不可能叫醒一个装睡的人”,很难教会一家不愿意推数据化管理的企业。企业的大数据积累和沉淀需要企业全员的数据思维和数据意识。如果中层管理者和基层员工缺乏数据思维和意识,企业高层难以推动。

    最后,笔者整理总结了一张图,方便大家系统了解“企业大数据”。

    参考资料:[1] 赵兴峰. 企业数据化管理变革[M]. 电子工业出版社, 2016.

  • ?

    神问答|到底什么叫大数据?

    粱焦

    展开

    导语:大数据是“大数据”吗?

    关于“到底什么叫大数据?”这个问题,小编整理了多个来源的用户回答,供大家更全面的了解。

    名为“程序媛不是程序猿”的网友的回答也是很透彻:

    大数据在像各个行业渗透,我们通过数据可以解决很多宏观上无法把控的事务,通过数据的收集处理分析可以得到更加科学性的得出一些用肉眼或者意识和思维无法得出的结论。例如,企业可以运用‘大数据’改善决策流程和业务成效的潜能;在医疗中,大数据剖析应用的计算能力可以让我们能够在几分钟内就可以解码整个DNA,而且让我们可以制订出最新的治疗方案,同时可以更好的去理解和预测疾病;在电商行业中,利用大数据进行精准营销,它根据客户的消费习惯提前生产资料、物流管理等,有利于精细社会大生产;在金融行业中,更多应用于交易,现在很多股权的交易都是利用大数据算法进行,这些算法现在越来越多的考虑了社交媒体和网站新闻来决定在未来几秒内是买出还是卖出。在传统领域大数据同样将发挥巨大作用:帮助农业根据环境气候土壤作物状况进行超精细化耕作;在工业生产领域全盘把握供需平衡,挖掘创新增长点;交通领域实现智能辅助乃至无人驾驶,堵车与事故将成为历史;能源产业将实现精确预测及产量实时调控。大数据不但单只是应用于企业和政府,在不久的未来在我们每个人身上会广泛应用。

    名为“西线学院”的网友的回答也是很透彻:

    大数据作为一个名词其实是晚于Hadoop的,更是晚于MapReduce。曾经有那么一段时间,流行的词语是MapReduce而不是大数据。当然再后来,大数据这个词就流行开了。但是大数据到底是什么,到今天应该还是稀里糊涂的一笔账。话说我做所谓的大数据都不知道多少年了,今天我还是搞不清楚大数据到底是什么。在维克托·迈尔-舍恩伯格及肯尼斯·库克耶编写的《大数据时代》中大数据指不用随机分析法这样捷径,而采用所有数据进行分析处理。我不知道大家是不是读懂了,反正我做大数据这么多年,这段定义我是读不懂。无非是数据和处理数据的工具以及从数据里面提取有用信息变成钱的过程。行为学家Dan Ariely关于大数据的名言,今天我们继续共享一下这段名言:大数据就像青少年性行为:大家都谈论,没有人真正知道怎么做,每个人都认为其他人都在做,所以每个人都声称自己在做。现在我们可以看到各行各业都在谈论大数据。现在大数据都上升到国家高度了。比如说政府办公要上大数据,一个三线城市,放两三台机器搞定的,这数据真的非常的大。如果我们撇开大数据这个概念不谈,自从有了数据以来,人类一直做的事情是什么?以前买Oracle的数据库IBM大型机Teradata的解决方案,贼贵。

    来看看网名为“汽车人参考”的网友是怎么说的:

    2017年我国汽车保有量已经达到2.05亿辆,而且预计在未来的销量还会增加,到2020年达到3000万辆。汽车的最终目的是为人们提供移动出行的解决方案,对于未来汽车的发展趋势,业界基本上有一个共识,未来的汽车会朝着“电动化,网联化,智能化,共享化”四个方向发展。基于汽车网联化的发展,形成了以用户为中心的生态链,如下图:围绕在车主周围,有不同层级的参与者。传统的主机厂,汽车制造商,硬件供应商,4S店,只是其中很一小部分。还有各种服务商,提供商,开发商,保险公司,传媒,甚至教育机构,也扮演着重要的角色。车联网能够将这些参与者全部连接起来,靠什么?汽车产业数据,驾驶行为数据,汽车感知数据,外部环境数据,还有最重要的人的社会数据,都储存在“庞大的汽车保有量”这个数据库中。围绕着车联网,以上的数据不断地更新,不断地累积,形成了庞大的数据库,可被收集,并进行分析和处理。通过数据处理,得到基于用户里程的分布,轨迹,行驶速度,超速违规事件一系列统计:由此,构建出一个精准的用户画像,做什么,爱好是什么,习惯什么等等。技术·原创·精致·有趣。

    名为“先锋原创”的网友的回答也是很透彻:

    大数据,这个名称简直是简单粗暴,顾名思义就是大量的数据,不,应该是海量的数据,是互联网发展的产物,互联网这么多年来,数据是呈指数爆炸式增长的。各行各业都有大数据,比如电子商务方面,买家的性别,年龄,联系方式,地址,购买过的产品,消费金额等都被记录下来,当有千万上亿条记录的时候,就是大数据,这些数据有什么用?有大用,宏观上可以给出预测,知道流行趋势,大家喜欢什么样的产品,从而指导生产;微观上可以给具体的消费者推送对应的商品,你对哪些感兴趣,你到处看到的都是这些东西。马云说的现在是data(数据)时代,新零售(消费指导生产)时代,实际上并没有夸张,只是好多人听不懂而已。

    名为“草原独狼”的网友的回答也是很透彻:

    简单来说,大数据就是大量的信息,尤其指存在于互联网和数字终端中的数字信息。大数据到底有多大?统计数据表明,在一天之中,互联网产生的全部内容可以刻满1.68 亿张DVD。IBM 公司的研究称,在整个人类文明所获得的全部数据中,有90% 是过去2 年内产生的。而到了2020 年,全世界所产生的数据规模将达到今天的44 倍。

  • ?

    #未来已来#大数据时代:数据到底有什么用?

    艾略特

    展开

    大家好,今天跟大家聊一聊数据时代的未来和发展。

    在近代人们对数据的要求没有那么的迫切,那个时候没有数据分析师,没有IT,但是随着人类的发展,随着工业革命和科技革命的发展,数据对我们来说越来越重要,比如说美国的一个城市---纽约就是一个很鲜明的例子,通过数据挖掘,有效预防了火灾。据统计,纽约大约有100万栋建筑物,平均每年约有3000栋会发生严重的火灾。纽约消防部门将可能导致房屋起火的因素细分为60个,诸如是否是贫穷、低收入家庭的住房,房屋建筑年代是否久远,建筑物是否有电梯等。除去危害性较小的小型独栋别墅或联排别墅,分析人员通过特定算法,对城市中33万栋需要检验的建筑物单独进行打分,计算火灾危险指数,划分出重点监测和检查对象。目前数据监测项目扩大到2400余项,诸如学校、图书馆等人口密集度高的场所也涵盖了。尽管公众对数据分析和防范措施的有效性之间的关系心存疑虑,但是火灾数量确实下降了。

    未来是DT和IOT的时代,数据的利用会极大丰富我们的生活,以前只有电脑象征着数据处理器,但是现在手机也通上了数据,电视、摄像头、空调、冰箱、电灯泡、窗帘等等一系列生活电器也通上了互联网数据,让我们还没有回家就已经打开了空调,让我们离开家也能关闭电视机、打开窗帘、观察家里发生的一切,是互联网+数据让我们生活变得更智能更丰富,让我们的工作效率更高。

    我觉得未来受数据影响最大的应该是生产制造业,因为就目前来看,我国的制造业还存在明显的短板,而且好多的生产厂家都是流水线的工人,真正意义上的自动化程度并没有那么高,前些天我在网上看到一个视频,视频是一个把活蹦乱跳的鸡杀死然后把每个部分的肉都分好类的机械设备,当然,这并不是中国的,是德国的一套机械设备,在生产过程中,全都靠机械手和传感器,鸡先在一个平台上,然后被依次推进先杀死放血然后再去毛,然后去内脏再分割腿、翅、脖子、鸡爪等等,一系列流程下来,最后把各个器官都分类堆在一起,视频全程没有出现一个人,我看完后不免惊叹科技竞如此发达,完全依靠机械手臂和传感器就能把原来我们几十分钟甚至几分钟做的事给缩短成了几秒,确实是提高了生产效率,而且还节省了人员成本。

    旧工业生产设备

    工业生产的物联网都是依靠采集的数据来使工业生产变得更精准更人性化,不管是在什么时候,不管是在做什么,不要以为好多数据没必要去采集,因为在数据没有采集上来之前你不知道这个数据到底有没有用,因为你不会考虑到你的核心业务诉求是否受这个数据影响,一个企业也是一样,如果单纯的以为只有自己想到收集的数据是有用的,其他的数据不去挖掘不去考量不及时呈现的话,这个企业不会更好更健康的发展下去,不能及时的解决、预防企业中的问题,就像在原来没有血压计、没有x光、没有CT这些数据采集机械设备,没有这些数据医学家也没办法来研究这些病症的治疗和预防方法,使得人们的高血压、心脏病等等这些病症没有办法得到治疗和预防。

    物联网用数据采集器

    综上所述,我觉得未来的统计数据是最值钱的,未来数据统计相关的职业会越来越火爆,会越来越值钱,谁掌握的数据多,谁采集的数据实时精确,谁就会坐拥财富!所以我觉得我们以后都必须重视数据,养成数据思维,学会分析利用数据来解决我们的问题,那我们的工作效率就会更高。那么朋友们你们怎么看呢?欢迎大家留言讨论!

  • ?

    科普:大数据专家告诉你到底什么是大数据

    亦巧

    展开

    近年来大数据发展越来越好,身处互联网的环境中,突然发现,周围的人经常谈的话题变了,很多人都在谈论大数据、人工智能、智慧城市,大数据中心等大数据相关的内容,看来大数据是真的火起来了,但是大数据到底是什么?很多人其实并不清楚,今天就为大家分享下,到底什么是大数据?

    下面我们一起来看看大数据的概念

    马云爸爸说“我们已从IT时代进入了DT时代,未来我们的汽车、电灯泡、电视机、电冰箱等将全部装上操作系统,并进行数据集成,数据将会让机器更“聪明”。DT时代,数据将成为主要的能源,离开了数据,任何组织的创新都基本上是空壳。”

    大数据是眼下非常时髦的热词,同时也催生出了一些与大数据处理相关的职业,通过对数据的挖掘分析来影响企业的商业决策。随着大数据在国内的发展,大数据相关人才却出现了供不应求的状况,大数据高级研发工程师、大数据分析师更是被媒体称为“未来最具发展潜力的职业之一”。

  • ?

    人人都在说的大数据到底是什么?(技术层)

    天堂海

    展开

    前沿技术普及系列·写在前面

    不知道大家有没有和象牙妹儿一样的感觉,便是最近1年很多AI产品铺天盖地的来到了我们的生活,比如某些家的智能陪伴音响、翻译棒、智能机器人、AR拍照手机等等。

    这里面背后的前沿技术大数据、云计算、区块链、物联网、 5G、数字化…前几年甚至到现在听着还很遥远,但却已有不少在冲击着商业的世界,渗透进我们的生活!

    如何拨开层层浓雾,抵达未来的彼岸?如何把握技术的钥匙,启开未来商业世界的大门!

    大象互联网圈发起主办的第二届中国【郑州】开发者大会不但关注技术·商业的融合,也关注着前沿技术的分享。

    因此,从今天起,大象互联网圈公众号将目光聚焦在大数据、云计算、物联网IOT、人工智能AI、区块链、VR/AR等板块,一一从概念层、目前行业发展状况、企业实际应用层、技术层、岗位前景等为大家带来干货的普及,快来和象牙儿妹一块围观吧!

    上一篇:人人都在说的大数据到底是什么?(概念层)

    本文由“壹伴编辑器”提供技术支持

    提到大数据技术,最基础和核心的仍是大数据的分析和计算。在2017年,大数据分析和计算技术仍旧在飞速的发展,无论老势力Hadoop还是当红小生Spark,亦或是人工智能,都在继续自己的发展和迭代。

    目前绝大部分传统数据计算和数据分析服务均是基于批量数据处理模型:使用ETL系统或OLTP系统进行构造数据存储,在线的数据服务通过构造SQL语言访问上述数据存储并取得分析结果。这套数据处理的方法伴随着关系型数据库在工业界的演进而被广泛采用。

    本文将分别讨论大数据技术涉及到的技术框架、平台以及未来的发展趋势。

    本文由“壹伴编辑器”提供技术支持

    1.批处理框架

    传统的批量数据处理模型通常基于如下处理模型:

    1.使用ETL系统或者OLTP系统构造原始的数据存储,以提供后续的数据服务进行数据分析和数据计算。用户装载数据,系统根据自己的存储和计算情况,对于装载的数据进行索引构建等一些列查询优化工作。

    因此,对于批量计算,数据一定需要加载到计算机系统,后续计算系统才在数据加载完成后方能进行计算。

    2.用户或系统主动发起一个计算作用并向上述数据系统进行请求。此时计算系统开始调度(启动)计算节点进行大量数据计算,该过程的计算量可能巨大,耗时长达数分钟乃至数小时。

    同时,由于数据累计的不可及时性,上述计算过程的数据一定是历史数据,无法保证数据的实时性。

    3.计算结果返回,计算作业完成后将数据以结果集形式返回用户,或者可能由于计算结果数量巨大保存着数据计算系统中,用户进行再次数据集成到其他系统。一旦数据结果巨大,整体的数据集成过程漫长,耗时可能长达数分钟乃至数小时。

    典型代表:Hadoop

    Hadoop是Apache的一个开源项目,是可以提供开源、可靠、可扩展的分布式计算工具。它主要包括HDFS和MapReduce两个组件,分别用于解决大数据的存储和计算。

    HDFS是独立的分布式文件系统,为MapReduce计算框架提供存储服务,具有较高的容错性和高可用性,基于块存储以流数据模式进行访问,数据节点之间项目备份。默认存储块大小为64M,用户也可以自定义大小。

    HDFS是基于主从结构的分布式文件系统,结构上包括NameNode目录管理、DataNode的数据存储和Client的访问客户端3部分。

    NameNode主要负责系统的命名空间、集群的配置管理以及存储块的复制;DataNode是分布式文件系统存储的基本单元;Client为分布式文件系统的应用程序。

    对于数据存储,HDFS采用的是多副本的方式来存储数据,即Client将数据首先通过NameNode获取数据将要存储在哪些DataNode上,之后这些存储到最新数据的DataNode将变更数据以同步或异步方式同步到其他DataNode上。

    在Hadoop3.0之后,采用Erasure Coding可以大大的降低数据存储空间的占用。对于冷数据,可以采用EC来保存,这样才能降低存储数据的花销,而需要时,还可以通过CPU计算来读取这些数。

    MapReduce是一种分布式计算框架,适用于离线大数据计算。采用函数式编程模式,利用Map和Reduce函数来实现复杂的并行计算,主要功能是对一个任务进行分解,以及对结果进行综合汇总。

    具体来说,MapReduce是将那些没有经过处理的海量数据进行数据分片,即分解成多个小数据集;每个Map并行地处理每一个数据集中的数据,然后将结果存储为,并把key值相同的数据进行归并发送到Reduce处理。

    本文由“壹伴编辑器”提供技术支持

    2.流计算框架

    不同于批量计算模型,流式计算更加强调计算数据流和低时延,流式计算数据处理模型如下:

    1.使用实时集成工具,将数据实时变化传输到流式数据存储(即消息队列,如RabbitMQ);此时数据的传输编程实时化,将长时间累积大量的数据平摊到每个时间点不停地小批量实时传输,因此数据集成的时延得以保证。

    2.数据计算环节在流式和批量处理模型差距更大,由于数据集成从累计变成实时,不同于批量计算等待数据集成全部就绪后才启动计算作业,流式计算作业是一种常驻计算服务,一旦启动将一直处于等待事件触发的状态,一旦小批量数据进入流式数据存储,流计算立刻计算并迅速得到结果。

    3.不同于批量计算结果数据需要等待数据计算结果完成后,批量将数据传输到在线系统;流式计算作业在每次小批量数据计算后可以立刻将数据写入在线系统,无需等待整个数据的计算结果,可以立刻将数据结果投递到在线系统,进一步做到实时计算结果的实时化展现。

    典型代表:Spark

    Spark是一个快速且通用的集群计算平台。它包含Spark Core、Spark SQL、Spark Streaming、MLlib以及Graphx组件。

    Spark SQL是处理结构化数据的库,它支持通过SQL查询数据。Spark Streming是实时数据流处理组件。MLlib是一个包含通用机器学习的包。GraphX是处理图的库,并进行图的并行计算一样。

    Spark提出了弹性分布式数据集的概念(Resilient Distributed Dataset),简称RDD,每个RDD都被分为多个分区,这些分区运行在集群的不同节点上。一般数据操作分为3个步骤:创建RDD、转换已有的RDD以及调用RDD操作进行求值。

    在Spark中,计算建模为有向无环图(DAG),其中每个顶点表示弹性分布式数据集(RDD),每个边表示RDD的操作。

    RDD是划分为各(内存中或者交换到磁盘上)分区的对象集合。在DAG上,从顶点A到顶点B的边缘E意味着RDD B是RDD A上执行操作E的结果。有两种操作:转换和动作。

    转换(例如;映射、过滤器、连接)对RDD执行操作并产生新的RDD。

    本文由“壹伴编辑器”提供技术支持

    3.交互式分析框架

    在解决了大数据的可靠存储和高效计算后,如何为数据分析人员提供便利日益受到关注,而最便利的分析方式莫过于交互式查询。

    这几年交互式分析技术发展迅速,目前这一领域知名的平台有十余个,包括Google开发的Dremel和PowerDrill,Facebook开发的Presto,Hadoop服务商Cloudera和HortonWorks分别开发的Impala和Stinger,以及Apache项目Hive、Drill、Tajo、Kylin、MRQL等。

    一些批处理和流计算平台如Spark和Flink也分别内置了交互式分析框架。由于SQL已被业界广泛接受,目前的交互式分析框架都支持用类似SQL的语言进行查询。早期的交互式分析平台建立在Hadoop的基础上,被称作SQL-on-Hadoop。

    后来的分析平台改用Spark、Storm等引擎,不过SQL-on-Hadoop的称呼还是沿用了下来。SQL-on-Hadoop也指为分布式数据存储提供SQL查询功能。

    典型代表:Hive

    ApacheHive是最早出现的架构在Hadoop基础之上的大规模数据仓库,由Facebook设计并开源。Hive的基本思想是,通过定义模式信息,把HDFS中的文件组织成类似传统数据库的存储系统。

    Hive保持着Hadoop所提供的可扩展性和灵活性。Hive支持熟悉的关系数据库概念,比如表、列和分区,包含对非结构化数据一定程度的SQL支持。它支持所有主要的原语类型(如整数、浮点数、字符串)和复杂类型(如字典、列表、结构)。

    它还支持使用类似SQL的声明性语言HiveQueryLanguage(HiveQL)表达的查询,任何熟悉SQL的人都很容易理解它。HiveQL被编译为MapReduce过程执行。下图说明如何通过MapReduce实现JOIN和GROUPBY。

    部分HiveQL操作的实现方式

    Hive与传统关系数据库对比如下:

    Hive的主要弱点是由于建立在MapReduce的基础上,性能受到限制。很多交互式分析平台基于对Hive的改进和扩展,包括Stinger、Presto、Kylin等。其中Kylin是中国团队提交到Apache上的项目,其与众不同的地方是提供多维分析(OLAP)能力。

    Kylin对多维分析可能用到的度量进行预计算,供查询时直接访问,由此提供快速查询和高并发能力。Kylin在eBay、百度、京东、网易、美团均有应用。

    本文由“壹伴编辑器”提供技术支持

    5.其他类型的框架

    除了上面介绍的几种类型的框架外,还有一些目前还不太热门但具有重要潜力的框架类型。图计算是DAG之外的另一种迭代式计算模型,它以图论为基础对现实世界建模和计算,擅长表达数据之间的关联性,适用于PageRank计算、社交网络分析、推荐系统及机器学习。这一类框架有GooglePregel、ApacheGiraph、ApacheHama、PowerGraph、,其中PowerGraph是这一领域目前最杰出的代表。很多图数据库也内置图计算框架。

    另一类是增量计算框架,探讨如何只对部分新增数据进行计算来极大提升计算过程的效率,可应用到数据增量或周期性更新的场合。这一类框架包括GooglePercolator、MicrosoftKineograph、阿里Galaxy等。

    另外还有像

    ApacheIgnite、ApacheGeode(GemFire的开源版本)这样的高性能事务处理框架。

    本文由“壹伴编辑器”提供技术支持

    6.总结与展望

    从Hadoop横空出世到现在10余年的时间中,大数据分布式计算技术得到了迅猛发展。不过由于历史尚短,这方面的技术远未成熟。各种框架都还在不断改进,并相互竞争。

    性能优化毫无疑问是大数据计算框架改进的重点方向之一。而性能的提高很大程度上取决于内存的有效利用。这包括前面提到的内存计算,现已在各种类型的框架中广泛采用。

    拥抱机器学习和人工智能也是大数据计算的潮流之一。Spark和Flink分别推出机器学习库SparkML和FlinkML。更多的平台在第三方大数据计算框架上提供机器学习,如Mahout、Oryx及一干Apache孵化项目SystemML、HiveMall、PredictionIO、SAMOA、MADLib。

    在同一平台上支持多种框架也是发展趋势之一,尤其对于那些开发实力较为雄厚的社区。

    Spark以批处理模型为核心,实现了交互式分析框架SparkSQL、流计算框架SparkStreaming(及正在实现的StructuredStreaming)、图计算框架GraphX、机器学习库SparkML。

    本文由“壹伴编辑器”提供技术支持

    7.学习资料

    最后介绍一下大数据计算方面的学习资料。

    论坛

    首推知乎、Quora、StackOverflow,运气好的话开发者亲自给你解答。其他值得关注的网站或论坛包括炼数成金、人大经济论坛、CSDN、博客园、云栖社区、360大数据、推酷、伯乐在线、小象学院等。

    微信订阅号

    InfoQ是最权威的,其他还有THU数据派、大数据杂谈、CSDN大数据、数据猿、Hadoop技术博文等,各人根据偏好取舍。

    官方网站文档

    若要进行系统的学习,则首先应参考官方网站文档。不少大数据平台的官方文档内容都比较详实,胜过多数教材。

    书籍

    国外O\'Reilly、Manning两家出版社在大数据领域出版了不少优秀书籍,特别是Manning的InAction系列和O\'Reilly的DefinitiveGuide系列。

    本篇关于大数据的技术层面分析就介绍到这,下一篇我们将对大数据的最终价值体现——大数据实践进行分析介绍。

    END

    第二届中国【郑州】开发者大会

    线上报名通道全面开放

    本次大会将开设从数字化到大数据落地专场,现已开放报名通道,门票分为49.9普通票和VIP票两种,其中VIP票权益非常丰富,票价为199元且仅限200张,下面是两种票的权益对比:

  • ?

    大数据起源,给你解析到底什么是大数据!

    祝鑫磊

    展开

    大数据,英文名big data。因为传播已经成为习惯,我们并没有过多的去思考为什么用big data去描述,但是现在我们仔细回味一下,会发现大数据这个大为什么不用large为什么不用海量vast呢?归根结底我们可能就需要从语法上,来分析一下,它们三个之间的区别。big形容大小。更多的时候,是一种比较行为上的大,是种相对来说的感觉,而large和vast更多的时候形容的是的是一种形体上的巨大。

    那么现在来推敲一下big data这个词,大数据这个大其实是一种相对的说法是相对于传统的数据体量来说的,过去任何时候的数据相对于现在来说都显得太过于渺小,而现在我们所说的大数据是一种量变最后达到了质变的概念。

    数据这个词最早在媒体上风靡应该是2007年左右。往上追溯应该就是05年谷歌参加有美国官方举办的一个机器翻译大赛,最终由于使用了海量的相关数据而夺得第一,在那之后大数据这个概念渐渐的被业内人士所传播。那么到底什么是大数据呢?

    大数据顾名思义,最表象的特征就是数据量够大。但是仅仅数据量够大,并不能构成大数据整体的含义。如果是海量杂乱无章,互之间没有关联的数据,即便再怎么定义,它也算不上是大数据。就譬如一个人体内的基因图谱,详细的基因图谱数据如果记录出来是一个很大体量的,但是没有意义。

    大数据而且还有个概念,那就是多维度。在十年前,如果说国内哪一家公司最有资格说大数据的,那无疑是百度了。作为一个独占13亿用户专属的搜索公司来说,百度对于用户画像的记录,无疑是多维的。百度搜索,至今记录了无数用户每天在互联网上搜索的问题,或者说知识。在时间维度上用户对某些词汇搜索的频次高低这些都是数据。它可以通过对注册用户的甄别就可以知道搜索这个词汇或者是这个问题的用户是男生还是女生?年龄分布是是小孩、青年抑或是一个中年大叔?再到后来个人电脑开始普及,通过记录ip等信息,根据ip搜索的百度的问题的分类,可以判断中国各个区域,是南方富裕一点,还是北方富裕点?是江苏人更爱吃,还是闽南人更喜欢谈论吃?百度完全可以根据自己的数据生成得到国内各种关于此类的数据,普查之后所能得到的答案这就是因为百度所具有的数据是一个多维度的数据。他的数据收集过程,是一个长期的持续性的工作。

    除了百度之外,腾讯的qq确实每年都会有一个关于qq的城市报告。它会根据qq的用户数据,甚至于至于活跃地点。在一个大的范围内青年QQ用户的占比,最终可以得到中国城市年轻度排行榜。可以根据这些数据判断,哪一个城市是,年轻人毕业之后最愿意去的。可以判断哪一个城市的,年轻人毕业之后,是回归率最高的。也可以判断哪一个城市的人才流失率更低,更容易留住外来人才。这些都是大数据多维度的应用。

    大数据还有一个非常重要的特点,那就是全面性。经常在某些大型活动之前我们都会遇到。某些公司对于这件事情,会做出预测。然后最终的结果让我们大失所望。预测无疑是需要基于数据基础的预测,如果这个数据不够全面的话,最终的预测结果肯定相差甚大。

    关于数据全面性有一个最经典的案例这是12年美国大选大选事件。一个名叫斯威尔的年轻人,利用大数据预测。成功预测出了51个州的选举果,要知道这在之前是从来没有发生过的事情。美国大选在之前就一直有专业的预测机构做预测,但是就连这种长期做数据,分析的公司都从来没有如此成功的预测过。那是因为斯威尔将网上所有关于选举的数据,包括新闻稿,以及facebook和推特上面人们关于选举的言论,所有的数据都做了甄选处理。这份数据反映的是网民全面几乎没有遗漏的想法,最终得到了某种程度上来说,比较具有完备性的数据,所以能够如此成功的预测13年美国大选的结果。

    关于大数据的科普我们就到这里了,有任何问题可以留言咱一起交流,本文由玩机丧志原创,欢迎关注,带你一起长知识!

  • ?

    都说大数据,你知道到底什么是大数据吗?

    梧桐树

    展开

    俺黑君够黑,慎关注!

    究竟什么是大数据?如何对大数据进行定义?大数据有哪些特征?了解了这些才能更好的知道自己学习是怎样的一门技术,以及它的前景如何。本文达妹就带大家一起了解大数据。

    DT时代,人人言必称大数据,所有的新系统几乎都是基于大数据,有人认为用了MongoDB就是大数据,也有人用了Hadoop就是大数据,或者认为数据量大就是大数据。

    更有甚者,笔者看到一篇新闻报道,说某企业成功实施大数据项目,结果只是SQL-Server集群……天呐,这可是上世纪的技术了!

    说了这么多到底什么是大数据呢,其实大数据并没有教科书式的明确定义,但是却有比较公认的特性描述,符合这些特性的就可以称作大数据,即大数据的4个V。

    第一个V——高容量

    这个最好理解,数据量一定要大,才好意思称自己为大数据嘛。大到什么程度呢?依目前行情来看,至少也要到TB级,很多案例都是PB甚至更高。但如果是GB级,非说自己是大数据也不是不可以,就是有点无颜见江东父老啊……

    第二个V——多样化

    这个很关键了!是区别于以往海量数据挖掘的最主要特征。它有两层含义,一是数据来源多样化,系统数据、设备日志、传感器、文件系统等等来源。二是数据结构多样化,这是核心特征!要包含结构化数据、非结构数据(包括所谓半结构化数据)。

    总结起来就是,多源异构。这就是为什么有人认为使用NoSQL数据库(如MongoDB)就是大数据了,因为满足了多样化的特征,但其实还不够。

    第三个V——高速

    即时效性,基本上至少也要达到亿级数据一秒查询,做的比较好的可以达到千亿级数据一秒查询。这个特征几乎决定了传统技术架构无法满足要求,因此Hadoop架构的出现催化了大数据的发展,也是有人认为Hadoop就是大数据的原因。

    第四个V——价值

    这个很好理解,数据一定要有价值、而后才能产生价值。就好比存商品的叫才能仓库,存垃圾的叫垃圾填满坑一样。没价值的数据就像一个垃圾填满坑,这也是为什么数据治理在大数据实施中非常重要的原因之一。

    最后,也是最重要的,以上4个V是逻辑与的关系,即需同时、注意是同时满足上述四个特征,就可以放心的说自己是大数据了!

    文版权归原作者所有。转载文章仅为传播更多信息之目的,如有侵权请与我们联系,我们将及时处理。

  • ?

    所谓大数据,那到底什么才是大数据?

    支灵竹

    展开

    世界包含的多得难以想象的数字化信息变得更多更快,从商业到科学,从政府到艺术,这种影响无处不在。科学家和计算机工程师们给这种现象创造了一个新名词:“大数据”。所谓大数据,那到底什么是大数据,他的来源在哪里,定义究竟是什么呢?

    一:大数据的定义。

    1、大数据,又称巨量资料,指的是所涉及的数据资料量规模巨大到无法通过人脑甚至主流软件工具,在合理时间内达到管理、处理、并整理成为帮助企业经营决策更积极目的的资讯。

    2、大数据技术,是指从各种各样类型的大数据中,快速获得有价值信息的技术的能力,包括数据采集、存储、管理、分析挖掘、可视化等技术及其集成。

    3、大数据应用,是指对特定的大数据集合,集成应用大数据技术,获得有价值信息的行为。对于不同领域、不同企业的不同业务,甚至同一领域不同企业的相同业务来说,由于其业务需求、数据集合和分析挖掘目标存在差异,所运用的大数据技术和大数据信息系统也可能有着相当大的不同。

    二:大数据的类型和价值挖掘方法

    1、大数据的类型大致可分为三类:

    1)传统企业数据:包括消费者数据,传统的ERP数据,库存数据以及账目数据等。2)机器和传感器数据:包括呼叫记,智能仪表,设备日志,交易数据等。3)社交数据:包括用户行为记录,反馈数据等。2、大数据挖掘商业价值的方法主要分为四种:1)客户群体细分,然后为每个群体量定制特别的服务。2)模拟现实环境,发掘新的需求同时提高投资的回报率。3)加强部门联系,提高整条管理链条和产业链条的效率。4)降低服务成本,发现隐藏线索进行产品和服务的创新。

    三:大数据的特点

    具体来说,大数据具有4个基本特征:

    1、是数据体量巨大

    2、是数据类别大和类型多样3、是处理速度快4、是价值真实性高和密度低

    四:大数据的作用

    1、对大数据的处理分析正成为新一代信息技术融合应用的结点移动互联网、物联网、社交网络、数字家庭、电子商务等是新一代信息技术的应用形态,这些应用不断产生大数据。云计算为这些海量、多样化的大数据提供存储和运算平台。通过对不同来源数据的管理、处理、分析与优化,将结果反馈到上述应用中,将创造出巨大的经济和社会价值。2、大数据是信息产业持续高速增长的新引擎面向大数据市场的新技术、新产品、新服务、新业态会不断涌现。在软件与服务领域,大数据将引发数据快速处理分析、数据挖掘技术和软件产品的发展。3、大数据利用将成为提高核心竞争力的关键因素各行各业的决策正在从“业务驱动” 转变“数据驱动”。对大数据的分析可以使零售商实时掌握市场动态并迅速做出应对;可以为商家制定更加精准有效的营销策略提供决策支持;可以帮助企业为消费者提供更加及时和个性化的服务;4、大数据时代科学研究的方法手段将发生重大改变,抽样调查是社会科学的基本研究方法。在大数据时代,可通过实时监测、跟踪研究对象在互联网上产生的海量行为数据,进行挖掘分析,揭示出规律性的东西,提出研究结论和对策。

    五:大数据的商业价值

    1、对顾客群体细分

    2、模拟实境3、提高投入回报率4、数据存储空间出租5、管理客户关系6、个性化精准推荐7、数据搜索

    六:大数据对经济社会的重要影响

    1、能够推动实现巨大经济效益2、能够推动增强社会管理水平3、如果没有高性能的分析工具,大数据的价值就得不到释放

  • ?

    人人都在说的大数据到底是什么?(概念层)

    Xena

    展开

    前沿技术普及系列·写在前面

    不知道大家有没有和象牙妹儿一样的感觉,就是最近1年很多AI产品铺天盖地的来到了我们的生活,比如某些家的智能陪伴音响、翻译棒、智能机器人、AR拍照手机等等。

    这里面背后的前沿技术大数据、云计算、区块链、物联网、 5G、数字化…前几年甚至现在听着还很遥远,却已有不少在冲击着商业的世界,渗透进我们的生活!

    如何拨开层层浓雾,抵达未来的彼岸?如何把握技术的钥匙,启开未来商业世界的大门!

    大象互联网圈发起主办的第二届中国【郑州】开发者大会不但关注技术·商业的融合,也关注着前沿技术的分享。

    因此,从今天起,大象互联网圈公众号将目光聚焦在大数据、云计算、物联网IOT、人工智能AI、区块链、VR/AR等板块,一一从概念层、目前行业发展状况、企业实际应用层、技术层、岗位前景等为大家带来干货的普及,快来和象牙儿妹一块围观吧!

    本文由“壹伴编辑器”提供技术支持

    正文

    如果你说大数据就是数据大,或者侃侃而谈4个V,也许很有深度的谈到BI或预测的价值,又或者拿Google和Amazon举例,技术流可能会聊起hadoop和Cloud Computing,不管对错,只是无法勾勒对大数据的整体认识,不说是片面,但至少有些管窥蠡测,也许“解构”是最好的方法。

    首先,大数据就是互联网发展到现今阶段的一种表象或特征而已,没有必要神话它或对它保持敬畏之心,在以云计算为代表的技术创新大幕的衬托下,这些原本很难收集和使用的数据开始容易被利用起来了,通过各行各业的不断创新,大数据会逐步为人类创造更多的价值。

    其次,想要系统的认知大数据,必须要全面而细致的分解它,本系列文章我们着手从概念、技术、实践三个层面来展开,本篇文章我们先介绍概念层。

    本文由“壹伴编辑器”提供技术支持

    大数据的定义

    大数据(Big Data)概念是1998年由SGI首席科学家John Masey在USENIX大会上提出的。他当时发表了一篇名为Big Data and the Next Wave of Infrastress的论文,使用了大数据来描述数据爆炸的现象。但大数据真正得到业界关注,则是其后多年的事情了。

    大数据是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    本文由“壹伴编辑器”提供技术支持

    大数据的分类

    互联网上的大数据很难清晰的界定分类界限,我们先看看BAT的大数据:

    百度拥有两种类型的大数据:用户搜索表征的需求数据;爬虫和阿拉丁获取的公共web数据搜索巨头百度围绕数据而生。阿里巴巴拥有交易数据和信用数据。这两种数据更容易变现,挖掘出商业价值。除此之外阿里巴巴还通过投资等方式掌握了部分社交数据、移动数据,如微博和高德。

    腾讯拥有用户关系数据和基于此产生的社交数据。这些数据可以分析人们的生活和行为,从里面挖掘出政治、社会、文化、商业、健康等领域的信息,甚至预测未来。

    在信息技术更为发达的美国,除了行业知名的类似Google,Facebook外,已经涌现了很多大数据类型的公司,它们专门经营数据产品,比如:

    Metamarkets:这家公司对Twitter、支付、签到和一些与互联网相关的问题进行了分析,为客户提供了很好的数据分析支持。

    Tableau:他们的精力主要集中于将海量数据以可视化的方式展现出来。Tableau为数字媒体提供了一个新的展示数据的方式。他们提供了一个免费工具,任何人在没有编程知识背景的情况下都能制造出数据专用图表。

    ParAccel:他们向美国执法机构提供了数据分析,比如对15000个有犯罪前科的人进行跟踪,从而向执法机构提供了参考性较高的犯罪预测。他们是犯罪的预言者。

    QlikTech:QlikTech旗下的Qlikview是一个商业智能领域的自主服务工具,能够应用于科学研究和艺术等领域。为了帮助开发者对这些数据进行分析,QlikTech提供了对原始数据进行可视化处理等功能的工具。

    本文由“壹伴编辑器”提供技术支持

    大数据的4V特征

    即Variety(多样化)、Volume(大量化)、Velocity(快速化)、Value(价值密度低)。如下图所示。

    其中,Variety表示来源多和格式多,数据可以来源于搜索引擎、社交网络、通话记录、传感器等等,这些数据要么以结构化形式存储,要么以非结构化数据存储;Volume表示数据量比较大,从TB级别,跃升到PB级别。

    尤其是在移动互联时代,视频、语言等非结构化数据快速增长;Velocity表示数据存在时效性,需要快速处理,并得到结果出来,这一点也是和传统的数据挖掘技术有着本质的区别;Value表示大量不相关信息,不经过处理则价值较低,属于价值密度低的数据。

    本文由“壹伴编辑器”提供技术支持

    大数据处理流程

    都有以下几个过程:数据采集、数据清洗、数据建模、数据加工、数据展现。如下图所示。

    举个例子,做饭通常都要包括“买菜~洗菜~配菜~炒菜”这几个必须环节,无论你是开饭店还是家里一日三餐,做饭的规模大小会有不同,但流程却是一样的。而这几个环节其实正好对应了数据人的日常工作内容:买菜(数据采集)~洗菜(数据清洗)~配菜(数据建模)~炒菜(数据加工)-上菜(数据展示)。

    在大数据时代,由于数据种类多,数据大,从结构化的数据到非结构化的数据,数据采集的形式也变得更加复杂而多样。

    当存储技术的发展变得步履蹒跚,赶不上数据发展的速度时,分布式存储成为了必然选择,非结构型数据也对存储格式提出了新的要求。

    层出不穷的数据源也使得数据量产生了井喷似的迅猛增长。此时分布式存储与NoSQL的诞生回应了这样的需求,解决了大数据存储的根本难题。

    本文由“壹伴编辑器”提供技术支持

    大数据思维

    关于大数据思维即我们该如何去理解大数据,十余年潜心研究数据科学的技术权威维克托·迈尔-舍恩伯格认为要注意三点:

    需要全部数据样本而不是抽样关注效率而不是精确度关注相关性而不是因果关系。

    阿里巴巴的王坚对于大数据也有一些独特的见解,比如:

    今天的数据不是大,真正有意思的是数据变得在线了,这个恰恰是互联网的特点非互联网时期的产品,功能一定是它的价值,今天互联网的产品,数据一定是它的价值你千万不要想着拿数据去改进一个业务,这不是大数据,你一定是去做了一件以前做不了的事情

    特别是最后一点,我是非常认同的,大数据的真正价值在于创造,在于填补无数个还未实现过的空白。

    有人把数据比喻为蕴藏能量的煤矿。煤炭按照性质有焦煤、无烟煤、肥煤、贫煤等分类,而露天煤矿、深山煤矿的挖掘成本又不一样。与此类似,大数据并不在“大”,而在于“有用”,价值含量、挖掘成本比数量更为重要。

    本文由“壹伴编辑器”提供技术支持

    大数据的价值

    如果把大数据比作一种产业,那么这种产业实现盈利的关键,在于提高对数据的“加工能力”,通过“加工”实现数据的“增值”。

    Target 超市以20多种怀孕期间孕妇可能会购买的商品为基础,将所有用户的购买记录作为数据来源,通过构建模型分析购买者的行为相关性,能准确的推断出孕妇的具体临盆时间,这样Target就可以有针对的在每个怀孕顾客的不同阶段寄送相应的产品优惠卷。

    Wal-Mart作为零售行业的巨头,他们的分析人员会对每个阶段的销售记录进行了全面的分析,有一次他们无意中发现虽不相关但很有价值的数据,在美国的飓风来临季节,超市的蛋挞和抵御飓风物品竟然销量都有大幅增加。

    于是他们做了一个明智决策,就是将蛋挞的销售位置移到了飓风物品销售区域旁边,看起来是为了方便用户挑选,但是没有想到蛋挞的销量因此又提高了很多。

    这些例子真实的反映在各行各业,探求数据价值取决于把握数据的人,关键是人的数据思维;与其说是大数据创造了价值,不如说是大数据思维触发了新的价值增长。

    未来在大数据领域最具有价值的是两种事物:1-拥有大数据思维的人,这种人可以将大数据的潜在价值转化为实际利益;2-还未有被大数据触及过的业务领域。这些是还未被挖掘的油井,金矿,是所谓的蓝海。

    本文由“壹伴编辑器”提供技术支持

    大数据的风险

    提到大数据人们生活造成的干扰,你或许对隐私泄露早有耳闻。当你在不同的网站上注册了个人信息后,可能这些信息已经被扩散出去了。

    当你莫名其妙的接到各种邮件,电话,短信的滋扰时,你不会想到自己的电话号码,邮箱,生日,购买记录,收入水平,家庭住址,亲朋好友等私人信息早就被各种商业机构非法存储或贱卖给其它任何有需要的企业或个人了。

    更可怕的是,这些信息你永远无法删除,它们永远存在于互联网的某些你不知道的角落。除非你更换掉自己的所有信息,但是这代价太大了。

    目前,中国并没有专门的法律法规来界定用户隐私,处理相关问题时多采用其他相关法规条例来解释。但随着民众隐私意识的日益增强,合法合规地获取数据、分析数据和应用数据,是进行大数据分析时必须遵循的原则。

    因此在大数据的背景下,很多人都在积极的抵制无底线的数字化,这种大数据和个体之间的博弈还会一直继续下去……

    专家给予了我们一些如何有效保护大数据背景下隐私权的建议:

    减少信息的数字化隐私权立法数字隐私权基础设施(类似DRM数字版权管理)人类改变认知(接受忽略过去)创造良性的信息生态语境化。

    本篇关于大数据的理论层面分析就介绍到这,下一篇我们将对大数据价值体现的手段和前进的基石——大数据技术深入进行展开分析。

    END

    第二届中国【郑州】开发者大会

    线上报名通道全面开放

    本次大会将开设从数字化到大数据落地专场,现已开放报名通道,门票分为免费票和VIP票两种,其中VIP票权益非常丰富,票价为199元且仅限200张,下面是两种票的权益对比:

到底什么是大数据

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP