中企动力 > 商学院 > 大规模数据分析
  • ?

    开源大数据分析工具!

    Tony

    展开

    据已经成为现代化企业中重要的宝贵资源。一切决策、策略或者方法都需要依托于对数据的分析方可实现。随着“大数据分析”逐步替代其上代版本,即“商务智能”,企业正面临着一个更加复杂、且商业情报规模更为庞大的新时代。

    考虑到现有技术解决方案的复杂性与多样化,企业往往很难找到适合自己的大数据收集与分析工具。然而,混乱的时局之下已经有多种方案脱颖而出,证明其能够帮助大家切实完成大数据分析类工作。下面我们将整理出一份包含十款工具的清单,从而有效压缩选择范畴。

    1. OpenRefine

    这是一款高人气数据分析工具,适用于各类与分析相关的任务。这意味着即使大家拥有多川不同数据类型及名称,这款工具亦能够利用其强大的聚类算法完成条目分组。在聚类完成后,分析即可开始。

    2. Hadoop

    大数据与Hadoop可谓密不可分。这套软件库兼框架能够利用简单的编程模型将大规模数据集分发于计算机集群当中。其尤为擅长处理大规模数据并使其可用于本地设备当中。作为Hadoop的开发方,Apache亦在不断强化这款工具以提升其实际效果。

    3. Storm

    同样来自Apache的Storm是另一款伟大的实时计算系统,能够极大强化无限数据流的处理效果。其亦可用于执行多种其它与大数据相关的任务,具体包括分布式RPC、持续处理、在线机器学习以及实时分析等等。使用Storm的另一大优势在于,其整合了大量其它技术,从而进一步降低大数据处理的复杂性。

    4. Plotly

    这是一款数据可视化工具,可兼容JavaScript、MATLAB、Python以及R等语言。Plotly甚至能够帮助不具备代码编写技能或者时间的用户完成动态可视化处理。这款工具常由新一代数据科学家使用,因为其属于一款业务开发平台且能够快速完成大规模数据的理解与分析。

    5. Rapidminer

    作为另一款大数据处理必要工具,Rapidminer属于一套开源数据科学平台,且通过可视化编程机制发挥作用。其功能包括对模型进行修改、分析与创建,且能够快速将结果整合至业务流程当中。Rapidminer目前备受瞩目,且已经成为众多知名数据科学家心目中的可靠工具。

    6. Cassandra

    Apache Cassandra 是另一款值得关注的工具,因为其能够有效且高效地对大规模数据加以管理。它属于一套可扩展NoSQL数据库,能够监控多座数据中心内的数据并已经在Netflix及eBay等知名企业当中效力。

    7. Hadoop MapReduce>

    这是一套软件框架,允许用户利用其编写出以可靠方式并发处理大规模数据的应用。MapReduce应用主要负责完成两项任务,即映射与规约,并由此提供多种数据处理结果。这款工具最初由谷歌公司开发完成。

    8. Bokeh

    这套可视化框架的主要目标在于提供精致且简洁的图形处理结果,用以强化大规模数据流的交互能力。其专门供Python语言使用。

    9. Wolfram Alpha

    这是一套搜索引擎,旨在帮助用户搜索其需要的计算素材或者其它内容。举例来说,如果大家输入“Facebook”,即可获得与Facebook相关的HTML元素结构、输入解释、Web托管信息、网络统计、子域、Alexa预估以及网页信息等大量内容。

    10. Neo4j

    其官方网站将这款工具称为图形数据库技术的下一场革命。这种说法在一定程度上并不夸张,因为此套数据库使用数据间的关系以操作并强化性能表现。Neo4j目前已经由众多企业用于利用数据关系实现智能应用,从而帮助自身保持市场竞争优势。

  • ?

    大数据分析你不能不懂的6个核心技术

    腐蚀

    展开

    目前,大数据领域每年都会涌现出大量新的技术,成为大数据获取、存储、处理分析或可视化的有效手段。大数据技术能够将大规模数据中隐藏的信息和知识挖掘出来,为人类社会经济活动提供依据,提高各个领域的运行效率,甚至整个社会经济的集约化程度。

    1大数据生命周期

    图1展示了一个典型的大数据技术栈。底层是基础设施,涵盖计算资源、内存与存储和网络互联,具体表现为计算节点、集群、机柜和数据中心。在此之上是数据存储和管理,包括文件系统、数据库和类似YARN的资源管理系统。然后是计算处理层,如hadoop、MapReduce和Spark,以及在此之上的各种不同计算范式,如批处理、流处理和图计算等,包括衍生出编程模型的计算模型,如BSP、GAS 等。数据分析和可视化基于计算处理层。分析包括简单的查询分析、流分析以及更复杂的分析(如机器学习、图计算等)。查询分析多基于表结构和关系函数,流分析基于数据、事件流以及简单的统计分析,而复杂分析则基于更复杂的数据结构与方法,如图、矩阵、迭代计算和线性代数。一般意义的可视化是对分析结果的展示。但是通过交互式可视化,还可以探索性地提问,使分析获得新的线索,形成迭代的分析和可视化。基于大规模数据的实时交互可视化分析以及在这个过程中引入自动化的因素是目前研究的热点。

    有2个领域垂直打通了上述的各层,需要整体、协同地看待。一是编程和管理工具,方向是机器通过学习实现自动最优化、尽量无需编程、无需复杂的配置。另一个领域是数据安全,也是贯穿整个技术栈。除了这两个领域垂直打通各层,还有一些技术方向是跨了多层的,例如“内存计算”事实上覆盖了整个技术栈。

    2.大数据技术生态

    大数据的基本处理流程与传统数据处理流程并无太大差异,主要区别在于:由于大数据要处理大量、非结构化的数据,所以在各处理环节中都可以采用并行处理。目前,Hadoop、MapReduce和Spark等分布式处理方式已经成为大数据bbsitedu处理各环节的通用处理方法。

    Hadoop是一个能够让用户轻松架构和使用的分布式计算平台。用户可以轻松地在Hadoop上开发和运行处理海量数据的应用程序。Hadoop 是一个数据管理系统,作为数据分析的核心,汇集了结构化和非结构化的数据,这些数据分布在传统的企业数据栈的每一层。Hadoop也是一个大规模并行处理框架,拥有超级计算能力,定位于推动企业级应用的执行。Hadoop又是一个开源社区,主要为解决大数据的问题提供工具和软件。虽然Hadoop提供了很多功能,但仍然应该把它归类为多个组件组成的Hadoop生态圈,这些组件包括数据存储、数据集成、数据处理和其他进行数据分析的专门工具。图2 展示了Hadoop 的生态系统,主要由HDFS、MapReduce、Hbase、Zookeeper、Oozie、Pig、Hive等核心组件构成,另外还包括Sqoop、Flume等框架,用来与其他企业融合。同时,Hadoop 生态系统也在不断增长,新增Mahout、Ambari、Whirr、BigTop 等内容,以提供更新功能。

    图2Hadoop生态系统

    低成本、高可靠、高扩展、高有效、高容错等特性让Hadoop成为最流行的大数据分析系统,然而其赖以生存的HDFS 和MapReduce 组件却让其一度陷入困境——批处理的工作方式让其只适用于离线数据处理,在要求实时性的场景下毫无用武之地。因此,各种基于Hadoop的工具应运而生。为了减少管理成本,提升资源的利用率,有当下众多的资源统一管理调度系统,例如Twitter 的Apache Mesos、Apache 的YARN、Google 的Borg、腾讯搜搜的Torca、Facebook Corona(开源)等。Apache Mesos是Apache孵化器中的一个开源项目,使用ZooKeeper实现容错复制,使用Linux Containers 来隔离任务,支持多种资源计划分配(内存和CPU)。提供高效、跨分布式应用程序和框架的资源隔离和共享,支持Hadoop、MPI、Hypertable、Spark 等。YARN 又被称为MapReduce 2.0,借鉴Mesos,YARN 提出了资源隔离解决方案Container,提供Java 虚拟机内存的隔离。对比MapReduce 1.0,开发人员使用ResourceManager、ApplicationMaster与NodeManager代替了原框架中核心的JobTracker 和TaskTracker。在YARN平台上可以运行多个计算框架,如MR、Tez、Storm、Spark等。

    基于业务对实时的需求,有支持在线处理的Storm、Cloudar Impala、支持迭代计算的Spark 及流处理框架S4。Storm是一个分布式的、容错的实时计算系统,由BackType开发,后被Twitter捕获。Storm属于流处理平台,多用于实时计算并更新数据库。Storm也可被用于“连续计算”(Continuous Computation),对数据流做连续查询,在计算时就将结果以流的形式输出给用户。它还可被用于“分布式RPC”,以并行的方式运行昂贵的运算。Cloudera Impala是由Cloudera开发,一个开源的Massively Parallel Processing(MPP)查询引擎。与Hive 相同的元数据、SQL语法、ODBC 驱动程序和用户接口(HueBeeswax),可以直接在HDFS 或HBase 上提供快速、交互式SQL 查询。Impala是在Dremel的启发下开发的,不再使用缓慢的Hive+MapReduce 批处理,而是通过与商用并行关系数据库中类似的分布式查询引擎(由Query Planner、Query Coordinator 和Query Exec Engine这3部分组成),可以直接从HDFS 或者HBase 中用SELECT、JOIN 和统计函数查询数据,从而大大降低了延迟。

    Hadoop社区正努力扩展现有的计算模式框架和平台,以便解决现有版本在计算性能、计算模式、系统构架和处理能力上的诸多不足,这正是Hadoop2.0 版本“ YARN”的努力目标。各种计算模式还可以与内存计算模式混合,实现高实时性的大数据查询和计算分析。混合计算模式之集大成者当属UC Berkeley AMP Lab 开发的Spark生态系统,如图3所示。Spark 是开源的类Hadoop MapReduce的通用的数据分析集群计算框架,用于构建大规模、低延时的数据分析应用,建立于HDFS之上。Spark提供强大的内存计算引擎,几乎涵盖了所有典型的大数据计算模式,包括迭代计算、批处理计算、内存计算、流式计算(Spark Streaming)、数据查询分析计算(Shark)以及图计算(GraphX)。Spark 使用Scala 作为应用框架,采用基于内存的分布式数据集,优化了迭代式的工作负载以及交互式查询。与Hadoop 不同的是,Spark 和Scala 紧密集成,Scala 像管理本地collective 对象那样管理分布式数据集。Spark支持分布式数据集上的迭代式任务,实际上可以在Hadoop文件系统上与Hadoop一起运行(通过YARN、Mesos等实现)。另外,基于性能、兼容性、数据类型的研究,还有Shark、Phoenix、Apache Accumulo、Apache Drill、Apache Giraph、Apache Hama、Apache Tez、Apache Ambari 等其他开源解决方案。预计未来相当长一段时间内,主流的Hadoop平台改进后将与各种新的计算模式和系统共存,并相互融合,形成新一代的大数据处理系统和平台。

    图3Spark生态系统

    3.大数据采集与预处理

    在大数据的生命周期中,数据采集处于第一个环节。根据MapReduce产生数据的应用系统分类,大数据的采集主要有4种来源:管理信息系统、Web信息系统、物理信息系统、科学实验系统。对于不同的数据集,可能存在不同的结构和模式,如文件、XML 树、关系表等,表现为数据的异构性。对多个异构的数据集,需要做进一步集成处理或整合处理,将来自不同数据集的数据收集、整理、清洗、转换后,生成到一个新的数据集,为后续查询和分析处理提供统一的数据视图。针对管理信息系统中异构数据库集成技术、Web 信息系统中的实体识别技术和DeepWeb集成技术、传感器网络数据融合技术已经有很多研究工作,取得了较大的进展,已经推出了多种数据清洗和质量控制工具,例如,美国SAS公司的Data Flux、美国IBM 公司的Data Stage、美国Informatica 公司的Informatica Power Center。

    4.大数据存储与管理

    传统的数据存储和管理以结构化数据为主,因此关系数据库系统(RDBMS)可以一统天下满足各类应用需求。大数据往往是半结构化和非结构化数据为主,结构化数据为辅,而且各种大数据应用通常是对不同类型的数据内容检索、交叉比对、深度挖掘与综合分析。面对这类应用需求,传统数据库无论在技术上还是功能上都难以为继。因此,近几年出现了oldSQL、NoSQL 与NewSQL 并存的局面。总体上,按数据类型的不同,大数据的存储和管理采用不同的技术路线,大致可以分为3类。第1类主要面对的是大规模的结构化数据。针对这类大数据,通常采用新型数据库集群。它们通过列存储或行列混合存储以及粗粒度索引等技术,结合MPP(Massive Parallel Processing)架构高效的分布式计算模式,实现对PB 量级数据的存储和管理。这类集群具有高性能和高扩展性特点,在企业分析类应用领域已获得广泛应用;第2类主要面对的是半结构化和非结构化数据。应对这类应用场景,基于Hadoop开源体系的系统平台更为擅长。它们通过对Hadoop生态体系的技术扩展和封装,实现对半结构化和非结构化数据的存储和管理;第3类面对的是结构化和非结构化混合的大数据,因此采用MPP 并行数据库集群与Hadoop 集群的混合来实现对百PB 量级、EB量级数据的存储和管理。一方面,用MPP 来管理计算高质量的结构化数据,提供强大的SQL和OLTP型服务;另一方面,用Hadoop实现对半结构化和非结构化数据的处理,以支持诸如内容检索、深度挖掘与综合分析等新型应用。这类混合模式将是大数据存储和管理未来发展的趋势。

    5.大数据计算模式与系统

    计算模式的出现有力推动了大数据技术和应用的发展,使其成为目前大数据处理最为成功、最广为接受使用的主流大数据计算模式。然而,现实世界中的大数据处理问题复杂多样,难以有一种单一的计算模式能涵盖所有不同的大数据计算需求。研究和实际应用中发现,由于MapReduce主要适合于进行大数据线下批处理,在面向低延迟和具有复杂数据关系和复杂计算的大数据问题时有很大的不适应性。因此,近几年来学术界和业界在不断研究并推出多种不同的大数据计算模式。

    所谓大数据计算模式,即根据大数据的不同数据特征和计算特征,从多样性的大数据计算问题和需求中提炼并建立的各种高层抽象(abstraction)或模型(model)。例如,MapReduce 是一个并行计算抽象,加州大学伯克利分校著名的Spark系统中的“分布内存抽象RDD”,CMU 著名的图计算系统GraphLab 中的“图并行抽象”(Graph Parallel Abstraction)等。传统的并行计算方法,主要从体系结构和编程语言的层面定义了一些较为底层的并行计算抽象和模型,但由于大数据处理问题具有很多高层的数据特征和计算特征,因此大数据处理需要更多地结合这些高层特征考虑更为高层的计算模式。

    根据大数据处理多样性的需求和以上不同的特征维度,目前出现了多种典型和重要的大数据计算模式。与这些计算模式相适应,出现了很多对应的大数据计算系统和工具。由于单纯描述计算模式比较抽象和空洞,因此在描述不同计算模式时,将同时给出相应的典型计算系统和工具,如表1所示,这将有助于对计算模式的理解以及对技术发展现状的把握,并进一步有利于在实际大数据处理应用中对合适的计算技术和系统工具的选择使用。

    表1典型大数据计算模式

    6.大数据分析与可视化

    在大数据时代,人们迫切希望在由普通机器组成的大规模集群上实现高性能的以机器学习算法为核心的数据分析,为实际业务提供服务和指导,进而实现数据的最终变现。与传统的在线联机分析处理OLAP不同,对大数据的深度分析主要基于大规模的机器学习技术,一般而言,机器学习模型的训练过程可以归结为最优化定义于大规模训练数据上的目标函数并且通过一个循环迭代的算法实现,如图4所示。因而与传统的OLAP相比较,基于机器学习的大数据分析具有自己独特的特点。

    图4基于机器学习的大数据分析算法目标函数和迭代优化过程

    (1)迭代性:由于用于优化问题通常没有闭式解,因而对模型参数确定并非一次能够完成,需要循环迭代多次逐步逼近最优值点。

    (2)容错性:机器学习的算法设计和模型评价容忍非最优值点的存在,同时多次迭代的特性也允许在循环的过程中产生一些错误,模型的最终收敛不受影响。

    (3)参数收敛的非均匀性:模型中一些参数经过少数几轮迭代后便不再改变,而有些参数则需要很长时间才能达到收敛。

    这些特点决定了理想的大数据分析系统的设计和其他计算系统的设计有很大不同,直接应用传统的分布式计算系统应用于大数据分析,很大比例的资源都浪费在通信、等待、协调等非有效的计算上。

    传统的分布式计算框架MPI(message passing interface,信息传递接口)虽然编程接口灵活功能强大,但由于编程接口复杂且对容错性支持不高,无法支撑在大规模数据上的复杂操作,研究人员转而开发了一系列接口简单容错性强的分布式计算框架服务于大数据分析算法,以MapReduce、Spark和参数服务器ParameterServer等为代表。

    分布式计算框架MapReduce将对数据的处理归结为Map和Reduce两大类操作,从而简化了编程接口并且提高了系统的容错性。但是MapReduce受制于过于简化的数据操作抽象,而且不支持循环迭代,因而对复杂的机器学习算法支持较差,基于MapReduce的分布式机器学习库Mahout需要将迭代运算分解为多个连续的Map 和Reduce 操作,通过读写HDFS文...

  • ?

    2018年中国大数据产业趋势分析:市场规模或超6000亿元

    喻水瑶

    展开

    随着时代的发展,信息技术的更新迭代与人类生存生活产生紧密联系,全球范围内的数据产业呈现爆炸式增长特点,我们的生活迎来了大数据时代,这些技术的发展对经济发展、社会治理、国家管理、人民生活都产生巨大的影响。科多大数据给大家看看,中国大数据产业的发展情况。

    中国大数据发展水平情况

    据统计数据显示,2017年中国大数据发展指数总数为1087.8,同比增长179.32;各省市增长的平均值为5.78。其中,浙江和重庆的大数据发展指数增长均超过10,北京、江苏、广东、浙江、上海味蕾大数据产业发展的第一梯队,大数据指数增长平均值为8.13。总的来看,中国大数据发展已形成了8个国家大数据综合试验区为引领,多区域集聚发展、第一梯队领先优势明显的格局。

    分区域大数据发展水平情况

    在中国分区域大数据发展指数中,东部地区大数据发展水平最高,2017年大数据发展总指数为470.51,占中国大数据发展总指数的43.25%;西部地区排名第二,2017年大数据发展总指数为347.13,占比为31.91%;其后是中部地区和东北地区,大数据发展指数分别为185.53和84.62,在中国大数据产业发展总指数的占比分布为17.06%和7.78%。

    数据来源:中国电子信息产业研究院、中商产业研究院整理

    2018年产值或突破6000亿元

    据中商产业研究院发布的《2018-2023年中国大数据产业市场前景及投资机会研究报告》,数据显示,2017年中国大数据产业规模达到4700亿元,同比增长30%;其中,大数据硬件产业的产值为234亿元,同比增长39%。随着大数据在各行业的融合应用不断深化,预计2018年中国大数据市场产值将突破6000亿元,达到6200亿元。

    数据来源:中国信通院、中商产业研究院整理

    大数据产业发展趋势

    1、大数据基础设施建设持续增长

    基础设施是大数据产业高速发展的前提和保障。我国加快推进“宽带中国”战略,可加快下一代互联网、4G通信网络、公共无线网络、电子政务网和物联网等网络基础设施的建设。

    2、大数据开放共享进度加快

    大数据时代,国家竞争力将部分体现为一国拥有数据的规模、活性以及该国解释、运用数据的能力,而国家数据主权体现了对数据的占用和控制。因此,大数据时代,数据主权成为另一个大国博弈的空间。

    3、政府大数据深入应用

    各级政府机关在日常管理中累积了大量的数据,但未对这些数据的价值进行充分挖掘,在未来多种数据的融合过程中,政府应用场景将更加丰富,数据挖掘和分析的结果对管理决策的辅助作用可逐步显现。

  • ?

    大数据未来五年发展趋势统计分析

    小笨

    展开

    随着大数据技术的飞速发展,大数据已经融入到各行各业。2017年中国的大数据行业发展趋势是什么?大数据行业整体市场规模如何?大数据行业前景如何?请看大讲台老师的分析。

    (一)大数据行业整体市场规模及预测

    整体来看,2017 年中国大数据行业的发展依然呈稳步上升趋势,市场规模达到了 234 亿元,和去年相比增速超过 39%。随着政策的支持和资本的加入,未来几年中国大数据规模还将继续增长,但增速可能会趋于平稳。

    (二)大数据在各行业应用状况

    (1)企业哪些方面需要大数据?

    根据大数据分析结果,将近一半的企业将大数据运用在企业工商信息管理方面,此外,在社会保障、劳动就业、市政管理、教育科研方面分别占据33.9%,32.7%,29.4%,29%。整体来看,大数据的应用范围广泛。

    (2)多少企业应用到了大数据?

    大数据分析对企业的发展越来越重要,35.1%以上的企业已经开始在企业内部应用到了大数据;34.2%的企业正在考虑应用大数据,22.9%的企业在未来1年有应用大数据的计划,仅仅有7.8%的企业暂不考虑应用大数据。

    (3)这些企业如何使用大数据?

    根据数据显示,38.8%的企业使用实时动态处理大数据并提供分析结果;37.5% 的企业分析历史数据;通过机器学习,辅助企业管理者更好地决策的企业占比为22.5% 。

    (三)各行业大数据的发展水平如何?

    我国行业大数据总体发展水平较好,在各行业都有应用。其中,金融大数据、政务大数据的应用水平高,同时交通、电信、商贸、医疗、教育、旅游等行业大数据的发展水平也有显着提升。

    (四)大数据助力企业发展

    (1)企业在哪些领域会应用大数据?

    大数据应用广泛的top3领域是营销分析、客户分析和内部运营管理。其中,营销分析占比6成以上;50.2%的企业使用大数据进行客户分析;48.4% 的企业运用大数据进行内部运营管理。 大数据应用对企业的影响

    (2)这么多企业应用大数据,大数据将会为这些企业带来什么收益呢?

    55.8%的企业表示应用大数据后实现了更智能的决策;应用大数据提升了运营效率的企业占比为48.2%,这两个影响较为显着。应用大数据更好的管理风险,创造新的业务收入,增强生产能力的企业也占有一定比重。

    从上述数据中,我们可以看出,大数据在各行各业的应用还将继续加强。

    本文转自光环国际

  • ?

    大数据行业分析报告

    凌晨

    展开

    一、大数据产业概述

    1. 大数据的认识

    大数据是新资源、新技术和新理念的混合体。从资源视角来看,大数据是新资源,体现了一种全新的资源观。1990年以来,在摩尔定律的推动下,计算存储和传输数据的能力在以指数速度增长,每GB存储器的价格每年下降40%。

    2000年以来,Hadoop为代表的分布式存储和计算技术迅猛发展,极大的提升了互联网企业数据管理能力,互联网企业对“数据废气”(Data Exhaust)的挖掘利用大获成功,引发全社会开始重新审视“数据”的价值,开始把数据当作一种独特的战略资源对待。大数据的所谓3V特征(体量大、结构多样、产生处理速度快)主要是从这个角度描述的。

    从技术视角看,大数据代表了新一代数据管理与分析技术。传统的数据管理与分析技术以结构化数据为管理对象、在小数据集上进行分析、以集中式架构为主,成本高昂。

    与“贵族化”的数据分析技术相比,源于互联网的,面向多源异构数据、在超大规模数据集(PB量级)上进行分析、以分布式架构为主的新一代数据管理技术,与开源软件潮流叠加,在大幅提高处理效率的同时(数据分析从T+1到T+0甚至实时),成百倍的降低了数据应用成本。

    从理念的视角看,大数据打开了一种全新的思维角度。大数据的应用,赋予了“实事求是”新的内涵,其一是“数据驱动”,即经营管理决策可以自下而上地由数据来驱动,甚至像量化股票交易、实时竞价广告等场景中那样,可以由机器根据数据直接决策;

    其二是“数据闭环”,观察互联网行业大数据案例,它们往往能够构造起包括数据采集、建模分析、效果评估到反馈修正各个环节在内的完整“数据闭环”,从而能够不断地自我升级,螺旋上升。

    目前很多“大数据应用”,要么数据量不够大,要么并非必须使用新一代技术,但体现了数据驱动和数据闭环的思维,改进了生产管理效率,这是大数据思维理念应用的体现。

    2.大数据的产业体系

    大数据本身既能形成新兴产业,也能推动其他产业发展。当前,国内外缺乏对大数据产业的公认界定。我们认为,大数据产业可以从狭义和广义两个层次界定。

    从狭义看,当前全球围绕大数据采集、存储、管理和挖掘,正在逐渐形成了一个“小生态”,即大数据核心产业。大数据核心产业为全社会大数据应用提供数据资源、产品工具和应用服务,支撑各个领域的大数据应用,是大数据在各个领域应用的基石。应该注意到,狭义大数据产业仍然围绕信息的采集加工构建,属于信息产业的一部分。

    数据资源部分负责原始数据的供给和交换,根据数据来源的不同,可以细分为数据资源提供者和数据交易平台两种角色。数据基础能力部分负责与数据生产加工相关的基础设施和技术要素供应,根据数据加工和价值提升的生产流程,数据基础能力部分主要包括数据存储、数据处理和数据库(数据管理)等多个角色。

    数据分析/可视化部分负责数据隐含价值的挖掘、数据关联分析和可视化展现等,既包括传统意义上的BI、可视化和通用数据分析工具,也包括面向非结构化数据提供的语音、图像等媒体识别服务。

    数据应用部分根据数据分析和加工的结果,面向电商、金融、交通、气象、安全等细分行业提供精准营销、信用评估、出行引导、信息防护等企业或公众服务。根据IDC、Wikibon等咨询机构预测,2016年,全球的大数据核心产业规模约为300亿美元。

    3.大数据的规模

    据中商产业研究院数据,我国大数据行业市场规模增速明显,2015年中国大数据市场规模为115.9亿元,增速达53.10%。

    4.大数据产业图谱

    二、大数据的行业运用

    1.零售业领域

    具体来说,在零售企业,大数据分析的应用可以归纳为如下方面:在智慧的客户体验领域的全方位的顾客洞察、提升客户服务、基于位置的营销和服务以及精准营销;在智慧的商品管理和供应联网络领域的供应链优化和商品优化;在智慧的运营领域的财务管理、劳动力管理和防损 / 防偷盗管理。

    大数据驱动的快速响应系统是ZARA实现供应链神话的重要原因之一

    ZARA有一个全天候开放的“数据处理中心”。每一个零售网点都可以通过该系统追踪销售数据。此外,顾客的反馈也能在系统上反映出来,ZARA能够很快发现哪些款好卖,哪些款滞销。ZARA店内,柜台和店内各角落都装有摄影机,店经理随身带着PDA。

    当客人向店员反映诸如“这个衣领图案很漂亮”、“我不喜欢口袋的拉链”等意见时,店员通过ZARA内部全球资讯网络,每天至少两次传递资讯给总部设计人员,由总部汇总信息进行分析并作出决策后立刻传送到生产线,改变产品样式。

    微软Dynamics零售分销渠道管解决方案

    微软Dynamics零售渠道管理解决方案提供通过系统管理渠道的收发货信息的渠道进销存管理;收集各渠道经营的其他竞争对手产品信息的客户拜访管理;管理会员信息及购买习惯发会员管理;

    管理会员促销及积分兑换的促销管理;报表分析,提供数据报表支持,帮助企业分析会员购买行为,对下一步销售策略做预测工作。

    新零售解决方案提供商—— 小工蚁科技推出客户大数据平台

    小工蚁科技是一家互联网创业公司,专注新零售解决方案。小工蚁推出的客户大数据平台可帮助企业从各给历史遗留系统中将客户相关的数据抽取出来,然后建模分析,使用大数据分析引擎帮助快速将企业客户360°画像、针对客户个性化产品推荐、进行客户群体分析,将数据变成可视化工具平台;

    同时小工蚁也提供客户社区,帮助企业和客户建立强连接。帮助传统企业将客户相关数据和信息提炼出规律和价值的平台工具。

    2.电信领域

    电信行业掌握体量巨大的数据资源,单个运营商其手机用户每天产生的话单记录、信令数据、上网日志等数据就可达到PB级规模。电信行业利用IT技术采集数据改善网络运营、提供客户服务已有数十年的历史,而传统处理技术下运营商实际上只能用到其中百分之一左右的数据。

    大数据对于电信运营商而言,首先意味着利用廉价便捷的大数据技术提升其传统的数据处理能力,聚合更多的数据提升洞察能力。比如法国电信、T-Mobile借助大数据加快了诊断网络潜在问题的效率,改善服务水平,为客户提供了更好的体验,获得了更多的客户以及更高的业务增长。

    中国移动、德国电信、沃达丰利用大数据技术加大对历史数据的分析,动态优化调整网络资源配置,大幅提高无线网络的运行效率。T-Mobile通过集成数据综合分析客户流失原因,在一个季度内将客户流失率减半。SK电讯成立SK Planet公司专门处理与大数据相关的业务,通过分析客户的使用行为防止客户流失。

    中国联通利用大数据技术对其全国3G/4G用户进行精准画像,形成大量有价值的标签数据,为客户服务和市场营销提供了有力支持。中国移动通过对消费、通话、位置、浏览、使用和交往圈等数据的分析,利用各种联系记录发现各种圈子,分析影响力及关键人员,用来进行家庭客户、政企客户和关键客户的识别,以实现主动营销和客户维系。

    二是提高数据意识,寻求合适的商业模式,尝试数据价值的外部变现。主要有数据即服务(DaaS)和分析即服务(AaaS)两种模式,数据即服务模式往往通过开放数据或开放API的方式直接向外出售脱敏后的数据;

    分析即服务(AaaS)模式往往与第三方公司合作,利用脱敏后的(自身或整合外部)数据资源为政府、企业或行业客户提供通用信息、数据建模、策略分析等多种形式的信息和服务,以创造外部收益,实现数据资源变现。

    数据即服务方面,AT&T将客户在WiFi网络中的地理位置、网络浏览历史记录以及使用的应用等数据销售给广告公司可以获取客观收益;AT&T同时还提供Alert业务,当客户距离商家很近时,就有可能收到该商家提供的折扣很大的电子优惠券;

    英国电信基于安全数据分析服务Assure Analytics,帮助企业收集、管理和评估大数据集,将这些数据通过可视化的方式呈现给企业,帮助企业改进决策;

    德国电信和沃达丰主要尝试通过开放API,向数据挖掘公司等合作方提供部分用户匿名地理位置数据,以掌握人群出行规律,有效的与一些LBS应用服务对接。限于国内对数据交易流通方面缺乏明确规定,国内运营商很少尝试数据即服务(DaaS)模式。

    分析即服务方面,西班牙电信成立动态洞察部门Dynamic Insights开展大数据业务,与市场研究机构Gfk进行合作,在英国、巴西推出名为智慧足迹的创新产品,该产品基于完全匿名和聚合的移动网络数据,可对某个时段、某个地点人流量的关键影响因素进行分析,并将洞察结果面向政企客户提供;

    Verizon成立精准营销部门Precision Marketing Divisio,提供精准营销洞察、精准营销、移动商务等服务,包括联合第三方机构对其用户群进行大数据分析,再将有价值的信息提供给政府或企业获取额外价值;

    中国电信在大数据RTB精准广告业务(根据客户行为和位置分析进行商铺选址和实施营销)、景区流动人口监测业务、基于客户行为的中小微企业通用信用评价等方面均有尝试,且成效显著,借助对不同行业、不同类型企业的行为数据分析,中国电信的“贷 189”平台,一个月吸引中小企业580家,金融机构24家,订单成交3368万元。

    中国移动和中国联通也与第三方合作,开展智慧旅游、智能交通、智慧城市等项目,探索数据外部变现的新型商业模式,寻找新的业务增长点。

    3.金融领域

    消费金融中的运用

    天创为消费金融机构提供“数据+风控+场景”的完整解决方案。

    可靠的数据渠道保障了数据的真实性、连续性和稳定性。

    多角度贷后监控与风险预警

    基于大数据的反欺诈服务

    4.交通领域

    对于驾驶者来说,不想开车的时候,在大数据和人工智能的支持下,车辆可以自动驾驶,并且对于你经常开的线路可以自学习自优化。

    谷歌的自动驾驶汽车,为了对周围环境作出预测,每秒钟要收集差不多 1GB的数据,没有大数据的支持,自动驾驶是不可想象的;在和周围车辆过近的时候,会及时提醒车主避让;上下班的时候,会根据实时大数据情况,对于你经常开车的线路予以提醒,绕开拥堵点,帮你选择最合适的线路;

    在出现紧急状况的时候,比如爆胎,自动驾驶系统将自动接管,提高安全性(人一辈子可能难以碰到一次爆胎,但人在紧急时的反应往往是灾难性的,只会更糟);到城市中心,寻找车位是一件很麻烦的事情,但未来你可以到了商场门口后,让汽车自己去找停车位,等想要回程的时候,提前通知让汽车自己开过来接。

    车辆是城市最大最活跃的移动物体,是拥堵的来源,也是最大的污染来源之一。数字化的车辆、大数据应用将带来很多的改变。红绿灯可以自动优化,根据不同道路的拥堵情况自动进行调整,甚至在很多地方可以取消红绿灯;

    城市停车场也可以大幅度优化,根据大数据的情况优化城市停车位的设计,如果配合车辆的自动驾驶功能,停车场可以革命性演变,可以设计专门为自动驾驶车辆的停车楼,地下、地上楼层可以高达几十层,停车楼层可以更矮,只要能高于车高度即可(或者把车竖起来停),这样将对城市规划产生巨大的影响;

    在出现紧急情况,如前方塌方的时候,可以第一时间通知周围车辆(尤其是开往塌方道路的车辆);现在的燃油税也可以发生革命性变化,可以真正根据车辆的行驶路程,甚至根据汽车的排污量来收费,排污量少的车甚至可以搞碳交易,卖排放量卖给高油耗的车;政府还可以每年公布各类车型的实际排污量、税款、安全性等指标,鼓励民众买更节能、更安全的车。

    三、大数据运用安全实践

    1.国内企业的方案

    京东大数据安全实践

    数据资源已经成为一种基础战略资源,数据的共享和流通会产生巨大价值。然而,数据资源在流通过程中却面临着诸多瓶颈和制约,尤其是当数据一种特殊的数字内容产品时,其权益保护难度远大于传统的大数据,一旦发生侵权问题,举证和追责过程都十分困难。

    为了解决这些问题,京东万象数据服务平台(如图B-6所示)利用区块链技术对流通的数据进行确权溯源,数据买家在数据服务平台上购买的每一笔交易信息都会在区块链中存储起来。

    数据买家通过获得交易凭证可以看到该笔交易的数字证书以及该笔交易信息在区块链中的存储地址,待买家需要进行数据确权时,登录用户中心进入查询平台,输入交易凭证中的相关信息,查询到存储在区块链中的该笔交易信息,从而完成交易数据的溯源确权。

    京东万象数据服务平台主要通过数据交易平台和区块链溯源平台2个核心模块提供服务:

    数据交易平台。平台通过数据搜索、数据展示、数据评论等服务,以各种维度展示数据商品,并提供订单和支付系统完成用户数据交易;

    区块链溯源平台。用户订单信息、数据标识、交易私钥等交易信息存入区块链集群中,用户获得交易凭证,并可利用该溯源平台查询溯...

  • ?

    大数据分析与数据分析的根本区别在哪里?

    永生

    展开

    作者:CDA数据分析师

    大数据分析与数据分析这几年一直都是个高频词,很多人都开始纷纷转行到这个领域,也有不少人开始跃跃欲试,想找准时机进到大数据或数据分析领域。如今大数据分析和数据分析火爆,要说时机,可谓处处都是时机,关键要明了的一点是,大数据分析和数据分析两者的根本区别在哪里,只有真正了解了,才会知晓更加适合自己的领域是大数据分析师还是数据分析师。毕竟职场如战场,时间就是生活,不容儿戏,更不容怠慢。下面我来好好告诉大家两者的本质区别到底是什么!

    大数据分析:指无法在可承受的时间范围内用常规软件工具进行捕捉、管理和处理的数据集合。是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    在维克托·迈尔-舍恩伯格及肯尼斯·库克耶编写的《大数据时代》 中大数据分析指不用随机分析法(抽样调查)这样的捷径,而采用所有数据进行分析处理,因此不用考虑数据的分布状态(抽样数据是需要考虑样本分布是否有偏,是否与总体一致)也不用考虑假设检验,这点也是大数据分析与一般数据分析的一个区别。

    数据分析是指用适当的统计分析方法对收集来的大量数据进行分析,提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。

    大数据分析与数据分析最核心的区别是处理的数据规模不同,由此导致两个方向从业者的技能也是不同的。在CDA人才能力标准中从理论基础、软件工具、分析方法、业务分析、可视化五个方面对数据分析师与大数据分析师进行了定义。

    【数据分析师的要求】

    数据分析师的理论要求:统计学、概率论和数理统计、多元统计分析、时间序列、数据挖掘。

    工具要求:必要:Excel、SQL可选:SPSS MODELER、R、Python、SAS等

    分析方法要求:除掌握基本数据处理及分析方法以外,还应掌握高级数据分析及数据挖掘方法(多元线性回归法,贝叶斯,神经网络,决策树,聚类分析法,关联规则,时间序列,支持向量机,集成学习等)和可视化技术。

    业务分析能力:可以将业务目标转化为数据分析目标;熟悉常用算法和数据结构,熟悉企业数据库构架建设;针对不同分析主体,可以熟练的进行维度分析,能够从海量数据中搜集并提取信息;通过相关数据分析方法,结合一个或多个数据分析软件完成对海量数据的处理和分析。

    结果展现能力:报告体现数据挖掘的整体流程,层层阐述信息的收集、模型的构建、结果的验证和解读,对行业进行评估,优化和决策。

    【大数据分析师的要求】

    理论要求:统计学、概率论和数据库、数据挖掘、JAVA基础、Linux基础。

    工具要求:必要: SQL、Hadoop、HDFS、Mapreduce、Mahout、Hive、Spark可选:RHadoop、Hbase、ZooKeeper等

    分析方法要求:熟练掌握hadoop集群搭建;熟悉nosql数据库的原理及特征,并会运用在相关的场景;熟练运用mahout、spark提供的进行大数据分析的数据挖掘算法,包括聚类(kmeans算法、canopy算法)、分类(贝叶斯算法、随机森林算法)、主题推荐(基于物品的推荐、基于用户的推荐)等算法的原理和使用范围。

    业务分析能力:熟悉hadoop+hive+spark进行大数据分析的架构设计,并能针对不同的业务提出大数据架构的解决思路。掌握hadoop+hive+ Spark+tableau平台上Spark MLlib、SparkSQL的功能与应用场景,根据不同的数据业务需求选择合适的组件进行分析与处理。并对基于Spark框架提出的模型进行对比分析与完善。

    结果展现能力:报告能体现大数据分析的优势,能清楚地阐述数据采集、大数据处理过程及最终结果的解读,同时提出模型的优化和改进之处,以利于提升大数据分析的商业价值。

    综上大数据分析与数据分析的根本区别就是分析的思维与分析所用的工具不同。大家在求职或转行过程认清自己对两者的偏好和自己的兴趣所在,以及自己的能力更适合在哪个领域发挥,还有自己所在城市对两者的职业需求,综合天时地利人和三个条件,我们才能做出更理智更客观更科学的抉择。

  • ?

    大数据的5大经典案例,挖掘数据背后的价值

    拉柏罗吐

    展开

    大数据时代的来临,使得企业在业务运作的过程中产生的数据量呈现出了爆发式的增长。各行各业都面临着海量数据的分析和处理问题。如何运用大数据技术从海量数据中挖掘出有价值的信息,将是今后企业发展的一个巨大挑战。我们在迎接挑战的同时,也可以了解、学习国内外大数据应用中的经典案例,希望能对我们有所启示。

    01 塔吉特(Target)百货孕妇营销分析

    最早关于大数据的故事发生在美国第二大超市塔吉特(Target)百货。孕妇对于零售商来说一直是个含金量很高的顾客群体,但是她们一般都会去专门的孕妇商店。人们一提起塔吉特,往往想到的都是日常生活用品,却忽视了塔吉特也有孕妇需要的一切。在美国,出生记录是公开的,等孩子出生了,新生儿母亲就会被铺天盖地的产品优惠广告包围。如果等到孩子出生再行动就晚了,因此零售商必须赶在孕妇怀孕前期就行动起来。

    塔吉特的顾客数据分析部门发现,怀孕的妇女一般会在怀孕第三个月的时候购买很多无香乳液、无添加的化妆品、护肤品等等。几个月后,她们会购买镁、钙、锌等营养补充剂。根据数据分析部门提供的模型,塔吉特制订了全新的广告营销方案,在孕期的每个阶段给客户寄送相应的优惠券。结果,孕期用品销售呈现了爆炸性的增长。2002年到2010年间,塔吉特的销售额从440亿美元增长到了670亿美元。大数据的巨大威力轰动了全美。

    02 谷歌的意图

    如果说有一家科技公司准确定义了“大数据”概念的话,那一定是谷歌。根据搜索研究公司comScore的数据,仅2012年3月一个月的时间,谷歌处理的搜索词条数量就高达122亿条。谷歌的体量和规模,使它拥有比其他大多数企业更多的应用大数据的途径。

    谷歌搜索引擎本身的设计,就旨在让它能够无缝链接成千上万的服务器。如果出现更多的处理或存储需要,抑或某台服务器崩溃,谷歌的工程师们只要再添加更多的服务器就能轻松搞定。将所有这些数据集合在一起所带来的结果是:企业不仅从最好的技术中获益,同样还可以从最好的信息中获益。下面选择谷歌公司的其中三个亮点。

    谷歌意图:谷歌不仅存储了搜索结果中出现的网络连接,还会储存用户搜索关键词的行为,它能够精准地记录下人们进行搜索行为的时间、内容和方式,坐拥人们在谷歌网站进行搜索及经过其网络时所产生的大量机器数据。这些数据能够让谷歌优化广告排序,并将搜索流量转化为盈利模式。谷歌不仅能追踪人们的搜索行为,而且还能够预测出搜索者下一步将要做什么。用户所输入的每一个搜索请求,都会让谷歌知道他在寻找什么,所有人类行为都会在互联网上留下痕迹路径,谷歌占领了一个绝佳的点位来捕捉和分析该路径。换言之,谷歌能在你意识到自己要找什么之前预测出你的意图。这种抓取、存储并对海量人机数据进行分析,然后据此进行预测的能力,就是数据驱动的产品。

    03 沃尔玛的“啤酒加尿布”

    总部位于美国阿肯色州的世界著名商业零售连锁企业沃尔玛拥有世界上最大的数据仓库系统。为了能够准确了解顾客在其门店的购买习惯,沃尔玛对顾客的购物行为进行了“购物篮分析”。沃尔玛数据仓库里集中了其各门店的详细原始交易数据,在这些原始交易数据的基础上,沃尔玛利用NCR数据挖掘工具对这些数据进行分析和挖掘,可以很轻松地知道顾客经常一起购买的商品有哪些。一个意外的发现是:“跟尿布一起购买最多的商品竟是啤酒!”

    这是数据挖掘技术对历史数据进行分析的结果,反映了数据内在的规律。沃尔玛派出市场调查人员和分析师对这一数据挖掘结果进行调查分析。经过大量实际的调查和分析,揭示了隐藏在“尿布与啤酒”背后的美国人的一种行为模式:在美国,一些年轻的父亲下班后经常要到超市去买婴儿尿布,而他们中有30%-40%的人同时也为自己买一些啤酒。产生这一现象的原因是:美国的太太们常叮嘱她们的丈夫下班后为小孩买尿布,而丈夫们在买尿布后又随手带回了他们喜欢的啤酒。

    既然尿布与啤酒一起被购买的机会很多,于是沃尔玛就在其一个个门店将尿布与啤酒摆放在一起,结果是尿布与啤酒的销售量双双增长。

    04 中国移动的数据化运营

    通过大数据分析,中国移动能够对企业运营的全业务进行针对性的监控、预警、跟踪。大数据系统可以在第一时间自动捕捉市场变化,再以最快捷的方式推送给指定负责人,使他在最短时间内获知市场行情。

    客户流失预警:一个客户使用最新款的诺基亚手机,每月准时缴费、平均一年致电客服3次,使用WEP和彩信业务。如果按照传统的数据分析,可能这是一位客户满意度非常高、流失概率非常低的客户。事实上,当搜集了包括微博、社交网络等新型来源的客户数据之后,这位客户的真实情况可能是这样的:客户在国外购买的这款手机,手机中的部分功能在国内无法使用,在某个固定地点手机经常断线,彩信无法使用——他的使用体验极差,正在面临流失风险。这就是中国移动一个大数据分析的应用场景。通过全面获取业务信息,可能颠覆常规分析思路下做出的结论,打破传统数据源的边界,注重社交媒体等新型数据来源,通过各种渠道获取尽可能多的客户反馈信息,并从这些数据中挖掘更多的价值。

    数据增值应用:对运营商来说,数据分析在政府服务市场上前景巨大。运营商也可以在交通、应对突发灾害、维稳等工作中使大数据技术发挥更大的作用。运营商处在一个数据交换中心的地位,在掌握用户行为方面具有先天的优势。作为信息技术的又一次变革,大数据的出现正在给技术进步和社会发展带来全新的方向,而谁掌握了这一方向,谁就可能成功。对于运营商来说,在数据处理分析上,需要转型的不仅是技巧和法律问题,更需要转变思维方式,以商业化角度思考大数据营销。

    05 阿里信用贷款和淘宝数据魔方

    中国最大的电子商务公司阿里巴巴已经在利用大数据技术提供服务:阿里信用贷款与淘宝数据魔方。

    每天有数以万计的交易在淘宝上进行。与此同时相应的交易时间、商品价格、购买数量都会被记录。更重要的是,这些信息可以与买方和卖方的年龄、性别、地址、甚至兴趣爱好等个人特征信息相匹配。各大中小城市的百货大楼做不到这一点,大大小小的超市做不到这一点,而互联网时代的电商可以做到。

    淘宝数据魔方就是淘宝平台上的大数据应用方案。通过这一服务,商家可以了解淘宝平台上的行业宏观情况、自己品牌的市场状况、消费者行为情况等,并可以据此进行生产、库存决策,而与此同时,更多的消费者也能以更优惠的价格买到心仪的宝贝。

    而阿里信用贷款则是阿里巴巴通过其掌握的企业交易数据,借助大数据技术自动分析判定是否给予企业贷款,全程不会出现人工干预。截至目前,阿里巴巴已经放贷300多亿元,坏账率约0.3%左右,大大低于商业银行。

  • ?

    用大数据预测旅游,数据分析让需求更直观

    毕晓亦

    展开

    数据不仅仅是最流行和广泛使用的术语,它是大型或复杂数据集的综合术语。大数据在搜索,捕获,存储,可视化,分析和信息隐私方面存在挑战,数据需要通过创新来揭示复杂,多样化和大规模扩展数据集的隐藏价值。

    大数据已经发展为现代生活带来了新的机遇,这些庞大的数据源库可以为管理人员,研究人员和决策者提供做出决策所需的数据驱动证据。在数字和分析的前提下,除了猜测,轶事,直觉或以前的经验,本文可以指导更自信的决策,准确的数据分析和更高的运营效率,以及降低风险和成本。

    大数据旅游?

    旅游业在信息方面蓬勃发展,大数据可以提供有关行为和人类活动的最新和非常明智的推断,从而增强旅游业。在网络上使用移动技术时,游客会留下各种数字痕迹。通过每位游客,可以获得大量关于旅行不同阶段的相关数据 - 航行之前,之间和之后。

    由于云中的大量数据可用性,分析已成为理解数据中存在的信息的需要。如果你是计划旅行的新客户,你可能在购买门票,研究景点或预订住宿时从互联网上获得更多来源。旅游业的成员正在慢慢转向大数据,以寻找改善机会,决策和整体表现的新方法,例如,通过大数据可以实现分散信息的互连。

    参与旅游的商家和代理商可以找到各种方法,利用各种数据资源在旅行的每个阶段与潜在的客人互动,并使用这些大数据来及时更好地了解不断增加的访客统计数据。他们还可以重新营销以瞄准在代理旅行网站上选择特定目的地的客户。

    大数据旅游的好处

    以前的旅游研究主要基于专家的观点和调查,这可能意味着他们从整个人口中检索了样本,并且没有游客的真实数据。使用特定方法的大数据旅游比传统方法具有优势,传统方法将在下面讨论。

    新的信息流动

    旅游大数据是旅行者自己产生的典型信息。它通过数据分析客户对各种服务和产品的需求,改善了旅游业务的思维过程。

    可靠性

    大数据不是基于调查,而是基于用户的实际行动。换句话说,一些行动、行为、 未陈述的询问或意图 、已经过审查等等问题,将所有数据源收集在一起,大数据增强了样本基础,传统的基础工作往往建立几个数量级。

    我们所有人都生活在一个前所未有的时期,即客户信念,公司商业模式和消费者反应,这些技术同时扰乱了已建立的机构并产生了新的机构。无论如何,旅游大数据表明客户与企业之间的关系发生了值得注意的变化。我们可以利用大数据来支持体验,并提供卓越的预测分析,以增强客户的决策和期望。

  • ?

    一篇文章详解大数据技术和应用场景

    诗蕊

    展开

    “本文作者 陈睿 ,优知学院创始人新技术、新趋势往往趋之若鹜却又很难说的透彻,希望这篇文章能让大家完整的理解什么是大数据:该篇包含:大数据、技术、场景应用以及大数据的岗位。

    什么是大数据

    说起大数据,估计大家都觉得只听过概念,但是具体是什么东西,怎么定义,没有一个标准的东西,因为在我们的印象中好像很多公司都叫大数据公司,业务形态则有几百种,感觉不是很好理解,所以我建议还是从字面上来理解大数据,在维克托迈尔-舍恩伯格及肯尼斯库克耶编写的《大数据时代》提到了大数据的4个特征:

    一个是数量大一个是价值大一个是速度快一个是多样性第一个是数量比较大,只有数据体量达到了PB级别以上,才能被称为大数据。1PB等于1024TB,1TB等于1024G,那么1PB等于1024*1024个G的数据。

    第二个是价值大,你如果有1PB以上的全国所有20-35年轻人的上网数据的时候,那么它自然就有了商业价值,比如通过分析这些数据,我们就知道这些人的爱好,进而指导产品的发展方向等等。如果有了全国几百万病人的数据,根据这些数据进行分析就能预测疾病的发生,这些都是大数据的价值。

    第三个就是多样性,如果只有单一的数据,那么这些数据就没有了价值,比如只有单一的个人数据,或者单一的用户提交数据,这些数据还不能称为大数据,所以说大数据还需要是多样性的,比如当前的上网用户中,年龄,学历,爱好,性格等等每个人的特征都不一样,这个也就是大数据的多样性,当然了如果扩展到全国,那么数据的多样性会更强,每个地区,每个时间段,都会存在各种各样的数据多样性。

    第四个是速度快,就是通过算法对数据的逻辑处理速度非常快,1秒定律,可从各种类型的数据中快速获得高价值的信息,这一点也是和传统的数据挖掘技术有着本质的不同。

    大数据的行业应用

    大数据无处不在,大数据应用于各个行业,包括金融、汽车、餐饮、电信、能源、体能和娱乐等在内的社会各行各业都已经融入了大数据的印迹。

    制造业,利用工业大数据提升制造业水平,包括产品故障诊断与预测、分析工艺流程、改进生产工艺,优化生产过程能耗、工业供应链分析与优化、生产计划与排程。

    金融行业,大数据在高频交易、社交情绪分析和信贷风险分析三大金融创新领域发挥重大作用。

    汽车行业,利用大数据和物联网技术的无人驾驶汽车,在不远的未来将走入我们的日常生活。

    互联网行业,借助于大数据技术,可以分析客户行为,进行商品推荐和针对性广告投放。

    电信行业,利用大数据技术实现客户离网分析,及时掌握客户离网倾向,出台客户挽留措施。

    能源行业,随着智能电网的发展,电力公司可以掌握海量的用户用电信息,利用大数据技术分析用户用电模式,可以改进电网运行,合理设计电力需求响应系统,确保电网运行安全。

    物流行业,利用大数据优化物流网络,提高物流效率,降低物流成本。

    城市管理,可以利用大数据实现智能交通、环保监测、城市规划和智能安防。

    生物医学,大数据可以帮助我们实现流行病预测、智慧医疗、健康管理,同时还可以帮助我们解读DNA,了解更多的生命奥秘。

    体育娱乐,大数据可以帮助我们训练球队,决定投拍哪种题财的影视作品,以及预测比赛结果。

    安全领域,政府可以利用大数据技术构建起强大的国家安全保障体系,企业可以利用大数据抵御网络攻击,警察可以借助大数据来预防犯罪。

    个人生活, 大数据还可以应用于个人生活,利用与每个人相关联的“个人大数据”,分析个人生活行为习惯,为其提供更加周到的个性化服务。

    大数据的价值,远远不止于此,大数据对各行各业的渗透,大大推动了社会生产和生活,未来必将产生重大而深远的影响。

    大数据使用的技术

    说起大数据,大数据有三个层数据采集、存储、计算三层。

    第一个是数据采集层,以App、saas为代表的服务。

    大数据基础阶段需掌握的技术有:Linux、Docker、KVM、MySQL基础、Oracle基础、MongoDB、redis以及hadoopmapreduce hdfs yarn等。

    第二个数据存储层,比如云存储,需掌握的技术有:hbase、hive、sqoop等。

    比如:Hadoop作为一个开源的框架,专为离线和大规模数据分析而设计,HDFS作为其核心的存储引擎,已被广泛用于数据存储。HBase,是一个分布式的、面向列的开源数据库,可以认为是hdfs的封装,本质是数据存储、NoSQL数据库。

    HBase是一种Key/Value系统,部署在hdfs上,克服了hdfs在随机读写这个方面的缺点,与hadoop一样,Hbase目标主要依靠横向扩展,通过不断增加廉价的商用服务器,来增加计算和存储能力。

    第三个是数据计算应用层,以数据为基础,为将来的移动社交、交通、教育,金融进行服务,涉及到大数据架构设计阶段需掌握的技术有:Flume分布式、Zookeeper、Kafka等,以及大数据实时计算阶段需掌握的技术有:Mahout、Spark、storm。

    大数据的岗位

    1.数据分析师Data analyst

    指熟悉相关业务,熟练搭建数据分析框架,掌握和使用相关的分析常用工具和基本的分析方法,进行数据搜集、整理、分析,针对数据分析结论给管理销售运营提供指导意义的分析意见。

    2.数据架构师Data architect

    对Hadoop解决方案的整个生命周期进行引导,包括需求分析,平台选择,技术架构设计,应用设计和开发,测试和部署。深入掌握如何编写MapReduce的作业及作业流的管理完成对数据的计算,并能够使用Hadoop提供的通用算法, 熟练掌握Hadoop整个生态系统的组件如: Yarn,HBase、Hive、Pig等重要组件,能够实现对平台监控、辅助运维系统的开发。

    3.大数据工程师Big DataEngineer

    收集和处理大规模的原始数据(包括脚本编写,网页获取,调用APIs,编写SQL查询等);将非结构化数据处理成适合分析的一种形式,然后进行分析;根据所需要的和专案分析商业决策。

    4.数据仓库管理员

    Data warehousemanager:指定并实施信息管理策略;协调和管理的信息管理解决方案;多个项目的范围,计划和优先顺序安排;管理仓库的各个方面,比如数据外包,移动,质量,设计和实施。

    5.数据库管理员Database manager

    提高数据库工具和服务的有效性;确保所有的数据符合法律规定;确保信息得到保护和备份;做定期报告;监控数据库性能;改善使用的技术;建立新的数据库;检测数据录入程序;故障排除。

    6.商业智能分析员Businessintelligence analyst

    就工具,报告或者元数据增强来进行传播信息;进行或协调测试,以确保情报的定义与需求相一致;使用商业智能工具来识别或监测现有和潜在的客户;综合目前的商业只能和趋势数据,来支持采取行动的建议;维护或更新的商业智能工具,数据库,仪表板,系统或方法;及时的管理用户流量的商业情报。

  • ?

    干货 | 这是一份完整的大数据处理技术总结与分析

    夏烟

    展开

    一 数据分析处理需求分类

    1 事务型处理

    在我们实际生活中,事务型数据处理需求非常常见,例如:淘宝网站交易系统、12306网站火车票交易系统、超市POS系统等都属于事务型数据处理系统。

    这类系统数据处理特点包括以下几点:

    一是事务处理型操作都是细粒度操作,每次事务处理涉及数据量都很小。

    二是计算相对简单,一般只有少数几步操作组成,比如修改某行的某列;

    三是事务型处理操作涉及数据的增、删、改、查,对事务完整性和数据一致性要求非常高。

    四是事务性操作都是实时交互式操作,至少能在几秒内执行完成;

    五是基于以上特点,索引是支撑事务型处理一个非常重要的技术。

    在数据量和并发交易量不大情况下,一般依托单机版关系型数据库,例如ORACLE、MYSQL、SQLSERVER,再加数据复制(DataGurad、 RMAN、MySQL数据复制等)等高可用措施即可满足业务需求。

    在数据量和并发交易量增加情况下,一般可以采用ORALCE RAC集群方式或者是通过硬件升级(采用小型机、大型机等,如银行系统、运营商计费系统、证卷系统)来支撑。

    事务型操作在淘宝、12306等互联网企业中,由于数据量大、访问并发量高,必然采用分布式技术来应对,这样就带来了分布式事务处理问题,而分布式事务处理很难做到高效,因此一般采用根据业务应用特点来开发专用的系统来解决本问题。

    2 数据统计分析

    数据统计主要是被各类企业通过分析自己的销售记录等企业日常的运营数据,以辅助企业管理层来进行运营决策。典型的使用场景有:周报表、月报表等固定时间提供给领导的各类统计报表;市场营销部门,通过各种维度组合进行统计分析,以制定相应的营销策略等。

    数据统计分析特点包括以下几点:

    一是数据统计一般涉及大量数据的聚合运算,每次统计涉及数据量会比较大。

    二是数据统计分析计算相对复杂,例如会涉及大量goupby、 子查询、嵌套查询、窗口函数、聚合函数、排序等;有些复杂统计可能需要编写SQL脚本才能实现。

    三是数据统计分析实时性相对没有事务型操作要求高。但除固定报表外,目前越来越多的用户希望能做做到交互式实时统计;

    传统的数据统计分析主要采用基于MPP并行数据库的数据仓库技术。主要采用维度模型,通过预计算等方法,把数据整理成适合统计分析的结构来实现高性能的数据统计分析,以支持可以通过下钻和上卷操作,实现各种维度组合以及各种粒度的统计分析。

    另外目前在数据统计分析领域,为了满足交互式统计分析需求,基于内存计算的数据库仓库系统也成为一个发展趋势,例如SAP的HANA平台。

    3 数据挖掘

    数据挖掘主要是根据商业目标,采用数据挖掘算法自动从海量数据中发现隐含在海量数据中的规律和知识。

    数据挖掘主要过程是:根据分析挖掘目标,从数据库中把数据提取出来,然后经过ETL组织成适合分析挖掘算法使用宽表,然后利用数据挖掘软件进行挖掘。传统的数据挖掘软件,一般只能支持在单机上进行小规模数据处理,受此限制传统数据分析挖掘一般会采用抽样方式来减少数据分析规模。

    数据挖掘的计算复杂度和灵活度远远超过前两类需求。一是由于数据挖掘问题开放性,导致数据挖掘会涉及大量衍生变量计算,衍生变量多变导致数据预处理计算复杂性;二是很多数据挖掘算法本身就比较复杂,计算量就很大,特别是大量机器学习算法,都是迭代计算,需要通过多次迭代来求最优解,例如K-means聚类算法、PageRank算法等。

    因此总体来讲,数据分析挖掘的特点是:

    1、数据挖掘的整个计算更复杂,一般是由多个步骤组成计算流,多个计算步骤之间存在数据交换,也就是会产生大量中间结果,难以用一条sql语句来表达。

    2、计算应该能够非常灵活表达,很多需要利用高级语言编程实现。

    二 大数据背景下事务型处理系统相关技术

    在google、facebook、taobao等大互联网公司出现之后,这些公司注册和在线用户数量都非长大,因此该公司交易系统需要解决“海量数据+高并发+数据一致性+高可用性”的问题。

    为了解决该问题,从目前资料来看,其实没有一个通用的解决方案,各大公司都会根据自己业务特点定制开发相应的系统,但是常用的思路主要包括以下几点:

    (1)数据库分片,结合业务和数据特点将数据分布在多台机器上。

    (2)利用缓存等机制,尽量利用内存,解决高并发时遇到的随机IO效率问题。

    (3)结合数据复制等技术实现读写分离,以及提高系统可用性。

    (4)大量采用异步处理机制,对应高并发冲击。

    (5)根据实际业务需求,尽量避免分布式事务。

    1相关系统介绍

    1) 阿里CORBAR系统

    阿里COBAR系统是一个基于MYSQL数据库的分布式数据库系统,属于基于分布式数据库中间件的分布式数据库系统。该系统是前身是陈思儒开发的“变形虫”系统(以前调研过),由于陈思儒离开阿里去了盛大,阿里当心“变形虫”稳定性等问题,重新开发该项目。

    该系统主要采用数据库分片思路,实现了:数据拆分、读写分离、复制等功能。由于此系统由于只需要满足事务型操作即可,因此相对真正并行数据库集群(例如TeraData等),此类系统提供操作没有也不需要提供一些复杂跨库处理,因此该系统存在以下限制:

    (1)不支持跨库的join、分页、排序、子查询。

    (2)insert等变更语句必须包括拆分字段等。

    (3)应该不支持跨机事务(以前变形虫不支持)。

    说白了此类系统不具备并行计算能力,基本上相当于数据库路由器!

    另外此类系统的在实际应用的关键问题是,根据什么对数据进行切分,因为切分不好会导致分布式的事务问题。

    2) 阿里OceanBase系统

    该系统也是淘宝为了解决高并发、大数据环境下事务型处理而定制开发的一个系统。该系统主要思路和特点如下:

    (1)他们发现在实际生成环境中,每天更新的数据只占总体数据的1%不到,因此他们把数据分为:基线数据和增量更新数据。

    (2)基线数据是静态数据,采用分布式存储方式进行存储。

    (3)只在一台服务器上存储和处理增量更新数据,并且是在内存中存储和处理更新数据。

    (4)在系统负载轻的时候,把增量更新批量合并到基线数据中。

    (5)数据访问时同时访问基线数据和增量更新数据并合并。

    因此这样好处是:

    (1)读事务和写事务分离

    (2)通过牺牲一点扩展性(写是一个单点),来避免分布式事务处理。

    说明:该系统虽然能处理高并发的事务型处理,号称很牛逼,但其实也只是根据电商的事务处理来定制开发的专用系统,个人认为其技术难度小于oracle等通用型的数据库。该系统无法应用到银行或者12306等,因为其事务处理的逻辑远远比电商商品买卖处理逻辑复杂。

    在目前的大数据时代,一定是基于应用定制才能找到好的解决方案!

    3) 基于Hbase的交易系统

    在hadoop平台下,HBASE数据库是一个分布式KV数据库,属于实时数据库范畴。支付宝目前支付记录就是存储在HBASE数据库中。

    HBASE数据库接口是非SQL接口,而是KV操作接口(基于Key的访问和基于key范围的scan操作),因此HBASE数据库虽然可扩展性非常好,但是由于其接口限制导致该数据库能支持上层应用很窄。基于HBASE应用的设计中,关键点是key的设计,要根据需要支持的应用来设计key的组成。

    可以认为HBASE数据库只支持作为KEY的这一列的索引。虽然目前HBASE有支持二级索引的方案,二级索引维护将会比较麻烦。

    2并发和并行区别

    并发是指同时执行通常不相关的各种任务,例如交易型系统典型属于高并发系统。

    并行是通过将一个很大的计算任务,划分为多个小的计算任务,然后多个小计算任务的并行执行,来缩短该计算任务计算时间。

    两者主要区别在于:

    (1)通讯与协调方面:在并行计算中,由于多个小任务同属一个大的计算任务,因此小任务之间存在依赖关系,小任务之间需要大量通讯和协调;相反,并发中的多个任务之间基本相互独立,任务与任务之间相关性很小。

    (2)容错处理方面:由于并发任务之间相互独立,某个任务执行失败并不会影响其它的任务。但是并行计算中的多个任务属于一个大任务,因此某个子任务的失败,如果不能恢复(粗粒度容错与细粒度容错),则整个任务都会失败。

    3本章总结

    数据量大不一定需要并行计算,虽然数据量大,数据是分布存储,但是如果每次操作基本上还是针对少量数据,因此每次操作基本上都是在一台服务器上完成,不涉及并行计算。只是需要通过数据复制、数据缓存、异步处理等方式来支撑高并发访问量

    三 大数据背景下数据统计分析技术介绍

    随数据量变大,和事务处理不同的是,单个统计分析涉及数据量会非常大,单个统计分析任务涉及数据会分散在多台服务器上,且由于计算量大,采用单台服务器进行计算,会导致计算时间非常长,单个统计分析任务必须采用并行计算方式来加快单个统计分析任务执行速度。

    1并行查询与并行计算技术介绍

    在大数据背景下的数据统计分析技术门类很多,常见的有:

    n MPP并行数据库 : TeraData、GreenPlum、Vertica等。

    n 基于MapReduce并行计算框架的数据仓库:

    HIVE(Hadoop平台) 、Tenzing(Google公司)

    n 基于Hbase的Phoenix系统

    n HadoopDB系统

    n EMC公司的hapt系统

    n MPP分布式查询引擎: Dremel、Impala、Presto、Shard query、Citusdb。

    n 基于SPARK的Shark、基于Dryad的SCOPE、基于Tez的stinger。

    n 基于hadoop+index的JethroData系统

    n 基于内存计算的Druid系统

    这些系统都解决了海量数据下的数据统计分析的问题,并且这些系统另外一个共同特点是都提供了SQL或者类SQL接口。

    为了能够较好研究这些系统,我们需要对并行查询与并行计算的相关技术做一个简要的介绍。

    首先所有的系统都可以分为三个层次: 语义层、并行计算引擎层、分布式存储层。语义层提供一个编程接口让用户表达所需要计算,并负责把该计算翻译成底层并行计算引擎可以执行的执行计划,并由并行计算引擎来执行,最下面一层是分布式存储层。

    对于提供类SQL接口并行计算系统,语义层可以认为是SQL解析层。

    1) 语义层

    SQL语言是一种声名式语言,SQL只是表达了要做什么,而没有表达怎么做。为此,SQL解析层主要作用是:将用户提交的基于SQL的统计分析请求,转化为底层计算引擎层可以执行的执行计划。也就是解决“怎么做”的问题。

    SQL解析层工作主要包括两个大方面:

    (1) 通过语法分析技术来理解要做什么。在关系数据库中,一般会把SQL语言分析后,形成树型结构的执行计划。

    (2) 在语法分析技术上,利用各种优化技术和算法,找出一种最经济物理执行计划。

    优化可以分为两个方面:一是逻辑层面优化、二是物理执行层面优化。

    (1) 逻辑层优化

    逻辑层面个人认为主要是因为同样表达一个分析请求,有的人SQL写的好,有的人SQL写的烂,因此在逻辑层面可以通过一些等价关系代数变换,实现查询重写,将写的比较烂的sql变换为好的写法。

    比较典型优化是:“把投影和过滤下沉,先执行过滤和投影操作”,减少中间结果。

    (2) 物理层优化

    物理层面优化是在逻辑优化后,结合实际物理执行过程,找出最优的物理执行计划。生成物理查询计划的工作包括:

    ü 增加一些操作符: 包括扫描和排序等。

    ü 确定各个操作符实现算法。例如扫描是全表扫描还是利用索引;Join是采用HASH连接、索引连接、合并排序等实现算法中的那一种。

    ü 确定操作符之间的数据流转方法:物化还是流水线方式。

    ü 采用基于代价估算方法确定最优的物理执行计划,目前代价估算主要是以估算该物理计划需要的IO量。另外对于并行数据库,则还要考虑通讯代价,即尽量减少数据在各个机器之间的传递。

    在物理层优化的代价估算过程中,代价估算需要依靠很多统计信息,如表有多大,表中相关列的值分布是什么样子等。传统数据库在数据Load过程中会事先计算好这些统计信息。并行计算中还需要考虑通讯代价。

    需要指出是,由于imapla、Presto、HIVE等系统只是一个查询引擎,它们可以直接查询以普通文件方式存储在HDFS系统上的文件,因此这些系统一般无法使用索引和各种统计信息来进行物理执行计划的优化,这些系统一般只能在逻辑层进行一些基于规则静态优化。根据SHARK论文,SHARK系统支持根据前面一些节点计算获得的信息,来动态优化后面执行计划。

    (3) 物化与流水线执行方法

    一条SQL语句对开发人员而言,感觉只是一次调用,但是实际上在数据库内部,一条SQL语句执行其实是有多个操作符组合而成的的树型结构计算流。如下图:

    针对该计算流有两种执行方式:一是基于物化或者是实体化执行方式,另外一种是基于数据流的执行方式。

    第一种方法的过程是: 把各个操作运算排序,并把每个操作运算的输出的中间结果存储在磁盘上,直到被另外一个操作运算所...

大规模数据分析

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP