中企动力 > 商学院 > 实战大数据分析
  • ?

    基于Hadoop大数据分析应用场景与实战

    安然

    展开

    为了满足日益增长的业务变化,京东的京麦团队在京东大数据平台的基础上,采用了Hadoop等热门的开源大数据计算引擎,打造了一款为京东运营和产品提供决策性的数据类产品-北斗平台。

    一、Hadoop的应用业务分析

    大数据是不能用传统的计算技术处理的大型数据集的集合。它不是一个单一的技术或工具,而是涉及的业务和技术的许多领域。

    目前主流的三大分布式计算系统分别为Hadoop、Spark和Strom:

    Hadoop当前大数据管理标准之一,运用在当前很多商业应用系统。可以轻松地集成结构化、半结构化甚至非结构化数据集。

    Spark采用了内存计算。从多迭代批处理出发,允许将数据载入内存作反复查询,此外还融合数据仓库,流处理和图形计算等多种计算范式。Spark构建在HDFS上,能与Hadoop很好的结合。它的RDD是一个很大的特点。

    Storm用于处理高速、大型数据流的分布式实时计算系统。为Hadoop添加了可靠的实时数据处理功能。

    Hadoop是使用Java编写,允许分布在集群,使用简单的编程模型的计算机大型数据集处理的Apache的开源框架。 Hadoop框架应用工程提供跨计算机集群的分布式存储和计算的环境。 Hadoop是专为从单一服务器到上千台机器扩展,每个机器都可以提供本地计算和存储。

    Hadoop适用于海量数据、离线数据和负责数据,应用场景如下:

    场景1:数据分析,如京东海量日志分析,京东商品推荐,京东用户行为分析

    场景2:离线计算,(异构计算+分布式计算)天文计算

    场景3:海量数据存储,如京东的存储集群

    基于京麦业务三个实用场景:

    京麦用户分析

    京麦流量分析

    京麦订单分析

    都属于离线数据,决定采用Hadoop作为京麦数据类产品的数据计算引擎,后续会根据业务的发展,会增加Storm等流式计算的计算引擎,下图是京麦的北斗系统架构图:

    图一 京东北斗系统

    二、浅谈Hadoop的基本原理

    Hadoop分布式处理框架核心设计:

    HDFS:(Hadoop Distributed File System)分布式文件系统;

    MapReduce:是一种计算模型及软件架构。

    2.1 HDFS

    HDFS(Hadoop File System),是Hadoop的分布式文件存储系统。

    将大文件分解为多个Block,每个Block保存多个副本。提供容错机制,副本丢失或者宕机时自动恢复。默认每个Block保存3个副本,64M为1个Block。将Block按照key-value映射到内存当中。

    图二 数据写入HDFS

    图三 HDFS读取数据

    2.2 MapReduce

    MapReduce是一个编程模型,封装了并行计算、容错、数据分布、负载均衡等细节问题。MapReduce实现最开始是映射map,将操作映射到集合中的每个文档,然后按照产生的键进行分组,并将产生的键值组成列表放到对应的键中。化简(reduce)则是把列表中的值化简成一个单值,这个值被返回,然后再次进行键分组,直到每个键的列表只有一个值为止。这样做的好处是可以在任务被分解后,可以通过大量机器进行并行计算,减少整个操作的时间。但如果你要我再通俗点介绍,那么,说白了,Mapreduce的原理就是一个分治算法。

    MapReduce计划分三个阶段执行,即映射阶段,shuffle阶段,并减少阶段。

    映射阶段:映射或映射器的工作是处理输入数据。一般输入数据是在文件或目录的形式,并且被存储在Hadoop的文件系统(HDFS)。输入文件被传递到由线映射器功能线路。映射器处理该数据,并创建数据的若干小块。

    减少阶段:这个阶段是:Shuffle阶段和Reduce阶段的组合。减速器的工作是处理该来自映射器中的数据。处理之后,它产生一组新的输出,这将被存储在HDFS。

    图四 MapReduce

    2.3 HIVE

    hive是基于Hadoop的一个数据仓库工具,可以将结构化的数据文件映射为一张数据库表,并提供完整的sql查询功能,可以将sql语句转换为MapReduce任务进行运行,这套SQL 简称HQL。使不熟悉mapreduce 的用户很方便的利用SQL 语言查询,汇总,分析数据。而mapreduce开发人员可以把己写的mapper 和reducer 作为插件来支持Hive 做更复杂的数据分析。

    图五 HIVE体系架构图

    由上图可知,hadoop和mapreduce是hive架构的根基。Hive架构包括如下组件:CLI(command line interface)、JDBC/ODBC、Thrift Server、WEB GUI、metastore和Driver(Complier、Optimizer和Executor)。

    三、Hadoop走过来的那些坑

    进行HIVE操作的时候,HQL写的不当,容易造成数据倾斜,大致分为这么几类:空值数据倾斜、不同数据类型关联产生数据倾斜和Join的数据偏斜。只有理解了Hadoop的原理,熟练使用HQL,就会避免数据倾斜,提高查询效率。

    本文转载自linkedkeeper。作者王雷,2016年加入京东,负责京东京麦团队的大数据分析和京麦网关。

  • ?

    “云环境下大数据挖掘和分析技术实战”公开课在北京举行

    书双

    展开

    随着互联网、移动互联网和物联网的发展,我们已经切实地迎来了一个大数据的时代。大数据是指无法在一定时间内用常规软件工具对其内容进行抓取、管理和处理的数据集合,对大数据的分析已经成为一个非常重要且紧迫的需求。

    为此,7月11日,培训中心“云环境下大数据挖掘和分析技术实战”公开课在北京举行。

    本课程从大数据挖掘分析技术实战的角度,结合理论和实践,全方位地介绍基于Yarn的Mahout和基于Spark的MLlib等大数据挖掘工具的开发技巧。

    涉及的主题包括:

    大数据挖掘及其背景;Mahout和 MLlib大数据挖掘工具;推荐系统及电影推荐案例,分类技术及聚类分析;与流挖掘和Docker技术的结合,分析了大数据挖掘前景。

    培训过程中,杨老师还提供了案例分析来帮助学员了解如何用Mahout和 MLlib挖掘工具来解决具体的问题,并介绍了从大数据中挖掘出有价值的信息的关键。

    杨老师对于大数据挖掘有深入的理论研究与实践经验,讲课过程中,将会针对这些问题与学员一起进行探讨,在关键点上搭建实验环境进行实践研究,以加深对于这些解决方案的理解。

    通过本课程学习,希望推动大数据分析挖掘项目开发上升到一个新水平。

  • ?

    英特尔戴金权:详解全新大数据分析+AI平台Analytics Zoo | CCF-GAIR 2018

    季季

    展开

    雷锋网按:2018 全球人工智能与机器人峰会(CCF-GAIR)在深圳召开,峰会由中国计算机学会(CCF)主办,雷锋网、香港中文大学(深圳)承办,得到了深圳市宝安区政府的大力指导,是国内人工智能和机器人学术界、工业界及投资界三大领域的顶级交流盛会,旨在打造国内人工智能领域最具实力的跨界交流合作平台。

    在大会第一天的“AI前沿”主会场,英特尔高级首席工程师、大数据技术全球CTO戴金权带来了题为“大数据分析+人工智能”的演讲。

    戴金权负责领导英特尔全球(位于硅谷和上海)的工程团队在高级大数据分析(包括分布式机器学习和深度学习)上的研发工作,他带领团队一手研发了基于Apache Spark 框架的分布式深度学习库 BigDL,在这次演讲中,他还着重介绍了一个新产品:会后,雷锋网就BigDL和Analytics Zoo对戴金权进行了专访。

    英特尔AI软件工具图谱

    近一年来,英特尔反复提到的“人工智能全栈解决方案”是其人工智能战略布局的最好诠释。

    戴金权介绍到,英特尔一直致力于提供一个完整的端到端的全栈人工智能解决方案,从终端设备端到网络,再到数据中心的云端。

    这一套解决方案的底层技术包括了至强可扩展处理器、NNP芯片、FPGA、网络以及存储技术,其上则是各种数据库、人工智能平台和具体的体验。

    此次,戴金权更为详细地解释了英特尔的人工智能软件层。

    在基础层,有英特尔针对机器学习优化的英特尔发行版Python、优化的DAAL的发行版、MKL-DNN和clDNN神经网络函数的优化库、开源的nGraph编译器等;在库这一层,有机器学习库的优化、TensorFlow/MXNet/Caffe/BigDL等的优化,再到工具包这一层,有开源视觉推断和神经网络优化工具包OpenVINO、VPU上的优化推断开发的英特尔Movidius SDK、CPU上的认知解决方案英特尔Saffron AI。这些端到端的解决方案可以帮助开发者更快速地开发AI应用。

    戴金权一直致力于大数据分析,开发出基于Spark的分布式深度学习框架BigDL和Analytics Zoo,让更多的大数据用户、数据工程师、数据科学家、数据分析师能够更好地在大数据的平台上使用人工智能技术。

    BigDL是将英特尔大数据平台与人工智能结合的产物,为什么要做这样的结合呢?

    戴金权介绍了三个趋势。

    第一个趋势,今天深度学习的发展很大程度上是由于数据规模来推动的。由下图可见,随着横坐标数据规模的增长,纵坐标显示的神经网络模型就越有效,越准确。任何深度学习的系统、框架、应用都要能够处理大规模的数据。

    第二个趋势是业界大数据的发展,不管是互联网公司还是传统企业,大家都以Apache Hadoop建立起数据平台,这个平台聚集大家处理过的和未处理的数据,从而你能够将各种数据的处理、分析和应用,应用到这个平台上。从这个意义上说,任何数据处理和分析的框架、应用,包括深度学习的应用,都要能够非常好地和Apache Hadoop为标准的数据平台交互。

    第三个趋势,深度学习的模型只是整个流程的一部分,要构建和应用深度学习模型,还有数据的导入、数据清洗、特征提取、对整个集群的资源的管理和各个应用之间对这个资源的共享等,这些工作事实上占据了机器学习或者深度学习这样一个工业级应用开发的大部分的时间和资源。所以,数据处理、机器学习,以及算法必须很好地和现有的大数据处理的工作流整合在一起。

    戴金权深刻感觉到,在大数据处理工作和深度学习模型算法之间有很大的断层。深度学习顶尖研究人员不断在突破模型,但是数据科学家、分析师、普通用户却很难将模型应用到现实的生产环境当中去。深度学习处理的一大瓶颈就是数据,特别是生产数据,都是采用分布式存储,很难将其拷贝到另一个环境再来进行处理。

    在戴金权看来,Apache Spark是业界最广泛应用的分布式集群计算引擎,它里面有大量的对数据分析处理的组件,比如说SQL的处理、实时流的处理,还有进行图分析的库。

    基于Spark推出的BigDL是Spark上标准的库、标准的组件,能够和这些大数据、生态系统里面的不同的分析、处理的组件非常好地整合在一起。BigDL与目前主流的深度学习框架Caffe、Torch、TensorFlow所能实现的功能相同。虽然市面上已经有主流的深度学习框架,英特尔推出BigDL则是因为看到了将大数据分析与人工智能结合起来的一个空白点。BigDL可以直接在现有的Hadoop和Spark的集群上运行,不需要对集群做任何修改。

    戴金权告诉雷锋网:“我们看到有另外一个很重要的应用场景,没有被这些现有的框架所覆盖到,我们有大量spark用户,从2007年开始开源开发,十年间已经成为了业内数据存储处理分析的标准,大家都已经建立了大数据集群,上面有大量的数据,集群可能几千台,互联网公司可能几万台这样的规模。

    为了深度学习和人工智能应用,难道是要把这套大数据集群完全抛弃,再另外建一套新的系统吗?我觉得其实并不是一个最合理的路径,从某种意义上来说,应该在你现有的大数据的平台,大数据的集群上面,能够将新的深度学习、人工智能的技术,能够加进来。”

    Analytics Zoo

    自2017年1月英特尔开源BigDL起,已经有广泛的合作案例。在去年年中,戴金权的团队在Apache Spark和BigDL的基础上又构建了Analytics Zoo大数据分析和人工智能的平台。

    差不多是在BigDL开源半年后,戴金权开始着手Analytics Zoo的构建。他谈到,在跟很多客户合作BigDL时,他感到,BigDL、Tensorflow这些框架里最终的AI应用还是有很长的距离。

    应用开发本身是非常复杂的工作流水线,戴金权思考如何才能提供像Spark上的Streaming这样很方便地对特征进行处理的流水线,提供内置的模型、特征工程操作、迁移学习的流水线的支持。Analytics Zoo正是这样一个更高级别的数据分析+AI平台,能够利用Spark的各种流水线、内置模型、特征操作等,方便用户构建深度学习端到端应用。

    某种意义上它是Spark和BigDL的扩充,它的目的是方便用户开发基于大数据端到端学习的应用,除了内置的模型、内置的一些非常简单的操作之外,它里面还提供了大量的高级的流水线的支持,能够使用Spark DataFrames、ML Pipelines的深度学习流水线,能够通过迁移学习的API构建API模型的定义,在这个基础上就可以很方便地将我们提供的Model Zoo的模型甚至端到端的参考应用,比如说异常检测等等,可以通过非常少的代码,使用这些高级的API,并且使用内置的模型,很方便地就能将一个端到端的大数据分析加上深度学习的应用构建起来。

    合作案例

    戴金权介绍了用户如何使用Analytics Zoo for BigDL在他们现有的大数据集群,通常是有非常大规模的至强的处理器上应用大数据的集群或者平台上,构建新的深度学习的应用。

    目前,BigDL和Analytics Zoo的技术能在包括AWS、阿里云、百度云等几乎所有的公有云平台上使用。

    第一个例子是英特尔与京东展开的合作。京东有大概几亿张的图片存储在分布式存储系统当中,他们想要把这几亿张图片从大数据系统里面读出来,然后对它进行处理。在这个案例中,用了SSD的模型来试图识别图片里面有什么物品,探后再用DeepBit的模型,将物品的特征提取出来。原来京东已经在GPU卡上做了一些应用,但是这里面有一些问题,包括如何处理端到端数据的流水线,包括如何提高端到端处理的效率。戴金权介绍到,“当我们把整个处理的应用迁移到Spark和BigDL平台上,可以看到它提升了很多的运维的效率,使用BigDL/Spark在Intel Xeon(英特尔至强可扩展处理器)集群有效扩展,取得相对于GPU集群3.8倍性能提升。”

    AI的三个核心点在大数据、算法、算力,现在很多人认为要有足够的AI算力,非GPU不可。京东的这个案例体现了BigDL与英特尔至强可扩展处理器配合,对整体深度学习表现的提升。戴金权告诉雷锋网,京东这个案例一开始是建立在多个GPU之上的,他们的团队在Caffe上训练,在开发、部署、性能方面都碰到问题。英特尔将京东方面迁移到Spark上面,跑在1200个逻辑的核,一台服务器支持50个逻辑,大致用了24台服务器,利用Spark这样的端到端流水线处理,与之前用GPU的方案相比可以达到差不多3.8倍的性能提升。

    第二个案例是英特尔和MLSListings合作的案例,他们是加州的不动产交易商,他们可以识别用户浏览的房屋图片,为用户推荐相似的房屋。这套系统构建在Microsoft Azure上。

    第三个案例是和世界银行在AWS上合作。世界银行通过志愿者上传的世界各地的食物图片,帮助大家来分析在世界各地的物价水平。其中如何通过大数据处理对图片进行清洗、处理,再用迁移学习来构建图片分类模型是值得关注的问题。

    第四个案例是与UCSF的合作,通过3D的模型对医疗图象进行分类,首先对3D的MRI照片进行识别,然后对它进行分类,可以试图诊断膝盖上面的一些病症。

    第五个案例是们和Cray公司(美国做超级电脑的公司)合作。合作内容是做近期的降水云图的预测,通过Seq2Seq的模型,把过去一小时的卫星云图做了一个序列,输入到模型里面,能帮预测下一个小时每10分钟这个卫星云图的变化,通过这个来进行一些降水的分析。

    第六个案例是和GigaSpaces合作的通过基于自然语言处理对呼叫中心进行管理。当有用户打电话进来,把其语音转成文本以后,导入到BigDL系统里面,然后对它进行实时的流式处理,使用BigDL上的文本分类模型可以知道用户打电话进来是为什么,他是Windows出了问题还是Mac出了问题,自动就会把呼叫中心的电话录入到不同的部门。

    最后,戴金权总结到,英特尔致力于端到端全栈人工智能解决方案。BigDL和Anaylitics Zoo致力于架起大数据和人工智能之间的桥梁,当用户已有基于Apache的大数据集群,就可以很方便地进行大数据分析和上人工智能应用,不仅能够有更高的资源利用率,还可以提升端到端的开发效率,以及提升部署效率。

  • ?

    2017大数据、数据分析学习资料合集(含学习路线图)

    水中月

    展开

    给大家整理一下本年度一些优质的文章,根据大数据相关的知识点一个个整理的,整理的内容包括知识点普及、学习书籍、学习路线图、学习笔记、学习资料、学习视频等等。

    AI时代就业指南

    未来已来:AI时代就业指南

    AI时代就业指南:计算机、统计完全零基础,到底能不能学数据分析?

    AI时代就业指南:数据科学人才成长之路

    AI时代就业指南:Java 程序员如何转行做大数据?

    AI时代就业指南:企业在招什么样的大数据工程师?

    AI时代就业指南:女生适合做数据分析吗?

    AI时代就业指南:数据挖掘工程师成长之路

    AI时代就业指南:数学专业,你看不见的前尘似锦

    AI时代就业指南:数据挖掘入门与指南

    AI时代就业指南:普通程序员如何转向AI方向

    AI时代就业指南:作为大数据从业人员,如何写好一份可堪入目的简历?

    大数据

    【入门】大数据行业如何入门-书籍、工具、案例(问题集锦)

    【工具】2017 年你应该学习的编程语言、框架和工具

    【资料】史上最全的“大数据”学习资源(上)

    【资料】史上最全的“大数据”学习资源(下)

    【路线图】大数据工程师学习路线图

    【路线图】2017年最全的数据科学学习计划

    【就业】2016年数据科学薪酬大盘点

    【学习群】数据挖掘-机器学习

    数据分析

    【入门】数据分析那些事(数据分析师入门必看)

    【职业】数据分析与数据挖掘类的职位必备技能

    【职业】与大数据相关的工作职位有哪些?

    【路线图】数据分析师学习路线图

    【路线图】数据科学学习路线图

    【书单】数据分析师的必读书单

    【学习群】人人都是数据咖

    统计学

    【书单】统计学入门经典书单

    【视频】大数据统计学基础

    【学习群】大数据-统计分析

    SQL

    【文章】实用SQL语句大全

    【笔记】SQL学习点滴合集

    【视频】13次课了解sql2008的故事

    Python

    【教程】python快速教程

    【文章】python爬虫实战

    【文章】Python-pandas技巧系(量化小讲堂)

    【路线图】python学习路线图

    【路线图】Python大数据学习之路

    【资料】python机器学习入门资料梳理

    【视频】Python入门:数据分析与数据挖掘

    【课程】Python进阶:数据挖掘实战

    【学习群】Python数据挖掘-初级

    【学习群】Python数据挖掘-高级

    R

    【文章】R语言知识体系

    【文章】怎样学习R(上、下)

    【文章】ggplot2绘图入门系列

    【文章】R利剑NoSQL系列文章

    【文章】R语言常用数据挖掘包

    【路线图】R语言学习路线图

    【视频】R学习免费学习视频

    【课程】R语言入门

    【课程】R语言实战

    【课程】机器学习与R语言实践

    【课程】R语言量化交易

    【工具】全球最火的R工具包一网打尽,超过300+工具,还在等什么?

    【学习群】R语言数据挖掘-初级

    【学习群】R语言数据挖掘-中高级

    Hadoop

    【文章】Hadoop学习路线图

    【文章】RHadoop实践系列文章

    【教程】Spark入门实战系列教程

    【课程】大数据实战工具Spark

    【学习群】大数据-hadoop-spark

    数据挖掘/机器学习

    【入门】机器学习和数据挖掘推荐书单

    【路线图】R语言学习路线图及R数据挖掘包

    【路线图】Python数据分析和数据挖掘学习路线图

    【路线图】机器学习路线图

    【资料】近200篇机器学习&深度学习资料

    【学习群】大数据-机器学习

    因文本问题无法嵌入链接,请复制http://ppvke/Blog/archives/27665 至浏览器查看原文

  • ?

    实战大数据——大数据在医疗行业的应用

    hsbzcb

    展开

    收集、存储和利用医疗数据是非常困难的。

    虽然医疗保健“数据湖”包含了可用于改善患者护理的有价值信息,医院留存了很多无法排序和有效使用的数据。组织数据并使其可用需要大量的IT基础设施规划。

    医院如要准备收集可行的健康数据,应创建一个路线图,使他们能够利用数据来改善工作流程和患者护理。

    大数据分析和人口健康分析是数据湖中收集数据的两种用途。有兴趣使用的公司需要了解所收集数据的性质,如何存储和访问该数据,以及如何使该数据可操作。

    1. 规划结构化和非结构化数据

    临床医生、患者和连接设备收集的数据是结构化或非结构化的。结构化数据是存储在固定范围内的数据,例如文件。结构化数据更易于分析和存储,因为它具有直接的界限,并以标准化格式创建和存储。

    来自EHR的患者人口统计信息,诊断和程序信息、药物信息和某些其他数据通常以标准化的、结构化的方式生成。传统的数据库通常用于处理结构化数据。

    非结构化数据没有标准化格式,也杂乱无章。非结构化数据来自许多不同的数据源,可以包含图像,数字和复杂数据集。

    非结构化数据存在于数据湖中,通常比较大而无法方便地检索或用于分析。

    公司需要工具来处理结构化和非结构化数据,因为两种数据都需要变为可操作的数据。不同的工具可以对数据进行排序,使其更易于访问和操作。利用Hadoop等工具可以将数据湖从”存储垃圾桶“激活。

    Hadoop是一个开源的分布式数据存储及分析应用程序。 Hadoop不是数据库,而是处理结构化和非结构化数据的软件框架。

    Hadoop将大量数据分发到不同的处理节点,然后将收集的结果组合在一起。由于系统通常使用较小批量的本地化数据而不是整个库的内容,因此这种方法可以更快地处理数据。

    Hadoop主要使用Hadoop分布式文件系统(HDFS)和MapReduce来存储和分析数据。

    HDFS是Hadoop应用程序使用的主要分布式存储。 HDFS不是物理数据库,但它会收集数据并将其存储在群集中,直到公司准备好使用它为止。

    Hadoop将非结构化数据分离为节点,这些节点构成更大型数据架构的单个部分。节点链接在一起,能够组合存储在Hadoop的数据,以根据公司想要设置的参数生成结果。

    2. 评估数据湖的云服务模型

    在云中存储数据可为公司提供一定程度的灵活性,而这些灵活性通常是内部部署无法实现的。

    公司根据需要可以在云存储服务中购买更多存储空间,而不是投资额外的内部部署服务器,从而节省资金。

    根据HIMSS的一项研究,随着越来越多的应用程序迁移到云,或者更多的计算周期因为分析工具能够访问,连接“应该可以轻松扩展”。

    将数据移动到云不仅为组织提供了更简单的扩展方式,而且还削减了本地服务器的硬件成本以及管理和维护本地服务器所需的其他IT人员。

    这个空间为公司提供了部署Hadoop等工具的资源,并可以更好地控制其IT基础架构。

    然后,公司需要决定是否希望在公共云,私有云或两者的组合中部署其工具。公共云是最具可扩展性的数据存储解决方案。随着组织规模的变化,可以添加或删除存储空间。这使得公共云在临时项目以及数据迁移中很受欢迎。

    私有云使组织能够更好地控制其数据所在的位置以及对用户的可访问性。私有云使健康IT人员可以直接控制存储在云中的内容。医疗保健组织可能会受益于私有云,因为他们可以密切关注PHI。公共云和私有云之间的决定因素是预算、人员和需要存储的数据量。对于拥有大量非结构化数据和较低预算但无法覆盖私有云部署的医疗系统而言,公共云通常是较便宜的选择。

    无论医院的预算是多少,产生的数据越多,要存储它的成本就越高。在规划数据湖时牢记这一点将有助于云存储变得更易于管理。

    “对象存储提供了一种廉价的方式来存储大量数据。“云服务密钥信息系统总监Clayton Weise说。 “使用对象存储的数据始终是可访问的,与磁带不同,磁带必须知道序列号,跟踪磁带并物理检索它。”

    对象存储将数据作为对象而不是文件或块进行管理。对象保存在没有分层结构的存储池中。相反,对象存储使用唯一标识符,允许将数据存储在存储池中的任何位置。

    使用对象存储去存储数据为医疗保健组织提供了更多的数据分析可能性,并提供了可扩展的基础架构。“最大的挑战之一是医疗保健组织数据量的指数级增长,”Weise说。 “医院监管要求各不相同,有些规则和法规要求将患者数据保存七年。一些医院只要患者活着就会保留信息,即使这样,他们也可能不会删除它。”

    存储用于分析的数据不需要像应用程序那样定期访问。对象存储不是分析工具运行的地方,因为它不是最快的存储解决方案,但它可以选择以一种方式存储大量数据,使其在需要时可访问。无论如何接近数据湖,公司应对其数据进行分类并了解其用途。确定数据使用后,构建路线图以便为生成的数据使用正确的存储工具。组织数据并在需要时使其可访问是使数据可用于分析的关键步骤

  • ?

    实战课堂丨大数据关系信息挖掘:知识图谱应用案例分享

    佟初露

    展开

    钱广锐 联想创投(香港)机器智能实验室高级产品经理。负责联想创投大数据机器智能产品和行业应用模型开发。拥有多年高性能计算、大数据、人工智能行业经验 。毕业于美国纽约州立大学,曾在IBM认知团队任行业解决方案专家。荣之联实战课堂第4期的《解读大数据分析:新技术,新实践》主题沙龙上,联想创投(香港)机器智能实验室高级产品经理钱广锐跟大家分享了《大数据关系信息挖掘:知识图谱应用案例分享》。

    联想创投主要投资机器智能领域,比如深度学习、机器学习等前沿科技,目前人工智能包括四个部分:机器学习,深度学习,语言处理,知识图谱。今天跟大家分享几个案例,包括我们的想法和经验。

    宝钢机器智能大数据

    宝钢的项目主要是用大数据处理的,更核心是用大数据结合人工智能里面机器学习的方法模型做预测,包括预测宝钢每天生产多少钢材,能够降低库存,提升供应链效率等。最终希望利用用户大额数据和现在使用的大数据平台,结合外部数据精准预测每个地区,或具体产品的需求量。

    首要工作就是分析用户的数据,越核心的数据价值越高,比如用户产量和客户销售需求。外面一层数据是宏观经济行业数据,包括汽车产量销量。所有工作都是希望使用这些数据,帮助用户做决策。决策的过程就是目标。为了构造出数据分析的模型,数据分析模型的构建有很多方法,我们使用机器学习、大数据平台和数据扒取平台做精准模型。

    机器智能数据构建流程是将内部数据和外部数据,通过大数据平台,通过模型分析帮助用户建立模型的过程。其中的机器学习和算法层就是通过清洗过的有价值的数据,比如有些外部数据,包括某辆车关注度、论坛关注度等,通过标签化、数字化工作,或者比较规范的格式使模型识别出来,越往外面,数据价值越低。为了提高准确度,1%、2%不采用这个方式。业务理解和数据理解全部做完,通过深度学习,不断迭代模型,最终得到比较好的预测模型。

    最后结果是什么呢?

    造一辆车需要不同的钢材,首先要预测各种钢的分布,预测每个阶段每个季度,车场市场上,一辆车大概需要几种材料,就能很好预测出某种高的需求,第一个预测钢的需求,利用模型可以直接输出,帮助公司预测未来各种实际需求,最后结果的预测准确度在90%以上。通过这个过程,通过机器学习,或是说通过人工智能,第一件事情就是帮助用户预测某一个产品的需求量,不仅是钢材,任何的市场需求行为都可以预测。

    第二个预测出每个生产厂商的订货量。模型通过市场的需求、历史记录等进行预测,最后结果的预测准确度也在90%以上。

    另外,我们希望帮助用户控制供应链,能够较好的预测出实际效果,发现特殊行为,进行用户忠诚度分析。最后发现用户对价格、物流、对资金比较敏感,并对这些用户行为打分,得出用户对钢材、汽车需求的描述,以及忠诚度分析。用户可以进行销售策略调整等决策。

    通过使用融合模型,结果预测准确率区域分品种订货量在90%几以上。每一种典型汽车生产上,按照车型辆数预测87.24%,这个精度能够帮用户节省很多工作。

    知识图谱

    知识图谱是是一种基于图的数据结构,由节点和边组成。在知识图谱里,每个节点表示现实世界中存在的实体,每条边为实体与实体之间的关系。其中,点与点之间的关联,举一个比较简单的例子,我晚上坐G10这趟火车从北京到上海,有可能建立起一些知识的实体。我个人、火车、G10、北京上海,知识图谱可以把连接起来,我、上海、北京、坐这辆高铁都是可以将虚线连起来。

    知识图谱是关系表达的知识结构,解决数据库里有一个信息就是关系的信息,所以知识图谱是把不同种类的信息联系在一起,而且得到一个关系网络,从提供关系角度分析问题,当然在很多的实际场景中会有它实实在在的应用。对企业、个人和大数据来说,这个已经成为主要的解决手段。在很多数据挖掘,尤其模型构建的时候已经成为很重要的因素。

    可以做哪些工作呢?比如,全文搜索的工作,跟全国数据库有点类似,能够做关系的搜索,比如搜上海和北京,那关系有可能出来我个人,我从上海到北京,从关系搜索搜索到你想要的东西。隐藏关系搜索,今天从北京到上海,明天从上海到南京,搜索会搜索到南京,这是一个隐藏关系,因为我并没有直接从北京到南京,但是我也通过这种关系搜索能找出隐藏关系,这也是知识图谱比较强的一个效果。还有全局报表,时空数据交互探索,关系搜索等。时间和空间能够表示你时间轴上发生什么事情,可以通过时空数据连接起来,比如说我今天从北京到上海,明天从上海到南京,跟南京时空关系隔了一天时间,知识图谱能够解决关系数据联系的结构。

    知识图谱能做的很多工作,其中较简单的是个人社会关系网络。使用图数据分析平台,通过对身份ID、信用卡/银行卡交易、通讯记录、住宿信息、工作单位信息等来分析获取重点监管的“联系人网络图”,“事件时空数据时序”信息,从而为个人社会关系调查,异常行为分析等监管工作提供更详细、精确的预测分析模型。通过“子群分析”,可以判断“团伙”、“宗派”等团体行为。

    知识图谱还可用于工商数据挖掘分析。上海工商数据里面有结点数很多,比如说公司935989家公司,里面有人,结点就是这个人是不是公司的董事长或持股人;里面的“边”表示谁是人员,是董事长还是投资人,有没有分支机构,投资做了担保,里面有多少股东,两个实体之间的关联就是“边”。

    知识图谱可以通过“连通子图”准确抓住其中的关键担保群和担保企业,防止互保联保的风险快速传染,用于对担保数据进行风险分析。

    在为香港公司做交叉尺骨的分析中,每一个点代表不同的公司,那每一条线代表对方是不是交叉池。图中红色的点代表一家公司,黄色的点是交换持股非常大的群体,这是一个小的交叉尺骨小集群,特别关注这个小集群是因为,这几家公司在某一个时间段股票暴跌,事后分析发现这几家公司是互相持股的。一个公司出现了金融或者资金的问题,导致暴跌,相关的所有的公司因为资金互相持股问题也会带来连锁效应。重点监控监管,能够较好的找出风险源头,也可以对政府监管机制提供比较好的决策作用。

    知识图谱+新技术

    如何将知识图谱和现在新的技术结合起来呢?

    比如说和自然语言分析结合起来,可以进行语言实体关系提取,进行实体提取,关系提取和标注工具应用。还可以做自然语言处理加上机器问答工作,比如问答机器人,基于图谱知识回答消费者问题。

    我们的机器学习平台DeepNEX AI-aaS,为用户提供“全栈”机器智能领域应用。包括DeepNEX深度学习平台、机器智能工具组件和行业模型组件。

  • ?

    产品案例|大数据研判实战分析系统

    Justonly

    展开

    合肥合和信息科技有限公司研发的大数据研判实战分析系统,是交通大数据应用的深度挖掘,系统将数据与业务充分结合,以实战为目的,利用道路卡口、电警抓拍的过车数据,结合车辆行驶轨迹,实时与后台嫌疑车辆信息库进行比对,对图片进行研判分析,交通管理部门可通过比对结果,预警布控,实现精准打击。

    系统创新点:

    大数据研判分析系统不仅可以对嫌疑车辆通过监控点时,进行实时报警,还可通过车辆历史轨迹进行分析研判,确定车辆行驶方向和路线,交警可根据比对结果进行提前布控,有效精准拦截。

    系统应用范围:

    布控违法嫌疑车辆、逾期未年检车辆、套牌车辆、无证失格人员驾驶车辆、禁区内行车等交通违法行为。

    系统功能:

    1、缉查布控系统自动从嫌疑车辆数据库名单中实时增量同步嫌疑车辆名单。

    2、系统每天自动统计嫌疑车辆中违法后仍在使用的车辆信息,并生成预警名单,未使用的嫌疑车辆不纳入预警范围。

    3、通过卡口抓拍到预警名单中的车辆驾驶人照片和违法驾驶人证件照比对以及通过违法前后两周预警车辆行驶轨迹比对,照片比对一致,轨迹相似则生成布控车辆名单。

    4、对布控名单内车辆近两周使用信息进行统计,生成一个高频率行驶的布控车辆名单。

    5、对高频率行驶的布控车辆名单中的车辆经过卡口按频次高低排名统计。

    6、对高频率行驶的布控车辆名单中的车辆,近两周行驶轨迹以及高频次路口进行分析对比。

    7、对驾驶轨迹规律的布控车辆进行精准打击,对驾驶轨迹不规律的布控车辆使用实时布控辅助精准打击。

    8、对布控车辆进行布控,当布控车辆被抓拍到轨迹信息后,后台服务会向指挥中心告警客户端推送告警信息,告警客户端向指挥中心提供车辆实时告警以及预测车辆行驶方向轨迹信息。为指挥中心调度执法站交警进行有效精准拦截。

    9、布控车辆抓捕结束后,指挥中心相关人员将结果反馈给后台系统。

  • ?

    解析丨警务实战平台大数据可视化应用

    苗紫易

    展开

    随着时代的发展和进步,“大数据分析”以前所未有的速度进步着。但大数据的快速发展也带来一个思考的问题:如何理解大数据?如何将大数据用于解决现实世界的问题?

    经济社会持续快速发展,全国各地的经济文化交流越来越频繁,在警务工作中人流、物流、信息流不断加强,我们能获取的数据量以爆炸式的速度增长,即使我们在计算能力方面有着令人难以置信的指数级增长,但我们想从大数据中获取的东西远远超过如今我们从数据中挖掘的东西。

    数据科学并不只是一门技术,它更多地是一种实践的艺术。适应新的治安形势,创新社会管理模式,提升动态环境下治安防控能力,积极解决“基层设施薄弱、基层采集负担重、民警应用手段少、底层数据资源整合不到位、研判应用工具智能化程度不高、资源应用服务缺乏”等老大难问题,将当前的技术转化成最大的价值,努力打造现代警务,提升公安工作的科技含量和现代化水平才是智慧警务的核心目标追求。

    可视化在智慧警务中发挥着至关重要的作用,它能帮助警务工作者更好地理解数据中可能存在的结构和规律。

    可视化让大数据成为决策利器

    第五元素警务大数据实战平台花费大量时间和精力对数据进行挖掘、建模、算法、分析等一系列深度加工处理,平台结合了社会现状和实战业务迫切需要,能有效解决系统分割、信息孤岛等制约信息共享的突出问题,在实际的应用当中,当决策者需要基于数据做出决策时,可视化无疑是可以让决策者快速对海量数据做出判断的最佳方式。

    可视化是让大数据接地气的唯一方法

    数据能够“触动”的人越多,其所产生的真正的价值越大。

    以第五元素大数据警务实战平台为例,警务实战应用平台主要围绕“人、案、物、地”四大警务实战元素,充分利用和整合公安内部资源数据及社会资源数据,汇聚整合本区一体化采集、警综系统、图侦系统、电子笔录等各类业务系统, 进行无缝对接和数据资料共享,通过讲述“数字故事”来表达数据反映的数据潜在内容。警务实在平台不仅仅在于“数值”和“变量”的分析,更体现在它汇集整合了有用的数据信息,面向实战平台的应用需求,实现系统互联互通,信息共享,实现服务资源的统一管理,切实提升控制和预警能力,将违反直觉的内容转化为直观内容的科学。

    可视化能最大化大数据的价值

    第五元素警务实战平台功能主要包括案件管理、重点人员管理、智慧地图功能、一键搜功能、设备管理、社会资源管理和为用户提供案件侦破的各种实战应用,包括案件串并碰撞分析、轨迹分析,多维碰撞、布控预警等功能,是平台可视化展示的内核。它可以根据业务需求变化进行灵活扩展,从而便捷快速地帮助警务工作者了解数据中的真理:这是什么数据?这些数据能说明什么?这些数据之间有什么样的内在关联?

    如今数据的量越来越大,数据的复杂性也越来越强,但追求视觉表达形式的趋势不会变,即使数据科学和大数据分析技术不断发展,新的分析方法和分析应用不断涌现,也都始终无法撼动可视化的重要地位。

    关于第五元素

    第五元素大数据科技有限公司是一家专注于技术研究、产品开发、系统设计、项目运行的大数据系统集成解决方案提供商,致力于为智慧城市、平安城市、智慧公安、智慧政务等业务建设提供整体解决方案及业务支撑,全面推进我国新型智慧城市发展。

    第五元素大数据

    领先的大数据集成系统解决方案提供商。

    关注

  • ?

    大数据分析项目实战直播分享

    梅瑞狄斯

    展开

    随着大数据相关技术的发展,大数据在行业内的应用越来越广泛,大数据又分为数据采集、数据清洗、数据存储、数据建模、数据呈现等多个环节。

    由于缺乏对应的大数据人才,以及国家对大数据的支持,目前很多人都开始关注大数据领域。考虑到很多人想了解大数据,我们特地准备了一个关于大数据可视化分析的项目实战课,里面包含多个大数据分析项目的讲解和演示,每周两到三次。具体的信息说明在最后。

    往期大数据分析项目展示:

    大数据项目实战案例一:二手房交易数据分析

    大数据项目实战案例二:数据可视化职位分析

    大数据项目实战三:智慧城市运营中心项目

    大数据项目实战案例四:空气质量监测

    大数据项目实战案例五:全国IT行业招聘信息分析

    项目知识点:大数据分析,大数据可视化呈现。在哪里学习?大数据项目实战467095527

    我们所处的这个时代,是一个知识大爆发的时代。仅就编程这项技能来说,现在几乎人人都能写上一两行,程序员这个群体也比十年前有了更多维度上的扩展。所以面对热门的大数据技术,有必要多做了解,多学习,才有利于长远的发展。

  • ?

    金融科技野蛮袭来 证券业“实战”大数据分析

    祁牛青

    展开

    “Kyligence Enterprise避免了开源框架需要投入的大量维护和调优成本,使我们能将大数据技术快速落地,我们最终的结果展现都是通过Kyligence Enterprise完成的,最终也得到了业务部门的正面反馈。”

    —— 财通大数据项目负责人

    自上世纪90年代至今,中国证券行业经过二十多年的发展,从初步萌芽到发展壮大、从监管缺位到逐步完善,市场规模已经达到发达国家几十年甚至上百年的发展水平,成为金融业务中最为重要的组成部分之一。

    而在过去几年间,随着信息技术革命的不断发展,越来越多的券商开始尝试采用数据驱动的方法来促进自身业务的升级转型,大数据分析与证券行业的结合日益紧迫。爱分析《中国金融大数据行业报告》显示,大数据已被以银行为代表的金融机构广泛认可,招商银行在2017年出资7.9亿元成立金融科技创新项目基金,中国银行也宣布将于2018年投入近50亿元用于科技创新建设,保险、证券等非银机构将成为银行之后的又一波将投入巨额资金用作大数据IT建设的企业。

    大数据分析技术在证券行业中的应用与推广虽然势不可挡,但想要驾驭大数据分析技术仍须克服重重困难。我们看到的典型问题和困难如下:

    资金挑战:证券行业的许多IT预算并不是为创新提供资金,而是用于金融合规和欺诈检测的“防御性”应用程序;系统老化:证券行业老化的数据系统很大程度上无法存储、汇总和分析来自不同数据源的客户和服务的海量大数据;应用缺位:面对迅猛发展的大数据变革环境,证券行业对于大数据改革缺乏具体落地的数据应用;决策谨慎:由于证券行业在数据安全、风险管理及合规性等方面的高要求,在大数据平台建设时需要寻找更加谨慎的方案——即在充分利用大数据技术、持续优化技术和业务架构,与满足各方面的安全和稳定性之间取得平衡。这些因素一定程度上限制了券商的大数据分析平台建设推进,也使得券商的大数据分析完全无法满足业务部门越来越高的业务需求。Kyligence 的大数据分析解决方案 Kyligence Enterprise,为证券公司解决了大数据IT建设与业务的需求。

    接下来,本文将以财通证券使用Kyligence Enterprise建设大数据平台为例,分析国内券商的大数据分析平台搭建实践,及如何通过建设大数据分析平台为其业务发展保驾护航。

    券商大数据分析平台建设

    财通证券是一家总部位于杭州的上交所主板上市证券公司,随着公司业务的高速发展,公司积累了各类海量数据,这些数据具有来源广、规模大、价值大和增长快等特征,且亟待整合、管理与发挥价值。在财通证券中构建自上而下、协调一致的数据治理体系,迫切而适时。

    财通证券的大数据平台建设分为三个阶段,第一阶段的建设目标是形成统一集中的大数据中心,这一目标旨在通过开源大数据技术,自主建设基于Hadoop和Kyligence Enterprise的大数据技术平台,并在此基础上自主研发各类大数据应用,包括经纪业务经营管理分析平台、两融大数据分析平台等,打破数据孤岛,并在数据治理体系下全面提高数据应用质量。目前,第一阶段的建设已经落地应用,其大数据中心的核心能力如下:

    数据治理体系建设:在数据治理体系基础上,对现有指标体系进行梳理和完善,规范化数据模型层,更好的支撑业务能力;数据仓库和技术平台:抽取集中交易系统UF2.0数据,在大数据平台下进行分布式存储和计算处理,Kyligence Enterprise 企业版则在超大数据集上提供亚秒级分析能力和计算服务;数据共享服务平台:通过数据订阅和Kyligence Enterprise RestAPI的方式,对下游业务应用系统提供数据共享和交互查询服务,并具备严格的数据访问权限;大数据分析平台:通过OLAP技术,多维可视化展现公司管理层、机构管理部、分支机构(分公司、营业部)所关心的指标体系,以及历史数据的查询统计分析,数据展示更直观,交互性更强。

    下面分别为财通证券落地后的业务和技术架构图:

    除此之外,在自动化运维方面,财通也做了很多个性化探索,通过实时监控,实现自动化数据采集、清洗、Cube构建等,与现有运维管理系统对接,实现自动化运维,以提升整体可用性。

    总体而言,财通证券在其大数据分析平台采用Kyligence Enterprise后,在以下几方面得到了提升:

    节省原有的繁琐报表开发中70%的人力成本,通过自主研发各类大数据应用,上线周期缩短50%;在大数据平台上,快速准确地监测分支机构运营情况,在以下四方面为管理者提供“一站式”决策支持信息服务;

    通过客户画像的数据挖掘分析,进行客户细分、流失客户预测等有效的客户关系管理,以提升客户满意度;深入挖掘海量投资交易信息,从而对市场预期和风险加以预测,提升综合金融服务能力和市场竞争能力。

    财通证券大数据团队负责人表示:未来,财通证券将致力于建设更加强大的大数据平台,实现数据应用价值的进一步挖掘,重构券商的“数据”与“业务”应用场景。在第二阶段,将致力于数据应用支持范围和深度的扩大与完善,同时丰富数据应用服务场景,第三阶段则将探索深入数据挖掘和人工智能等专业的数据分析应用,建立数据为核心的生态体系。

    结论

    结合财通证券的案例,我们归纳出大数据分析技术助力证券行业的转型与发展主要体现在技术与服务两个层面:

    技术层面:大数据分析技术的使用将有助于实现券商投资产品的创新——如智能投顾、黑天鹅预警等业务,并通过端到端自助服务平台缩短分析周期、丰富数据探索、增加数据洞察力,从而快速调整业务以满足不断变化的需求。服务层面:大数据分析技术的应用将有助于提高券商的服务水平,一方面,通过精准营销的方式提升获客质量,从用户、业务、留存、成本等多个维度进行评估,以实现ROI最大化;另一方面,通过精细化管理和运营,加强现有客户的业务转化和留存,在保证活跃用户体验的同时,不断提升用户生命周期的价值。目前,证券行业仍然是风险最大,但最具活力的行业之一,证券公司从客户、交易、全球化和其他许多来源获得的数据量很大,往往是传统处理平台无法承载的。可以说Hadoop和Kyligence Enterprise的数据分析解决方案是专门为这种丰富的数据和依赖数据的业务而构建的,借助其横向扩展能力、数据包容性,以及不断迭代的OLAP分析解决能力,以Kyligence Enterprise为代表的大数据分析平台将会成为证券业务增长的重要力量。

    作者介绍

    海书山(Sky Hai),Kyligence高级解决方案架构师,超过7年数据行业从业经历,在零售、金融等行业拥有丰富的大数据架构、实施和咨询经验。

    更多关于 Kyligence Enterprise 信息

    还可申请30天免费试用!

实战大数据分析

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP