中企动力 > 商学院 > 大数据平台软件
  • ?

    一站式大数据分析平台免费试用

    特雷吉耶

    展开

    数据分析历经报表、BI、敏捷BI、自服务BI、数据挖掘等传统发展阶段,科技创新快速发展,今天,大数据已经进化到智能革命的阶段,任何企业都面临数据智能化的转型,大数据分析平台ETHINK在以上传统功能基础上,已为企业带来新的智能基因:

    智能BI是“敏捷BI+深度洞察算法”

    智能DM是“特征工程+机器学习+自动化挖掘”

    智能AI是“数据+专家经验+智能算法”

    ETHINK数据智能分析平台V8.0版本包括数据可视化、数据分析、数据挖掘等核心技术产品,欢迎对大数据有兴趣的企业和个人前来试用。(加入ETHINK体验QQ群:213750619,即可联系客服开通账号,不收取任何费用。)

    ETHINK数据智能分析平台五款核心产品介绍:

    快速BI:快速、简单、敏捷,帮助数据运营企业,建立拖拽式、数据探查式、在线分析的分析平台,自适应布局,可适应大屏、PC、移动BI等各类场景。

    智能BI:强大、专业、智能,帮助行业企业建立拖拽式分析分析平台,强大的2次开发能力,帮助快速复制与行业推广。

    数据挖掘分析:分布式内存计算大数据挖掘平台,流程式拖拽设计,包含从数据清晰加工、数据100多种算法,可以实现从客户流失分析、故障预警、风控、征信、推荐、预测等各类数据挖掘应用。

    统计分析:统计分析平台集成了丰富的统计分析算法,通过拖拽的方式实现分析,平台包括数据探索、相关分析、方差分析、聚类分析、回归分析、时间序列分析、参数估计、假设检验等100余种统计分析方法,能够解决制造业、电信、金融、医疗、电力、零售、教育、政府等各个领域的问题。

    小e机器人:包含图像、语音、自然语言感知,情感分析的听说读写感知,基于大数据深度学习的认知计算能力,是企业提供深度AI应用的基础平台。通过图像识别,文字识别,以及自然语言处理,ETHINK学习更多的知识,帮助机器服务人类。帮助实现图像识别、文本分析。通过特征工程,以及深度学习算法,结合专家经验和数据智能,实现类人智能应用。

    想了解更多产品内容,可访问官网http://ethinkai网站的资源库中为大家提供了详细的操作手册,可自行下载。

    每次更新,都是为了更好的前行

    更酷炫的功能

    全新的操作界面

    为了每一位用户的体验而诞生

    你,还要错过吗??

    附:ETHINK演示DEMO

  • ?

    「2017APP平台大数据」APP平台综合排行榜

    Ziv

    展开

    用户价值、精细化运营、自2016年,不断有人提出这些概念,到2017更为普及,这个趋势将一并波及大公司、独角兽和创业公司。

    不多说,先上各类榜单。

    (游金地整理发布)

  • ?

    做中国最好的大数据平台,新华三底气何来?

    宁梦秋

    展开

    近日,新华三集团在“H3C Navigate 2017”领航者峰会上发布了大数据系列产品数据引擎1.0,正式进军大数据行业,并提出“要做国内最好的大数据平台”的目标。

    自从2016年5月成立以来,新华三的战略布局始终聚焦一个“新”字。在计算、网络、存储为主的传统IT架构基础上,新华三提出了“三大一云”的新IT战略,要做融合了大数据、大安全、大互联和云计算在内的全方位一站式服务提供商。

    那么,作为其战略核心的大数据业务定位是什么?核心竞争力与战略规划又是什么?从趣味科技对新华三集团副总裁、大数据产品线总裁孙德和的采访当中,我们可以细细解读新华三大数据业务在战略、打法和产品上的独特之处。

    定位全行业的大数据服务平台

    目前国内做大数据业务的公司已达数千家,包括各类软件商、平台商、工具商,但是大部分还局限于互联网。针对行业客户的海量结构化、非结构化数据的专业服务,则为数不多。

    新华三大数据业务的定位非常清晰,就是做大数据平台和数据服务,服务范围是全行业。相比应用开发和硬件,做平台对企业技术实力要求很高,需要庞大的研发团队,需要对技术、研发的长期持续投入。“未来,做平台一定是有实力的公司才能参与竞争,而新华三有这个实力。”孙德和说道。

    在技术研发方面,新华三实力不容小觑。据了解。此次领航者峰会上发布的大数据产品,前期的研发周期已经运作了2-3年,并且已在多个行业收获了成功实践的案例。

    ISV策略:聚焦细分行业TOP3

    做平台,关键在于对行业客户及产品有充分的了解并满足其需求。开放平台的定位,决定了新华三的大数据业务与ISV(应用开发商)有着很强的互补关系。“新华三的平台就是把新IT的技术架构,包括云的架构,一直到大数据服务平台形成一个大的平台。将来的应用合作伙伴可以基于我们的平台,再基于客户的需求去开发应用。”孙德和介绍道。

    新华三的大数据战略是跟细分行业的领先应用开发商进行合作。TOP ISV显然更懂行业客户的业务逻辑,能够满足客户的需求。新华三负责利用大平台的规模化优势,做行业共性的数据服务。接下来,为客户定制专业化的应用就交给各个ISV合作伙伴。

    H3C Data Engine数据引擎1.0

    此次新华三发布的数据引擎1.0产品Data Engine,包括了基础计算平台、数据服务(智能化数据采集和处理)、创新应用开发平台以及数据视觉引擎等核心组件。其中,创新应用里涉及人工智能的部分功能,包括深度学习、机器学习等,旨在帮助应用开发商构建基于大数据、基于人工智能的应用。

    不久前,在全国信标委大数据标准工作组主持的全国首次大数据系统通用规范测试中,Data Engine以最短的耗时通过了全部71项测试用例,从几十家申请测试的大数据产品中脱颖而出。测试中,Data Engine展示了其支持单集群100节点、数据量超过1PB以及内外网隔离的大数据服务能力。

    据透露,新华三的大数据平台已经得到了政府、公安、教育、医疗等各行业客户的青睐并被广泛应用。

    在孙德和看来,丰富的产品线、覆盖最广的IT销售体系、广泛的行业客户群和优秀的产品平台,是新华三大数据业务的核心竞争力,也是做国内最好大数据平台的信心所在。

    遍布全国的新IT版图

    目前,新华三“三大一云”的IT版图已经初步完成,包括坐落在郑州的大数据公司,落在成都的云计算公司和合肥的大安全公司。郑州大数据中心以研发为主,预计规模将达到800-1000人,将为客户提供整合交付的数据服务。

    随着城市化的加速和大数据产业的发展,数据已经成为国家重要战略资源之一。在打造数字化城市、新型的智慧城市的进程中,新华三已经做好了准备,希望通过大数据平台构建城市数据引擎,融合高校、企业、政府的资源,共同围绕着城市的一些关键业务问题去开展课题研究。

    根据中国信息通信研究院的调研测算,2016年我国大数据核心产业的市场规模达到168亿元,增速达44.9%,预计2017-2018年还将维持40%左右的高速增长。

    在互联网、C端大数据和公有云蓬勃发展的同时,如何满足行业客户的大数据需求,是目前阶段大数据产业发展的重点。新华三瞄准行业大数据这个契机,以大平台的定位切入,为大数据产业上下游打造了一个开放共赢的数据生态。

  • ?

    大数据平台在电商销售中的应用

    Rochelle

    展开

    项目背景

    上海宏原信息科技有限公司成立于2013年,致力于帮助品牌建立大数据时代营销模式。宏原基于跨平台的大数据连接,洞察消费者决策旅程,为品牌主提供包括:营销策略制定、活动效果评估、touchpoint规划、营销效果转化等服务和产品。

    宏原作为大数据营销创业公司,对营销洞察有着自己独特的营销分析模型和独特算法。但是对于大数据基础软件的开放和运用并不是强项,选择存储处理能力较强的数据平台,可以解决在数据平台相关项目上的人才招聘、培养等问题,节省成本,将更多的精力投入自己擅长的营销数据挖掘和应用中。

    项目需求

    宏原科技专注营销智能化分析,凭借营销经验,将消费者数据进行分析和挖掘,继而进行消费洞察等数据应用。

    宏原拥有海量数据,这其中大量来自淘宝等电商渠道的图、表等非结构化数据占据了很大比例,对海量结构复杂的数据的存储和处理是数据应用的基础,选择一个强有力的数据平台,将数据进行最优化的处理,才能支撑在此之上进行的所有数据应用、数据挖掘。

    随着公司数据量的不断增加,以较低的成本进行数据平台扩容,以及扩容的便捷性,被提上日程,同时,营销洞察对数据处理的速度提出了较高的要求。

    大数据平台选型

    宏原自身建有数据库存储数据,最初只涉及医药品类,产品品类较少,数据量在一定范围内,自身的数据库尚可以满足。随着公司涉足服装等产品,品类越来越多,数据量激增,原有的数据库无法处理大量级数据,在存储和处理上都出现了相应的问题。

    宏原之前采用MongoDB软件,处理几万条数据需要的时间是10秒。而随着公司的不断进阶、发展,公司的数据量也不断增长、逐渐变得更为庞大,数据库对于数据处理的速度已经无法满足需求。

    电商在国内发展飞速,数据增长的速度惊人,数据库扩容和维护的便捷性,都是宏原关注的重点。综合考虑之后宏原选择和星环科技牵手,采用TDH大数据平台,非常便捷的将数据迁移至TDH平台,处理大量结构化、半结构化、非结构数据,TDH平台具备线性扩容的特性,分布式处理的架构使得计算速度大大提升。星环在国内的研发团队可以为宏原提供强有力的技术支持,大大降低宏原组建基础软件研发的人力成本和资金成本。

    数据平台建设效果及数据应用

    1、提升数据处理效率

    宏原通过AMP人群管理平台,完成数据获取,获取来的数据存入TDH平台,进行存储和计算。TDH平台将结构化、半结构化、非结构化数据进行分布式存储,平均处理五亿条数据所花的时间为2秒,效率大大提升。

    2、便于快速查询、线性扩容

    TDH组件Hyperbase提供JDBC/ODBC接口,支持SQL直接操作,通过利用星环TDH平台的Hyperbase组件,程序员完全可以按照传统数据库方式进行代码编写,并且无论是从key,还是从属性列,都可以进行快速查询。分布式的存储和计算没有复杂的关系模型,可以拆分,也方便进行线性扩容。

    3、基于大数据平台上的营销洞察

    在大数据平台基础之上,宏源利用自己的计算模型进行营销洞察,基于TDH的数据存储和计算框架,可以实现全数据的快速扫描和统计,为数据应用提供了必要的后台支撑。

    以女性服装消费品为例,在数百万的商品详情属性,和上千万的电商评论、人群的属性中,通过宏原科技的系统可以抓取800万条女装评论数据,TOP75% 卖家销量及商品详情数据,根据算法模型可以知道女神都在关注什么、女神都有哪些类型、女神们是如何评论服装的。通过结合场景,天气,感官,质感等多维度的关联分析,宏源科技可以更为准确地把握女神们对着装的不同要求,从而帮助品牌厂家设计新的服装或制定新的营销效果。将数据应用落实到行动指导上。

    4、数据挖掘与应用分析

    基于品牌的特点选择有ID体系的真实用户,进行数据挖掘与分析洞察消费者,新浪微博,天猫评论和垂直户外社区的互动数据是户外品牌的主要数据来源。将这些数据进行计算和归类分析,洞察消费诉求、消费偏好、消费场景、社交关系等,将结果与阿里巴巴数据平台的上人群标签进行匹配,找到最有可能购买产品的消费人群,不同特征的人群投放针对消费者特征和消费场景的个性化广告内容。

  • ?

    金融大数据平台应该如何搭建及应用?

    裘婷冉

    展开

    金融大数据平台的搭建和应用是两个部分,对于金融大数据平台来说,这两个部分都很重要。

    所以以下的部分我们从大数据平台和银行可以分析哪些指标这两个角度来阐述。

    一、大数据平台

    大数据平台的整体架构可以由以下几个部分组成:

    从底层逐步往上,如图所示表示这么几个环节:

    一、业务应用:其实指的是数据采集,你通过什么样的方式收集到数据。互联网收集数据相对简单,通过网页、App就可以收集到数据,比如很多银行现在都有自己的App。

    更深层次的还能收集到用户的行为数据,可以切分出来很多维度,做很细的分析。但是对于涉及到线下的行业,数据采集就需要借助各类的业务系统去完成。

    二、数据集成:指的其实是ETL,指的是用户从数据源抽取出所需的数据,经过数据清洗,最终按照预先定义好的数据仓库模型,将数据加载到数据仓库中去。而这里的Kettle只是ETL的其中一种。

    三、数据存储:指的就是数据仓库的建设了,简单来说可以分为业务数据层(DW)、指标层、维度层、汇总层(DWA)。

    四、数据共享层:表示在数据仓库与业务系统间提供数据共享服务。Web Service和Web API ,代表的是一种数据间的连接方式,还有一些其他连接方式,可以按照自己的情况来确定。

    五、数据分析层:分析函数就相对比较容易理解了,就是各种数学函数,比如K均值分析、聚类、RMF模型等等。

    列存储让磁盘中的各个Page仅存储单列的值,并非整行的值。这样压缩算法会更加高效。进一步说,这样能够减少磁盘的I/O、提升缓存利用率,因此,磁盘存储会被更加高效的利用。

    而分布式计算能够把一个需要非常大的算力才能解决的问题分成很多小部分,接着把这些部分给到许多计算机同时处理,然后把这些计算结果综合起来,得到最终的结果。

    综合这两种技术,就能够大幅度提高分析环节的效率。Yonghong MPP可以说是目前在这两方面做的最出色的了。

    六、数据展现:结果以什么样的形式呈现,其实就是数据可视化。这里建议用敏捷BI,和传统BI不同的是,它能通过简单的拖拽就生成报表,学习成本较低。国内的敏捷BI中,个人用户推荐Tableau,像银行这类的企业级需求推荐Yonghong BI 。

    七、数据访问:这个就比较简单了,看你是通过什么样的方式去查看这些数据,图中示例的是因为B/S架构,最终的可视化结果是通过浏览器访问的。

    二、银行数据分析体系如何搭建?

    搭建一个数据平台可能是项目制的工作,在一段时间内会完成,但是搭建数据分析体系这件事却任重而道远。但是如果有人能在做产品的同时,将金融行业同类的数据应用经验也分享给你,帮助你去搭建数据分析体系,那就是真正的“良药”了。

    下面分享一个YonghongTech帮助某大型银行数据服务平台建设的案例。

    以客户在银行办理业务的行为路径,可以有这样几个主题,不同主题有对应的场景及其指标。

    1.一个客户

    客户主题:客户属性(客户编号、客户类别)、指标(资产总额、持有产品、交易笔数、交易金额、RFM)、签约(渠道签约、业务签约)组成宽表

    2.做了一笔交易

    交易主题:交易金融属性、业务类别、支付通道组成宽表。

    3.使用哪个账户

    账户主题:账户属性(所属客户、开户日期、所属分行、产品、利率、成本)组成宽表

    4.通过什么渠道

    渠道主题:渠道属性、维度、限额组成宽表

    5.涉及哪类业务&产品

    产品主题:产品属性、维度、指标组成宽表

    三、案例

    鉴于篇幅问题,此处可以参考这篇文章:

    华夏银行:大数据技术服务业务需求,实现销售高速增长

    http://.baidu/builder/preview/s?id=1600613969915764917

  • ?

    六大主流大数据采集平台架构分析

    紫罗兰

    展开

    随着大数据越来越被重视,数据采集的挑战变的尤为突出。今天为大家介绍几款数据采集平台:

    Apache Flume Fluentd Logstash Chukwa Scribe Splunk Forwarder

    大数据平台与数据采集

    任何完整的大数据平台,一般包括以下的几个过程:

    数据采集–>数据存储–>数据处理–>数据展现(可视化,报表和监控)

    其中,数据采集是所有数据系统必不可少的,随着大数据越来越被重视,数据采集的挑战也变的尤为突出。这其中包括:

    我们今天就来看看当前可用的六款数据采集的产品,重点关注它们是如何做到高可靠,高性能和高扩展。

    1、Apache Flume

    Flume 是Apache旗下的一款开源、高可靠、高扩展、容易管理、支持客户扩展的数据采集系统。 Flume使用JRuby来构建,所以依赖Java运行环境。

    Flume最初是由Cloudera的工程师设计用于合并日志数据的系统,后来逐渐发展用于处理流数据事件。

    Flume设计成一个分布式的管道架构,可以看作在数据源和目的地之间有一个Agent的网络,支持数据路由。

    每一个agent都由Source,Channel和Sink组成。

    Source

    Source负责接收输入数据,并将数据写入管道。Flume的Source支持HTTP,JMS,RPC,NetCat,Exec,Spooling Directory。其中Spooling支持监视一个目录或者文件,解析其中新生成的事件。

    Channel

    Channel 存储,缓存从source到Sink的中间数据。可使用不同的配置来做Channel,例如内存,文件,JDBC等。使用内存性能高但不持久,有可能丢数据。使用文件更可靠,但性能不如内存。

    Sink

    Sink负责从管道中读出数据并发给下一个Agent或者最终的目的地。Sink支持的不同目的地种类包括:HDFS,HBASE,Solr,ElasticSearch,File,Logger或者其它的Flume Agent。

    Flume在source和sink端都使用了transaction机制保证在数据传输中没有数据丢失。

    Source上的数据可以复制到不同的通道上。每一个Channel也可以连接不同数量的Sink。这样连接不同配置的Agent就可以组成一个复杂的数据收集网络。通过对agent的配置,可以组成一个路由复杂的数据传输网络。

    配置如上图所示的agent结构,Flume支持设置sink的Failover和Load Balance,这样就可以保证即使有一个agent失效的情况下,整个系统仍能正常收集数据。

    Flume中传输的内容定义为事件(Event),事件由Headers(包含元数据,Meta Data)和Payload组成。

    Flume提供SDK,可以支持用户定制开发:

    Flume客户端负责在事件产生的源头把事件发送给Flume的Agent。客户端通常和产生数据源的应用在同一个进程空间。常见的Flume 客户端有Avro,log4J,syslog和HTTP Post。另外ExecSource支持指定一个本地进程的输出作为Flume的输入。当然很有可能,以上的这些客户端都不能满足需求,用户可以定制的客户端,和已有的FLume的Source进行通信,或者定制实现一种新的Source类型。

    同时,用户可以使用Flume的SDK定制Source和Sink。似乎不支持定制的Channel。

    2、Fluentd

    Fluentd是另一个开源的数据收集框架。Fluentd使用C/Ruby开发,使用JSON文件来统一日志数据。它的可插拔架构,支持各种不同种类和格式的数据源和数据输出。最后它也同时提供了高可靠和很好的扩展性。Treasure Data, Inc 对该产品提供支持和维护。

    Fluentd的部署和Flume非常相似:

    Fluentd的架构设计和Flume如出一辙:

    Fluentd的Input/Buffer/Output非常类似于Flume的Source/Channel/Sink。

    Input

    Input负责接收数据或者主动抓取数据。支持syslog,http,file tail等。

    Buffer

    Buffer负责数据获取的性能和可靠性,也有文件或内存等不同类型的Buffer可以配置。

    Output

    Output负责输出数据到目的地例如文件,AWS S3或者其它的Fluentd。

    Fluentd的配置非常方便,如下图:

    Fluentd的技术栈如下图:

    FLuentd和其插件都是由Ruby开发,MessgaePack提供了JSON的序列化和异步的并行通信RPC机制。

    Cool.io是基于libev的事件驱动框架。

    FLuentd的扩展性非常好,客户可以自己定制(Ruby)Input/Buffer/Output。

    Fluentd从各方面看都很像Flume,区别是使用Ruby开发,Footprint会小一些,但是也带来了跨平台的问题,并不能支持Windows平台。另外采用JSON统一数据/日志格式是它的另一个特点。相对去Flumed,配置也相对简单一些。

    3、Logstash

    Logstash是著名的开源数据栈ELK (ElasticSearch, Logstash, Kibana)中的那个L。

    Logstash用JRuby开发,所有运行时依赖JVM。

    Logstash的部署架构如下图,当然这只是一种部署的选项。

    一个典型的Logstash的配置如下,包括了Input,filter的Output的设置。

    几乎在大部分的情况下ELK作为一个栈是被同时使用的。所有当你的数据系统使用ElasticSearch的情况下,logstash是首选。

    4、Chukwa

    官网:https://chukwa.apache.org/

    Apache Chukwa是apache旗下另一个开源的数据收集平台,它远没有其他几个有名。Chukwa基于Hadoop的HDFS和Map Reduce来构建(显而易见,他用Java来实现),提供扩展性和可靠性。Chukwa同时提供对数据的展示,分析和监视。很奇怪的是它的上一次 github的更新事7年前。可见该项目应该已经不活跃了。

    Chukwa的部署架构如下:

    Chukwa的主要单元有:Agent,Collector,DataSink,ArchiveBuilder,Demux等等,看上去相当复杂。由于该项目已经不活跃,我们就不细看了。

    5、Scribe

    代码托管:https://github/facebookarchive/scribe

    Scribe是Facebook开发的数据(日志)收集系统。已经多年不维护,同样的,就不多说了。

    6、Splunk Forwarder

    以上的所有系统都是开源的。在商业化的大数据平台产品中,Splunk提供完整的数据采金,数据存储,数据分析和处理,以及数据展现的能力。

    Splunk是一个分布式的机器数据平台,主要有三个角色:

    Search Head负责数据的搜索和处理,提供搜索时的信息抽取。

    Indexer负责数据的存储和索引 Forwarder,负责数据的收集,清洗,变形,并发送给Indexer

    Splunk内置了对Syslog,TCP/UDP,Spooling的支持,同时,用户可以通过开发 Input和Modular Input的方式来获取特定的数据。在Splunk提供的软件仓库里有很多成熟的数据采集应用,例如AWS,数据库(DBConnect)等等,可以方便的从云或者是数据库中获取数据进入Splunk的数据平台做分析。

    这里要注意的是,Search Head和Indexer都支持Cluster的配置,也就是高可用,高扩展的,但是Splunk现在还没有针对Farwarder的Cluster的功能。也就是说如果有一台Farwarder的机器出了故障,数据收集也会随之中断,并不能把正在运行的数据采集任务Failover到其它的 Farwarder上。

    总结

    我们简单讨论了几种流行的数据收集平台,它们大都提供高可靠和高扩展的数据收集。大多平台都抽象出了输入,输出和中间的缓冲的架构。利用分布式的网络连接,大多数平台都能实现一定程度的扩展性和高可靠性。

    其中Flume,Fluentd是两个被使用较多的产品。如果你用ElasticSearch,Logstash也许是首选,因为ELK栈提供了很好的集成。Chukwa和Scribe由于项目的不活跃,不推荐使用。

    Splunk作为一个优秀的商业产品,它的数据采集还存在一定的限制,相信Splunk很快会开发出更好的数据收集的解决方案。

  • ?

    什么是大数据和大数据平台?

    特罗弗明德

    展开

    “大数据”时下一个热门的词语,近几年来,关于大数据的著作和文章铺天盖地,似乎也在共同在传递一个信息:越来越多的行业、人士开始关注并实际探索大数据的应用,我们正在一起描绘着大数据巨大效用的蓝图,但在实践的路上,我们都孩子起步阶段小步前行。

    大数据根基于互联网,数据仓库、数据挖掘、云计算等互联网技术的发展为大数据应用奠定基础。对于任何一个大数据的从业者或初接触者,或者都会有个共同的感触:大数据很有用!但大数据是什么呢?

    今天就给大家讲解一下:

    对于大数据的定义,我们来引用3个比较差用的大数据定义:

    1)Gartner:需要信息处理模式才能具有更强的决策力,洞察发现力和流程优化能力的海量、高增长率很多样化的信息资产。

    2)IDC:海量的数据规模(Volunme)、快速的数据流转和数据体系(Velocity)、多样的数据类型(Variety)、巨大的数据价值(Value)。

    3)Wiki:或称巨量数据、海量数据、大资料,指所涉及的数据量规模巨大到无法通过人工,在合理时间内达到截取、管理、处理、并整理成为人类所能解读的信息。

    其他关于大数据的定义也大抵类型,我们可以用几个关键词对大数据做一个界定。

    首先,“大规模”,这种规模可以从两个维度来衡量,一是时间序列累积大量的数据,二是在深度上更加细化的数据。

    其次,“多样化”,可以是不同的数据格式,如文字、图片、视频等,可以是不同的数据类别,如入口数据,经济数据等,还可以有不同的数据来源,如互联网、传感器等。

    最后,“动态化”,数据是不停变化的,可以随着时间快速增加大量数据,也可以是在空间上不断移动变化的数据。

    这三 个关键词对大数据从形象上做了界定。

    但是还需要一个关键能力,就是“处理速度快”。如果这么大规模、多样化又动态变化的数据有了,但需要很长的时间去处理分析,那不叫大数据。从另一个角度,要实现这些数据快速处理,靠人工肯定是没办法实现的,因此,需要借助于机器实现。

    最终,我们借助机器,通过对这些数据进行快速的处理分析,获取想要的信息或者应用的整套体系,才能称为大数据。

    我们可以用下面的图示给大数据定义:

    这下,就知道什么是大数据了吧

  • ?

    大数据十大平台集合

    循环

    展开

    1数据星河大数据平台

    全球首款大数据产业链生态平台,大数据界的App store。

    实现数据模型、可视化引擎工具、应用场景、采集爬虫工具、清洗脱敏工具、数据分析平台、数据开发平台、数据管理平台、数据安全组件等大数据资产的分类展示、检索和使用。

    一站式服务,快速实现大数据应用设计,同时可在平台进行应用产品交易。

    2大数据可视化平台

    标准的、友好易用、具备丰富展示形式、与底层数据分析实现解耦。

    提供丰富的专业级可视化图表组件,在线进行图表配置、导出,提供使用指导。

    提供可视化产品工厂,以及Dashboard自定义布局。

    具备可视化编程能力,供用户快速开发可视化图表应用。

    3企信宝APP

    拥有约9000万海量企业信息数据。

    提供失信企业及失信人查询及公布失信榜单,全国各企业查询,股东高管数据挖掘,企业网站地址查询,企业风险信息监测。

    4农业大数据平台

    涵盖农业监测预警大数据平台、农产品全产业链追溯预警大数据平台和农业产业链企业信用大数据平台。

    覆盖农林牧副渔各行业,贯穿农业生产经营管理服务全过程。

    目标群体包括部级农业部门、地方农业部门、涉农企业、农业金融机构等。

    5金融大数据——54个九宫格小场景

    九宫格应用场景包含四大类别,分别是基础数据库类、决策类、预测类、预警类,基础数据库类场景满足客户对基本数据的查询,决策类场景助理用户根基数据分析得到的价值信息进行有效决策,预测类场景便于用户对于潜在的风险及时规避。同时,用户可以根据自身需求进行场景化自定义组合,以满足个性需求。

    6工商大数据平台

    包括工商大数据分析展示、企业信用信息大数据监管和市场主体全景谱图大数据分析服务。

    一网、一库、一中心、一平台、一门户,提升工商公共服务能力、市场监管能力、辅助决策能力和助推发展能力

    7食药监大数据平台

    对食品、药品、餐饮、中药材的生产、仓储、分销、物流运输、市场巡检及消费者等信息,以及产品名称、执行标准、配料、生产工艺、标签标识等数据,进行采集、跟踪、分析。

    使监管部分实现产品种养、生产、销售、流通、公众服务、物流等环节的整个生命周期的监管

    通过互联网等途径,实时呈现给消费者,实现食品药品全过程的全知晓。

    8旅游大数据平台

    显示最直观的客源、客流、经济收入数据、履约企业运营趋势、市场景气指数等指标。

    管理部门可以从宏观角度了解地区旅游产业的整体发展水平和竞争力,辅助管理者制定基于大数据的行业发展决策。

    所有数据来源于近五年累计数据(2011-2017),每周更新。

    9民意云大数据平台

    从海量的数据中分析民意诉求,精准分析民意热点——这是大数据在服务民意诉求中的重要作用。九次方民意云大数据平台,通过提供大数据操作台,方便用户实时全面了解区域内民意变化,根据推送消息进行应急反应。

    10传播力监测大数据

    根据全网采集的文章标题、作者、来源、时间等信息,计算文章的规范被转载量、非规范被转载量、以及文章的影响地域分析,并将各指标进行加权算法,帮助没提了解具体文章的全网传播详情。

    协助监管部门加强没提传播监管和提升媒体机构的传播咯、公信力、影响力和引导力。

  • ?

    大数据平台快速解决方案

    Fronde

    展开

    内容来源:2017年5月13日,周末去哪儿架构师李锡铭在“Java开发者大会 | Java之美【上海站】”进行《大数据平台快速解决方案中》演讲分享。

    阅读字数:1891 | 4分钟阅读

    摘要

    大数据(big data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。周末去哪儿架构师李锡铭根据自己的成功经验,为我们分享大数据平台快速解决方案。

    大咖演讲视频

    http://t/R9an7Rr

    搭建始末

    当时我们确定要做大数据的时候,有两种选型。第一种选型是用用原生的、开源的大数据技术,需要自己搭建;第二种是ODPS。

    后来我们选择了利用原生大数据,自己搭建一个大数据平台。因为我们已经有了一定的小积累,并且也想做一个大数据方面的技术沉淀。

    在移动互联网时代,用户所有的行为、浏览、记录和收藏等所有的数据,我们都会把它拿下来分析,前段时间阶段性沉淀的东西有多少,是对之前的一个总结。这个数据还能帮助我们进行深度挖掘,之后如何对不同用户分类,做一个精准化的营销定位。

    每个公司都会对这些数据进行报表级的展现。我们最开始的数据实现方式是把所有用户的行为数据放到传统的关系型数据库中,利用纯Java应用程序去读这张表。当计算某个指标的时候,还会关联若干张子表。这张主表大概有几千万,其它子表也是百万级甚至千万级的。如果单纯用Java去算的话,还要额外处理多线程。

    所以我们用传统的Java纯程序+关系型数据库去处理报表的时候,在存储和计算的性能上会出现问题,以至于报表需求越来越慢。

    在这样的大背景下,我们改成了使用大数据去处理这种场景。

    技术概览

    Hadoop是现在所有大数据计算存储的一个底层概念,后面所有衍生的大数据产品都是在Hadoop的基础上进行衍生的。

    这张图是目前大数据平台的架构。

    原生的Hadoop应该包含了Hdfs(文件存储)、Yarn(资源调度)和Mapreduce(算法)。

    Spark是类似于Mapreduce的一个计算框架,它在很多场景中的性能会比原生的Mapreduce好很多,尤其是迭代计算的时候,会有好几个数量级的提升。

    Sqoop是一个数据的迁移工具。

    Hive是对底层Hdfs系统的文件抽象出一个类似Mysql的关系型数据库,但大前提是它是在Hadoop这个大的语义下的关系型数据库。

    Oozie是一个任务编排和调度的框架。

    Hue是大数据的管理后台。

    Zookeeper是分布式协调工具。

    1.组件分类

    基础数据:Mysql,File。基础数据层是游离于大数据之外的概念,它是传统的数据来源。

    大数据存储:Hdfs、Hive。大数据存储是最基础的文件存储,在这基础上抽象出一个大数据的关系型数据库。

    大数据计算:Mapreduce、Spark、Sqoop。Mapreduce是原生的,Spark是新生的,Sqoop是数据转移的工具。

    大数据协调与调度:Yarn、Zookeeper、Oozie。Yarn是原生的,Zookeeper是一个分布式保证文件原子性的工具,Oozie是调度工具。

    大数据展现:Hue。Curd的展现层。

    2.典型执行流程

    最开始说过,我们遇到的问题是,Mysql的表存不下,计算也有问题。在这个场景下要把数据,从Mysql转到大数据,并利用大数据进行计算,最后做一个展现。

    它的流程是,首先通过Sqoop把Mysql的数据一次性或是增量的同步到一张Hive表里,用Hive Sql写好查询后,本质上Hive Sql会转化成Mapreduce任务再去执行,最后数据就展现出来了。

    很多时候后台的服务Control层会有入口和出口,我们需要把入口和出口的参数都记下来,方便以后排错或做统计方面的应用。

    在应用程序里,把这些消息定时写到消息队列中,用Spark定时读消息队列,并把这些读取到的消息按Spark的方式做一个编程。这个任务最终会被丢到Hadoop的底层计算里,然后用Yarn去调度,计算出结果,把这个结果写入Hive,这就完成了一次流式计算。

    3.Hue

    这里写了一个Hive Sql,与传统Mysql的写法几乎一样。Hive Sql写好以后点执行。它的过程是把Sql首先交给Hive去跑,Hive用自己的Sql解析引擎把这个任务翻译成Mapreduce,Mapreduce再用Yarn跑在Hadoop上,最终把结果跑出来。

    4.存储:Hadoop hdfs

    HadoopHdfs是基础的存储层。

    HadoopHdfs其实只包含了两种类型,一个是Namenode,一个是Datanode。Namenode是一个管理的节点,而datanode只负责数据的存储和冗余。

    5.计算:Mapreduce&spark

    Hadoop原生的计算框架是Mapreduce,而spark是一个新兴的计算框架,它更快更全面。

    6.资源管理器:yarn、Apache、hadoop yarn

    资源管理器的架构内包含rescource manager和node manager。Rescource manager是管理节点,node manager是work节点。

    把任务丢给rescource manager,它去把任务分发给每个节点,做一些状态的变换,最后把结果通过rescource manager汇总以后,处理完毕交给客户端。

    7.hive

    hive的架构并不是很复杂,上层是一些用户的API、web页面和命令行。它的核心是执行引擎,把sql翻译成大数据平台可以接受的任务。底层基于存储,它可以存在hdfs上。

    8.sqoop

    主要用于在hadoop与传统的数据库间进行数据的传递。

    9.ooize

    大数据任务编排调度。

    学习与使用路线

    如果想要学习一些大数据相关的东西,我推荐可以先掌握一些基础,然后找一个场景套进技术里,进行快速实践。在快速实践的过程中会发现很多问题需要解决,很多知识需要补充,所以要在实践中前行,在错误中补充。

    我的分享到此结束,谢谢大家!

  • ?

    工业大数据平台实现

    张大民

    展开

    当下,互联网技术与可再生能源革命正在开启新一轮工业革命的大幕,人类已经站在新时代的门槛上。

    随着物联网(IOT)技术的飞速发展,对传统企业,能否抓住这一历史机遇,依靠技术进步,改善和产业素质与提高生产效率,对企业进行智能化、工业化相结合的改进升级,从传统的厂发展为高技术企业。借助互联网+物联网等技术, 坚持“创新驱动、质量为先、绿色发展、结构优化、人才为本”的基本方针,实现“中国制造2025”伟大目标。

    在工业领域中,以产品数据为核心,极大延展了传统工业数据范围,同时还包括工业大数据相关技术和应用。其主要来源可分为以下三类:第一类是生产经营相关业务数据。第二类是设备过程数据。第三类是外部数据。

    上述三种数据中,最难获取的是第二类数据,是产业升级中实现过程自动化、机械制造自动化、管理自动化的关键数据来源依据。

    工业大数据平台由后台服务器、WEB服务器、手机APP、数据库、后台监控软件、前端展示框架、现场采集控制主机、工业微电脑控制器、物联网模块、无线网关、4G传输设备、传感模块等组成。

    现场MQTT服务器

    英特隆工业级微电脑控制器

    无线网关集中器

    传感器模块

    GPRS数据传输

    数据化展示

    自组网IOT模块

    整机拓扑框图

大数据平台软件

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP