中企动力 > 商学院 > 大数据平台是什么意思
  • ?

    大数据十大平台集合

    寄云

    展开

    1数据星河大数据平台

    全球首款大数据产业链生态平台,大数据界的App store。

    实现数据模型、可视化引擎工具、应用场景、采集爬虫工具、清洗脱敏工具、数据分析平台、数据开发平台、数据管理平台、数据安全组件等大数据资产的分类展示、检索和使用。

    一站式服务,快速实现大数据应用设计,同时可在平台进行应用产品交易。

    2大数据可视化平台

    标准的、友好易用、具备丰富展示形式、与底层数据分析实现解耦。

    提供丰富的专业级可视化图表组件,在线进行图表配置、导出,提供使用指导。

    提供可视化产品工厂,以及Dashboard自定义布局。

    具备可视化编程能力,供用户快速开发可视化图表应用。

    3企信宝APP

    拥有约9000万海量企业信息数据。

    提供失信企业及失信人查询及公布失信榜单,全国各企业查询,股东高管数据挖掘,企业网站地址查询,企业风险信息监测。

    4农业大数据平台

    涵盖农业监测预警大数据平台、农产品全产业链追溯预警大数据平台和农业产业链企业信用大数据平台。

    覆盖农林牧副渔各行业,贯穿农业生产经营管理服务全过程。

    目标群体包括部级农业部门、地方农业部门、涉农企业、农业金融机构等。

    5金融大数据——54个九宫格小场景

    九宫格应用场景包含四大类别,分别是基础数据库类、决策类、预测类、预警类,基础数据库类场景满足客户对基本数据的查询,决策类场景助理用户根基数据分析得到的价值信息进行有效决策,预测类场景便于用户对于潜在的风险及时规避。同时,用户可以根据自身需求进行场景化自定义组合,以满足个性需求。

    6工商大数据平台

    包括工商大数据分析展示、企业信用信息大数据监管和市场主体全景谱图大数据分析服务。

    一网、一库、一中心、一平台、一门户,提升工商公共服务能力、市场监管能力、辅助决策能力和助推发展能力

    7食药监大数据平台

    对食品、药品、餐饮、中药材的生产、仓储、分销、物流运输、市场巡检及消费者等信息,以及产品名称、执行标准、配料、生产工艺、标签标识等数据,进行采集、跟踪、分析。

    使监管部分实现产品种养、生产、销售、流通、公众服务、物流等环节的整个生命周期的监管

    通过互联网等途径,实时呈现给消费者,实现食品药品全过程的全知晓。

    8旅游大数据平台

    显示最直观的客源、客流、经济收入数据、履约企业运营趋势、市场景气指数等指标。

    管理部门可以从宏观角度了解地区旅游产业的整体发展水平和竞争力,辅助管理者制定基于大数据的行业发展决策。

    所有数据来源于近五年累计数据(2011-2017),每周更新。

    9民意云大数据平台

    从海量的数据中分析民意诉求,精准分析民意热点——这是大数据在服务民意诉求中的重要作用。九次方民意云大数据平台,通过提供大数据操作台,方便用户实时全面了解区域内民意变化,根据推送消息进行应急反应。

    10传播力监测大数据

    根据全网采集的文章标题、作者、来源、时间等信息,计算文章的规范被转载量、非规范被转载量、以及文章的影响地域分析,并将各指标进行加权算法,帮助没提了解具体文章的全网传播详情。

    协助监管部门加强没提传播监管和提升媒体机构的传播咯、公信力、影响力和引导力。

  • ?

    做中国最好的大数据平台,新华三底气何来?

    Vivero

    展开

    近日,新华三集团在“H3C Navigate 2017”领航者峰会上发布了大数据系列产品数据引擎1.0,正式进军大数据行业,并提出“要做国内最好的大数据平台”的目标。

    自从2016年5月成立以来,新华三的战略布局始终聚焦一个“新”字。在计算、网络、存储为主的传统IT架构基础上,新华三提出了“三大一云”的新IT战略,要做融合了大数据、大安全、大互联和云计算在内的全方位一站式服务提供商。

    那么,作为其战略核心的大数据业务定位是什么?核心竞争力与战略规划又是什么?从趣味科技对新华三集团副总裁、大数据产品线总裁孙德和的采访当中,我们可以细细解读新华三大数据业务在战略、打法和产品上的独特之处。

    定位全行业的大数据服务平台

    目前国内做大数据业务的公司已达数千家,包括各类软件商、平台商、工具商,但是大部分还局限于互联网。针对行业客户的海量结构化、非结构化数据的专业服务,则为数不多。

    新华三大数据业务的定位非常清晰,就是做大数据平台和数据服务,服务范围是全行业。相比应用开发和硬件,做平台对企业技术实力要求很高,需要庞大的研发团队,需要对技术、研发的长期持续投入。“未来,做平台一定是有实力的公司才能参与竞争,而新华三有这个实力。”孙德和说道。

    在技术研发方面,新华三实力不容小觑。据了解。此次领航者峰会上发布的大数据产品,前期的研发周期已经运作了2-3年,并且已在多个行业收获了成功实践的案例。

    ISV策略:聚焦细分行业TOP3

    做平台,关键在于对行业客户及产品有充分的了解并满足其需求。开放平台的定位,决定了新华三的大数据业务与ISV(应用开发商)有着很强的互补关系。“新华三的平台就是把新IT的技术架构,包括云的架构,一直到大数据服务平台形成一个大的平台。将来的应用合作伙伴可以基于我们的平台,再基于客户的需求去开发应用。”孙德和介绍道。

    新华三的大数据战略是跟细分行业的领先应用开发商进行合作。TOP ISV显然更懂行业客户的业务逻辑,能够满足客户的需求。新华三负责利用大平台的规模化优势,做行业共性的数据服务。接下来,为客户定制专业化的应用就交给各个ISV合作伙伴。

    H3C Data Engine数据引擎1.0

    此次新华三发布的数据引擎1.0产品Data Engine,包括了基础计算平台、数据服务(智能化数据采集和处理)、创新应用开发平台以及数据视觉引擎等核心组件。其中,创新应用里涉及人工智能的部分功能,包括深度学习、机器学习等,旨在帮助应用开发商构建基于大数据、基于人工智能的应用。

    不久前,在全国信标委大数据标准工作组主持的全国首次大数据系统通用规范测试中,Data Engine以最短的耗时通过了全部71项测试用例,从几十家申请测试的大数据产品中脱颖而出。测试中,Data Engine展示了其支持单集群100节点、数据量超过1PB以及内外网隔离的大数据服务能力。

    据透露,新华三的大数据平台已经得到了政府、公安、教育、医疗等各行业客户的青睐并被广泛应用。

    在孙德和看来,丰富的产品线、覆盖最广的IT销售体系、广泛的行业客户群和优秀的产品平台,是新华三大数据业务的核心竞争力,也是做国内最好大数据平台的信心所在。

    遍布全国的新IT版图

    目前,新华三“三大一云”的IT版图已经初步完成,包括坐落在郑州的大数据公司,落在成都的云计算公司和合肥的大安全公司。郑州大数据中心以研发为主,预计规模将达到800-1000人,将为客户提供整合交付的数据服务。

    随着城市化的加速和大数据产业的发展,数据已经成为国家重要战略资源之一。在打造数字化城市、新型的智慧城市的进程中,新华三已经做好了准备,希望通过大数据平台构建城市数据引擎,融合高校、企业、政府的资源,共同围绕着城市的一些关键业务问题去开展课题研究。

    根据中国信息通信研究院的调研测算,2016年我国大数据核心产业的市场规模达到168亿元,增速达44.9%,预计2017-2018年还将维持40%左右的高速增长。

    在互联网、C端大数据和公有云蓬勃发展的同时,如何满足行业客户的大数据需求,是目前阶段大数据产业发展的重点。新华三瞄准行业大数据这个契机,以大平台的定位切入,为大数据产业上下游打造了一个开放共赢的数据生态。

  • ?

    大数据到底是什么,其统计功能,可以让你在平台方面前成为透明人

    Ding

    展开

    大数据到底是什么,其统计功能,可以让你在平台方面前成为透明人

    从阿里巴巴和各大互联网公司,开始提出所谓的大数据开始,大数据就在整个互联网圈子炸开了锅,那么什么是大数据呢?

    下面吐槽君就来简单粗暴的告诉大家吧!

    其实,大数据并没有大家想象中那么神秘,在互联网上,大数据非常普遍,只是大数据所计算的数据比较多而已,通俗的说,大数据就是一个统计表格。

    当你通过互联网上网的时候,平台方就会记录你的上网习惯,爱好,以及你的个人信息,然后就会通过数据分析给你贴上一个标签,那么最终就可以推算出你的个人喜好,个人爱好,个人消费水平,以及年龄,甚至连资产都可以通过各种各样的数据给你统计出来。

    然而这所谓的大数据,虽然现在很流行,但一旦社会的进度在持续发展之后,未来的人们或许就会有自我保护意识,因为长久这样的数据统计下去,你在互联网平台公司面前,就可能成为透明人,经过数据分析以及统计,系统就能知道你去过哪,干过什么,喜欢干什么等等等等。

    所以,大数据到底是好是坏,你们觉得呢?

    对于大数据你们有什么想吐槽的?下方评论区尽情吐槽!

    记住!有时候,吐槽!也是一种正能量!

  • ?

    你真的知道大数据是什么吗?那你知道它和Hadoop有什么关系吗?

    半芹

    展开

    随着近几年计算机技术和互联网的发展,“大数据”这个名词越来越多进入我们的视野。大数据的快速发展也在无时无刻影响着我们的生活。

    那大数据究竟是什么呢?

    首先,看看专家是怎么解释大数据的:

    大数据就是多,就是多。原来的设备存不下、算不动。 ——啪菠萝·毕加索

    大数据,不是随机样本,而是所有数据;不是精确性,而是混杂性;不是因果关系,而是相关关系。—— Schnberger

    顾名思义“大数据”,从字面意思来理解就是“大量的数据”。

    从技术的的角度来解释,大数据就是指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

    IBM提出大数据具有5V特点:Volume(大量)、Velocity(高速)、Variety(多样)、Value(低价值密度)、Veracity(真实性)。

    大家可以关注我的【公众号】孙国宇,回复“百家”。获取今年最新Hadoop大数据教程(包括0基础入门、Hadoop生态系统、真实商业项目实战3大部分)已帮助300+人转型Hadoop开发,90%起薪超过20K,工资比之前翻了一倍。

    我们所谈论的大数据实际上更多是从应用的层面,比如某公司搜集、整理了大量的用户行为信息,然后通过数据分析手段对这些信息进行分析从而得出对公司有利用价值的结果。

    比如:头条的推荐机制,就是建立在对海量用户的阅读信息的搜集、分析之上。这就是大数据在现实中具体体现。

    那Hadoop又是什么?它和大数据又有什么联系呢?

    Hadoop是一个对海量数据进行处理的分布式系统架构,可以理解为Hadoop就是一个对大量的数据进行分析的工具,和其他组件搭配使用,来完成对大量数据的收集、存储和计算。

    Hadoop框架最核心的设计就是:HDFS 和 MapReduce。

    HDFS为海量的数据提供了存储

    MapReduce为海量的数据提供了计算

    一套完整的Hadoop大数据生态系统基本包含这些组件。

    HDFS:Hadoop分布式文件系统,专门存储超大数据文件,为整个Hadoop生态圈提供了基础的存储服务。

    MapReduce:分布式离线计算框架,用来处理大量的已经存储在本地的离线数据。

    Storm:分布式实时计算,主要特点是实时性,用来处理实时产生的数据。

    ZooKeeper:用于Hadoop的分布式协调服务。Hadoop的许多组件依赖于Zookeeper,它运行在计算机集群上面,用于管理Hadoop操作。

    HBase:是一个建立在HDFS之上,面向列的NoSQL数据库,用于快速读/写大量数据。

    Hive:基于Hadoop的一个数据仓库工具,可以将结构化的数据文件映射为一张数据库表。

    Sqoop:是一个连接工具,用于在关系数据库、数据仓库和Hadoop之间转移数据。

    Pig:它是MapReduce编程的复杂性的抽象。Pig平台包括运行环境和用于分析Hadoop数据集的脚本语言(Pig Latin)。

  • ?

    基于大数据平台的数据分析

    万悲

    展开

    标签 | 大数据 架构

    作者 | 张逸

    无论是采集数据,还是存储数据,都不是大数据平台的最终目标。失去数据处理环节,即使珍贵如金矿一般的数据也不过是一堆废铁而已。数据处理是大数据产业的核心路径,然后再加上最后一公里的数据可视化,整个链条就算彻底走通了。

    数据处理的分类

    如下图所示,我们可以从业务、技术与编程模型三个不同的视角对数据处理进行归类:

    业务角度的分类与具体的业务场景有关,但最终会制约技术的选型,尤其是数据存储的选型。例如,针对查询检索中的全文本搜索,ElasticSearch会是最佳的选择,而针对统计分析,则因为统计分析涉及到的运算,可能都是针对一列数据,例如针对销量进行求和运算,就是针对销量这一整列的数据,此时,选择列式存储结构可能更加适宜。

    在技术角度的分类中,严格地讲,SQL方式并不能分为单独的一类,它其实可以看做是对API的封装,通过SQL这种DSL来包装具体的处理技术,从而降低数据处理脚本的迁移成本。毕竟,多数企业内部的数据处理系统,在进入大数据时代之前,大多以SQL形式来访问存储的数据。大体上,SQL是针对MapReduce的包装,例如Hive、Impala或者Spark SQL。

    Streaming流处理可以实时地接收由上游源源不断传来的数据,然后以某个细小的时间窗口为单位对这个过程中的数据进行处理。消费的上游数据可以是通过网络传递过来的字节流、从HDFS读取的数据流,又或者是消息队列传来的消息流。通常,它对应的就是编程模型中的实时编程模型。

    机器学习与深度学习都属于深度分析的范畴。随着Google的AlphaGo以及TensorFlow框架的开源,深度学习变成了一门显学。我了解不多,这里就不露怯了。

    机器学习与常见的数据分析稍有不同,通常需要多个阶段经历多次迭代才能得到满意的结果。下图是深度分析的架构图:

    针对存储的数据,需要采集数据样本并进行特征提取,然后对样本数据进行训练,并得到数据模型。倘若该模型经过测试是满足需求的,则可以运用到数据分析场景中,否则需要调整算法与模型,再进行下一次的迭代。

    编程模型中的离线编程模型以Hadoop的MapReduce为代表,内存编程模型则以Spark为代表,实时编程模型则主要指的是流处理,当然也可能采用Lambda架构,在Batch Layer(即离线编程模型)与Speed Layer(实时编程模型)之间建立Serving Layer,利用空闲时间与空闲资源,又或者在写入数据的同时,对离线编程模型要处理的大数据进行预先计算(聚合),从而形成一种融合的视图存储在数据库中(如HBase),以便于快速查询或计算。

    场景驱动数据处理

    不同的业务场景(业务场景可能出现混合)需要的数据处理技术不尽相同,因而在一个大数据系统下可能需要多种技术(编程模型)的混合。

    场景1:某厂商的舆情分析

    某厂商在实施舆情分析时,根据基于需求,与数据处理有关的部分就包括:语义分析、全文本搜索与统计分析。通过网络爬虫抓取过来的数据会写入到Kafka,而消费端则通过Spark Streaming对数据进行去重去噪,之后交给SAS的ECC服务器进行文本的语义分析。分析后的数据会同时写入到HDFS(Parquet格式的文本)和ElasticSearch。同时,为了避免因为去重去噪算法的误差而导致部分有用数据被“误杀”,在MongoDB中还保存了一份全量数据。如下图所示:

    场景2:Airbnb的大数据平台

    Airbnb的大数据平台也根据业务场景提供了多种处理方式,整个平台的架构如下图所示:

    Panoramix(现更名为Caravel)为Airbnb提供数据探查功能,并对结果进行可视化,Airpal则是基于Web的查询执行工具,它们的底层都是通过Presto对HDFS执行数据查询。Spark集群则为Airbnb的工程师与数据科学家提供机器学习与流处理的平台。

    大数据平台的整体结构

    行文至此,整个大数据平台系列的讲解就快结束了。最后,我结合数据源、数据采集、数据存储与数据处理这四个环节给出了一个整体结构图,如下图所示:

    这幅图以查询检索场景、OLAP场景、统计分析场景与深度分析场景作为核心的四个场景,并以不同颜色标识不同的编程模型。从左到右,经历数据源、数据采集、数据存储和数据处理四个相对完整的阶段,可供大数据平台的整体参考。

  • ?

    自测一下,你对大数据平台架构还有多少知识是不知道的

    水之

    展开

    马总说过这是一个DT的时代,一个从IT到DT转变的时代。确实这几年到处都能听到诸如“云计算”、“大数据”、“上云”的谈论,确实随着云计算的兴起,依托于相对低成本、高稳定性的云设施构建平台的成本越来越低,越来越多的公司都在推数据相关的平台、产品。如阿里、京东、百度、腾讯,以及一些打着大数据旗号的创业公司都有出自己的数据平台和产品,用户依托于平台确实大大降低了数据处理、使用的难度,降低了从数据挖掘价值的时间成本。于此同时,平台架构的变迁也成为备受关注的问题。今天我们就来看看有哪些大数据的平台架构你不知道。

    489034603

    一、首先是数据方面(大数据时代以数据为主导):如何进行模型分层?一般模型分层计算程序,以哪种语言为主?

    从数据仓库 或 大数据平台 的角度来讲,数据的分层,大体有两种思路:

    a) 基础数据层:主要避免后续数据应用层的大变更。一般面向各业务系统或数据源集,利用业界较为先进的数据模型(如FS-LDM),按数据的特性(即数据驱动)进行数据的整合,以形成相对稳定的基础数据模型层。

    b) 应用数据层:一般是面向各应用需求 或 业务用户,利用业界较为合理的数据模型理念(如星型\维度模型),按需求的要求(即需求驱动)进行数据的分布,以形成统计方便、展示友好、满足需求的应用数据模型层。

    在数据流向 或 数据处理的过程中,所使用到的语言或方式可能更多的是以下两大类:

    a) 基于传统数据库:大多采用ETL的方式,进行数据的抽取、清洗、整合;这中间,可能会利用到类似DataStage,Kettle等工具,用得最多的,可能就是各数据库提供的SQL语言了,SQL语言使用简单、方便、学习门槛较低,且易于掌握。

    b) 基于大数据平台:大多采用的开源的工具 或 语言,如Hive, Hbase , Spark,Python等。这里面,可能使用更多的是Hive 与 Python, 这两个工具学习简单,易于掌握,并且,进行数据处理时,也更直观、方便。

    二、架构方面:在架构过程中,一般以7点展开,如:

    a. 存储和计算都基于HIVE;

    b. GREENPLUM作为HIVE的“cache”存在,供用户做一些小数据的快查询,报表存储;

    c. 调度:和canaan框架进行整合,支持用户快速新增任务,并自动导入任务依赖;

    d. 主数据:保存了数据仓库元数据信息,供用户查询和系统内部各个模块交互;

    e. ACL:构建了数据仓库数据访问权限控制,包括用户权限申请、审批者审批、数据赋权等;

    f. 传输;

    g.监控:由于任务数量增长较快(2000+),运维已经是个问题此外,需花了较大精力做了可视化的工作:

    有些朋友不认为Hive是一个数据库,认为Hive是一个类似传统数据库的SQL引擎的工具,虽然Hive有自带的元数据存储库,但这个库里面,也只是存放了Hive工具为完成用户提交的请求而必须要的Hadoop的元数据信息 及两者的映射关系数据;并没有存放用户的任何数据,用户的数据还是存放在Hadoop或Hbase等文件系统或数据库中。

    在以上这7点中,最难的就是:数据治理 与 系统监控 这两块

    三、数据应用:数据一般以哪种形式,呈现给用户?技术上是通过哪些策略实现?

    数据应用主要分成两大类:

    a) 面向业务人员:一般是自行研发一个界面美观的WEB应用,调用业界成熟的工具(如MSTR,COGNOS)的API,实现数据展示给终端用户进行查看。

    b) 面向IT专业人员:一般是直接从数据库/文件系统中,借助SQL或其它的开源工具,直接查询、统计、分析、挖掘;这样会更直接、更方便。

    以上这些可供大家测试一下,有哪些知识是自己还不熟练的,可以再学习,个人观点不喜勿喷,谢谢大家。

    另外,如果小伙伴想学习大数据技术,可以加下图片下面的交流群,群里有很多学习视频都可以下载,而且每天大数据架构师马士兵老师都会在群里分享大数据的技术。。

  • ?

    什么是大数据挖掘平台

    陆安卉

    展开

    当今社会已经步入大数据时代,数据挖掘已经成为各应用领域的重要技术,高校数据挖掘课程的开设也应运而生,数据挖掘课程综合了多门学科知识,该课程既包括各种理论知识,又离不开相关的实践技术,整个教学过程是培养和提高学生的创新能力及综合解决问题的能力。以往的教学过程理论性强,枯燥乏味,学生学习热情普遍不高,不利于学生专业能力的培养。

    数据挖掘建模平台(TipDM-TB)是面向高校数据挖掘课程教学的数据挖掘建模工具。平台使用JAVA语言开发,采用B/S结构,用户不需要下载客户端,可通过浏览器进行访问。用户可在没有编程基础的情况下,通过拖拽的方式进行操作,将数据输入输出、数据预处理、挖掘建模、模型评估等环节通过流程化的方式进行连接,已达到数据分析挖掘的目的。

    平台以实际挖掘案例为切入点,对老师而言,老师在使用平台进行教学时不仅可以讲授数据挖掘基本流程、主要挖掘算法的基本原理,还可以使用平台的示例模板讲解一个算法的应用场景或者是一个完整案例的挖掘步骤,并查看各步骤源代码;老师还可以上传自定义算法,与平台算法进行对比。对学生而言,平台大大降低了学习数据挖掘的门槛,让学生对数据挖掘有了更感性的认识,激发学生的学习兴趣。

  • ?

    什么是大数据,大数据的定义又是什么?

    思山

    展开

    大数据,

    又称巨量资料,指的是所涉及的数据资料量规模巨大到无法通过人脑甚至主流软件工具,在合理时间内达到撷取、管理、处理、并整理成为帮助企业经营决策更积极目的的资讯。

    简而言之,大数据就是数据量非常大、数据种类繁多、无法用常规归类方法应用计算的数据集成。大数据的收集、开发和利用,已经成为了当今社会的潮流之一,人们都认为,对于大数据的分析应用,对于政府和企业的决策是非常积极的,影响也是非常深远的。

    大数据的采集、发掘与处理

    大数据的采集与发掘与云计算是离不开的,与庞大的服务器空间也是分不开的。而现在的倾向就是租用云计算平台进行大数据的整理运用,简单快捷,还不占地方。

    大数据的应用

    一切皆可以大数据。

    将人们所收集的各种数据分类汇总,最终通过高精尖的平台运算,分析其中的规律所在,就是大数据的应用。如果数据收集得当,任何行业、任何事情都可以运用大数据寻找规律,最终做出最优的小抉择。无论从公司营销、政府决策、高速公路运营、农场管理、来年预算等等,大大小小的事情都可以应用大数据,并且从中获利。

    大数据的前景

    大数据的前景并不仅仅是某一个行业的前景,一句话以盖之——大数据时代已经来临,并将从根本影响人类的生活。

  • ?

    怎样搭建一个大数据分析平台?内附资料福利

    管寒蕾

    展开

    一般的大数据平台从平台搭建到数据分析大概包括以下几个步骤:

    1、Linux系统安装

    一般使用开源版的Redhat系统--CentOS作为底层平台。为了提供稳定的硬件基础,在给硬盘做RAID和挂载数据存储节点的时,需要按情况配置。比如,可以选择给HDFS的namenode做RAID2以提高其稳定性,将数据存储与操作系统分别放置在不同硬盘上,以确保操作系统的正常运行。

    2、分布式计算平台/组件安装

    当前分布式系统的大多使用的是Hadoop系列开源系统。Hadoop的核心是HDFS,一个分布式的文件系统。在其基础上常用的组件有Yarn、Zookeeper、Hive、Hbase、Sqoop、Impala、ElasticSearch、Spark等。

    使用开源组件的优点:1)使用者众多,很多bug可以在网上找的答案(这往往是开发中最耗时的地方);2)开源组件一般免费,学习和维护相对方便;3)开源组件一般会持续更新;4)因为代码开源,如果出现bug可自由对源码作修改维护。

    常用的分布式数据数据仓库有Hive、Hbase。Hive可以用SQL查询,Hbase可以快速读取行。外部数据库导入导出需要用到Sqoop。Sqoop将数据从Oracle、MySQL等传统数据库导入Hive或Hbase。Zookeeper是提供数据同步服务, Impala是对hive的一个补充,可以实现高效的SQL查询

    3、数据导入

    前面提到,数据导入的工具是Sqoop。它可以将数据从文件或者传统数据库导入到分布式平台。

    4、数据分析

    数据分析一般包括两个阶段:数据预处理和数据建模分析。

    数据预处理是为后面的建模分析做准备,主要工作时从海量数据中提取可用特征,建立大宽表。这个过程可能会用到Hive SQL,Spark QL和Impala。

    数据建模分析是针对预处理提取的特征/数据建模,得到想要的结果。如前面所提到的,这一块最好用的是Spark。常用的机器学习算法,如朴素贝叶斯、逻辑回归、决策树、神经网络、TFIDF、协同过滤等,都已经在ML lib里面,调用比较方便。

    5、结果可视化及输出API

    可视化一般式对结果或部分原始数据做展示。一般有两种情况,行数据展示,和列查找展示。

    以上就简单介绍这么多,如果有小伙伴想了解和学习更多的大数据技术,可以私信小编索要资料

  • ?

    什么是大数据和大数据平台?

    Irina

    展开

    “大数据”时下一个热门的词语,近几年来,关于大数据的著作和文章铺天盖地,似乎也在共同在传递一个信息:越来越多的行业、人士开始关注并实际探索大数据的应用,我们正在一起描绘着大数据巨大效用的蓝图,但在实践的路上,我们都孩子起步阶段小步前行。

    大数据根基于互联网,数据仓库、数据挖掘、云计算等互联网技术的发展为大数据应用奠定基础。对于任何一个大数据的从业者或初接触者,或者都会有个共同的感触:大数据很有用!但大数据是什么呢?

    今天就给大家讲解一下:

    对于大数据的定义,我们来引用3个比较差用的大数据定义:

    1)Gartner:需要信息处理模式才能具有更强的决策力,洞察发现力和流程优化能力的海量、高增长率很多样化的信息资产。

    2)IDC:海量的数据规模(Volunme)、快速的数据流转和数据体系(Velocity)、多样的数据类型(Variety)、巨大的数据价值(Value)。

    3)Wiki:或称巨量数据、海量数据、大资料,指所涉及的数据量规模巨大到无法通过人工,在合理时间内达到截取、管理、处理、并整理成为人类所能解读的信息。

    其他关于大数据的定义也大抵类型,我们可以用几个关键词对大数据做一个界定。

    首先,“大规模”,这种规模可以从两个维度来衡量,一是时间序列累积大量的数据,二是在深度上更加细化的数据。

    其次,“多样化”,可以是不同的数据格式,如文字、图片、视频等,可以是不同的数据类别,如入口数据,经济数据等,还可以有不同的数据来源,如互联网、传感器等。

    最后,“动态化”,数据是不停变化的,可以随着时间快速增加大量数据,也可以是在空间上不断移动变化的数据。

    这三 个关键词对大数据从形象上做了界定。

    但是还需要一个关键能力,就是“处理速度快”。如果这么大规模、多样化又动态变化的数据有了,但需要很长的时间去处理分析,那不叫大数据。从另一个角度,要实现这些数据快速处理,靠人工肯定是没办法实现的,因此,需要借助于机器实现。

    最终,我们借助机器,通过对这些数据进行快速的处理分析,获取想要的信息或者应用的整套体系,才能称为大数据。

    我们可以用下面的图示给大数据定义:

    这下,就知道什么是大数据了吧

大数据平台是什么意思

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP