中企动力 > 商学院 > 大数据云数据教程
  • ?

    云计算好学么?大数据云计算学习路线

    贲幼翠

    展开

    云计算好学么?其实,小马过河的故事大家都读过,这云计算好不好学,还得看自身。有人说了,你这不是废话么?还真不是。其实我们不妨看看云计算到底是个什么东西。如今,云计算频繁出现在我们的视野,他是一种经由网络统一组织和灵活应用各种信息,通信,技术资源,来实现大规模计算的信息处理方式。

    云是网络、互联网的一种比喻说法。过去在往往用云来表示电信网,后来也用来表示互联网和底层基础设施的抽象。狭义云计算指IT基础设施的交付和使用模式,指经由网络以按需、易扩展的方式获得所需资源;广义云计算指服务的交付和使用模式,指经由网络以按需、易扩展的方式获得所需服务。这种服务可以是IT和软件、互联网相关,也可是其他服务。它意味着计算能力也可作为一种商品经由互联网进行流通。

    经由使计算分布在大量的分布式计算机上,而非本地计算机或远程服务器中,企业数据中心的运行将与互联网更相似。这使得企业能够将资源切换到需要的应用上,根据需求访问计算机和存储系统。好比是从古老的单台发电机模式转向了电厂集中供电的模式。它意味着计算能力也可以作为一种商品进行流通,就像煤气、水电一样,取用方便,费用低廉。不同在于,它是经由互联网进行传输的。辨析云计算常与网格计算、效用计算、自主计算相混淆。

    还是没有明白?没关系,打个比方,如果我们想在办公室或者公司的网站上运行一些企业应用,传统的方式是去租用一些服务器,存储设备,在上面部署操作系统,最后在上面部署应用,这种方式就是好像吃烧烤的时候,自己准备烤炉,木炭,酱料串好食材,动手烧烤,这样比较费力。

    实际上,我们在吃烧烤时,一般经由以下途径,第一种方法是串好串串去野营地租用烧烤炉子自己烤,这就像IAAS服务一样,直接使用商家提供的基础设施。第二种方法是到自助烧烤店里面,商家为你准备好烤炉和烤串,只需要你动手自己烤,这就好像PAAS服务一样,利用商家的平台。第三种方法是坐在餐馆点菜,这就好像SAAS服务一样,直接使用云服务商提供全套服务。这就是常见的云计算模式。

  • ?

    腾讯云大数据实战案例

    小花

    展开

    内容来源:2017年5月20日,腾讯高级软件工程师吴友强在“中生代技术沙龙系列之互联网大数据”进行《腾讯云大数据实战》演讲分享。IT 大咖说(id:itdakashuo)作为独家视频合作方,经主办方和讲者审阅授权发布。

    阅读字数:1954 | 3分钟阅读

    嘉宾演讲视频回顾及PPT:http://t/R1rnCxI

    摘要

    腾讯云是腾讯公司倾力打造的面向广大企业和个人的公有云平台。腾讯高级软件工程师吴友强将为我们分享大数据在腾讯云的实践。

    一、TDF(数据工坊)简介

    TDF简介

    源于腾讯云数智大数据套件的轻量云上大数据产品,提供基于SQL的大数据计算框架。

    适用于需要动态灵活获取大数据计算能力进行批量计算、日志处理或数据仓库应用的场景。

    因为公有云上的用户需要简单,所以要有一个可视化的集成开发环境,在这环境中可以进行数据血缘管理、工程/工作流管理、用户管理和告警/日志。通过一些工具把数据导入到数据存储里面,然后对数据进行处理,最终输出数据。下层的任务和资源调度是用来调度用户的任务在各个资源上运行起来。底层就是腾讯云的基础设施。

    二、CDP(数据管道)实现详解

    CDP整体架构-设计

    上图是我们刚开始在开发之前做的设计。最左边有很多客户的数据点,比如log、DB Binlog、自建的Kafka以及自定义数据。我们会利用一些工具开发一个Flume插件,帮助它把数据上云。

    数据到达中间部分,对数据进行校验和处理。处理完成后根据用户的需求通过插件的方式实时导入到TDF、COS或者其它存储里面。

    CDP整体架构-目前

    上图是目前我们已经实施的工作。我们自己开发了一个Flume插件,把数据实时发送到腾讯公有云的数据接收器endpoint上。数据接收器会根据用户的选择来决定用Kafka还是CKafka。CKafka也是腾讯云内部自行研发的一套兼容转换协议的消息系统,基于C++开发,性能方面会比原生的提升很多。把数据导入到Nifi里进行二次开发,最终导到Hive中。

    Flume简介

    FlumeNG是一个分布式、可靠、可用的系统。它能够将不同数据源的海量日志进行高效收集、聚合、移动,最后存储到一个中心化数据存储系统中。由原来的Flume OG到现在的Flume NG,进行了架构重构,并且现在NG版本完全不兼容原来的OG版本。经过架构重构后,Flume NG更像是一个轻量级的小工具,非常简单,容易适应各种方式日志收集,并支持failover和负载均衡。

    Flume的架构主要有一下几个核心概念:

    Event:一个数据单元,带有一个可选的消息头。

    Flow:Event从源点到达目的点的迁移的抽象。

    Client:操作位于源点处的Event,将其发送到Flume Agent。

    Agent:一个独立的Flume进程,包含组件Source、Channel、Sink。

    Source:用来消费传递到该组件的Event。

    Channel:中转Event的一个临时存储,保存有Source组件传递过来的Event。

    Sink:从Channel中读取并移除Event,将Event传递到Flow Pipeline中的下一个Agent(如果有的话)。

    Flume插件

    Flume支持插件开发,最简单的方法就是直接拷贝已有插件进行改造。

    我们提供的endpoint需要权限验证,主要是基于腾讯云的一些帐号,通过这个方式可以实时地在客户端进行加密或格式化的存储。

    首先我们是多用户的系统,其次要防止用户数据量过大。通过数据大小限制能够满足90%以上的用户需求,而对于数据大小的限制是根据自身配置来决定的。

    在传输过程中我们采用了一些自定义的协议,这个协议基于avro进行格式化,主要是便于对数据进行序列化和反序列化。

    Kafka客户端改造支持CKafka

    CKafka(Cloud Kafka)是一个分布式的、高吞吐量、高可扩展性的消息系统,100%兼容开源 Kafka API(0.9版本)。Ckafka 基于发布/订阅模式,通过消息解耦,使生产者和消费者异步交互,无需彼此等待。Ckafka 具有数据压缩、同时支持离线和实时数据处理等优点,适用于日志压缩收集、监控数据聚合等场景。

    CKafka主要开放给公有云上的部分VIP用户使用,VIP只能绑定对应的虚拟机,这样保证了它的安全性。但我们是直接使用内网IP访问的,所以我们需要调整客户端的交互协议,通过某种手段把VIP替换成真实的IP,以保证数据的通畅。还有自定义的管理API和封装Java SDK。

    NiFi

    ApacheNiFi 是一个易于使用、功能强大而且可靠的数据处理和分发系统。Apache NiFi 是为数据流设计。它支持强大且可高度配置的基于有向图的数据路由、转换和系统中介逻辑,支持从多种数据源动态拉取数据。Apache NiFi原来是NSA的一个项目,现在开源出来,由Apache基金会进行管理。

    主要特性:

    基于web的用户界面:无缝体验设计、控制和监控。

    高度可配置:数据丢失容错和保证交付;低延迟和高吞吐量;动态优先级;流可以在运行时修改;背压(Back presure)。

    数据来源:从始至终跟踪数据流。

    为扩展设计:构建自己数据处理器;支持快速开发和有效的测试。

    安全:支持SSL、SSH、HTTPS加密内容等等;多租户授权和内部授权/策略管理。

    Hive插件

    获取元数据:获取Hive表结构信息,是否支持Streaming API写入。

    数据写入:insert插入,支持多分区批量插入;支持streaming;可以直接写hdfs。

    CDP未来?

    1、支持etl功能,对前端进行分组和做一些实时的计算。

    2、支持实时的计算和分析。用户需要可以直接拿到结构去在前端进行展示,而不是再到其它系统上去做计算和分析。

    3、支持实时SQL。实时计算对部分用户来说使用成本可能会更高,大部分做数据统计的人员对SQL的掌握度会更高。实时SQL是对数据进行SQL的查询计算。

    4、可视化图像操作界面。用户的需求越来越多样化,腾讯云上的很多产品都需要用到数据来做,我们希望以这种方式让用户可以自己选择数据源

    我今天的分享就到这里,感谢聆听!

  • ?

    大数据培训学习之云计算大数据分析该怎么学?

    霍曼安

    展开

    当下的互联网领域,云计算、大数据、人工智能成为最热词汇。互联网da咖阿里云“为了无法估算的价值”将中国的计算触角伸向海外,百度首次向外界展示“百度大脑”的科技成果。移动互联网利用人口红利带来的增长已经逐渐见顶,互联网正在进入“下一幕”智能时代,科多大数据带大家来看看,云计算、大数据、人工智能将怎么使全社会迎来变革性的发展。

    无论是计算机行业,还是汽车领域,技术形态的成熟是一个必然的要素。如果某个所谓的时代在技术上、硬件上没有达到产业的要求,数据库和平台都是非完整和非稳定的,时代的产业基础也就十分薄弱。从产业的政策角度分析,当技术累积到一定层次,产业政策的出台是必然的。为了激活云计算的发展,国务院在2015年就出台了《关于促进云计算创新发展培育信息产业新业态的意见》、《云计算白皮书2016》等,这些政策的出现并非偶然,在其背后有很多云计算服务商多年默默的技术耕耘。

    技术和政策的形态达到一定的地步,真正的产业化和市场化是否也已经达到?

    等待入局者必须考虑几个重要因素:

    一、目的是什么(为了降低成本、提高效率,还是在渠道上更接近用户);

    二、企业是否愿意使用(产品同质化严重,如何体现差异化);

    三、是否有助于提高社会福利(消费者福利、管理效率)。

    如果这些问题得到肯定的答案,云计算与时代的发展需求相契合,真正的时代大门就会开启。

    大数据本身除了要有数据、采集、汇聚一定量的数据之外,更重要的是数据的处理、挖掘、分析、可视化、应用这样一整套的过程。

    关于大数据的话题,基本围绕三个问题展开:

    一是数据从哪里来;

    二是数据如何进行分析;

    三是数据如何进行商品化。

    任何大数据都是以应用为主的,在未来,通过多维度、多复合的大数据的精准挖掘,最终提供出优质的商务解决方案才是最关键的。

    数据的三个来源分别是政府、企业行业和个人消费。

    政府数据做了授权,但由于法律和其他方面的不健全,政府数据被滥用。消费者数据来源于电信、金融或类似BAT大企业,流量入口处的数据将被自动抓取,数据提供商可以提供所有维度的数据,但每一个都是局部。数据优化商在大数据产业链里要想长久发展,必须精通大数据的模型、算法以及数据特征,同时对行业及生态要有明显的敏感性。而算法提供商如果仅仅依赖单纯算法,未来将成为成长软肋。应用提供商最贴近客户、最熟悉客户需求,同时做的是最后的数据整合,在产业链上可能发展空间更大。

    中国具有高达7.22亿的大规模网民群体,目前国内仅有3万个机柜,对比美国的3亿群体2.4万个机柜可以看出,中国的数据市场规模还远未达到平衡点,未来将保持高速增长的态势。另一个方面,由于企业客户运营模式的改革,企业的云化增加了对大数据及专业数据中心的需求。

    未来云计算产业和大数据产业将呈现规模化发展趋势,市场红利可观,创新、服务、合作、技术将推动互联网科技企业走得更高、更远。大数据时代已经到来,想要快速掌握这门高薪前景的技术该如何学习呢?

    Linux基础和分布式集群技术

    学完此阶段可掌握的核心能力:熟练使用Linux,熟练安装Linux上的软件,了解熟悉负载均衡、高可靠等集群相关概念,搭建互联网高并发、高可靠的服务架构;学完此阶段可解决的现实问题:搭建负载均衡、高可靠的服务器集群,可以增大网站的并发访问量,保证服务不间断地对外服务;学完此阶段可拥有的市场价值:具备初级程序员必要具备的Linux服务器运维能力。

    学习大数据处理需要的语言:

    javaMR语言这种语言产生很早了,大家也或多或少的接触过,但是在大数据中使用已经有的原型进行构建庞大系统,是一种基本的选择。

    Scala语言以java为基础的语言,和java很像,对任何想要进行大规模的机械学习或是建立高阶的算法,Scala是逐渐兴起的工具,善于呈现且拥有建立可靠系统的能力。

    Hadoop在以java为基础的大数据处理当中,Hadoop为作一批数据处理,发展以java为基础的架构关键。相对于其他处理工具而言,Hadoop慢许多,但是无比的准确可被后端数据库分析广泛使用。

    Kafka andStorm它是一个特别快速的查询信息系统,但是因为太快了在实施操作时会犯错,有时候会漏掉东西。

    Pythom语言Python拥有R语言处理复杂数据的能力及更务实的语言特质,更简单和直观,在近几年的成长很快。在数据处理范畴内,通常在规模与复杂之间要有个选择,Python无疑当选。

    学习一门课程,掌握好的学习方法至关重要,大数据云计算发展趋势非常好,现在学习好这门技术,未来的就业和选择会更多。

  • ?

    大数据云计算学习路线图

    萝卜

    展开

    【ps:以下纯属个人观点和看法,有什么不对的,还请多多指教。】

    1:之前发过一个Java攻城狮的学习路线图【ps:挺详细的~~~】:http://cnblogs/biehongli/p/5754555.html

    恰恰是这个Java攻城狮学习路线图使我在学习编程的路上看到了希望,使迷茫的我找到了方向。现在还为此在努力......

    2:而今天呢,结合一些培训机构的学习路线图,今天发一个大数据云计算的学习路线图,也许有的人心中会有些疑问说这货是骗浏览量,点击量的吧,可是原因不是这样的哦!【ps:有的人会想,之前发了Java学习路线,今天又发大数据云计算学习路线,这货瞎搞什么,下面我说说一些原由】。

    2.1:第一呢,首先声明呢,楼主现在依旧是在校生,今天之所以发这个学习路线图,算是给自己制定一个技术职业生涯规划吧。

    2.2:第二呢,因为lz的专业是云计算,昨天老师给我们讲hadoop集群的搭建,lz竟然搭建起来了,当然班里不学习的不算了,学习的搭建起来的也不多,虽然是一个很简单的hadoop集群搭建吧。为什么说这个,还要从lz发的Java攻城狮学习路线图说起,发这个图大概一年了吧,lz虽然专业是云计算,但是由于大学老师讲的也很浅,加上电脑硬件和需要服务器等等一些原由,lz没有学习云计算开发,而lz一直学习的是Java开发【自我感觉学的还不错,虽然还没找到工作吧,因为校招还没开始呢。】,但是今天怎么会花一上午的时间搞了这个很low的学习路线图呢。

    2.3:第三呢,紧接上面,为了搞这个真low的学习路线图,因为lz踏踏实实学习java这一年【ps:之前学的乱七八糟的】内心有些小感慨吧,现在IT这个行业,形形色色,各种培训机构如雨后春笋,但凡有点经验的,都想办培训机构,我这里不是反对培训机构哈,因为培训机构太多了,这里就不说培训机构的好坏的,有的是真心实意做教育的,有的是出来搂钱的,被培训出来没找到工作还被银行追着要贷款的也是屡见不鲜,我想中国的培训结构一个一个查都查不过来,因为培训机构说实话挺挣钱的,跑题了,说正题,培训机构真么多,他们培训机构也想活下去,是不是,就想到各种办法招人,这样一来就很容易达到供满于求的状况了,lz仔细想想,这年头学Java的真是TNN多啊,像Java,php,HTML5,python,ui,甚至有的培训大数据,云计算,真的是太多太多了,甚至外行转行来学习编程,而又仔细想想,学的最多的也就是这种大家都能学的,但是现在都说是大数据云计算时代,真正学精通的还真不多,lz也是我们学校第一届招收的云计算专业,虽然lz当了小白鼠,但是lz不后悔啊!虽然当初选专业的时候胡选的,也算是瞎猫碰到死耗子啊,lz觉得值就行~.~。

    2.4:所以呢,lz现在虽然还在学Java开发,但是lz心里有念头在上班挣钱之后买性能高本本学习大学没有学习的这些知识啊,【ps:我们的机房i7处理器,8G内存都被学生搞的卡了。学习云计算大数据真的需要投入啊,而且我们都是搭建在学校的服务器上的,课下基本没法好好学习啊,当然在lz眼里也挺复杂的,都是命令,但是很装逼啊,都是命令行,啪啪啪的敲起来】,所以先发个图震震惊,就像之前发的Java学习,lz没事还翻翻看看那些没学呢。总之吧,lz个人觉得有个学习路线真的蛮重要的,有目标有规划,并为此努力,想想都刺激。

    路是自己选的,就算再难也要走下去。夸张点说:路是自己选的,就算跪着也要走下去;

  • ?

    大数据教程之大数据处理流程

    横颜

    展开

    随着互联网的发展,大数据也在逐渐彰显出自己的优势特点,那么关于大数据的处理流程,你是否了解?

    第一,数据采集

    定义:利用多种轻型数据库来接收发自客户端的数据,并且用户可以通过这些数据库来进行简单的查询和处理工作。

    特点和挑战:并发系数高。

    使用的产品:MySQL,Oracle,HBase,Redis和 MongoDB等,并且这些产品的特点各不相同。

    第二,统计分析

    定义:将海量的来自前端的数据快速导入到一个集中的大型分布式数据库 或者分布式存储集群,利用分布式技术来对存储于其内的集中的海量数据 进行普通的查询和分类汇总等,以此满足大多数常见的分析需求。

    特点和挑战:导入数据量大,查询涉及的数据量大,查询请求多。

    使用的产品:InfoBright,Hadoop(Pig和Hive),YunTable, SAP Hana和Oracle Exadata,除Hadoop以做离线分析为主之外,其他产品可做实时分析。

    第三,挖掘数据

    定义:基于前面的查询数据进行数据挖掘,来满足高级别的数据分析需求。

    特点和挑战:算法复杂,并且计算涉及的数据量和计算量都大。

    使用的产品:R,Hadoop Mahout

  • ?

    Java工程师高端架构以及大数据云计算课程视频教程网盘下载

    听芹

    展开

    AVA高并发、负载均衡、NoSQL、服务器集群、性能优化、数据库集群等架构师技能; Hadoop、HDFS、ResourceManager

    、Yarn平台、Mapreduce、Hbase、Hive、Storm、Spark、Kafka、R语言、Scala语言、Mahout、Redis、Docker、KVM、Openstack等技术

    下载地址:

    百度搜索:怪兽IT学院 或者直接输入guaishouxuyaun

    云计算Java大数据编程语言收藏

  • ?

    手把手教你使用Kyligence Cloud,玩转云端大数据

    阿伯道尔

    展开

    作为“手把手教你”系列的第 3 篇,本篇将为您介绍 Kyligence Cloud 如何在 Azure 平台上部署大数据分析集群,包括准备工作、集群创建、集群管理、数据建模与分析等内容。

    1 关于Kyligence Cloud

    Kyligence Cloud 是 Kyligence 公司基于云端的大数据服务,为客户将大数据分析平滑上云提供解决方案。使用 Kyligence Cloud,您可以在云端快速实现对 PB 级数据的交互式 OLAP 分析和关键业务查询的亚秒级响应,助力业务分析师和数据科学家快速发现数据内在价值,驱动商业决策。

    Kyligence Cloud 支持在 Microsoft Azure 平台上部署,它基于 Azure HDInsight 云端 Hadoop 服务,将数据处理容量从TB级扩展至PB级,同时保持 OLAP 分析和关键业务查询的亚秒级响应能力。Kyligence Cloud 以用户的身份与 Azure 进行通信。用户创建集群时,Kyligence Cloud 使用用户提供的帐户信息,在其Azure 帐户下创建 HDInsight 集群及其它资源,并部署 Kyligence 大数据分析引擎 Kyligence Analytics Platform(以下简称 KAP),从而实现数据的存储、访问与分析都在用户自己的云端账户内进行,最大程度上保护数据安全。

    Kyligence Cloud @ Azure 架构图

    借助于 Azure 计算与存储分离的架构,用户可以方便地对集群进行扩容和缩容,甚至在不需要数据分析的时候,可以安全地停止集群而不用担心丢失数据。表结构、Cube 模型等元数据存储在用户帐户下的 SQL Server 实例中,Cube 数据会保存在 Azure Blob Store 中。

    2 文档主要内容

    本文档主要介绍如何使用 Kyligence Cloud 在 Azure 上部署大数据分析集群,并进行后续的数据建模与分析。

    1. 准备工作

    2. 创建集群

    3. 管理集群

    4. 数据建模与分析

    5. 帮助与支持

    3 准备工作

    3.1

    申请 Kyligence Cloud 试用

    Kyligence Cloud 提供 30 天的免费试用,试用期间能操作一个集群,并能试用产品的全部功能。

    可通过以下地址进行试用申请:

    https://cloud.kyligence.io/cloudapply

    填写相关信息并提交,Kyligence Cloud 将会对申请进行审核,申请通过后(通常一至三个工作日)会以邮件进行通知 。

    3.2

    准备 Microsoft Azure 帐号

    Kyligence Cloud 以 Azure 作为底层计算和存储基础平台。本文仅介绍 Azure 的使用方法,您需要自己准备一个 Azure 帐号,并保证帐号中有可用的订阅,且帐号需具有分配角色的权限。

    具体清单如下:

    1. 准备1个 Azure 帐号( Azure 中国或 Azure 海外皆可)

    2. 保证帐号中有可用订阅(该订阅需能创建 HDInsight,Storage Account 等资源)

    3. 保证该帐号具有分配角色的权限

    4. 保证 HDInsight 的可用内核数量能满足您的需要

    3.3

    Azure 应用注册

    Kyligence Cloud 通过 Service Principle 的方式来验证和操作你的 Azure 帐号。简单来说,通过将 Kyligence Cloud 进行 Azure 应用注册,获取该应用的应用程序 ID、应用密钥和目录 ID,以这三者作为 Azure 授权凭证提供给 Kyligence Cloud 使用。 如果不了解这些概念,没关系,跟随下面的操作进行即可。

    在 Azure 的控制台中,依次找到 Azure Active Directory –> 应用注册 ->新应用程序注册。

    在接下来的创建页面,名称一栏中填入“Kyligence Cloud”,应用程序类型选择“ Web 应用/ API”,登录 URL 填入 Kyligence Cloud Portal 地址:

    https://cloud.kyligence.io

    创建完成后,把应用程序 ID 记录下来。

    之后点击 设置 –>密钥,在密钥页面输入密码描述,选择到期时间。点击保存,密码值将会生成,将生成的值保存下来。

    在 Azure Active Directory –> 属性 中,找到目录 ID 并记录下来。

    现在来为刚才创建的应用赋予权限。我们在左侧“所有服务”中找到订阅,在 订阅 -> 访问控制(标示和访问管理) -> 添加中,角色一栏选择参与者、选择一栏输入 Kyligence Cloud,之后点击保存即可。

    4 创建集群

    4.1

    登录Kyligence Cloud Portal

    Kyligence Cloud Portal 是Kyligence Cloud提供集群服务和大数据分析入口的用户交互界面。

    可通过以下地址进行访问:

    https://cloud.kyligence.io

    进入后需先进行登录。如果是初次访问,还将需要选择基础云平台,在本文中我们选择 Microsoft Azure -> Azure China(operated by 21Vianet),如果使用 Azure 海外帐号选择 Azure Global 即可。

    之后将自动跳转至 Kyligence Cloud Portal,其界面如下图所示:

    界面左侧为导航栏,有主页、集群、监控三个标签。

    主页页面展示集群的一些概要信息、帮助信息和大数据分析平台的快捷入口;集群列表页面展示 Kyligence Cloud 所管理的集群,可在该页面操作具体集群;监控页面展示对集群的操作的详细进度和状态。

    4.2

    创建集群

    点击左侧导航栏中的“集群”标签进入在集群管理页面,在该页面中点击“新建集群”按钮。

    第一次创建 Azure 集群时,需要在弹出对话框中填入的 Azure 验证应用 ID、应用密钥和目录 ID,这三样东西我们已在章节二中准备妥当,对应填入即可。

    填写完成后再次点击“新建集群”按钮,进入集群创建页面。在弹出的对话框中选择“创建新的 Hadoop 集群”。

    在集群创建页面中,需要做一些必要的集群配置:

    填写集群名称;选择集群密钥。集群密钥用于提交任务和登录集群仪表板,可以通过条目右侧“创建密钥”按钮进行创建;选择 SSH 密钥。SSH 密钥用于远程访问集群;设置集群节点。在集群拓扑结构中可以看到, 集群由两个头节点(负责任务调度)、一个边缘节点(KAP 安装于此)和若干工作节点(负责执行计算任务)组成。可以根据具体计算需求选择各类节点的类型(配置),以及工作节点的数量;选择 KAP 版本。同时也可以选择是否安装 Kyligence 自主研发的 BI 工具 KyAnalyzer ;设置邮件通知。集群的操作结果将会以邮件的形式通知到指定邮箱。

    5 管理集群

    Kyligence Cloud 不仅能快速创建出用于大数据分析的集群环境,还可以弹性地改变集群的规模,迅速响应用户的数据分析需求,实现成本优化。在没有数据分析请求时,甚至可以停止集群,系统会自动备份元数据和分析数据,之后可重新启动集群恢复至原本的状态。集群管理包括以下操作:

    伸缩集群停止/启动集群删除集群

    5.1

    伸缩集群

    当计算资源不足或过剩时,可以利用 Kyligence Cloud 动态调整集群规模。

    可以通过动态增加节点的方式来应对日益增长的数据规模所带来的计算需求,整个过程安全快捷。相对的,当计算资源过剩时可以动态地缩减集群规模,减少集群的节点数量,以节约成本。

    点击集群条目的折叠按钮,可以找到简要的节点信息,点击工作节点这一项右侧的“修改”按钮即可针对工作节点的数量进行调整。

    点击工作节点右侧的“+”和“-”进行数量调整。

    5.2

    停止集群

    当集群没有任何分析查询请求并长时间处于空闲状态时,此时 Azure 仍将对集群硬件收取费用,可以考虑使用 Kyligence Cloud 停止集群 来节省费用。

    停止集群会为您安全地移除所有 Azure HDInsight 节点,并保存 KAP 和 Hive 的元数据至 BLOB 存储/SQL Server。可以在之后重启这个集群,元数据与分析数据也将随之恢复,集群一切如初。

    停止集群,点击集群条目右侧的“停止”按钮即可。

    停止操作大概持续十分钟,之后集群状态变为 STOPPED。你可以在之后任意时刻重新这个集群,仅仅需要点击一下“开始”按钮。

    5.3

    删除集群

    当我们不再需要某个集群的时候,可以删除该集群。集群的一切资源将被移除,费用也将终止产生。注意删除集群会导致数据一同删除,且该过程不可逆,如果需要保留数据可以使用停止集群服务。

    删除集群,点击集群条目右侧的菜单下的“删除”按钮即可。

    6 数据建模与分析

    集群启动完成后,我们可以使用集群内置 Kyligence Analytics Platform (简称KAP)进行大数据分析。

    KAP 大数据智能分析平台,是一款基于 Apache Kylin 的在超大数据集上提供亚秒级分析能力的企业级数据仓库产品,为业务用户、分析师及工程师提供简便、快捷的大数据分析服务。

    6.1

    访问大数据分析平台 KAP

    在集群处于 RUNNING 状态时,Kyligence Cloud 会在集群列表下对应的集群条目中展示 KAP 的入口。

    6.2

    使用 KAP 和 KyAnalyzer 进行大数据建模与分析

    更多关于数据建模与分析的使用方法,请参考Kyligence Analytics Platform文档:

    http://docs.kyligence.io/books/v2.5/zh-cn/index.html

    您也可以点击 Kyligence Cloud Portal左侧导航栏中的“主页”标签获取。

    7 帮助与支持

    微软 Azure 降价,使用 Kyligence Cloud 成本下降超过50%

    手把手教你使用Kyligence Cloud on AWS:集群操作篇

    手把手教你使用Kyligence Cloud on AWS 准备和创建集群篇

    Kyligence Cloud 正式发布 提供端到端的云上大数据解决方案

    给力!48小时完成云端流数据接入与分析

  • ?

    一个典型的大数据云是如何设计和部署的呢?

    奥尔胡斯

    展开

    随着云计算和大数据的普及,越来越多的IT公司选择将自己的大数据解决方案部署在云上面。云计算和大数据的结合带来了什么便利呢?一个典型的大数据云又是如何设计和部署的呢?

    下面我们以Google Cloud作为例子,讲解在工业界里边是如何实际应用云。

    Google Cloud

    Google作为分布式系统和大数据的领导者,开发了众多跨时代的产品。几乎每一个Google的产品,写出一篇paper就可以创造一个开源社区的。

    比如MapReduce发布之后,开源社区根据Google的一篇论文开发出的Hadoop,BigTable发布之后,开源社区又进一步开发出Hbase等等。可以说没有Google的创新,就没有现在开源社区的繁荣。

    而Google又把自家的产品,都放在Google Cloud上面,形成了丰富多彩的产品线,吸引了非常多的大大小小的公司如Snapchat等来使用。

    Google App Engine (GAE)

    我们都知道Web项目都需要大量的Web Service以及为之服务的运维系统。Google在云计算领域首次尝试的就是Google App Engine (GAE),相对比当时的Amazon EC2,GAE只需开发者上传软件代码,其他部署将由Google完成。

    用户只需要熟悉后端语言开发即部署大规模的集群。Google今年更是推出了GAE Flex,可以帮助用户实现auto-scaling,用户不再需要自己部署负载均衡的服务了。大部分中小企业的网站几乎都可以无缝衔接到GAE上。

    BigTable

    BigTable的底层是注明的Google File System (GFS),他实现了数据中心级别的可靠的分布式存储。

    也是最早的NoSQL数据库的一种。各种网站如果有需要永久存储的数据,一般都可以存放在BigTable里边,Google Cloud会自动帮你做replication,分布在不同的服务器节点里边,这样实现了可靠的分布式存储。

    Dataflow

    Dataflow的底层实现利用了大名鼎鼎的MapReduce的升级版Flume。

    Dataflow特别方便进行大量的批处理,举个例子来说,比如要把所有的用户数据里边的格式都升级一遍,用GAE或者其他service是很难实现的。

    Dataflow也提供了特别多的接口,诸如BigQuery, Datastore, BigTable等等也是为了方便各种批处理。最近Google还提供了streaming(流服务)版本的Dataflow,可以实现持续不断的批处理。

    BigQuery

    BigQuery相当于是Cloud version的SQL,可以方便使用各种复杂的查询语言查找数据。这个尤其适合数据分析师进行各种数据分析,几乎各种SQL的语法都是支持的。

    但是BigQuery在scaling上并不如BigTable,并不是面向用户的,所以并不适合直接用来存储用户数据。只适合做一些离线分析,数据来源很多都是Dataflow从BigTable里边dump出来的一些拷贝。

    其他服务

    Google Cloud还有非常多的其他服务,诸如支持消息队列处理的Pubsub,支持缓存的Memchace,支持Monitoring的Stackdriver,等等完整的构成了一个企业数据云所必须的各种服务,可以满足大到Snapchat级别,小到各种startup的不同业务需求。

  • ?

    一起学大数据|最详细的大数据资源教程,呕心沥血全部分享

    董含灵

    展开

    跟大家已经分享了这么长时间的大数据文章了,我们的一起来学大数据系列已经将Java和Linux全部做了一次基础的分享。今天,我把我整理的全套大数据资源分享给大家,一起共同学习,记得关注呦。

    Java基础

    java是大数据的铺垫,是我们学习大数据之前必要的一门必修课。之前我也给大家介绍了一篇文章,就是将为什么要在学大数据之前学习java。

    这里是我们Java基础的部分资源。

    JavaWeb

    web在大数据的可视化中起到了举足轻重的作用,我们分析的数据是干巴巴的,在没有可视化之前。通过JavaWeb的简单学习,我们可以了解前端的一些知识点。

    准确的讲我们学习大数据的主要负责的是后台的运行,前端的东西交给前端工程师即可,所以这里我们并不需要学习太深,而且前端东西也比较杂碎,不如花更多的时间去学习我们下面的视频。

    三大框架

    到这里,我们就进去的java更高一级的学习,通过框架的学习,我们可以达到企业级应用的简单开发。

    Linux

    linux是大数据的入门基础,在这里我们会学习linux系统的中的详细命令,以及如何去搭建大数据环境的集群,shell编程等等。我们从这里走进大数据的学习。

    Hadoop

    当数据分析面对的是海量(1T以上)的数据时,普通技术手段难以胜任,就需要更强大的技术手段来实现。

    大数据技术的核心,其实就是解决海量数据场景下的数据存储和运算问题;而海量数据场景下的数据存储和运算的核心技术又是:分布式技术。

    Scala

    Scala是一种多范式的编程语言,类似java的编程语言,集成面向对象编程和函数式编程的各种特性,而且无缝地结合了命令式编程和函数式编程风格。通过学习Scala语言,我们为下面的spark的学习做铺垫。

    Spark

    Spark 是研发师专门为庞大海量数据处理而设计的快速通用的计算引擎,其是在 Scala 语言中实现的,spark将 Scala 用作其应用程序框架。与 Hadoop 不同,Spark 和 Scala 能够紧密集成,其中的 Scala 可以像操作本地集合对象一样轻松地操作分布式数据集。

    上面就是对大数据视频的一些简单的分析,通过这些的学习大家能够基本掌握大数据的内容,最后想成为真正的大师还要勤加练习。

    这么多视频也是够大家学习一段时间的了。之后,我还会继续更新文章,大家记得关注哟~

    获取方式

    1.首先右上角点击【关注】,关注我的百家号~

    2、私信我:大数据

    明天我单独给发给大家,耐心等待有~如果觉得资源不错,请给个好评,谢谢各位了,来个转发、收藏哦!

    感谢坚持关注的朋友~

    世界很大,幸好有你~

    欢迎在评论区留下你的问题或困惑,我将每天与你分享我的观点和心得。

    聚焦最新科技咨讯,探寻未来智能领域,我是女陶Mario

大数据云数据教程

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP