中企动力 > 商学院 > 云数据大数据分析
  • ?

    云计算是什么?云计算与大数据要学啥?

    爱飞

    展开

    云计算是什么?云计算与大数据要学啥?云计算的虚拟空间无限大,物联网和互联网产生的大量数据,要找一个地方集中存储和处理,就要用云来存储。比如我们平时手机或电脑存储空间不够的情况下,会把一些图片及视频存在云盘,云端。

    云计算,简单说就是把你自己电脑里的或者公司服务器上的硬盘、CPU都放到网上,统一动态调用,现在最有名的云计算服务商是亚马逊的AWS。以前你要玩最新的大型3D游戏或者做了个大型3D动画需要渲染,首先想到的都是重新买一台更高配置电脑或者换个显卡等;

    有了云计算之后,你只需要一台显示器,连到服务商的云计算平台上,如果想玩两天新游戏,就单独购买这两天的高配CPU和显卡,只付两天的钱,玩腻了就恢复成普通的配置;如果你今晚要做大量渲染,就买今晚几个小时的高配,第二天早上拿到成片,就可以恢复原来的配置。所有这些计算和渲染工作都在云计算服务商的数据中心统一完成,你只需要按小时甚至按分钟计费,不用再自己买电脑和服务器了。做云计算的服务商都会自建数据中心。

    大数据,简单说,就是把所有的数据放到一起分析,找到关联,实现预测。这里的所有数据对应的是之前的抽样调研取得的部分数据。比如传统的市场调研方法,就是去大街上或者网上发问卷,能得到成百上千份结果就很不错了,或者邀请几个典型用户到会议室访谈一下;大数据的做法是把收集所有人的数据进行分析,把每个人都当做独立个体进行分析,而不是找群体特征。大数据的结果就是更精准,更细致,更个性化。

    再比如我们经常会看一些现代谍战片,侦察部如何找到罪犯?就是通过全城监控录像,在海量数据中搜索一个人的面孔,犯罪分子只要出现在监控中都会保留一条数据及位置,从而更好地实施下一步方案,大大提高破案效率。这也是企业为什么在极力追捧云计算大数据技术。再比如京东、淘宝、今日头条、新浪、百度、网易、等购物网站,就是采用这种技术。今天看过或搜过的,下次再打开就会主动推送什么类型的文章。

    简单的说大数据就是超级存储的意思,海量数据上传到云平台后,大数据就会对数据进行深入分析和挖掘。在在各行各业均存在大数据。比如天气预报,气象中心会通过卫星发送回气象局无数条关于空气温度、湿度、密度、空气微粒等的数据,运用大数据技术,从而分析判断出这些数据。得出天气状况、空气质量、温度及风量。再比如将几千辆车的数据位置信息综合起来分析出某条路的拥堵状况。大数据必须有云作为它的基础架构,才可以推广并体现出强大的实用价值。云计算和大数据是相辅相成的。

  • ?

    Forrester大数据能力报告:阿里云仅次于AWS

    tftlj

    展开

    【IT168 云计算】日前,全球权威调研机构Forrester发布《2018年一季度云端数据仓库》报告。报告对大数据服务商的主要功能、区域表现、细分市场和典型客户等进行了全面评估,最终AWS、阿里云、Google、微软四大巨头杀入全球一线阵营。阿里云成为唯一入选的中国科技公司。

    ▲ Forrester对云端大数据服务商的划分

    Forrester报告被认为是全球各大公司CIO选择服务商的指导手册,在行业内极具权威性。云端的大数据服务凭借安全、弹性伸缩、部署速度快、成本低等特点,已经成为近年来的发展趋势。与之相应的,本地部署的大数据分析解决方案正在逐渐落伍。

    分析师在报告中明确指出,使用云端大数据,使得企业避免了在硬件基础设施和软件上的投入,大多数企业发现使用云端大数据服务比本地部署要节省20%的成本,有一些甚至节省了70%-80%。

    报告中处于第一阵营的AWS、阿里云、Google、微软同样是全球公有云领域的四巨头,这是一个有趣的转变。此前大数据服务领域的主要玩家均为IBM、Oracle、Teradata等老牌厂商。

    行业专家认为,依托于公有云的大数据服务带来了类似摩尔定律的概念,颠覆已经来临。如今企业的数据集群越来越大,数据类型越来越复杂,本地部署的大数据架构的运行和维护则会成为一场噩梦:首先是高昂的成本;其次冗长的环节导致无法快速支持新的需求。最关键的,大数据技术发展的快速性和多样性,也让内部技术人员疲于追赶。

    阿里云作为唯一入选的中国科技公司,Forrester在报告中对其进行了详细分析。目前,阿里云提供基于公用云的多租户大数据仓库和混合云服务,全球化进展迅速。金融、互联网、零售、电子商务等是其主要业务领域,典型客户包括微博、华大基因等。

    此前,在国际另一家权威机构Gartner报告中,阿里云同样冲进了大数据分析解决方案魔力象限,再次验证了中国互联网技术的高速发展和强劲实力。

  • ?

    在大数据与云:达到引爆点

    尔岚

    展开

    那么应该重新考虑您想要支持一个大数据计划。

    即使你可以找到大量的云数据存储提供商提供分析和服务于企业客户,早期大数据项目的频繁发生。这个事实导致许多失败,大数据项目,在很多方面,形象被禁药物玷污了什么可以做的大数据分析。

    但随着越来越多的大数据成功故事继续滴流出来,开始图像形成。照片显示,大数据分析将真正成为企业成功的关键的数字化改变世界,而且更容易成功如果您的数据和分析发生在云端。

    有大量数据需要备份的数据,将会起到巨大的作用在企业的竞争力。什么是不太理解是为什么大数据是更成功的云相比,私有。在本文中,我们要探索这些原因,指出为什么大数据在云终于达到了临界点的企业。

    大数据:大项目

    大多数企业的IT组织尝试的大数据项目的房子,不是一件容易的事。但是即便有诸多计划和砂粒,因为项目失败的项目仅仅消耗太多的时间和所需技能,那时候,稀缺。甚至在2017年,数据管理员,擅长在大数据平台等hortonworks或/或者/换句话说/不然的话/还是/要不/抑MapR基本上可以写他们自己。许多项目没有完成,因为它们经历显著的“人才流失”为移动平台的大数据人才敬而远之。

    了解数据科学家

    尽管仍有大量短缺在基础设施方面,将真正的自家大数据的分析项目中被发现的。毕竟,这实际上是企业的真正的、深入的科学数据如此大的规模。它的领导人试图保护那些分析数据的管理与操作侧壳体。实际上,数据科学家的工作经历是配合运营团队--无论是内部员工还是一个云提供者。这样做允许数据科学家更好地调整他们的模型,简化流程,加快挤压所需的时间量的信息从堆积如山的数据。

    为什么我们达到了一个引爆点

    尽管显然外包带来的好处与喂养大数据平台和数据库,真正的原因是他们的大数据企业移动为公用云就是因为它们中的大多数数据,不久或将驻留。不管你如何细分,移动大量的数据是一项艰巨的壮举。但随着时间的推移,许多企业对于数据迁移有机公司的资讯科技部门开始利用低成本的云存储。

    在某种程度上,大数据五年或十年前只是提前了许多。我们不仅有误判的复杂性,开发和实施大数据平台,我们误解了大数据的关键角色。利用云支持大数据基础设施的基础让我们内部的IT部门专注于重要的事情上来说,可以提高分析的能力。

    大数据将接收的大换购:

    大数据分析的目标是创建一个状态的操作称为情景意识。这是在数据被收集到一定程度,就可以判定动作快速,在某些情况下(在实时。但过去的失败已经导致许多企业对他们的大数据野心。如果你认为今天你可能要重新考虑。特别是如果你已存储数据移动到云。通过后端任务卸载至第三方提供者,在理想情况下,业务数据可以集中使用,形成正确决策对公司的发展方向。多年来,我们一直都在等待。接下来的问题就是,谁会迈出这一步的呢?

  • ?

    手把手教你使用Kyligence Cloud,玩转云端大数据

    指挥官

    展开

    作为“手把手教你”系列的第 3 篇,本篇将为您介绍 Kyligence Cloud 如何在 Azure 平台上部署大数据分析集群,包括准备工作、集群创建、集群管理、数据建模与分析等内容。

    1 关于Kyligence Cloud

    Kyligence Cloud 是 Kyligence 公司基于云端的大数据服务,为客户将大数据分析平滑上云提供解决方案。使用 Kyligence Cloud,您可以在云端快速实现对 PB 级数据的交互式 OLAP 分析和关键业务查询的亚秒级响应,助力业务分析师和数据科学家快速发现数据内在价值,驱动商业决策。

    Kyligence Cloud 支持在 Microsoft Azure 平台上部署,它基于 Azure HDInsight 云端 Hadoop 服务,将数据处理容量从TB级扩展至PB级,同时保持 OLAP 分析和关键业务查询的亚秒级响应能力。Kyligence Cloud 以用户的身份与 Azure 进行通信。用户创建集群时,Kyligence Cloud 使用用户提供的帐户信息,在其Azure 帐户下创建 HDInsight 集群及其它资源,并部署 Kyligence 大数据分析引擎 Kyligence Analytics Platform(以下简称 KAP),从而实现数据的存储、访问与分析都在用户自己的云端账户内进行,最大程度上保护数据安全。

    Kyligence Cloud @ Azure 架构图

    借助于 Azure 计算与存储分离的架构,用户可以方便地对集群进行扩容和缩容,甚至在不需要数据分析的时候,可以安全地停止集群而不用担心丢失数据。表结构、Cube 模型等元数据存储在用户帐户下的 SQL Server 实例中,Cube 数据会保存在 Azure Blob Store 中。

    2 文档主要内容

    本文档主要介绍如何使用 Kyligence Cloud 在 Azure 上部署大数据分析集群,并进行后续的数据建模与分析。

    1. 准备工作

    2. 创建集群

    3. 管理集群

    4. 数据建模与分析

    5. 帮助与支持

    3 准备工作

    3.1

    申请 Kyligence Cloud 试用

    Kyligence Cloud 提供 30 天的免费试用,试用期间能操作一个集群,并能试用产品的全部功能。

    可通过以下地址进行试用申请:

    https://cloud.kyligence.io/cloudapply

    填写相关信息并提交,Kyligence Cloud 将会对申请进行审核,申请通过后(通常一至三个工作日)会以邮件进行通知 。

    3.2

    准备 Microsoft Azure 帐号

    Kyligence Cloud 以 Azure 作为底层计算和存储基础平台。本文仅介绍 Azure 的使用方法,您需要自己准备一个 Azure 帐号,并保证帐号中有可用的订阅,且帐号需具有分配角色的权限。

    具体清单如下:

    1. 准备1个 Azure 帐号( Azure 中国或 Azure 海外皆可)

    2. 保证帐号中有可用订阅(该订阅需能创建 HDInsight,Storage Account 等资源)

    3. 保证该帐号具有分配角色的权限

    4. 保证 HDInsight 的可用内核数量能满足您的需要

    3.3

    Azure 应用注册

    Kyligence Cloud 通过 Service Principle 的方式来验证和操作你的 Azure 帐号。简单来说,通过将 Kyligence Cloud 进行 Azure 应用注册,获取该应用的应用程序 ID、应用密钥和目录 ID,以这三者作为 Azure 授权凭证提供给 Kyligence Cloud 使用。 如果不了解这些概念,没关系,跟随下面的操作进行即可。

    在 Azure 的控制台中,依次找到 Azure Active Directory –> 应用注册 ->新应用程序注册。

    在接下来的创建页面,名称一栏中填入“Kyligence Cloud”,应用程序类型选择“ Web 应用/ API”,登录 URL 填入 Kyligence Cloud Portal 地址:

    https://cloud.kyligence.io

    创建完成后,把应用程序 ID 记录下来。

    之后点击 设置 –>密钥,在密钥页面输入密码描述,选择到期时间。点击保存,密码值将会生成,将生成的值保存下来。

    在 Azure Active Directory –> 属性 中,找到目录 ID 并记录下来。

    现在来为刚才创建的应用赋予权限。我们在左侧“所有服务”中找到订阅,在 订阅 -> 访问控制(标示和访问管理) -> 添加中,角色一栏选择参与者、选择一栏输入 Kyligence Cloud,之后点击保存即可。

    4 创建集群

    4.1

    登录Kyligence Cloud Portal

    Kyligence Cloud Portal 是Kyligence Cloud提供集群服务和大数据分析入口的用户交互界面。

    可通过以下地址进行访问:

    https://cloud.kyligence.io

    进入后需先进行登录。如果是初次访问,还将需要选择基础云平台,在本文中我们选择 Microsoft Azure -> Azure China(operated by 21Vianet),如果使用 Azure 海外帐号选择 Azure Global 即可。

    之后将自动跳转至 Kyligence Cloud Portal,其界面如下图所示:

    界面左侧为导航栏,有主页、集群、监控三个标签。

    主页页面展示集群的一些概要信息、帮助信息和大数据分析平台的快捷入口;集群列表页面展示 Kyligence Cloud 所管理的集群,可在该页面操作具体集群;监控页面展示对集群的操作的详细进度和状态。

    4.2

    创建集群

    点击左侧导航栏中的“集群”标签进入在集群管理页面,在该页面中点击“新建集群”按钮。

    第一次创建 Azure 集群时,需要在弹出对话框中填入的 Azure 验证应用 ID、应用密钥和目录 ID,这三样东西我们已在章节二中准备妥当,对应填入即可。

    填写完成后再次点击“新建集群”按钮,进入集群创建页面。在弹出的对话框中选择“创建新的 Hadoop 集群”。

    在集群创建页面中,需要做一些必要的集群配置:

    填写集群名称;选择集群密钥。集群密钥用于提交任务和登录集群仪表板,可以通过条目右侧“创建密钥”按钮进行创建;选择 SSH 密钥。SSH 密钥用于远程访问集群;设置集群节点。在集群拓扑结构中可以看到, 集群由两个头节点(负责任务调度)、一个边缘节点(KAP 安装于此)和若干工作节点(负责执行计算任务)组成。可以根据具体计算需求选择各类节点的类型(配置),以及工作节点的数量;选择 KAP 版本。同时也可以选择是否安装 Kyligence 自主研发的 BI 工具 KyAnalyzer ;设置邮件通知。集群的操作结果将会以邮件的形式通知到指定邮箱。

    5 管理集群

    Kyligence Cloud 不仅能快速创建出用于大数据分析的集群环境,还可以弹性地改变集群的规模,迅速响应用户的数据分析需求,实现成本优化。在没有数据分析请求时,甚至可以停止集群,系统会自动备份元数据和分析数据,之后可重新启动集群恢复至原本的状态。集群管理包括以下操作:

    伸缩集群停止/启动集群删除集群

    5.1

    伸缩集群

    当计算资源不足或过剩时,可以利用 Kyligence Cloud 动态调整集群规模。

    可以通过动态增加节点的方式来应对日益增长的数据规模所带来的计算需求,整个过程安全快捷。相对的,当计算资源过剩时可以动态地缩减集群规模,减少集群的节点数量,以节约成本。

    点击集群条目的折叠按钮,可以找到简要的节点信息,点击工作节点这一项右侧的“修改”按钮即可针对工作节点的数量进行调整。

    点击工作节点右侧的“+”和“-”进行数量调整。

    5.2

    停止集群

    当集群没有任何分析查询请求并长时间处于空闲状态时,此时 Azure 仍将对集群硬件收取费用,可以考虑使用 Kyligence Cloud 停止集群 来节省费用。

    停止集群会为您安全地移除所有 Azure HDInsight 节点,并保存 KAP 和 Hive 的元数据至 BLOB 存储/SQL Server。可以在之后重启这个集群,元数据与分析数据也将随之恢复,集群一切如初。

    停止集群,点击集群条目右侧的“停止”按钮即可。

    停止操作大概持续十分钟,之后集群状态变为 STOPPED。你可以在之后任意时刻重新这个集群,仅仅需要点击一下“开始”按钮。

    5.3

    删除集群

    当我们不再需要某个集群的时候,可以删除该集群。集群的一切资源将被移除,费用也将终止产生。注意删除集群会导致数据一同删除,且该过程不可逆,如果需要保留数据可以使用停止集群服务。

    删除集群,点击集群条目右侧的菜单下的“删除”按钮即可。

    6 数据建模与分析

    集群启动完成后,我们可以使用集群内置 Kyligence Analytics Platform (简称KAP)进行大数据分析。

    KAP 大数据智能分析平台,是一款基于 Apache Kylin 的在超大数据集上提供亚秒级分析能力的企业级数据仓库产品,为业务用户、分析师及工程师提供简便、快捷的大数据分析服务。

    6.1

    访问大数据分析平台 KAP

    在集群处于 RUNNING 状态时,Kyligence Cloud 会在集群列表下对应的集群条目中展示 KAP 的入口。

    6.2

    使用 KAP 和 KyAnalyzer 进行大数据建模与分析

    更多关于数据建模与分析的使用方法,请参考Kyligence Analytics Platform文档:

    http://docs.kyligence.io/books/v2.5/zh-cn/index.html

    您也可以点击 Kyligence Cloud Portal左侧导航栏中的“主页”标签获取。

    7 帮助与支持

    微软 Azure 降价,使用 Kyligence Cloud 成本下降超过50%

    手把手教你使用Kyligence Cloud on AWS:集群操作篇

    手把手教你使用Kyligence Cloud on AWS 准备和创建集群篇

    Kyligence Cloud 正式发布 提供端到端的云上大数据解决方案

    给力!48小时完成云端流数据接入与分析

  • ?

    云计算大数据的趋势化分析

    Xie

    展开

    去年,阿里云将中国的计算方式推向全球,百度首次向全社会展示了百度大脑的科技成果,移动互联网的迅速崛起,预示着互联网正在逐步进入到智能时代,云计算、大数据、人工智能的进步将推动人类社会迎来变革性的发展。

    无论是计算机产业,还是其他制造领域,技术层面的成熟都是推动行业飞速发展的基础。如果在一个新的技术创新时代,在硬件和软件上没有达到产业的要求,时代的产业基础将变得十分薄弱,而从产业政策角度分析,当技术累积到一定程度时,产业政策的出台也会变成一种必然。

    就像为了刺激云计算的发展,国务院相继出台了《关于促进云计算创新发展培育信息产业新业态的意见》、《云计算白皮书2016》等,当然国务院出台这些政策绝非偶然,是在其背后众多云计算相关从业者共同努力的结果。

    作为云计算运行的基础,大数据主要来源于政府、企业和消费者三个方面。政府对数据进行授权,但由于法制的不健全,政府数据被大量滥用,消费者的数据在流量入口处被自动抓取,数据提供商可以提供所有维度的数据,但并不是全部。

    中国有高达7亿的大规模网民群体,每人每时每刻都在产生着数据,中国的数据市场还远远没有达到平衡点,未来还将继续保持高速增长的态势,另一个方面,企业经济增长模式的改变,也使得企业对大数据应用的需求在不断提高,更加强调数据的专业性和实用性。

  • ?

    云时代,看大数据如何助力企业实现业务创新!

    稚雅

    展开

    随着云技术的快速发展以及国家机关对推动企业上云的支持,各行各业都在“云”中快速成长,云时代正悄然来临,云计算必将成为未来所有IT应用的基石。而大数据作为数据应用分析的基础技术,也将会变的越来越重要,大数据为人工智能提供基础物料,为企业决策者提供数据支撑。未来,大数据将成为企业、社会和国家层面重要的战略资源。大数据将不断成为各类机构,尤其是企业的重要资产,成为提升机构和公司竞争力的有力武器。企业也将通过大数据实现业务创新,获取更多价值。

    迅达云大数据平台,挖掘多维度热点内容分析、网站资源的关联分析评估、投诉故障定位处理,从三个层面提升网内资源引入针对性、加强已引入资源流量贡献、提高互联网业务故障投诉定位准确性。迅达云大数据平台支持多种数据源接入,以 Hadoop 主流框架为核心,融合优秀的开源技术,支持 MapReduce, Hive, Spark 等主流框架。当集群规模很大或运行时间过长时,经常会遇到某台机器宕机的情况,迅达云大数据平台可以在集群机器出现问题时,秒级感知集群状态,及时踢出或重新拉起问题机器。

    迅达云大数据平台系统架构

    迅达云大数据平台将数据的完整走向分为7层:

    首先,在数据源这一层,我们知道数据有很多种,有在关系型数据里面存储的结构化数据,有日志形式的半结构化数据,也有视频音频这种非结构化数据,迅达云大数据平台可以将三大类型的数据都采集到集群中。

    对于数据集成的过程,迅达云大数据平台既支持全量非实时的接入,也支持增量形式的实时接入。比如,想看一个人在某个页面停留多久,对即时性要求比较高,可以采用实时的流式接入,而对于对实时性要求不高的(比如第二天才要数据结果),则可以采用非实时的数据接入。

    数据接入进来之后,需要存储。数据的安全很重要,应对现代的应用场景,单机的存储已无法满足需求,数据丢失会导致很大损失,所以迅达云采用的分布式存储。对于结构化数据,迅达云采用的是分布式数据库来存储。而对于非结构化和半结构化数据,是Hadoop的主流框架HDFS存储。

    再往上一层,经过整体的资源调度,应对不同场景,不同的处理需求,迅达云大数据可以提供离线计算、流式计算、交互式查询和内存计算,最后将处理结果可视化呈现。对于大数据的集群状态,迅达云也有运维监控平台、智能作业调度,以及元数据管理等。

    迅达云大数据平台功能及服务

    数据源集成

    支持全量离线接入和各种日志数据的增量,以及准实时接入、RDBMS的数据接入。

    数据存储与计算

    支持不同的存储方案和计算方案,灵活满足客户的各类场景。

    元数据管理

    通过数据地图、数据字典、数据血缘三个方面保证企业的元数据标准,同时对主题、维度、指标进行一致性定义和管理,解决了数据生产过程中的质量问题。

    数据应用开发

    提供SQL开发、依赖配置与调度管理、交互式查询等,提高开发效率。

    迅达云大数据平台优势

    DNS数据分析

    提供域名解析分析和运营监控的能力。

    日志分析

    提供网络流量、访问来源、带宽利用率、丢包率、延时等与网络质量状况相关的内容。

    智能调度

    对海量数据分析,实现对不同地域引入流量的管理,提高资源利用率。

    迅达云大数据平台适用场景

    运营商DNS日志分析

    通过迅达云大数据运营平台为DNS日志提供各种维度的数据分析,解决单机服务能力的限制,提供动态计算能力和分布式数据存储功能。

    DNS日志分析平台为运营商提供域名解析分析和运营监控的能力。

    分析每天出网流量、出网趋势对比和详情

    分析本省的各个地区的流量

    分析移动和PC用户流量的占比

    分析DNS解析的域名数量等情况

    同时,还可为运营商提供业务分析。

    根据现有数据和历史数据导入算法模型,预测未来IDC规模量的变化,Cache数量,CDN走势波动状况,方便运营商提前调配资源,另一方面能够及时发现流量变化问题,提高服务质量。

    由运营商内部考校标准,通过无监督聚类算法搭建的模型,找到影响本网率的重点域名,方便运营商方与内容提供商进行相关业务沟通,从而更好地提供服务,降低运营成本和缓解通道压力。

    案例展示

    以上是运营商日志分析结果图(本图仅作案例展示,为保护客户隐私,图片已做特别处理),从当日用户流量的维度来看,可以很直观的看到固网用户和移动用户的比重;从流量走向的维度看,社交娱乐的流量最多;从省份维度来说,A市的流量使用占比最高。对于流量多的城市,可以调配更多资源来提高服务的稳定性。同时,也可以通过这些流量走向,利用机器学习算法来预测未来的IDC规模量变化,帮助运营商及时扩充机房,降低运营成本,缓解通道压力等等。

    迅达云大数据平台助力企业实现业务创新

    网络故障预测,帮助运营商提升运维效率。对DNS解析的数量变化和成功率、CDN缓存命中率和回源量、应用服务器峰值流量和告警等数据进行进行综合分析,预测网络设备的故障率,以改进网络的可靠率。

    流量分布分析,为运营商进行网规网优提供依据。按照各地市维度对网络流量的分布进行分析,掌握各地市的互联网用户访问量和网络承载能力状况,为网络扩容规划、网络结构优化提供定量化的依据。

    流量流向分析,为运营商开展内容引入提供指导。通过网内和跨网流量的监测和分析,将用户跨网访问的热点内容引入到运营商网内,提升本网用户的访问体验,同时有效降低网间结算支出。

    用户行为画像,为运营商开展流量经营提供支持。从海量日志信息中提取用户特征和行为数据,包括地域来源、访问时间、访问路径、访问域名等,形成用户画像,进行个性化内容推荐,增强用户粘性。

    此外,迅达云大数据平台可以对不同领域的运营商进行数据的深度定制,并提供一对一的算法与服务支撑团队,利用迅达云的平台集成优势,提供一站式服务体验,降低实施和部署的成本。

  • ?

    云计算跟大数据究竟有什么关系

    星无尘

    展开

    随着科学技术的迅速发展,人类开始进入大数据时代,云计算、大数据、移动互联网已成为时代三大主题,正在推动着新经济时代的发展。在科学领域、经济领域及社会生活的方方面面,呈现出海量数据特征,在海量数据中蕴含着人类各种行为、心理信息。

    对此有网友表示称,常说的"大数据"和"云计算"应该当成动词。即"大数据"指大数据分析或大数据处理。"大数据"对应"小数据算法","云计算"对应"单个计算机的计算"。比如"1+1等于几"这个问题,我们可以通过小数据算法(口算),用单个计算机的计算(甚至计算器)完成计算。再想象一个复杂的问题,需要跨时间、跨空间计算的问题,比如"去年中国各行各业的生产总值,加上美国今年各行各业的生产总值是多少?"这个问题我们就需要通过大数据的分析或处理方法,用云计算完成。

    进一步说,要通过分析或处理各地各时段存储的各种数据资源,用互联网上(云)大量的计算机进行计算(计算)得出结果。这就是大数据、云计算。你可以通俗的理解为:大数据(分析或处理)是前台,云计算是后台。

    或者理解为:大数据(分析或处理)是软件方法,云计算是硬件设备资源。或者可以再直观的理解为:大数据就是人直接操作的界面(网页、软件或App),云计算就是这些网站、软件或App供应商提供的服务。

  • ?

    云计算和大数据哪个发展前景好?

    号16

    展开

    云计算和大数据哪个发展前景好?

    说实在话,二者之间都是未来的发展趋势,没有说那种好或者不好,根据你的兴趣,你未来的发展方向,来判断你想走那条路!

    大数据相当于海量数据的“数据库”,而且通观大数据领域的发展也能看出,当前的大数据处理一直在向着近似于传统数据库体验的方向发展,Hadoop的产生使我们能够用普通机器建立稳定的处理TB级数据的集群,把传统而昂贵的并行计算等概念一下就拉到了我们的面前,但是其不适合数据分析人员使用(因为MapReduce开发复杂),所以PigLatin和Hive出现了(分别是Yahoo!和facebook发起的项目,说到这补充一下,在大数据领域Google、facebook、twitter等前沿的互联网公司作出了很积极和强大的贡献),为我们带来了类SQL的操作,到这里操作方式像SQL了,但是处理效率很慢,绝对和传统的数据库的处理效率有天壤之别,所以人们又在想怎样在大数据处理上不只是操作方式类SQL,而处理速度也能“类SQL”,Google为我们带来了Dremel/PowerDrill等技术,Cloudera(Hadoop商业化最强的公司,Hadoop之父cutting就在这里负责技术领导)的Impala也出现了。

    整体来看,未来的趋势是,云计算作为计算资源的底层,支撑着上层的大数据处理,而大数据的发展趋势是,实时交互式的查询效率和分析能力,借用Google一篇技术论文中的话,“动一下鼠标就可以在秒级操作PB级别的数据”难道不让人兴奋吗?

    在谈大数据的时候,首先谈到的就是大数据的4V特性,即类型复杂,海量,快速和价值。IBM原来谈大数据的时候谈3V,没有价值这个V。而实际我们来看4V更加恰当,价值才是大数据问题解决的最终目标,其它3V都是为价值目标服务。在有了4V的概念后,就很容易简化的来理解大数据的核心,即大数据的总体架构包括三层,数据存储,数据处理和数据分析。类型复杂和海量由数据存储层解决,快速和时效性要求由数据处理层解决,价值由数据分析层解决。

    数据先要通过存储层存储下来,然后根据数据需求和目标来建立相应的数据模型和数据分析指标体系对数据进行分析产生价值。而中间的时效性又通过中间数据处理层提供的强大的并行计算和分布式计算能力来完成。三层相互配合,让大数据最终产生价值。

    传统的BI分析通过大量的ETL数据抽取和集中化,形成一个完整的数据仓库,而基于大数据的BI分析,可能并没有一个集中化的数据仓库,或者将数据仓库本身也是分布式的了,BI分析的基本方法和思路并没有变化,但是落地到执行的数据存储和数据处理方法却发生了大变化。

    谈了这么多,核心还是想说明大数据两大核心为云技术和BI,离开云技术大数据没有根基和落地可能,离开BI和价值,大数据又变化为舍本逐末,丢弃关键目标。简单总结就是大数据目标驱动是BI,大数据实施落地式云技术。

  • ?

    大数据与云计算分析

    窦思雁

    展开

    大数据:藏在啤酒和尿布背后的秘密; 云计算:物联网的隐形大脑

    我们提到物联网,就不得不把它与现在非常火热的另一个概念联系起来,那就是“大数据”。

    大数据是怎么一回事呢?有一个为人津津乐道经典案例,就是啤酒与尿布的例子。一家美国超市把尿布与啤酒这两种风马牛不相及的商品居然摆在一起,但这一奇怪的举措居然使尿布和啤酒的销量大幅增加了。原来,美国的妇女通常在家照顾孩子,所以她们经常会嘱咐丈夫在下班回家的路上为孩子买尿布,而丈夫在买尿布的同时又会顺手购买自己爱喝的啤酒。

    在这个案例里面,丈夫的行为被预测出来,其预测的依据是根据长期经验所得的。假定不在尿布旁边放啤酒,爱喝酒的丈夫可能也会去买,但嫌麻烦或者酒瘾不那么大的丈夫可能就只会买了尿布就走,而想不到去买啤酒。因而,大数据就此产生了经济价值。当然,这背后基本是一个零和游戏,这家超市的啤酒销售得多了,别家超市卖得就少了。

    腾讯的QQ我们都用过,它能够把我们久未联系的老同找出来,推荐给我们去联系,但也会把你的前女友推荐给你的未婚妻认识。而淘宝在我们买东西的时候会把相关产品推荐给我们,还会告诉我们诸如某省狮子座最败家、某省水瓶座最花心、某省天蝎座最抠门这样的信息。而百度则会对人们使用关键字搜索进行排名,从而让更多人知道最近大家的关注点在哪里。

    显然,这些数据或多或少已经开始影响我们的生活。而在未来,万物联网产生的数据量与现在人们通过互联网活动产生的数据量不可同日而语,开发的价值也会更加巨大。比如我们现在的手环、手表读取我们的心率、运动量等数据,仅仅是反馈给我们让我们管理自身健康。而未来随着大数据的分析能力增强,加上能够互动的设备增多,那么这些数据就变成了健康服务,甚至能提前预防疾病发生。

    反过来,大数据的处理能力能力会反过来帮助物联网实现智能控制和产品改进。比如,我们的智能家居的学习功能,可以看做是对用户一段时间的行为数据的收集,然后通过特定算法得出主人的喜好从而自己完成对家庭环境的控制。

    前面讲了大数据,那么还有另一个大数据的亲兄弟不得不讲,那就是云计算。从成本和实际效果来考虑,其实很多物联网设备并不需要太多的计算能力,只要能够取得数据并反馈给上层具有计算能力的数据处理中心就好了,多一点的还有能够通过从计算中心获取的指令完成某些活动就可以了。

    那么,这些数据谁谁在处理呢,他们又是怎么处理的呢,这里就要提到云计算的概念。云计算被认为是一种革命性的计算方法,是继大型计算机到客户端-服务器的大转变之后的又一关于计算方式的重大转变。

    举一个不那么恰当但比较好理解得例子。使用过QQ远程助手的朋友大概可以体验云计算,你在QQ提供的界面里面访问对方的电脑,使用对方的软件。云计算大概也可以看做这么种方式,不过对方的电脑变成了处理能力超强的云计算中心,而处理方式更加复杂一些。

    云计算给我们带来了全新的解决思路。由于通讯技术的不断发展,我们的计算不一定要在本地进行。比如,在远程操作的例子,哪怕你的电脑没有安装一个程序,你仍然能够获得这个程序的使用结果。而我们平时收发邮件,这些邮件存储在我们的邮箱里,而不是在我们的电脑上,这其实可以视作早期的云服务。这种理念,简单概括起来就是“网络即电脑”。只要有网络,我们就能获得更高的运算能力。

    目前云计算还处于基础阶段,现在的云计算被分为三层:基础设施即服务(IaaS),平台即服务(PaaS)和软件即服务(SaaS)。基础设施可以看做是我们的电脑主机,其实质是大规模的主机集群。平台的地位大致相当于我们的计算机系统,类似于windos,是开发和运行程序的基础。软件服务我们就明白多了,微信、游戏客户端、美图秀秀这样的都是软件。

    借助云计算,企业的管理成本将降低。由于云计算的作用,一些企业不用浪费金钱和精力建立自己的数据处理中心,而将自己的一些数据和企业管理软件放在公共的云服务器上;而另一些企业对于数据的安全性和专业性等要求较高,于是自建云服务器,于是有了公有云、私有云、的概念之别;有一些私有云并不能满足企业的运算需求,向公有云服务器寻求支持,于是就有了混合云的提法。

    同时,云计算中心能够根据实际需求来安排服务器的运算,让整个计算中心保持高效的运作,避免了运算资源的浪费。除此之外,云计算的好处在于按使用付费。这就是说,你可以按照实际需要的存储空间或者运算能力购买云服务。这是云服务诞生之初的“电厂模式阶段”就提出的理念,即把计算能力当做像水、电这样的产品来出售。现在基本已经变成现实,而在未来,个人用户也将慢慢感受到这种全新方式给生活带来的改变。

    讲了这么多云计算,那么云计算和物联网是是怎么结合起来的呢?前面我们已经提到,我们的物联网设备只需要能够联网,云计算就能够通过网络为我们的设备提供数据处理能力。其次,大数据的运用对物联网来说十分重要,而云计算和大数据分析就像一枚硬币的两面密不可分。

    比如智能家居系统,其一部分运算其实就是依托云服务器,因为我们的家里面的数据处理中心(电脑或手机)没有必要一直保持开机状态。而更多的诸如交通系统、工厂制造系统、社区服务系统等等都将依托于私有云或者公有云的服务。除了这些,我们前面提到云计算还是打通各种物联网标准的有效手段,两个采用不同技术标准的设备也具有了互相交换数据的可能,简单说来,就像你在网上和一个外国人聊天,哪怕你不懂他的语言,只要通过相应的翻译软件,就能够理解对方的意思了。

云数据大数据分析

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP