中企动力 > 商学院 > 云计算集群
  • ?

    支撑云计算的五大关键技术

    青烟

    展开

    云计算系统运用了许多技术,其中以编程模型、数据管理技术、数据存储技术、虚拟化技术、云计算平台管理技术最为关键。

    (1)编程模型

    MapReduce是Google开发的java、Python、C++编程模型,它是一种简化的分布式编程模型和高效的任务调度模型,用于大规模数据集(大于1TB)的并行运算。严格的编程模型使云计算环境下的编程十分简单。MapReduce模式的思想是将要执行的问题分解成Map(映射)和Reduce(化简)的方式,先通过Map程序将数据切割成不相关的区块,分配(调度)给大量计算机处理,达到分布式运算的效果,再通过Reduce程序将结果汇整输出。

    (2)海量数据分布存储技术

    云计算系统由大量服务器组成,同时为大量用户服务,因此云计算系统采用分布式存储的方式存储数据,用冗余存储的方式保证数据的可靠性。云计算系统中广泛使用的数据存储系统是Google的GFS和Hadoop团队开发的GFS的开源实现HDFS。

    GFS即Google文件系统(GoogleFile

    System),是一个可扩展的分布式文件系统,用于大型的、分布式的、对大量数据进行访问的应用。GFS的设计思想不同于传统的文件系统,是针对大规模数据处理和Google应用特性而设计的。它运行于廉价的普通硬件上,但可以提供容错功能。它可以给大量的用户提供总体性能较高的服务。

    一个GFS集群由一个主服务器(master)和大量的块服务器(chunkserver)构成,并被许多客户(Client)访问。主服务器存储文件系统所以的元数据,包括名字空间、访问控制信息、从文件到块的映射以及块的当前位置。它也控制系统范围的活动,如块租约(lease)管理,孤儿块的垃圾收集,块服务器间的块迁移。主服务器定期通过HeartBeat消息与每一个块服务器通信,给块服务器传递指令并收集它的状态。GFS中的文件被切分为64MB的块并以冗余存储,每份数据在系统中保存3个以上备份。

    客户与主服务器的交换只限于对元数据的操作,所有数据方面的通信都直接和块服务器联系,这大大提高了系统的效率,防止主服务器负载过重。

    (3)海量数据管理技术

    云计算需要对分布的、海量的数据进行处理、分析,因此,数据管理技术必需能够高效的管理大量的数据。云计算系统中的数据管理技术主要是Google的BT(BigTable)数据管理技术和Hadoop团队开发的开源数据管理模块HBase。

    BT是建立在GFS,Scheduler,Lock

    Service和MapReduce之上的一个大型的分布式数据库,与传统的关系数据库不同,它把所有数据都作为对象来处理,形成一个巨大的表格,用来分布存储大规模结构化数据。

    Google的很多项目使用BT来存储数据,包括网页查询,Google

    earth和Google金融。这些应用程序对BT的要求各不相同:数据大小(从URL到网页到卫星图象)不同,反应速度不同(从后端的大批处理到实时数据服务)。对于不同的要求,BT都成功的提供了灵活高效的服务。

    (4)虚拟化技术

    通过虚拟化技术可实现软件应用与底层硬件相隔离,它包括将单个资源划分成多个虚拟资源的裂分模式,也包括将多个资源整合成一个虚拟资源的聚合模式。虚拟化技术根据对象可分成存储虚拟化、计算虚拟化、网络虚拟化等,计算虚拟化又分为系统级虚拟化、应用级虚拟化和桌面虚拟化。

    (5)云计算平台管理技术

    云计算资源规模庞大,服务器数量众多并分布在不同的地点,同时运行着数百种应用,如何有效的管理这些服务器,保证整个系统提供不间断的服务是巨大的挑战。

    云计算系统的平台管理技术能够使大量的服务器协同工作,方便的进行业务部署和开通,快速发现和恢复系统故障,通过自动化、智能化的手段实现大规模系统的可靠运营。

  • ?

    云计算通俗解释,什么叫云计算?

    Kemi

    展开

    云计算已经越来越为大众所熟知,那么云计算到底是什么呢?有没有云计算通俗解释呢?云计算是由分布式计算、并行处理、网格计算发展来的,是一种新兴的商业计算模型。目前,对于云计算的认识在不断的发展变化,云计算仍没有普遍一致的定义。

    云计算(Cloud Computing)是分布式计算(Distributed Computing)、并行计算(Parallel Computing)、效用计算(Utility Computing)、 网络存储(Network Storage Technologies)、虚拟化(Virtualization)、负载均衡(Load Balance)、热备冗余(High Available)等传统计算机和网络技术发展融合的产物。

    云计算早期,就是简单一点的分布式计算,解决任务分发,计算结果合并就好了。也曾经还有一个别名,叫网格计算。很多大企业早期可能也只是想解决自己的效率与计算问题,到后来,这些大佬发现,这个能力也可以提供给外部使用,所以,就出现了公共云(public cloud)计算 ,把计算机的计算能力直接放在网上卖出去。

    小编倒是觉得,阿里云提出来的水电煤基础设施能更好的解释云计算是什么,未来的云计算,就像我们使用水电煤气一样,我们从来不会想着去建电厂,也不关心电厂在哪里,只要插上插头,就能用电。所以,真正的云计算一定有这些重要的基础条件:

    计算资源的虚拟化,按计算能力购买才是真正的云计算,目前的虚机嘛,嗯,看不到机器心里不踏实。云计算能力的弹性伸缩能力,一定是想用多少就是多少,不用的时候就不要,目前的专有云嘛,嗯,机器不放在我这里心里也不踏实。

    狭义的云计算指的是厂商依靠分布式计算和虚拟化技术搭建数据中心或超级计算机,以免费或按需租用方式向技术开发者或者企业客户提供数据存储、分析以及科学计算等服务,比如亚马逊数据仓库出租生意。

    广义的云计算指厂商依靠建立网络服务器集群,向各种不同类型客户提供在线软件服务、硬件租借、数据存储、计算分析等不同类型的服务。广义的云计算包括了更多的厂商和服务类型,例如国内用友、金蝶等管理软件厂商推出的在线财务软件,谷歌发布的Google应用程序套装等。

    通俗的理解是,云计算的“云“就是存在于互联网上的服务器集群上的资源,它包括硬件资源(服务器、存储器、CPU等)和软件资源(如应用软件、集成开发环境等),本地计算机只需要从互联网发送一个需求信息,远端就会有成千上万的计算机为你提供需要的资源并将结果返回到本地计算机,这样,本地计算机几乎不需要做什么,所有的处理都在云计算提供商所提供的计算机群来完成。

  • ?

    什么是集群?什么是分布式?什么又是SOA?

    房煜城

    展开

    Tips:“小鸟云”是深圳前海小鸟云计算有限公司旗下云计算品牌,国内领先的企业级云计算服务商。团队拥有多年行业经验,专注云计算技术研发,面向广大开发者、政企用户、金融机构等,提供基于智能云服务器的全方位云计算解决方案,为用户提供可信赖的企业级公有云服务。

    传统的系统架构就是经典的三层结构,就一个项目跑在一个tomcat中,但是随着用户数量的增加,一个服务器一个tomcat肯定是不靠谱的,如果乡村教师马云在杭州一个小地方,搞了一台服务器,一个tomcat,跑天猫的代码,然后让我们去访问,那我们估计是不可能看到网站首页的,一直处于宕机状态。哈哈!

    这时候可以使用集群的架构,就是说现在马云狠着买了5台服务器,每台服务器都跑天猫的代码,然后又搞了一个Nginx做负载均衡,这时候我们的请求由五台服务器完成的,第一次请求是第一台服务器响应,第二次请求是由第二台服务器响应,这样可以应对的并发量就是之前的5倍,马云很开心,美滋滋。

    总结:多台服务器跑的都是一套完整的代码,这就叫集群。

    随着淘宝的做大,功能也日益完善,加了很多的功能,在把一个项目都让一套tomcat跑,tomcat说它也很累,能不能少跑点代码,这时候分布式系统架构就产生了,我们把天猫这个大项目按功能划分为很多的模块,比如说单独一个系统处理订单,一个处理用户登录,一个处理后台等等,然后每一子系统都单独跑在一个tomcat中,和起来就是一个完整的天猫项目,这样对每一个tomcat就相对轻松一点。(如果某个子系统的压力还是很多,可以考虑对这个子系统再做集群)

    总结:多台服务器合起来跑的才是一套完整代码,这就叫分布式。

    SOA:Service Oriented Architecture面向服务的架构。也就是把工程拆分成服务层、表现层两个工程。服务层中包含业务逻辑,只需要对外提供服务即可。表现层只需要处理和页面的交互,业务逻辑都是调用服务层的服务来实现。

    这样做的好处就是,系统之间的调用很方便,A系统要用到B系统,直接调用B系统的服务层就可以了。

    总结:在分布式这种横向拆分的基础上又做了纵向拆分。就变成SOA架构。

    SOA:Service Oriented Architecture面向服务的架构。也就是把工程拆分成服务层、表现层两个工程。服务层中包含业务逻辑,只需要对外提供服务即可。表现层只需要处理和页面的交互,业务逻辑都是调用服务层的服务来实现。

    这样做的好处就是,系统之间的调用很方便,A系统要用到B系统,直接调用B系统的服务层就可以了。

  • ?

    2018年五个云计算趋势

    祝鹏煊

    展开

    你会在未来一年期待什么?IT部门的领导和云专家表示,多云和容器的将会迎来巨大的增长。

    云计算将会是新的常态,但这并不意味着它是不变的。相反,云计算和相关技术,实践,比如容器、微服务架构、DevOps等等将继续以惊人的速度发生变化。

    随着2018年的到来,我们邀请了一些IT领导者和云专家,分享在未来的一年他们对云及相关领域的期望。请阅读下面5个对云的发展趋势的预测:

    1. 多云将成为主流 - 开源是可移植的推动者

    Heptio首席执行官兼联合创始人Craub McLuckie是Kubernetes最初的开发人员之一,他认为2018年将是多云策略成为IT常态的一年,特别是那些现在对自己的初始云环境充满信心的组织,希望能增加第二个,第三个,或者说更多,(你懂的。。。。)

    McLuckie说:“大多数企业现在都在云中运行工作负载,许多企业正在开始评估他们的第二个云提供商是谁?

    正如红帽通用管理战略部门的亚历山德罗·佩里利(Alessandro Perilli)在今年早些时候指出的那样,这是一个自然而然执行多云、多供应商策略的时代。

    Perilli建议说:“大多数公司都是以这种方式开始的,即从管理每个单一的供应商开始,之后快速获得投资回报并建立下一阶段所需的专业知识。

    McLuckie指出,寻求扩展到其他平台和环境的原因因不同组织而异,它们都导致了相同的基本结果:多云。“在某些情况下,这只是一个采购政策问题,那些规模大的公司很少会依靠单一的供应商。在其他情况下,企业可以看到其它提供商提供的解决方案中潜在的服务质量,能力或价格优势。”

    为了实现这些好处 ,快速进行工作负载的迁移和优化的想法,开源将需要扮演主角,McLuckie说。

    他解释说:“开源技术本质上将成为一个重要的考虑因素,因为它是避免被供应商锁定到特定环境的一种方法。“更复杂的组织将开始重视与开源社区建立更紧密的关系,以此来满足他们的需求。”

    2. IT将从使用云转向优化云

    OneNeck IT Solutions咨询顾问和产品管理副总裁Jeff Budge表示,2018年的云计算也将成为一个阶段,从使用云转向优化云。

    Budge说:“优化将出现在许多不同的层面,包括成本,多云治理和管理以及数据优化。

    云计算成本已经是一个重要的话题,但是Budge预计,IT领导者明年将对它们进行优化和管理,尤其是在云策略成熟的情况下。

    同样,随着多云环境的激增,人们越来越重视所有这些问题:我们如何管理所有这些问题?

    Budge说:“随着客户在云计算之旅中的进步,他们意识到需要混合云来满足他们公司的需求。“在当前,这通常意味着这种混合云的管理涉及到从A供应商的云端控制台切换到B供应商的云端控制台。

    Budge预测,明年统一的云管理工具领域将会成为热门话题。

    Budge预计,特别是跨多种云组合的数据优化将成为重中之重:“数据整合,数据隔离,数据安全,数据加密,数据!数据!数据!”,Budge说。“随着公司正在为他们的应用程序组合确定正确的云组合,将会对数据的影响产生巨大的推动作用。”

    3. 混合云继续扩展并推动相关领域

    Tech Data全球云解决方案高级副总裁Sergio Farache表示,随着数字转换和边缘计算等趋势的不断发展,混合云模式的情况可能会在许多IT部门内部增长。

    Farache说:“从通信成本,知识产权,应用程序接近用户和可靠性等几个方面,都需要混合计算环境。

    Webair首席技术官Sagi Brody说:“企业的数据和应用程序越来越多地在内部平台、SaaS、IaaS和边缘物联网之间传播。换句话说,混合信息技术正在成为生活中的一个事实。“

    因此,布罗迪指出,IT领导者及其团队需要管理比以往更广泛的产品组合,这可能需要做出明智的决定,决定在内部保留什么和那些需要迁移到其他地方。

    Brody说:“首席信息官和首席技术官必须慎重决定未来混合IT环境的哪些方面应该在内部进行管理和协调,以及他们可能更倾向于将责任和义务转移到第三方。”

    4. 容器,编排和微服务将成为主流技术

    容器,编排和微服务一直是IT界的热门话题; 预计这一话题将在未来一年转化为更广泛的应用。

    “随着云计算的不断发展,我们将看到微服务架构和容器编排技术成为主流,” CloudBees的高级顾问Viktor Farcic说。

    三者之间的关系是非常共生的 - 容器和微服务就像牛奶和面包一样聚集在一起,编排工具使一切都可以管理 - 这就是为什么我们会看到他们的使用率相互提高。

    Farcic说:“我们已经看到企业正在转向基于微服务的体系结构,但是当使用传统方法进行打包和部署时,微服务可能是昂贵而复杂的。这就是为什么我们会看到容器的持续增长,“,并补充,Kubernetes将巩固其作为主要领导者的地位。“Kubernetes将成为集群计算的标准。2018年将是Kubernetes及其生态系统的一年。我们将看到许多软件供应商将基于Kubernetes生态系统的支持策略建立起来,几乎每个人都会采用Kubernetes或者提供基于它的解决方案。“

    Heptio公司的McLuckie公司也有类似的预测,因为容器和编排正好到了软件供应商开始提供容器解决方案的时间点,在集成和其他任务时为客户节省了时间和金钱。

    “在2018年期间,随着容器日益成为主流,Linux应用程序容器OCI和Kubernetes认证计划等标准化计划开始在行业内发挥作用,越来越多的传统软件供应商开始越来越多地将相关技术视为他们的解决方案的起点,“McLuckie说。“我们将开始看到越来越多的解决方案被打包为容器进行交付和动态管理,这些产品建立在容器和调度器的生态系统之上。”

    Retriever Communications公司首席技术官Nic Grange 也预计Kubernetes今年将冲击IT主流,特别是在混合云环境中,部分原因在于工作负载的可移植性。Grange还指出,IT团队开始使用容器和微服务而不必立即在云环境中运行它们,或者根本不需要在云环境中运行它们,但是如果他们决定稍后迁移这些应用程序,也会更容易。

    Grange说:“大多数IT部门习惯于直接将应用程序部署到操作系统上,但是像Kubernetes这样的技术提升了抽象级别,这使得在本地和云之间移动应用程序变得更加容易。“IT部门必须适应这一点,通过降低改变方向的成本,让他们的业务具有竞争力并对市场变化作出反应。”

    灵活性也是另一个重要原因,也是支撑多云战略和混合云环境发展的原因。IT领导人非常清楚将工作负载与适当环境相匹配的重要性。SAS首席信息官基思·柯林斯(Keith Collins) 指出,你可以简单地将传统应用程序封装在容器中,将工作负载迁移到公有云上,这在许多IT部门中并不存在。相反,IT领导者需要仔细的去匹配工作负载和各种环境。

    5.CIO需学会以精益的方式扩展DevOps

    随着DevOps与云并行发展,Rainforest QA首席信息官Derek Choy预测同类IT领导者会面临越来越大的压力,去发掘潜能,而更快、更频繁地提供高质量服务 。

    “我们已经达到了DevOps采用的关键转折点。 Choy表示,CIO们将在2018年面临压力,确保他们的企业能够在不增加成本的情况下,高速和高质量的发布软件。 事实上,这是DevOps的一个关键承诺,但Choy指出,即使在DevOps商店中,软件开发生命周期的大部分仍然是人力密集型的。 随着团队接受像Kubernetes这样的自动化和云原生工具,希望团队能够更大规模地交付,而不必增加大量新的人员。

    Choy说:“2018年,首席信息官将会考虑如何实现DevOps的自动化扩展,同时实现人员和招聘的业务目标。”

    作者:Kevin Casey | 2017年12月28 | Kevin为各种出版物撰写有关技术和商业的文章,曾获取Azbee奖。

    翻译:云星数据 | 2017年12月29日 |云星数据是国内领先的多云管理平台和服务提供商,也是全球混和云领导者RightScale在国内的唯一合作伙伴。其合作推出的多云管理平台RightCloud可以帮忙企业客户更好的构建多云体系,提供管控效率,大幅降低企业云成本。

  • ?

    云计算之Zookeeper—分布式服务协调利器

    侯念芹

    展开

    内容导读

    可扩展性 - 可以在需要时增加性能,通过添加更多机器,在应用程序配置中进行微小的更改,而不会有停机时间。ZooKeeper允许开发人员专注于核心应用程序逻辑,而不必担心应用程序的分布式特性。1.分布式协调过程操作简单上手快2.同步 - 服务器进程之间的相互排斥和协作。当会话由于任何原因结束时, 在该会话期间创建的临时节点也会被删除。监视是一种简单的机制,使客户端收到关于ZooKeeper集合中的更改的通知。下一个在线follower节点将检查是否存在其他具有最小数字的znode。

    1.ZooKeeper的产生

    ZooKeeper是一种分布式协调服务。在分布式环境中协调和管理服务是一个复杂的过程。

    分布式应用的优点

    可靠性 - 单个或几个系统的故障不会使整个系统出现故障。

    可扩展性 - 可以在需要时增加性能,通过添加更多机器,在应用程序配置中进行微小的更改,而不会有停机时间。

    透明性 - 隐藏系统的复杂性,并将其显示为单个实体/应用程序。

    分布式应用的挑战

    竞争条件 - 两个或多个机器尝试执行特定任务,实际上只需在任意给定时间由单个机器完成。例如,共享资源只能在任意给定时间由单个机器修改。

    死锁 - 两个或多个操作等待彼此无限期完成。

    不一致 - 数据的一致性。

    分布式应用程序提供了很多好处,但它们也抛出了一些复杂和难以解决的挑战。ZooKeeper通过其简单的架构和API解决了这个问题。ZooKeeper允许开发人员专注于核心应用程序逻辑,而不必担心应用程序的分布式特性。

    ZooKeeper的好处

    1.分布式协调过程操作简单上手快2.同步 - 服务器进程之间的相互排斥和协作。3.有序的消息4.序列化 - 根据特定规则对数据进行编码。确保应用程序运行一致。这种方法可以在MapReduce中用来协调队列以执行运行的线程。5.可靠性 -通过集群来保证可靠性6.原子性 - 数据转移完全成功或完全失败,但没有事务是部分的。

    2.ZooKeeper的基本架构

    看看下面的图表。它描述了ZooKeeper的“客户端-服务器架构”。

    49a262f02991463c5c91ac2d46ceb2b3.png

    Client(客户端)客户端,我们的分布式应用集群中的一个节点,从服务器访问信息。对于特定的时间间隔,每个客户端向服务器发送消息以使服务器知道客户端是活跃的。Server(服务器)服务器,我们的ZooKeeper总体中的一个节点,为客户端提供所有的服务。向客户端发送确认码以告知服务器是活跃的。ZooKeeper Service服务器组形成服务器组。所需的最小节点数为3。Leader服务器主节点,负责客户端的write类型的请求。Leader在服务启动时被选举。Follower负责客户端的read类型请求,并可以参与Leader的选举

    ZooKeeper的核心znode

    一个znode对应着一个客户端,每个客户端都可以在ZooKeeper文件系统中进行增删改查的文件操作,创建属于自己的znode文件节点,下图描述了用于内存表示的ZooKeeper文件系统的树结构。

    201612291345162031.jpg

    ZooKeeper数据模型中的每个znode都维护着一个 stat 结构。一个stat仅提供一个znode的元数据。它由版本号,操作控制列表(ACL),时间戳和数据长度组成。

    Znode的类型

    Znode被分为持久(persistent)节点,顺序(sequential)节点和临时(ephemeral)节点。

    持久节点 - 即使在创建该特定znode的客户端断开连接后,持久节点仍然存在。默认情况下,所有znode都是持久的。

    临时节点 - 客户端活跃时,临时节点就是有效的。当客户端与ZooKeeper集合断开连接时,临时节点会自动删除。因此,只有临时节点不允许有子节点。如果临时节点被删除,则下一个合适的节点将填充其位置。临时节点在leader选举中起着重要作用。

    顺序节点 - 顺序节点可以是持久的或临时的。当一个新的znode被创建为一个顺序节点时,ZooKeeper通过将10位的序列号附加到原始名称来设置znode的路径。例如,如果将具有路径 /myapp 的znode创建为顺序节点,则ZooKeeper会将路径更改为 /myapp0000000001 ,并将下一个序列号设置为0000000002。如果两个顺序节点是同时创建的,那么ZooKeeper不会对每个znode使用相同的数字。顺序节点在锁定和同步中起重要作用。

    每个znode互相之间可以通过和ZooKeeper连接session来watch其他znode或者整个文件系统,来达到分布式环境下的消息联通。其中两个重要概念就是session和watchSessions(会话)

    会话对于ZooKeeper的操作非常重要。一旦客户端连接到服务器,将建立会话并向客户端分配会话ID 。客户端以特定的时间间隔发送心跳以保持会话有效。如果ZooKeeper集合在超过服务器开启时指定的期间(会话超时)都没有从客户端接收到心跳,则它会判定客户端死机。会话超时通常以毫秒为单位。当会话由于任何原因结束时,在该会话期间创建的临时节点也会被删除。

    Watches(监视)

    监视是一种简单的机制,使客户端收到关于ZooKeeper集合中的更改的通知。客户端可以在读取特定znode时设置Watches。Watches会向注册的客户端发送任何znode(客户端注册表)更改的通知。Znode更改是与znode相关的数据的修改或znode的子项中的更改。只触发一次watches。如果客户端想要再次通知,则必须通过另一个读取操作来完成。当连接会话过期时,客户端将与服务器断开连接,相关的watches也将被删除。

    Znode leader选举

    让我们分析如何在ZooKeeper集合中选举leader节点。考虑一个集群中有N个节点。leader选举的过程如下:

    1.所有节点创建具有相同路径 /app/leader_election/guid_ 的顺序、临时节点。ZooKeeper集合将附加10位序列号到路径,创建的znode将是 /app/leader_election/guid_0000000001,/app/leader_election/guid_0000000002等。

    2.对于给定的实例,在znode中创建最小数字的节点成为leader,而所有其他节点是follower。

    3.每个follower节点监视下一个具有最小数字的znode。例如,创建znode/app/leader_election/guid_0000000008的节点将监视znode/app/leader_election/guid_0000000007,创建znode/app/leader_election/guid_0000000007的节点将监视znode/app/leader_election/guid_0000000006。

    4.如果leader关闭,则其相应的znode/app/leader_electionN会被删除。下一个在线follower节点将通过监视器获得关于leader移除的通知。下一个在线follower节点将检查是否存在其他具有最小数字的znode。如果没有,那么它将承担leader的角色。否则,它找到的创建具有最小数字的znode的节点将作为leader。

    5.类似地,所有其他follower节点选举创建具有最小数字的znode的节点作为leader。leader选举是一个复杂的过程,但ZooKeeper服务使它非常简单。

    ZooKeeper提供的功能

    Apache ZooKeeper是由集群(节点组)使用的一种服务,用于在自身之间协调,并通过稳健的同步技术维护共享数据。ZooKeeper本身是一个分布式应用程序,为写入分布式应用程序提供服务。ZooKeeper提供的常见服务如下 :

    命名服务 - 按名称标识集群中的节点。它类似于DNS,但仅对于节点。配置管理 - 加入节点的最近的和最新的系统配置信息。集群管理 - 实时地在集群和节点状态中加入/离开节点。选举算法 - 选举一个节点作为协调目的的leader。锁定和同步服务 - 在修改数据的同时锁定数据。

    命名服务通过ZooKeeper默认的文件系统得到解决配置管理和集群管理通过znode的数据存储得到解决选举算法和锁服务通过ZooKeeper的顺序节点的不重名得到解决

  • ?

    云计算华东基地:打造安全便利的“数字工厂”

    wqh

    展开

    3年前,云计算对大众来说还是一个非常陌生的概念,云靠不靠谱?把数据放在云端上安不安全?……而3年后的今天,作为已建成的华东地区最大的云计算基地,大大满足了周边企业商户乃至华东地区云业务的使用需求。钟楼这座“数字工厂”正发挥着不可估量的作用。

    日前,记者探访了钟楼经济开发区云计算华东基地,一期项目自2016年试运行以来,以基地为核心辐射整个华东地区,建立了高安全的“云端”工厂,便利了企业信息的存储、计算及互联网业务发布,促进区域产业升级。

    依托平台集聚大数据产业发展

    云计算华东基地由常州云路互联科技有限公司投资建设,基地位于常州钟楼经济开发区内,四至范围:梧桐路以南、桂花路以西、棕榈路以北、京杭大运河以东,占地82亩,总建筑面积9万平方米,其中包括4栋云计算数据中心机楼(每栋6层,建筑面积19500平方米,每栋设计安装机柜为3000个)、1栋10000平方米的办公综合楼以及1座22万伏变电站。

    据介绍,整个云计算基地能容纳1.2万个机柜,约能提供20至30万台云主机服务器处理能力。项目将重点围绕健康医疗大数据中心国家级平台,打造医疗卫生数据中心、研究中心、展示中心和产业孵化中心。着力引进云大物移新兴产业集聚发展,将基地打造成华东地区乃至全国重要的云计算、云储存产业生态圈。

    架起华东地区的“智慧高速路”

    基地IT运维部负责人黄俊德向记者介绍,云计算基地相当于IT资源集群,当许多公司不能满足自我储存需求的时候,就可以使用基地的IT资源来进行存储和快速业务部署,整个基地就是大数据中心。“特别是一些公司拥有海量的数据,就不必花费额外的财力物力来建立储存中心。我们提供TB级的网络带宽,客户数据业务存储提取都很方便,像某知名游戏加速业务就从我们机房发布,供常州和周边用户实时获取在线游戏内容。此外,云计算基地具有全套网安信安网络架构,可全面可靠保证云数据的安全,很多金融机构都是我们的客户。”目前,1栋数据中心与中国移动合作运营,其他3栋正在与中国电信等洽谈合作。

    记者跟随负责人走进IDC机房:“这是服务器、交换机、存储设备等,数据在这里汇集、分流,再由互联网传播出去。”黄俊德继续说道,“整个云计算架构就像一棵大树,伸展为很多树杈,即使有机器突然中断了,也有其他的机器能够支撑,不会出现单点故障,极大地提升了客户使用云计算资源的访问速度和访问质量。”据了解,1期运营的数据中心目前已经有19家企业入驻,涉及电商业务,游戏加速业务,cdn加速业务,银行、金融代理业务,云计算大数据分析计算业务、网络新闻媒体业务等。

    此外,整个基地机柜全年24小时运行,为找到设备的最佳生存环境,就需要机房保持恒温,及时冷却散热,所以云计算基地耗电很大。“按照10000个机柜全部运行来计算的话,预计可能每年电费就达几亿元。”为此,钟楼经济开发区引入华润分布式能源项目,建设冷、热、电三联供的分布式能源综合利用系统,年发电量6.5亿度。届时可以与云计算华东基地形成联动,在电力资源及冷源供应达到最佳效益,从而促使基地在服务能力和节能指标上成为国内的标杆。

    王可人/文 顾克琦/摄

  • ?

    云计算网络基础架构的实践和演进——打造云计算网络基石

    Jacinthe

    展开

    更多深度文章,请关注云计算频道:https://yq.aliyun/cloud

    摘要:从传统IT部署到云,人肉运维已经是过去式,云上运维该怎么开展?人工智能对于运维“威胁论”也随之袭来,如何去做更智能的活,当下很多运维人在不断思考和探寻答案。在2017云栖社区运维/DevOps在线技术峰会上,阿里云专家云登就为大家分享了云计算网络基础架构的实践和演进,精彩不容错过。

    以下内容根据演讲视频以及PPT整理而成。

    众所周知,云计算是以计算、存储和网络作为基础的。网络作为云计算的重要基石之一,其架构设计和演进是云计算发展的重要一环,而网络架构涉及可靠性、性能、可扩展性等多方面内容。架构是从理论设计开始的,理论设计和实践碰撞到一起,能否经得住考验,是否能够符合预期呢?厂商所提供的网络设备的高级特性真的是解决问题的银弹么?如何通过经典网络和VPC构建混合云,打通云上和云下呢?阿里云在以往的实践以及与用户的交互碰撞中遇到的问题又是如何解决的呢?本次分享中将与大家一起进行探讨。

    本次分享的目录

    一、常见的云计算网络架构

    二、云计算网络的可靠性和故障定界

    三、专有云网络的模块化

    四、混合云构建的并网案例

    五、云网络架构的演进趋势

    下图所展示是一种常见的云计算网络集群架构。传统情况下云计算网络架构会分为三层:接入层、汇聚层和核心层。如下图所示,在接入层下面的两台交换机会进行堆叠,再下面会连接服务器,服务器一般会选择使用两个网卡进行bond之后以双上连的方式连接到2台接入交换机。在接入交换机和汇聚交换机之间也会有多条线路的连接,一般而言会存在二层或者三层的接入。对于带宽收敛比的设计而言,对于千兆集群可以采用1:1无收敛的方式,而对于万兆集群则可以使用收敛比为1:3或者1:2的方案,也可能使用无收敛的设计。从汇聚层再向上连接到核心层,一般情况会使用三层连接。

    下图是另外一种比较常见的云计算网络集群架构,在Spine节点和Leaf节点之间可能会存在三层连接,而Spine节点和Core节点之间也可能会存在三层连接,这种网络架构相比于前面提到的架构而言,其扩展粒度要更细,可以细化到一组或者多组进行接入。

    想必大家对于Overlay以及Underlay网络都有所了解,物理网络被称为Underlay网络,物理网络搭建完成之后应该尽量保证网络拓扑是固定的;而对于Overlay的网络而言,可以基于VXLAN技术构建VPC网络,通过软件定义和控制器的方式可以动态地构建虚拟的网络。所构建的网络可以是一个或多个虚拟的网络,可以通过云上不同的租户去定义地址规划以及路由的规划,甚至还可以提供类似于高速通道这样跨VPC之间的互通。Underlay网络的设计基本上就是前面所提到的接入-汇聚-核心架构以及Spine-Leaf架构,而对于Overlay的网络则描述的是虚拟的层面,提供的实际上是虚拟的路由器和虚拟的交换机,包括其构建出来的可以接入像SLB、RDS、ECS、OCS等云产品的VPC容器。为什么叫做Overlay呢?其实因为Overlay网络是通过VXLAN隧道的封装运行在Underlay物理网络之上的。通过Overlay逻辑网关去组织业务进行资源编排就可以构建出非常丰富的基于Overlay网络的产品。

    前面主要介绍了云计算网络的一些基础概念,接下来将会针对云计算网络的可靠性以及故障定位的方式进行分享。

    对于云计算平台的物理网络而言,其可靠性可以分为以下的几类:

    多线路,常见二层的LACP,也就是链路聚合,对于三层则使用等价路由。设备HA,从体系结构来讲,分布式的多框、多插槽的设备能够提供多主控、多接口板这样的方式,还可以提供类似于堆叠技术和多机之间的双机热备以及多机的备份或者多机堆叠的方式,还可以提供VRRP的链路切换。探测和切换机制,实际上在网络配置交付之后,如果远端出现了问题,为了解决链路上的负载均衡以及主备切换的问题,可以引入比如NQA+Track这样的探测技术,这样可以针对静态路由的配置通过不同的优先级和NQA探测方式发现远端节点不可达的时候进行路由切换。除此之外,在探索到某台设备出现故障的时候就可以进行故障隔离,可以实现端口级或者设备级的故障隔离,保证流量可以走备份或者冗余链路进而避免流量中断,当然,这种情况下可能对于流量带宽造成一定的损失。巡检和监测,针对于Overlay和Underlay的网络会提供主动探测的机制,还有对于设备的日常日志告警的分析。设备在运行中往往会报很多的日志和告警,将这些信息收集起来之后结合云平台的业务流量可以挖掘出很多故障的可能性、已经出现的故障还有对于未来可能出现故障的预判。还可以进行流量分析,并且基于此判断云平台的网络是否出现了一些问题。

    如下图所示的是常见的网络集群故障点分布图,云计算平台的网络故障点主要集中在下图中标号的几个位置:

    标号1:线路故障,比如服务器上连到TOR交换机,也就是服务器上的接入网卡接入到交换机上时出现了网卡、线路或者是接入端口损坏导致线路上出现故障。同样的,从接入层到汇聚层,从汇聚层到核心层也会出现这样的线路故障。标号2:核心设备的故障,核心设备的故障可能导致跨网络端口之间的流量损失,由此造成的影响范围往往比较大。对图中所示的网络架构而言,如果流量需要跨端口进行传输,就一定需要从接入层到汇聚层再到核心层再转入另外一个POD的汇聚层。标号3:汇聚交换机的故障,一般情况下汇聚交换机采用堆叠的方式,可能会出现堆叠的分裂以及单台设备的故障,也可能出现整个端口流量上行的带宽减半或者是分裂以后导致等一些不可预期的后果,因此需要及时检测出一些故障并且及时进行隔离以及对于设备进行下线维修从而排除此类故障。标号4:接入交换机的故障,接入交换机也会发生类似于汇聚交换机的故障,堆叠分裂或者单机故障则会导致下面连接的服务器出现问题。标号5:服务器故障。标号6和7:像上述提到的堆叠出现问题造成的故障,这样的故障需要通过日常的巡检以及网络设备自身报告故障的日志告警来发现问题并及时去进行相应的处理。

    以下是对于常见的网络集群故障点的详细描述:

    线路故障。体现为带宽的损失,一般通过多条线路保障,三层网络设备间通常用ECMP等价路由,二层网络设备间通常采用聚合LACP,提高可靠性。在实际情况下,在公有云环境中会发现:一旦网络集群规模大了之后,堆叠出现问题的概率就会变大,与此同时,二层的广播风暴和环路出现的概率也会变大,阿里云目前在逐步地考虑去掉堆叠并且去掉二层,这也可能是未来的发展方向。这样的目的是为了简化网络并提高网络集群的可靠性。DSW故障。DSW是对于核心设备的称呼,由于所有的DSW之间不直接互联,它本身的可靠性只能依靠硬件框式分布式,多主控板(主备HA)、多接口板(上面说的多线路跨板连接)来保证单点可靠性,使用多台DSW,平时负载均衡,单台故障时互为备份链路。如果是单台DSW故障,将会影响带宽损失。PSW故障。也就是汇聚设备的故障,拓扑中有PSW堆叠和去堆叠两种情况,如果是堆叠的,单台故障,上下连线依靠跨堆叠设备的LACP或者ECMP实现业务不中断(但带宽有损失),如果不是堆叠的,参考(2)的场景。如果是单台PSW故障,影响的是下连的多组ASW带宽损失一半。ASW故障。线上很多的ASW都是堆叠的,目前阿里云也开始去堆叠,如果是堆叠的,ASW下连服务器,服务器双网卡bond接入(LACP),如果是去堆叠的ASW,服务器双网卡等价路由负载均衡。如果单台ASW故障,影响的是下连的48台服务器的带宽损失一半。未来,阿里云新构建的集群会逐渐减少对于堆叠的使用,进而提高网络设备的可靠性。其实对于网络厂商而言,他们也会对于堆叠特性进行大量的测试,但是实际上由于堆叠特性十分复杂,因为其涉及到硬件、软件、内部检测以及协议的传输备份,也就是会涉及到很多跨框、跨设备的同步以及选举机制。由于堆叠特性实现本身就非常复杂,就会导致出现问题的可能性比像路由转发这样其他简单特性更高。而在云计算场景下海量的网络设备同时运行,就进一步提升了堆叠特性出现问题的可能性,基本上就会导致出现存在堆叠的场景下可能经常会出现问题。为了解决这样的问题就需要逐步地去除堆叠和二层。服务器故障。可能体现在服务器网卡或者本身内部的应用系统的问题,服务器故障一般只会影响自己,范围比较小。PSW堆叠分裂。各自认为自己是主设备,为了减小影响,一般会配置DAD双主检测,禁掉一边,影响为整个pod的上联带宽和跨asw之间转发带宽损失一半。如果PSW堆叠整体故障,整个pod挂掉(各组ASW下的48台服务器之间仍可互通),上连不通,跨asw的互连不通。ASW堆叠分裂。类似于(6),影响为一组ASW下挂的48台服务器的互联或者上联带宽损失一半。如果ASW堆叠整体故障,该组ASW下连的48台服务器全部不通。对于(6)(7)的堆叠故障,由于厂商堆叠技术本身复杂,导致故障概率提升,再加上公共云使用的网络设备规模大,基数上去了就进一步放大出故障的概率,且影响范围大。因此网络本身的可靠性和故障位置,对于云产品来说影响的范围也是不同的,ecs之类的云产品能够打散到不同的ASW、POD甚至AZ(跨网络集群),其可靠性指标也是不同的。基本上是打散的网络设备之间的层级越高,可靠性保证越高,但同样的网络延迟也越高。

    那么怎样才能够及早地发现这些故障呢?其实可以使用故障主动探测的模型。在网络集群里面,可能会选择特定的接入设备比如像服务器,将其作为主动探测的机器,其探测的目标就是网络设备下面的其他服务器。

    建立的第一个简单故障主动探测的模型如下:

    一个TOR下面所有物理服务器(例如48台)都同时出现大量丢包-->TOR交换机故障。个别物理服务器出现丢包-->服务器负载问题/TOR交换机端口队列打满。到某个机房的大量物理服务器同时出现大量丢包-->汇聚交换机/核心交换机故障。到某个机房的大量物理服务器出现少量概率丢包->汇聚交换机/核心交换机的个别端口问题。每个机房最少只需要1台机器作为探测源,部署对业务网络影响小,ICMPping之类的只能做Layer3的探测。

    依照上述的故障主动探测模型就可以简单地判断网络出现故障的范围。

    建立的第二个简单故障主动探测的模型如下:

    通过选择不同位置的服务器作为探测源或者探测目标,发现不同层次的故障位置,多轮次组合。要求每台服务器运行agent,并接受外部控制器指令,动态调整探测策略,可建立TCP连接并测试。可以针对overlay和underlay网络进行探测,更容易模拟实际应用的业务流量特征,支持Layer4探测、时延计算。

    第二个故障主动探测模型在服务器内部会增加一些代理Agent,安装代理之后可以做到对于4到7层的探测,可以探测出TCP连接的情况以及其延迟和性能速率。同样的,探测模型也可以组合出不同的探测方式,在了解网络架构的拓扑之后就可以探测位于同一组接入交换机下面的两台或者多台服务器,也可以探测位于不同的核心交换机或者汇聚交换机下面的多台服务器。通过这种建模方式就可以知道当前延迟高或者丢包的场景下,网络的问题到底出现在什么位置。

    上述提到的是网络体现在本身体系结构上的可靠性,比如分布式设备、支持主备HA、支持双机热备或者多机堆叠以及其他一些高级特性,这些都是从网络设备本身的角度而言的。除此之外,通过线路带宽的设计保证收敛比以及负载均衡,以此来保证云计算网络的可靠性。而通过日常的巡检和探测能够及时地发现故障,并在故障发生之后及时了解故障发生的具体原因并提供故障定位的方式,进而提高云平台网络的可靠性。

    上述这些都是在公有云网络上的实践,对于专有云而言,又会存在什么样的差别呢?其实对于专有云而言,更多地会对其进行模块化的设计。公有云一般而言是可规划的,可以对于未来集群的规模、建设的地域以及网络架构的选择等进行规划。而对于专有云而言,客户的需求往往不能够规划出来,不同的客户所需要的业务的场景和诉求往往是不同的,这些在网络设备的选型、已有设备的利旧使用以及对于云平台功能的裁剪上都会有所体现,所以专有云与公有云上的的网络设计就存在较大的差别。

    下图是专有云网络架构图,一个很明显的特点就是专有云网络会分成几个区域,最上面的是外部接入区,外部接入区包含了阿里云和ISP或者用户骨干网出口的链接以及在其上进行安全防护的云盾。专有云网络架构图中间的DSW和下部的PSW则属于DC区,也就是网络架构的核心区域。图中右面的综合接入区分为了两个部分,一部分是阿里云所提供的负载均衡、VPC网关以及OPS相关的接入,另外一部分则是CSW,实际上就是客户的VPC专线接入区,阿里云的专有云客户会有一些原来的物理网络需要与云上的VPC进行网络打通,一般会通过VPC的专线接入交换机的综合交换机接入进来。也就是说专有云网络的每一个模块都有一个相对独立的设计,所有的模...

  • ?

    云计算那么强大,为何还需要负载均衡?

    秦天德

    展开

    在互联网快速发展的今天,“云计算改变生活”早已不是一句口号了。通过云端实现的各种智能产品越来越多的进入我们日常生活,智能手表、智能汽车、智能家居、智能建站等智能化产物的层出不穷,都不同程度地说明了云计算的强大。

    应用:从智能生活到工业物联网

    除了常见的智能手表、智能汽车等产品以外,其实云计算的应用领域非常广泛。无论是家里的温控器还是高清电视上的智能电影推荐,又或者是改善城市居民生活条件的智慧城市,甚至可以说一切可以变得“智能化”的产品设备软件都是在云端上运行的,它们都是由云上运行的分析引擎驱动。

    而除了“智能化”以外,云计算还可用于物联网(IoT)领域,尤其是工业物联网。这指的是工业机械将与互联网连接,把数据传输到云中,以获得有关使用情况的洞察、提高效率,避免停机。

    功能:“超级计算机”按需配置资源

    云计算能够广泛运用于生活的各个层面,当然与其强大的功能有关。要了解云计算的功能,就需从云计算的本质入手。云计算就是把计算资源放在网络里,将网络里的计算机虚拟成一台前所未有的“超级计算机”。

    云计算的本质特征是按需提供计算服务,而不是事先配置资源,它的计算能力可以动态伸缩。而传统的数据中心只能按照最大流量来配置,但事实上它的平均利用率只有15-20%。由于规模经济性和众多新技术、新方法的运用,加之共享使用可以大大提升资源利用率,云计算的性价比较传统模式提高了30倍以上。

    云计算+负载均衡才完美

    正是因为云计算功能强大,才使得其在社会生活的方方面面均有广泛应用。然而,不管今天的云计算有多么真实和强大,要实现应用程序在云平台间的自动分配,自由切换,负载均衡就不可或缺。

    负载均衡是一种基础的网络服务,其原理是通过运行在前面的负载均衡服务,按照指定的负载均衡算法,将流量分配到后端服务集群上,从而为系统提供并行扩展的能力。负载均衡建立在现有网络结构之上,它提供了一种廉价有效透明的方法扩展网络设备和服务器的带宽、增加吞吐量、加强网络数据处理能力、提高网络的灵活性和可用性。

    目前,小鸟云负载均衡服务,可在多个实例间自动分配应用程序的对外服务能力,通过消除单点故障提升应用系统的可用性,让您实现更高水平的应用程序容错能力,从而无缝提供分配应用程序流量所需的负载均衡容量,为您提供高效、稳定、安全的服务。

  • ?

    云计算的基本原理

    龚以寒

    展开

    云计算(英语:Cloud Computing),是一种基于互联网的计算方式,通过这种方式,共享的软硬件资源和信息可以按需求提供给计算机和其他设备。云是网络、互联网的一种比喻说法。过去在图中往往用云来表示电信网,后来也用来表示互联网和底层基础设施的抽象。云计算是继1980年代大型计算机到客户端-服务器的大转变之后的又一种巨变。用户不再需要了解“云”中基础设施的细节,不必具有相应的专业知识,也无需直接进行控制。云计算描述了一种基于互联网的新的IT服务增加、使用和交付模式,通常涉及通过互联网来提供动态易扩展而且经常是虚拟化的资源,它意味着计算能力也可作为一种商品通过互联网进行流通。

    Wiki定义:云计算是一种通过Internet以服务的方式提供动态可伸缩的虚拟化的资源的计算模式。原文:Cloud computing is a style of computing in which dynamically scalable and offer virtualized resources are provided as a service over the Internet.美国国家标准与技术研究院(NIST)定义:云计算是一种按使用量付费的模式,这种模式提供可用的、便捷的、按需的网络访问, 进入可配置的计算资源共享池(资源包括网络,服务器,存储,应用软件,服务),这些资源能够被快速提供,只需投入很少的管理工作,或与服务供应商进行很少的交互。“云计算”概念被大量运用到生产环境中,国内的“阿里云”与云谷公司的XenSystem,以及在国外已经非常成熟的Intel 和IBM,各种“云计算”的应服务范围正日渐扩大,影响力也无可估量。原文:Cloud computing is a model for enabling ubiquitous, convenient, on-demand network access to a shared pool of configurable computing resources (e.g., networks, servers, storage, applications, and services) that can be rapidly provisioned and released with minimal management effort or service provider interaction.

    云计算常与网格计算、效用计算、自主计算相混淆。网格计算:分布式计算的一种,由一群松散耦合的计算机组成的一个超级虚拟计算机,常用来执行一些大型任务;效用计算:IT资源的一种打包和计费方式,比如按照计算、存储分别计量费用,像传统的电力等公共设施一样;自主计算:具有自我管理功能的计算机系统。事实上,许多云计算部署依赖于计算机集群(但与网格的组成、体系结构、目的、工作方式大相径庭),也吸收了自主计算和效用计算的特点。

云计算集群

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP