中企动力 > 商学院 > 数据中心恢复
  • ?

    数据中心网络快速排障

    Derrick

    展开

    当数据中心的网络规模变得很大时,不得不要增加网络设备,实现多层级联。现在的数据中心往往都是树形结构,核心放置几台转发容量超大的设备,然后下挂多层设备(因为端口数量不够,可能需要多层),数十台甚至几百台的网络设备级联到一起,一旦出了故障,如何能快速找到故障设备,经常困扰着很多网络运维人员。

    数据中心的网络设备都是有冗余的,只要网络故障时找到故障设备,将其隔离即可恢复业务,然后再去慢慢排查故障原因,但从数百台的设备中找到具体哪台故障绝非易事。网络故障往往先从应用侧得到故障反馈,然后开始排障,这时应用人员往往描述的只是一个应用访问故障现象,他不会告诉你具体哪些地址到哪些地址不通,有时甚至是错误的信息,这极大延误了问题定位时长。问题定位大部分时间都是花在故障现象的整理过程中,怎么办?数据中心网络该如何快速排障?本文将给出答案。

    网络故障如果要从应用侧反馈的故障现象去分析,这时已经晚了,而且容易被应用人员带入误区,有些应用人员反馈的现象只是他自己看到的,现象很可能只是一个局部现象,并不能反映出整个网络的故障情况。所以要靠自己,做好网络监控,通过监控去发现问题,从而迅速找到故障设备,做设备隔离或者解除故障。

    早期的网络监控主要是对设备的一些日志和端口流量做监控,更多的时候这些信息并不够,并不能及时发现问题。很多网络设备厂商说自己的设备日志非常完整,但实际使用时仍有一些极端情况或者软件BUG导致故障时无日志输出,这时就要针对流量进行定位。到了这个时候,就需要网络人员去找应用人员了解故障现象,通过现场找出一些丢包或者不通的IP地址来,然后进行网络流通,对这个故障流量经过的设备都做流通,找到故障设备。既然是树形网络,每一层都有很多设备,这个流通量是相当大的,而且并不是所有的设备都能支持对所有特征的流量做统计,有不支持的设备就会使得统计不准,加大了寻找故障设备的难度,做网络运维的这些年都是这样坚持过来的。

    显然,之前的网络排障方式有效但效率太低,定位故障时间长,对业务影响大。现在的网络监控都是针对数据流的,对网络中的具体数据流进行监控,这样一旦数据流量有中断,立即可以查明故障位置。在这里,要提到几种新兴的网络监控方法,也叫网络可视化技术,是快速排障的最有效方法。

    首先是INT(In-band Network Telemetry,带内网络遥测技术)技术,INT通过在数据层面收集和报告网络的状态来实现对网络状态的监控。当数据报文进入第一个网络设备时,设备上设置采样方式采样并镜像出该业务流报文,INT在报文基础上封装一个INT头,并将需要收集的交换机信息填入到INT数据段中,报文经过的所有网络设备均这样处理,直到最后一个服务器连接的网络设备将INT头剥离。

    报文经过的每台设备都将采集到的INT报文通过gRPC报文发送到远端的监控服务器进行解析和呈现,INT报文中携带了报文转发的延迟、设备拥塞等情况,都能呈现到监控服务器上,一旦数据报文出现丢包或者不通情况,监控服务器立即感知到,并几秒就能确定问题范围和故障设备。

    其次是ERSPAN(Encapsulated Remote Switch Port Analyzer,跨三层IP传输的远程网络流量监控技术),ERSPAN的报文基于GRE封装,并通过以太网转发到任何IP路由可达的地方。ERSPAN是将源端口报文复制一份通过GRE(Generic Routing Encapsulation)发送到目的服务器进行解析,采集服务器的物理位置不受限制,这样我们可以将整个网络的关键流量转发都通过ERSPAN发送到监控服务器上,流量在哪部分网络出现了丢弃,一目了然。第三是sFlow和Netstream,这两种都是数据采样技术,Netstream采集的比较完整,但需要有专用的硬件来完成,在网络中部署sFlow和Netstream后,可以通过gRPC将监控数据发给服务器,由监控服务器计算和整理,并将结果图形化显示出现,一旦哪部分网络有问题,立即可以在监控服务器上显现。

    sFlow和Netstream采集的都是报文头的主要特征,而不是报文整个内容,这个和INT、ERSPAN有较大区别,应对绝大部分网络故障排查都没有问题,除非应用报文特征比较特殊,Netstream捕捉不到,这时只能求助INT和ERSPAN。在一个网络中,并不介意三种监控方案都部署,这样在故障时,可以从多个角度采集的数据去分析问题。

    还有一点很重要,尽量要将这些数据采集通过管理网发向监控服务器,否则一旦数据网出问题,可能监控的数据也无法正常达到监控服务器。大部分情况下,数据网络故障很少波及到管理网,所有设备依然可以正常访问,如果故障时,很多设备都无法通过管理网进行访问,基本可以判定这台设备就是故障点。

    有了以上这些网络监控方法,出现故障时第一时间发现就不难了,而且完全可以实现自动化,当发现故障时,由监控服务器自动下发隔离命令,将故障设备隔离,自动恢复。这样在应用报障过来之前,就可以找到网络故障位置,及时隔离故障设备,恢复业务,这样可以极大缩短故障分析时间,对业务影响很小,甚至业务部分根本感知不到故障。像INT和ERSPAN这些网络监控的技术实际应用的效果还未知,都是最近总被提及的技术,还有待实践的考验。SFLOW和Netstream技术比较成熟,但真正在网络排障时用到的还不多,需要加大这方面的推广。

    依靠这些监控技术,可以快速排除网络故障,这对于数据中心运维来说,意义重大,极大地提升了运维效率。

  • ?

    数据中心电力中断了怎么办?你需要知道这五点

    念珍

    展开

    最近的几次数据中心停电造成非常最严重的停电事故。例如,美国达美航空公司数据中心的电力中断,造成该航空公司1.5亿美元的损失,美国"超级碗"的赛场断电,让主办方尴尬不已。而停电可能会随时影响任何人。

    然而,数据中心运营商所面临的困难是确定停电的根本原因,因为电力中断的原因比较复杂,例如,服务器负载过重,导致系统崩溃;当地电力供应商的供应问题,工作人员误操作的人为因素等。

    以下是数据中心运营商应该关注的五个最重要的问题,以确保不会发生数据中心停电事故。

    (1)可以随着快速发展的电力系统迁移吗?

    数据中心的不同阶段,对电力需求也在变化。服务器或交换机的添加都可能对电力的需求产生重大影响。因此,能够分析数据中心一段时间内对电力的需求是非常重要的,以便更容易地进行长期预测。

    (2)电源链是否受到威胁?

    越来越多的数据中心连接到网络,除了机架中包含的终端和访问点之外,很多渠道可能会成为破坏网路犯罪行为的破坏途径。

    此外,网络违规行为甚至不需要通过电线和电缆来实施。狡猾的犯罪分子可能会进入某个数据中心,破坏内部的电力供应。但是,不仅仅是外部的恶意人员所造成的危害,也要警惕数据中心内部工作人员的行为。有些知识和经验不足的工作人员在与接口进行交互的过程中犯错,也会造成不可估量的伤害。

    为了防止出现这种情况,运维文档和流程控制至关重要。采用更多的硬件不是防止灾难性停电的最佳选择,事实上,添加额外的硬件实际上可能使控制情况更加糟糕。

    (2)灾难恢复计划是什么?记录文档了吗?

    在不影响业务环境的情况下进行断电测试,实际上是采用虚拟开关设备,这将允许数据中心运营商可以应对最坏的情况,并实施恢复服务。

    数据中心工作人员总是假设他们的电源供应链和电源备份系统是万无一失的,但是如果没有故障安全测试,会认为面临什么样的结果?

    电源故障模拟使数据中心运营商可能找到缺乏冗余的设施,并发现单点故障。但是,这需要文档进行记录。

    因此,数据中心运营商在灾难性的电源故障之前,建立断电测试机制并记录其恢复过程。

    (4)可以实时监控操作吗?

    数据中心运营商必须知道哪些设备现在在哪里,使用了多少电能。对于不断增加基础架构的数据中心来说,这往往会很困难,因为这可能会对电源容量和电源分配产生巨大的影响。

    注意所有移动部件的唯一有效方法是单一视图。这种整体视图具有实时监控和警报的功能,使数据中心运营商能够减轻风险,并进行更改以避免灾难发生。

    (5)知道所有互连设备和系统的一切情况吗?

    对于数据中心运营至关重要的是,需要电力链记录在一起,从进入建筑物的电力,再通过UPS、PDU/提供给所有的机架设备。这意味着数据中心运营需要知道哪些与电力相关的设备,以及设备各自的相互依赖关系。这可以让数据中心运营了解某些设备故障或脱机维护时的潜在影响。此外,还应该了解每个电源链设备的状态。

    可以通过采用数据中心基础架构管理(DCIM)实现对电源管理。DCIM使数据中心运营能够以最高的效率运行数据中心,同时允许所有相关人员改进整体运营情况,并识别漏洞,从而保持电源链的安全。

    部署的DCIM还可以让数据中心运营全面了解自己的产品,通过共享实时数据和易于理解的图表,消除IT和设施之间的通信孤岛。

    由于数据中心停电的原因很多,尝试用人工方法和电子表格来跟上基础设施的所有变化是费力的,并引起不可预见的风险。因此,必须采取适当可行的方法和措施进行管理。

  • ?

    数据中心里的数据销毁技术

    章中道

    展开

    数据中心是信息处理的集中场所,每天都会产生海量数据,这些数据不仅要占用很多的存储设备空间,还影响了应用的计算效率。这些数据中大部分都是交易数据、过程数据、用户数据或者中间计算数据,数据中心永久存留这些数据并无益处,还有一些时效性的数据,过期数据,让这些数据在数据中心的存储设备里睡大觉,不如清理出去,节省出来存储空间,这样可以大大节省数据中心的运营支出,提升数据中心的生产效率。如何对这些数据进行销毁,这里也大有学问。

    首先,数据质量远比数据的数量重要,数据中心为了不断增长的数据而在软硬件上连续投资的做法,实在是一个代价昂贵的错误,要注重有效数据的处理。表面上看,数据中心的数据总量增长是非常迅猛的,全球数据量以每年58%的速度增长,不到两年就翻一倍,在未来这个速度会更快,其中大部分数据都是在数据中心里产生的。我们的数据中心是不可能每两年就扩容一倍的容量,所以任由数据量增长下去,数据中心会很快陷入不断扩容的怪圈,结果数据中心的规模越来越大,而数据中心业务并没有实质增长,数据中心的盈利水平下降。就好像是一个胖子,总是吃炸鸡可乐,将会越来越胖,但实际上身体的体质在不断下降,最后除了一身赘肉,什么也干不了。数据切不可成为数据中心的负担,该清理时就清理,该销毁时就销毁。

    其次,我们要对数据进行销毁,就要分清哪些数据是有用的,哪些数据是无用的。这就要从数据产生的源头做起,在数据中心产生增量数据时,要将这些数据进行分类、整理归档,存储到分类的存储空间里去,同时对这些数据进行明确标记名称,通过名称就可以知道数据的大概内容,以便作为数据是否无用的判断准则,如果在数据记录时不明确,那么后来的数据销毁就无法做到精准,不仅销毁数据效率低下,还可能将有用的数据误销毁。管理这些数据是非常复杂的,涉及到数据辨识、清理、优化等等,而这些工作又是周期性,需要花费时间和一定的人力资源,且不会带来明显的收益,常常被忽视。其实,数据的有效存储工作将对数据中心的业务产生长期和正面的收益,且越早行动收益越明显。

    第三,数据的销毁并不是简单的删除清空这样简单,数据销毁也有标准可遵循。美国国防部的DOD 5220.22-M标准是应用最广的一套规范,许多人都把DOD 5220.22-M直接当作数据清除与销毁的标准。销毁的手段也有几种,这和销毁希望达到的效果有关。一般销毁分为软销毁和硬销毁两种。软销毁是通过数据覆盖等软件方法数据销毁或者数据擦除。硬盘数据销毁中的硬销毁则通过采用物理、化学方法直接销毁存储介质,以达到彻底的硬盘数据销毁的目的。软销毁一般只是将数据文件进行销毁,并不能真正将磁盘区数据擦除,操作系统由于考虑到操作者操作习惯或者误操作,数据销毁后各种非常情况等诸多方面因素,用户所使用的删除命令,只是将文件目录项做一个删除标记,把它们在文件分配表中所占用的簇标记为空簇,并没有对数据区进行任何改变也就是没有对这些信息做任何数据擦除、数据销毁的操作,这样数据其实依然占用存储空间,没有达到节省存储空间的目的。所以数据中心的数据销毁都采用硬销毁的方式,真正将存储空间释放出来,用来存放更有意义的数据。硬销毁常用的方法有:格式化硬盘、硬盘分区、文件粉碎软件。格式化仅仅是为操作系统创建一个全新的空文件索引,将所有的扇区标记为“未使用”状态,让操作系统认为硬盘上没有文件,因此,若采用数据恢复工具软件是可以恢复格式化后数据区中的数据的,格式化也分高级格式化、低级格式化、快速格式化和分区格式化几种。低级格式化的销毁最为彻底,很难通过软件再将已经销毁的数据还原回来,硬盘存储空间得到充分释放。硬盘分区的方式销毁数据,也只是修改了硬盘主引导记录和系统引导扇区,绝大部分的数据区并没有被修改,没有达到数据销毁数据擦除的目的。文件粉碎软件是专门用于彻底删除文件达到数据销毁数据擦除目的的,在网上也出现了不少,一些反病毒软件也增加了数据销毁数据擦除的功能,用于处理一般的私人数据可以,但不能用于处理带密级的数据。以上的硬销毁方式虽然可以将数据销毁,但是不够安全,还是有可能被恶意份子还原出来,拿到数据去做坏事。还有一种硬销毁是采用专用的消磁硬盘机或者折弯机来彻底销毁数据,不管是直接对硬盘进行消磁,还是对硬盘进行折弯,都是破坏性的行为,硬盘将被损坏,不仅数据不能再还原,硬盘也无法再进行使用,这种硬销毁往往是用来对已经故障的硬盘进行处理,避免故障硬盘里存着的数据被坏人还原出来,拿着数据去做坏事。

    及时对数据中心中的无用数据进行销毁,不仅可以节省硬盘存储空间,为数据中心节约运营成本,还可以提升安全性,避免一些数据泄露,给数据中心带来安全隐患。有些数据也许对数据中心或者部分数据中心用户是无用的,但并不代表对所有人都无用,数据的有用性完全要看将数据放在了什么样的环境中,若是这些数据被人所利用就给数据中心带来安全隐患,所以对于无用数据要进行彻底销毁,不让任何人有可乘之机,更不能让人有机会再还原出来利用。

  • ?

    数据中心遭雷劈 全球第二大云服务无法运行

    雍绿柳

    展开

    【PConline 资讯】微软云服务 Azure 报告,9月4日 09:29 UTC,它的美国中南区数据中心附近发生了雷击在内的恶劣天气事件,导致了影响冷却系统的电压增加,进而导致其多个 Azure 服务出现连接问题,客户难以访问储存在中南区数据中心的资源。

    微软的Azure客服人员在微博网站Twitter上发布的帖子称,在微软位于德州的数据中心附近出现了“恶劣的天气情况,包括打雷闪电”,结果导致功率骤增,影响了制冷系统。

    这个数据中心已暂停运行,以防止Azure服务器和其他设备出现过热现象。受到此次Azure服务中断影响的还有微软的Office 365产品和Active Directory服务。

    Azure是一组云端服务,用于开发、测试、部署和管理应用程序和服务。这些服务包括网站经营、存储空间和数据网络管理。微软Azure与亚马逊AWS等云服务形成了竞争。

    微软Azure客服部门发帖称,工程师们已成功恢复数据中心的电能,而且恢复了受到影响的大多数网络设备。该公司称,它仍然进行各种“抢修工作”,力争让所有受到影响的服务重新开始正常运行。

    受到影响的服务包括:Office365、Active Directory、Visual Studio Online、Visual Studio Team Services 等等,这些服务下线了数个小时甚至更长时间。这起事件影响到了很多微软 Azure 客户的工作,VSTS 是许多公司重要的生产力工具。

    PS:我国贵州地区数据中心较为集中,其配套的电力设施相信比美国更好,建议Azure将数据中心迁移至我国将会彻底杜绝这类事件的发生。

  • ?

    数据中心未来发展六大趋势

    毕涔雨

    展开

    近年来,由于金融电信等行业需求的增长、既有机房的升级改造、以及政府公共服务平台建设的加大投入等各方面的驱动下,数据中心获得了空前的发展,但同时,也面临着多方挑战。主要有下列几个方面:

    1. 能耗压力。随着不断增加的电力开支,耗电和散热成为数据中心的一大挑战;

    2. 资源整合。当前数据中心系统大多庞杂,从而导致运维效率低下,各种存储、计算及信息资源难以共享;

    3.信息安全。数据中心作为企业IT系统的核心,其安全性尤为重要。

    数据中心未来发展六大趋势:

    基于当前数据中心的现状和挑战,数据中心未来的发展趋势将呈现以下几大方面:

      趋势一:绿色化

      数据中心规模的剧增带来了运营成本的大幅提高,其中电力成本是最主要的运营成本,如何提升电源利用效率(PUE,越低越好。)成为各大数据中心大户的一大课题。目前包括Google、Facebook、微软、BAT在内,都在积极引入各种绿色节能技术以降低PUE。除了水冷、自然冷却、冷热封闭通道、取消UPS、高温运行等通用做法,新能源技术也在逐步引入,而利用软件调度技术降低能耗将成为发展趋势。

    趋势二:模块化部署

      云计算和移动互联网的发展给数据中心的部署就绪时间提出了更高要求,目前整机柜、集装箱部署模式可将数据中心的建设周期大幅缩短,但整体并未得到规模化应用。因此,未来几年整机柜将是主要部署模式,而集装箱可在大型会议、活动等特定场合作为临时数据中心应用。

    趋势三:自动化

      随着单数据中心规模的不断扩大,传统模式所需的运维力量大幅增加,成本也不断增加。对此,Google等巨头很早就引入软件方式实现数据中心的自动化运维,提升运维效率,提高客户体验,这也将成为未来的一大趋势。

    趋势四:虚拟化与软件定义化

      虚拟化可以极大地提高数据中心的资源利用效率,并已得到广泛应用。而软件定义技术,可以为大规模用户提供快速灵活的多租户异构资源配置、隔离和供应,但存储和网络是瓶颈,这就需要引入软件化技术,通过存储和网络虚拟化的实现,为客户快速提供虚拟化数据中心业务,让每个客户都感觉拥有独立的一体化数据中心。

    趋势五:集约化和集群化部署

      互联网、移动互联网、云业务等大规模应用需部署在多个数据中心,这给数据中心带来繁重的同步以及高昂的宽带成本,因此数据中心集群化部署和集约化部署将成为发展趋势。集群化部署,相当于将多个数据中心形成一体,大二层网络建设成为趋势,SDN在这里有用武之地。而集约化部署则可以节省数据中心之间的交互成本,也有利于降低部署和运维成本。

    趋势六:安全与可信

      安全性不仅是指防火墙、IPS/IDS、入侵检测、防病毒等安全防范措施,更包括火灾、飓风以及其他灾害应对。因此,数据中心建设在初始阶段就应该构建可靠的灾难恢复方案,或建立异地的灾难备份中心。这是当前以及未来数据中心建设需要重视的一大热点问题。

    结语:

      在信息化时代,数据呈现爆炸式的增长,其影响已广泛涉及各个行业和人们生活的方方面面,因此数据中心建设是大势所趋,更是未来发展必不可少的重要部分。而如何让数据中心更具高效和绿色节能、更好地为企业服务,无疑成为未来研究的重点方向。

  • ?

    数据中心运维里的那些“潜规则”你不可不知

    巴伦西亚

    展开

    数据中心是信息处理的重要场所,里面的设备承载着很多重要的业务,对连续稳定运行都有很高要求。

    可是业务的运行还是要靠成千上万台的电子设备稳定运行来保证,为了确保这些设备运行不出问题,或者出了问题也让业务层面感知不到,数据中心运维的技术人员想了很多办法,有些还逐渐成为了行业运维的标准,很多数据中心都效仿和执行。

    其实,有时技术人员做这些不成文的规定也是实属无奈,根本目的还是为了保证数据中心业务的连续稳定运行。业务中断对于数据中心都是天大的事儿,业务中断的损失很多都是以秒来计费,所有的规定都是为数据中心服务的。那我们就来看看,运维的工作都有哪些好玩的不成文规定。

    01重大节假日必封网

    每逢重大节假日来临,各大网络运营商,重要行业企业等的数据中心纷纷进行封网。所谓封网,就是停止一切对数据中心的人为操作和业务变更,让设备自己运行,不进行人工干预。封网并不是减少人员的值班,而是要加强人员的值守,确保数据中心运行不出问题,若出问题也及时处理和消除。此时封网可以减少一些人为故障,要知道百分之八十的故障都是人为操作产生的,不去动它反而是最安全的。

    谁也不想在关键时刻自己的数据中心掉链子,出风头。重大活动时,主流的数据中心都已经封网,不再允许做任何的网络变更操作(设备出现故障的除外),有的数据中心机房甚至已经上锁,无人可以进得去。这项制度也是数据中心在运维的工作中摸索出来的,从以往的历史经验看,只要减少人为干预,让设备自己运行,出现问题概率会大大下降,所以在关键时期坚决不做任何变更操作,就让数据中心自行运行,发生故障的概率最低。

    02定期重启设备

    我们的手机如果用久了速度会变慢,如果重启一下再用会发现好很多。其实对于数据中心里的设备也是这样,数据中心里的设备常年不中断运行,运行时间久了,各种内存垃圾,各种软件BUG就容易暴露出来,设备出问题的风险随之增加,定期对设备进行重启,将有助于减少故障的发生,延长设备使用寿命。如果设备上业务没有备份,重启设备可能对业务造成影响。

    所以,在重启设备前要做好评估,避免主动重启给业务造成影响。如果重启一次设备对业务造成的中断时间可以接受,那么可以定期,比如半年或一年对设备主动进行一次重启,如果设备使用的软件版本较老,也可以借此进行软件升级,不要认为重启了设备就是一件很丢人的事情。这就像马拉车,走的时间久了,马也需要休息一下。有的数据中心每年都做一两次的故障模拟演练,这其中就包括对设备的重启,来检查数据中心系统的稳定性和冗余性,有这个演练就很好,不仅可以让设备临时休息一下,也可以及时发现数据中心运行的漏洞,进行修补。千万不要被动等出了严重问题时,再考虑重启设备恢复,这时往往会给业务造成严重损失。

    03加强对设备操作管理

    数据中心里有很多设备,不同的设备来自不同的厂家,使用的功能也不同,对这些设备的操作人员要进行严格管理。避免不熟悉设备的人误操作设备,这些人为故障数不胜数。所以一定要对访问设备的权限做控制,不同的设备由不同的人来管理,由最熟悉它的人来控制。对于一些设备变更操作,要提前做评估,配置是否符合规范,是否有已知风险,让设备厂商也参与到变更操作中来,以防出现变更未达预期的情况出现。数据中心对登录设备管理非常严格,对不同的人员都有不同的权限要求,如果需要申请相应更高访问权,需要到高级领导那里去申请,并且将操作的理由和原因说清楚,这是数据中心运维管理工作的重要组成部分。

    04隔离/离线/重启三把斧

    数据中心运行过程中出现故障,第一时间就是恢复业务,定位故障原因是其次,所以运维人员处理故障时,首先要明确故障位置,如果短时间内无法完全明确,也要尝试进行恢复业务的操作,这时常用的就是这三把斧:隔离、离线、重启。这三把斧都是针对具体设备的,因为数据中心故障都是来自具体设备,稳定运行过程中出了故障基本都是其中某个或某些设备出问题了。

    隔离就是只根据业务故障的范围,对故障的设备端口、VLAN或流量进行切换,切换到其它正常的通道上来,如果故障范围无法明确这些细,就考虑对设备尽心离线,即将设备下线,整个设备的业务切换到其它设备上来,比如某个服务器业务异常了,将这个服务器上的虚拟机迁移到其它服务器上来,尽快恢复业务。

    有时,设备之间没有备份无法进行离线处理,比如一些核心的网络设备,离线需要做大量的业务切换工作,这时就考虑对设备进行重启了,看重启能否恢复,一般运行异常的设备通过重启基本都能恢复,在短时间内继续正常运行,这样为分析问题原因赢得了宝贵时间。一方面继续分析原因,一方面让数据中心业务正常运行下去,找到问题原因后,再将隐患补救。

    数据中心运维人员在日常的工作中逐渐摸索出了很多经验,这些都是一个个血的教训换来的,是数据中心的宝贵财富。有些规定虽然没有太深的技术支撑,但却非常实用,这些也是运维人员面对数据中心故障时想到的办法。俗话说“话糙理不糙”,这些不成文的规定看似简陋,关键时刻却非常管用。(文章转自互联网,侵权删。)

    ServiceHot独立研发的IT服务运营管理平台(ITSOM),一款专业的云运维管理平台,现提供免费试用哦!

    热文推荐:

    牛X了,这款运维软件到底包含了多少最佳实践?!

    中国企业级服务SaaS市场 将迎来新一轮资本投资高潮

    上市的 SaaS 公司有什么特质

  • ?

    2018年数据中心行业三大发展趋势

    阎青雪

    展开

    数据中心管理人员在2017年面临着一些挑战:只有不到30%的企业做好了灾难恢复的准备;2021年网络安全成本预计会每年增加到6万亿美元;IT团队和数据中心管理人员很难掌握需要采取的直接和可行的步骤。

    考虑到在新的一年中将不可避免地呈现出这些"假如"的情况,组织需要对行业趋势发展的一些预测来提供重要洞察力。

    根据2017年的发展情况,以下是所预计的2018年数据中心行业发展的三个趋势:

    1.对灾后恢复采取积极主动的态度

    2017年全球多地经历了前所未有的自然灾害,很多数据中心管理人员正在被迫评估当前的灾难恢复计划,云计算基础设施解决方案占据主导位置,并将灾难恢复策略列为2018年的首要议程。例如,通过云计算工具使用功率封顶策略,在遭遇停电事件时将允许以较低的功率继续运行,因为实施功率策略可以提供最大功率消耗的一些保证。

    组织制定备份计划可以扩展运行服务器的操作,而不必关闭和重新启动服务器。更重要的是,依靠云计算解决方案进行灾难恢复,组织可以通过监控服务器温度来检查基础设施冷却失败的情况。由于采用最新的灾难恢复计划,所以组织在新的一年中都不能忽视这一战略。尽管无法预测2018年将会遭遇的自然灾害,但有一点可以肯定,数据中心管理人员将会优化计划以防止出现意外。

    2.数据中心健康检查可以减少停机时间

    "每天一苹果,医生不找我",不管人们是否愿意承认这一点,这个古老的说法是完全正确的,通过这种方式保持健康可能会让医生远离。机器也不例外。他们也需要持续的监测和健康检查,以确保数据中心设施的质量。为了在问题成为灾难之前主动解决和减轻问题,制定数据中心健康管理战略对每个组织都是至关重要的。

    不幸的是,只有三分之一的企业组织了健康管理战略,并且只有在遇到切实的问题时才这样做,在电力中断之后被迫实施,或见证其他地方出现故障,或被高级管理人员施加压力才会这样做。到2018年,电力中断事件可能只有小幅增加,因为一些组织不再提供被动方案,而组织的每次平均停电损失超过75万美元。

    3.云计算 vs托管数据中心 vs 内部部署:IT决策者将在2018年做出重大决策

    如今,数据中心市场正在升温,并没有放缓的迹象。根据调研机构451 Research公司的调查,目前云计算应用成为数据中心行业增长最快的部分,并处于领先地位。

    预计到2020年,全球托管数据中心基础设施的空间年复合增长率将达到16%。托管和批发数据中心市场的复合年增长率预计将达到7%,这表明很多数据中心管理人员将他们的设备进行托管而不是在自己的数据中心运营管理,这是一个重大转变。

    随着2018年的到来,数据中心管理人员将会继续面临与数据中心外包环境相关的收益和挑战,可以预期这些转变和对话将会持续。

    除了优先考虑灾难恢复主动性,定期健康检查,以及满足迅速变化的行业期望以外,那么在2018年,组织还需要实施哪些重要的数据中心战略?

    来源:互联网

  • ?

    数据中心的能源将会发生什么样的变化

    迷离

    展开

    日前,数据中心行业专家Russell Bulley对数据中心动力的将来开展,UPS电源的技术提高,以及使用愈加普遍的可再生动力技术将如何影响数据中心的运营停止了讨论。

    依据预测,数据中心能耗将在将来10年增长三倍以上。随着动力本钱和可继续开展成绩的添加,数据中心一切者和运营商需求对其能耗停止优化,并采用可再生动力坚持数据中心的可用性和恢复才能,这些措施将至关重要。

    Bulley在相关会议上对数据中心和能耗密集型用户如何优化其电力资产的运用停止了剖析,并指出其优化不只要浪费本钱,还要从电网效劳中取得额定支出,同时对数据中心关键负载完成片面的电力维护。

    动力效率

    动力效率在数据中心行业中变得越来越重要,而这反映了人们对可继续开展和气候变化的态度的转变。而UPS电源技术经过临时的开展变得越来越节能高效。

    数据中心的运营商正在思索如何更好地使用根底设备中UPS电源零碎,以最大限制地进步效率,同时以最小的资本收入(CAPEX)提供分歧性和弹性。这促进了高效节能的模块化UPS零碎日益普及,并且随着客户负载增长而扩展,同时坚持100%的正常运转工夫。

    在以往,企业爲了满足将来负载增长的需求,在其数据中心中部署了大型UPS零碎,并影响了资本收入(CAPEX)/运营收入(OPEX)。

    锂离子电池的影响

    在UPS供电零碎中使用锂离子电池具有许多益处:与同等规格的铅酸蓄电池相比,其体积减少70%,并且分量更轻,这意味着可以将更多的机房空间分配给效劳器。锂离子电池还具有更长的运用工夫,这使得锂离子电池无望替代铅酸蓄电池。

    由于锂离子电池价钱不断在下降,将来将会装置部署更多的锂离子电池。但人们估计锂离子电池将更多地使用在工夫较短的待机使用,或使用于需求疾速充电才能和放电/充电周期的电网中。

    在可预见的将来,铅酸蓄电池依然是UPS电源使用中最具本钱效益的选择。而随着电池技术的不时开展提高,锂离子电池最终能够会取代铅酸蓄电池。

    数据中心将来的电源选择

    由于电源容量和根底设备的限制,以及古代化机架的高功率密度,采用传统设计的数据中心越来越不能满足用户的需求。而一些电网根底设备具有一定的局限性,因而,需求更多的创新技术,而太阳能和电池储能零碎将成爲数据中心供电的一种可行的选择。

  • ?

    如何让你的数据中心实现且保持最高价值?

    白梦

    展开

    【IT168 评论】数据中心的管理者应该有自己的一套原则办法,来使数据中心能够实现最优价值。这里为大家介绍一套所谓“DCM 10”办法,其中共10个基本步骤。当然不是说每个数据中心管理者都应该使用这套方法来评估当前数据中心,也没有必要严格按照每个步骤执行,不过应用最佳实践会带来更高的价值,至少它可以提供一些具有参考意义的帮助。

    1、应用混合环境

    对IT基础设施使用混合解决方案,你的组织应该具有更好的可视性和管理能力,以接近带来改变的关键洞察力。无论是on-premises、托管数据中心、还是在云中,达到峰值性能意味着需要创建一个灵活的、可扩展的、可持续的、可靠的数据中心,在目前和将来都能满足业务需求。

    2、优化电力和冷却

    使用高密度服务器会产生大量的热量,而且消耗的电力比旧的遗留设备要多。随着新技术的进步,如大数据和机器学习,其功率和产生的热量只会增加。典型的机架功率密度在5kW到40kW之间,数据中心管理人员需要安装新的程序和软件,以获得对预计新发现的冷却需求的实时洞察。

    3、考虑“绿色”

    除了监控电力和冷却,数据中心管理者应该评估“绿色”替代能源,以提高能源效率。通过使用风能或太阳能板等可再生资源,组织可以将其数据中心战略转变为包括环境友好型的做法,并优化现有的数据中心基础设施。

    4、进行自动化健康检查

    通过不断地进行分析、诊断和补救,数据中心管理人员可以进行定期的健康管理检查,以缓解宕机风险,避免宕机损失。通过监控数据异常或潜在的威胁,组织可以制定计划,处理系统中可能发生的任何问题来保护他们的设施,以助实现业务流程的自动化。

    5、以主动应对被动

    除了定期的健康检查,实时监控你的数据中心还能让你做好最坏的准备,并对诸如自然灾害等不可预见的威胁采取积极的态度。这意味着从监控你的数据中心的日常表现,到设置灾难恢复计划都应有所举措。

    6、平衡预算

    如果没有能跟上时代的数据中心设施和IT设备,企业就很难跟上成功的脚步。由于只有一部分IT预算直接使用与数据中心,因此数据中心的管理人员必须保持功能、效率、空间和成本为首要考虑因素,并且只执行与数据中心性能、可靠性和敏捷性直接相关的智能升级。

    7、获得高管支持

    虽然这看起来可能只是表面利害关系,但组织数据中心策略中最大的脱节之一就是从高管层中获得支持。为了确保DCM部署的成功,整个团队——从IT经理、系统架构师到高管层——都必须通力合作,充分利用解决方案堆栈。

    8、评估管理流程

    部署DCM解决方案的组织,可以自动化变更管理过程区域并记录设备中所做的任何更改。这意味着实时了解如何管理变更、变更的影响以及何时完成变更。对于不使用DCM解决方案的公司来说,这是一种手动的、耗时的过程,将会占用数据中心管理者的宝贵时间。

    9、确保灵活性和可扩展性

    数据中心管理者必须能够根据需要增加部署,而不受当前硬件或软件的限制。也就是说,不要害怕引入新的解决方案,比如可以将计算能力调整到特定工作负载或应用程序的现场可编程门阵列(FPGA),以增加灵活性和可伸缩性。

    10、保持在最前沿

    在当今快节奏的商业环境中保持领先优势是至关重要的。如我们所见,数据中心管理已大步走向自动化、智能化。虽然没有人能预测未来会发生什么,但实现数据中心战略的现代化,至少会确保你在未来的两步中领先一步。

  • ?

    数据中心决策之虚拟化管理与灾难恢复

    凌奎

    展开

      目前对于虚拟化管理软件,70%的商业专家希望虚拟化管理软件能监控服务器的可用性。60%的人希望软件可以监控网络的性能,50%的人希望能够管理系统安全性,53%的人希望软件对容量规划做出一份公告,52%的人希望软件能管理配置和变更以及执行其他任务。

      在所有这些期待的特点中,虚拟化采购团队中大部分人(46%)认为价格是决定他们采购决定的主要因素,其次是管理控制台的性能和可用性,以及虚拟化平台的兼容性(分别都是42%)。

      无论你的虚拟化管理软件都提供了什么功能,没有它似乎是不行的。在954份调查回访里,只有18%的组织数据中心内部没有任何虚拟化管理工具。

      数据中心刺激了购买灾难恢复的迫切需求

      IT团队追求着保持负载的尽可能长的在线时长,当有停用的情况发生时,灾难恢复系统的质量直接决定了故障停机的时间和引发的对工作负载的影响。

      企业的灾难恢复业务连续性调查表明了,有59%的灾难恢复采购团队希望在数据之间有远程的拷贝或数据同步。如果类似电力故障导致系统停用,会影响所有的服务器和存储,因此远程同步可以在生产环境数据中心以外多份备份。

      远程拷贝可以依赖于自由的数据中心,托管场地的自有设备,或者类似磁盘柜之类的冷备存储设备。另一个方案是使用云备份,将数据拷贝到托管的云存储上。

      对于IT商家来说高度聚合的基础设施盒子使远程同步更简单了,对于小型企业来说在高度聚合的基础设施中,删除重复数据和压缩的特性使备份和恢复更重要而且更不复杂。

      对于网络而言,数据中心的管理员希望简化网络操作过程,另外一方面,IT人员也会购买云存储服务。。

数据中心恢复

所有视频需要登录后,才能观看

请先登录您的帐号,即可完整播放,如果您尚未注册帐号,请先点击注册。

img

在线咨询

建站在线咨询

img

微信咨询

扫一扫添加
动力姐姐微信

img
img

TOP