- ?
技术干货丨锐捷带你认识支撑AI的高性能数据中心网络的架构设计
映安
展开
近日,工信部印发《促进新一代人工智能产业发展三年行动计划(2018-2020年)》,意在加快人工智能从战略到落地,推动人工智能和实体经济深度融合。在新工业革命的背景下,大数据、计算力、算法等快速迭代,正驱动人工智能进入新阶段。2017年Q3,全球AI公司融资金额突破77亿美元,是2012年的70余倍。可能会有人说这是‘泡沫’,而我更愿意相信这是人工智能发展的必然结果。在AI技术的应用过程中,各个企业都在寻找能够更好支撑高性能计算的基础网络解决方案。在《数据中心基础网络架构最佳实践及未来发展趋势》这篇文章中,我分享了如何设计一个稳定可靠的数据中心网络,下面我们再来探讨支撑AI应用的高性能无损网络应该如何设计。——权熙哲 锐捷网络互联网系统部技术副总监
前面提到大数据、计算力、算法等快速迭代,正驱动人工智能进入新阶段,而这些技术的实现对网络的低时延、无丢包、高性能这三个方面提出更高要求。
AI应用的技术体系及对数据中心网络的要高性能和无丢包比较好理解,就是指网络带宽性能的提升以及网络中不存在拥塞导致的丢包。产生时延的环节较多,要实现端到端的低时延,需要多角度分析:
其中,光电传输时延和数据串行时延相对较小,且很难通过架构设计来优化,我们应重点关注主机处理时延和设备转发时延。在各大企业积极寻求的高性能计算方案中,基于以太网的RDMA(Remote Direct Memory Access)凭借其高性能和低成本优势逐渐取代InfiniBand而成为主流技术。RoCEv2(RDMA over Converged Ethernet)技术基于UDP协议,对于建设支撑AI应用的高性能无损以网络变得尤为重要。
结合设备转发层面的时延优化手段,高性能无损网络的实现取决于两个要素:
无带宽收敛(1:1)的网络架构设计基于PFC(Priority-Based Flow Control)和ECN(explicit congestion notification)功能的优先队列管理和拥塞管理
综上,AI集群高性能计算和网络方案实践思路如下图所示:
在这里,我以25G网络为例,结合业界主流产品形态,分享AI网络架构设计和实现思路。
主要设计理念:
核心设备全线速高性能转发,核心之间不互联,采用Fabric架构,隔离核心故障,最大程度降低核心故障的影响三层路由组网,通过ECMP提高冗余度,降低故障风险TOR上下行收敛比严格实现1:1,通过提高核心设备接口密度扩展单集群服务器规模应用PFC+ECN功能,实现低延时无损网络
网络架构设计:
中小型(集群规模1000台)
架构特性:
每台TOR采用 8*100GE上联8台32口100G BOX交换机,OSPF/BGP组网适用集群规模1000台每台TOR下联32台Servers,IDC内收敛比1:1 ,集群带宽25Tbps
中型(集群规模2000台)
架构特性:
每台TOR采用 8*100GE上联8台64口100G BOX,OSPF/BGP组网适用集群规模2000台每台TOR下联32台Servers,IDC内收敛比1:1 ,集群带宽50Tbps
大型(集群规模2000-18000台)
架构特性:
每台TOR采用 8*100GE上联4~8台核心(机框式),BGP组网适用集群规模2000~18000台每台TOR下联32台Servers,IDC内收敛比1:1 ,集群带宽50~450Tbps
超大型(集群规模20000+台)
架构特性:
单POD集群规模1000~2000台,数据中心集群规模20000+,BGP组网POD内收敛比1:1,单POD集群带宽25Tbps,总集群带宽500Tbps+POD内收敛比和上行带宽根据集群带宽需求灵活配置,适用与非AI应用混合部署
在数据中心网络中,PFC和ECN功能将部署在Leaf和Spine设备上。PFC作用于设备互联端口,通过反压影响上游端口队列的发送速率,而ECN是作用在设备转发过程,最终影响的是数据流的发送方,通过降低某条数据流发送速率规避数据丢包。
(1)PFC 机制将以太链路上的流量区分为不同的等级,基于每条流量单独发送“不许可证”。相对于PAUSE帧而言,PFC可以将链路虚拟出8条不同等级的虚拟通道,当某条通道出现拥塞后不会影响其它通道。
(2)RoCEv2 定义了 RoCEv2 Congestion Management ( RCM ),其中拥塞管理用的特性ECN(RFC 3168)是在交换机出口(egress port)发起的拥塞控制机制。当交换机的出口buffer达到设定的阈值时,交换机会改变数据包头中的ECN位来给数据打上ECN标签,当带ECN标签的数据到达接收端以后,接收端会生成CNP(Congestion Notification Packet)并将它发送给发送端。CNP包含了导致拥塞的flow或QP的信息,当发送端收到CNP后,会采取措施降低发送速度。
(3)由于PFC作用于整个队列,而ECN只针对产生拥塞的具体会话,在设置PFC和ECN相关水线时,应做到先触发ECN后再触发PFC。
从外卖订单和叫车订单的智能调度,到电商平台的智能推荐,再到人脸识别支付以及即将实现的全自动无人驾驶汽车量产,AI技术的应用已在方方面面影响着人们的生活和工作,让大家的生活越来越便捷、时间利用越来越合理。但是,这都离不开基础设施的支撑。锐捷网络将凭借在数据通信领域近20年的技术积累和行业经验,创新出更好的产品和解决方案,助力AI技术的蓬勃发展。
- ?
云上“超算中心” 阿里云推出弹性高性能计算平台E-HPC
西门丝
展开
9月12日,阿里云弹性高性能计算平台E-HPC启动邀测。它可一键部署弹性伸缩的高性能计算集群环境,帮助科研院所和企业处理大规模科学计算问题,包含但不限于生命科学,气象预报,石油勘探,工业设计,流体力学,分子动力学等领域。
E-HPC也是中国首个公共云上的HPC as a Service产品。
“如果把传统超算中心比作‘珠穆朗玛峰’,那么阿里云的E-HPC则是将高性能计算做更普惠的覆盖,成为高性能计算的‘青藏高原’。阿里云资深专家何万青表示。
阿里云官网介绍,E-HPC基于阿里云强大的异构计算产品家族,为科研人员、企业构建了一整套科学家、程序员熟悉的并行计算软件环境。
依托阿里云E-HPC弹性高性能计算提供的PaaS平台,通过调用OpenAPI创建阿里云基础架构层IaaS产品,包括弹性计算ECS资源,虚拟专用网VPC,异构计算资源,高性能高可靠和横向扩展的NAS资源等产品。
安全方面,E-HPC提供了VPC专有网络,通过管控空间和用户空间分离,保证多租户间数据安全隔离,阿里云的安全能力将为高性能计算提供坚实的防护能力。
目前,阿里云E-HPC已向国内用户开放邀测,支持包月包年和按需付费。据悉,该产品不久将实现全球同步售卖。
- ?
全球数据中心正在使用2%的世界能源
Zhang
展开
随着更多数据中心的建立和全球能源消耗的持续增长,可靠地为所有高科技服务器供电,需要构建更具弹性的能源网格。停机时间对于数据中心来说是一个非常昂贵的事件。全球数据中心每年消耗的电力超过416太瓦时,这相当于世界能源产量的2%左右。
即使按照电力批发价格计算,数据中心仍然需要数百亿美元的能源。除了数据中心的规模之外,它们的功耗也显示了我们对这些现代基础设施的依赖程度。由于规模经济,与云计算相比,内部服务器机房正在逐渐失去任何竞争优势。
展望2021年,云计算将占据数据中心流量的95%,云计算处理超过94%的高性能计算工作负载。大量数据的生成也使超大规模数据中心成倍增长。 2016年,全球估计有286艾字节的数据。在2021年,我们将超过1.3 zettabytes的存储数据。
展望未来,许多新数据中心将配备大量电源功能。 Silent Partner Group of Companies希望通过构建更高效和可扩展的设施来使Google现有的数据中心相形见绌。谷歌位于芬兰的Hamina地区的云计算中心能够获得100MW的功率,而SPGC希望在欧洲建立6个250MW的数据中心。
- ?
从高性能计算到人工智能—GPU的加速能力得到广泛认同
滕语山
展开
GPU开始在超算领域崭露头角。在最新公布的2017中国高性能计算TOP 100排行榜中,已经有28套采用NVIDIA Tesla GPU,其中22套为Tesla P100。中国工程院院士廖湘科表示,今天人们借鉴GPU在超算领域的经验,已经将其引入人工智能领域。GPU的出现对人工智能新崛起起到了积极推动作用。NVIDIA副总裁暨中国区企业事业总经理沈威也表示AI现在已经变成高性能运算的一个杀手级应用。有越来越多的高性能运算中心有专属的AI超算。
NVIDIA副总裁暨中国区企业事业总经理沈威
从互联网图像、视频分类、语言识别、自然语言处理等服务到医疗领域癌细胞探测、药物发现再到安防领域人脸识别、视频监控、网络安全再到智慧交通领域行人识别、车道跟踪、交通信号识别。基于深度学习和人工智能的快速发展,人们对与计算能力的需求呈指数型增长,对于计算加速也呈现爆炸式增长。同时深度学习已经渗入到各个行业,沈威举例中国移动是中国最大的呼叫中心,有超过1.5万个话务员,他们也使用了深度学习和GPU技术大量了减轻了人工的负担。
在金融领域,平安科技采用GPU和深度学习的方法来协助自身业务。比如车险业务,你只要拿出手机拍个照传输过去,它马上就可以基于照片上拍出来的损坏状况来做定损,也是深度学习在传统行业应用的体现。 这些应用背后是NVIDIA的技术创新和应用落地。
NVIDIA推出世界领先的HPC 和 AI 数据中心加速平台TESLA 平台,这个平台包括端到端的产品系列,基于深度学习训练和推理Training - Tesla P100和Inference - Tesla P4 & P40,Tesla P100 with NVLink可以为数据 中心HPC and DL应用 应用可扩充到多GPUs,数据中心HPC 应用 混合的 CPU和 GPU作业,Tesla P100 with PCI-E,集成的深度学习超级计算机DGX-1。
在HPC 2017现场展示上,NVIDIA展示了最先进的产品和应用。
现场展示了DGX Station超级计算机,可以说是业界唯一一款专门针对个人设计的超级计算机。它采用了工作站式的设计、采用了很多新技术。在架构上采用了最新TESLA V100 GPU + NVLink,配置了4个GPU,GPU之间用最新NVLink高速带宽连接起来,性能可高达480 TeraFlops;虽然售价为69000美元,听起来比较贵但是其服务器性能大约相当于124台的CPU服务器性能,从性价比来看,还是非常有优势。设计亮点采用了水冷设计实现静音(35分贝低噪音),这是目前业界唯一在工作站采用液冷设计的产品,非常静音,适合办公室环境。过去风冷的设计可能噪声会比较大,现在采用了水冷设计,整个机器的噪音只有35分贝,非常低,在办公室里可以很安静的工作,不会打扰我们的正常思维,这是我们设计最大的一个亮点。
而且它是专门针对深度学习这款产品不光有硬件,而且软件都预装好了,开机只要经过简单设置,就可以用Caffe、TensorFlow等做深度学习的训练,图像识别也好,语音识别也好,而无需花费大量的时间自己去配置软件、装驱动、SDK等等。
现场还进行可视化实时仿真的演示。Ansys公司和NVIDIA经历4年时间,利用CUDA制作了一款叫做Discovery Live的软件。目前,这个软件仍为技术预览版,预计明年的2月份会正式发布。
通过NVIDIA强大的加速能力,这款软件能够实现可视化实时仿真,即借助NVIDIA GPU的并行处理能力,实现传统计算仿真和可视化渲染的完美结合。
简单说就是以前只能先进行仿真模拟,在进行可视化渲染,仿真模拟过程错了还需要从头修改,现在通过强大的计算处理能力能够实现仿真模拟和可视化渲染的完美结合。以前若在验证的过程中发现设计存在的缺陷再回头修改设计,是一个重复的过程;现在,计算和可视化能够在单台工作站实现,大大提升了工作效率。
如上图所示:这个测试的是车。刚才介绍的物理场,比如测试车的风阻系数,可以加入这个模拟状态,位置的改变会调整车的风阻模拟参数:比如加入导风设计,车的风阻系数就会发生改变。
DeepStream,能够实现30路高清视频解码、实时分析和元数据提取,可以时时处理30路视频的解码,解码完了以后通过深度学习的算法提取里面感兴趣的物体,在这里可以看到这些人和这些车,提取完了以后可以做一些声音的处理。大家可以看到这个应用可以把30路视频里所有的人和车都提取出来。
最后在至顶网记者看来,NVIDIA 产品大受欢迎核心就是其具有加速的能力、因为不管是高性能计算、还是人工智能以及大数据应用,更快的速度成为其必备的要求之一,具体来讲,采用GPU对于训练和推理来说其具有大的优势,一个是训练,几十亿,上万亿的操作,GPU 可以训练大的模型,加速应用走向市场。二个是数据中心推理, 每天数十亿的图像,语音,视频的查询,GPU 推理加速相应时间,使数据中心推理吞吐量最大化。
- ?
「重磅」京东获得国际高性能计算委员会颁发数据中心创新技术大奖
曹紫菱
展开
全国高性能计算学术年会(HPC China 2017)是中国一年一度高性能计算领域的盛会。它为相关领域的学者提供交流合作、发布最前沿科研成果的平台,强有力的推动了中国的高性能计算发展。10月19日,今年的HPC China 2017在合肥如期盛大召开。
今年的国际高性能计算咨询委员会举办的国际研讨会上,京东IDC建设部负责人,首席技术专家张敬针对京东在自建数据中心应用创新技术方面,做了深入的分享。
基于2017年京东在数据中心领域创新技术的成果,国际高性能计算咨询委员会将2017年度数据中心创新技术大奖授予京东。
国际高性能计算咨询委员会(HPC Advisory Council)成立于美国硅谷,是一个拥有超过400家成员的非营利性国际组织。一直致力于探索高性能计算技术在各领域的应用以及未来的技术,具有极高的行业影响力。
这次在中国将数据中心创新技术大奖颁发给京东,正是对京东在数据中心领域不断技术创新和突破的高度认可。
回顾京东数据中心的发展,是伴随着京东集团的高速发展,经历了一个从无到有,从简单到复杂,从租用到自建的过程。
2012年,京东就组建了自己的数据中心技术团队,开始正式进军数据中心行业。同年,京东在江苏宿迁投建的首个数据中心园区的项目规划落地,迈出了京东在全国布局自建数据中心的第一步。
2017年刘总在京东的开年大会上提出未来的京东需要在技术引领下开拓创新的发展战略。我们看到的人工智能,物联网,无人机,无人车,无人仓,云计算,大数据等一个个酷炫技术的背后,都离不开稳健的数据中心能力支持。
HPC Advisory Council举办的第五届全球大学生RDMA编程挑战赛结果也在研讨会上发布。这届大赛的竞赛题目紧追热点,也是围绕人工智能、深度学习的框架和实践模型方向展开。
京东数据中心应用RDMA技术,在人工智能和大数据等多个业务场景下,对RDMA技术与应用结合方面积累了丰富的经验,给大赛的参赛团队提供了专业的建议。
到2017年5月,京东的第一个自建数据中心已经投产运行1年多的时间,使用率接近100%,这个占地面积将近6万平方米,总投资30亿元的数据中心园区,可以提供20万台的服务器安装和运营能力,存储能力不小于32EB,计算能力不小于128千万亿次每秒,更有多项业界创新技术都在这里展开应用。
京东自建数据中心应用蒸发冷却技术
通过6sigma做CFD气流仿真计算,了解IDC模块内的气流组织,温度分布情况
京东宿迁数据中心互联网升级接入国家骨干互联网络
京东IT资源服务部负责人吕科在研讨会上谈到:业界大家高度关注的大数据,人工智能提供云化服务的前提条件就是首先IDC化,只有完成了第一步的IDC聚集,才有可能带来更进一步的业务能力云化聚集。数据中心行业从简单的技术提升,进入到了围绕应用场景化的数据中心及服务阶段。
获得国际高性能计算咨询委员会在数据中心方面颁发的奖项,也是对我们2017年在技术创新应用方面的高度认可。面对数据中心正在经历着的新一波的技术创新和革命,我们也更加有信心依托技术,引领前行。
- ?
华为极速以太网解决方案成功通过EANTC数据中心高性能测试
解天菱
展开
近日,在德国汉诺威举行的“2018国际消费电子信息及通信博览会(CEBIT 2018)”期间,华为和国际权威第三方独立测试机构欧洲高级网络测试中心(以下简称EANTC)共同宣布,华为极速以太网解决方案凭借零丢包、低时延和高吞吐的优异测试结果,成功通过EANTC数据中心高性能严格测试,开创了基于以太实现极速网络的先河。
作为华为CloudFabric云数据中心网的子方案之一,华为极速以太网由CloudEngine系列数据中心交换机组建,支持运行ROCEv2(RDMA over Converged Ethernet)网络通信协议。在本次测试中,EANTC在高性能计算(HPC)和分布式存储场景下,基于100GbE和25GbE的测试组网,对华为极速以太网的吞吐率、丢包率和时延等重要网络性能进行测试。高性能计算采用MPI(Message Passing Interface)计算模型,分布式存储基于标准性能指标 IOPS (Input/Output Operations per Second),有效验证了拥有独特创新拥塞管理和流量控制功能的华为极速以太网对传统以太网性能的大幅优化和提升。
经过EANTC严格测试验证,华为极速以太网依靠精确的拥塞流识别、动态拥塞水线设定和快速反压机制等拥塞管理和流量控制的三大创新技术,在高性能计算和分布式存储的所有场景测试用例中,都实现了高吞吐和零丢包,并基于网络时延的优化有效缩短高达40%的HPC节点间通信时长,大幅提升AI训练等创新业务效率。这也标志着华为CloudFabric能够帮助企业构建面向AI应用的云网络。
EANTC联合创始人与高级主管Carsten Rossenhoevel表示:“通过全面测试验证,我们对华为极速以太网解决方案零丢包、低时延和高吞吐的网络性能印象深刻。我们还验证了它与传统以太网的兼容性和对计算、存储网络融合的能力。客户可以从完整测试报告中发现华为极速以太网的价值,它完全满足企业对大数据分析、AI训练等应用快速创新的诉求。”
华为数据中心网络领域总经理王雷表示:“极速以太网是华为基于人工智能时代的客户需求推出的创新方案,非常高兴EANTC对它进行了独立严格测试,这是行业权威对华为极速以太网解决方案的又一次认可。我们将持续致力于云数据中心网络场景化方案的研发和创新,促进网络通信的产业发展,帮助企业客户开展基于云、AI、大数据等技术的快速创新,实现商业成功。”
华为作为云数据中心网络建设的领导者之一,华为CloudFabric云数据中心网方案已在全球2800多家企业成功商用,助力金融、互联网、运营商等行业客户开展基于数字孪生的创新业务,使能数据中心成为商业价值中心。
- ?
AI就是高性能计算
射手
展开
SUN说:网络就是计算机。
联想说:AI就是HPC(高性能计算)。
抱歉,联想没有说。这是小编总结的。
尽管联想没有明确这样说,但在8月31日举行的2018联想全球超算峰会上,联想对外发布了全新AI产品家族,将HPC、AI紧紧关联在一起。
这也是AI就是HPC的灵感来源。
早已经是产业共识
AI就是高性能计算,这已经是产业界的共识。
但以小编知识结构,其实一时转不过来,没有领悟其中的奥秘。
“HPC为AI提供了计算引擎,大数据为AI提供了数据引擎;反过来,AI、大数据给HPC带来了新的业态。”这就是结论。
如何理解这个结论呢?
先说说AI,如今AI有泛化的趋势,无助于人们的理解。
简单说,这一波AI浪潮的兴起和深度神经元网络和机器学习有关。AlphaGO就是最初的表现。其中最关键的技术是以大数据处理为基础的机器学习,对于算法模型的不断调优,从而使得其具备智能判断、分析的能力。
说到AI,很容易和人脸识别、语音识别、步态识别等具体技术联系在一起。
但实际上,AI分为重型AI和轻型AI。
其中,轻型AI在消费级产品领域应用比较快,更加容易被人们所熟悉,例如AI手机,如摄影模式的智能判断和选择等
轻型AI的特点是针对目标硬件进行裁剪,可以通过硬件固化,如AI芯片,来实现秒级处理的效果。
但对于重型AI来说,体现出来的特点就是大数据、大模型和多任务。其模型训练需要大数据和大机器,其中HPC首当其冲。追求的是高吞吐率的智能推理以及复杂的关联关系分析。
简单说,当今的AI可以理解为算法、机器学习和人工经验的结合,是基于数据和结果,对于控制参数进行调优的结果。
绕不开的GPU话题
谈到AI,GPU是一个绕不开的话题。
实际上,不仅是GPU,围绕着复杂繁多的AI应用场景,如今GPU、TPU、HPU、BPU、IPU、NPU、VPU、XPU等百花齐放。几乎26字母都已经被用到。
原因很简单,没有任何一款通用处理器或者芯片可以满足所有AI应用场景的需要。
似乎这些和HPC无关。
说到HPC,离不开Top500排行,以Link Pack测试性能指标为前提的排行。
HPC、超级计算机的性能被誉为一个国家科技实力象征,王冠上的明珠。
中国在Top500排行榜上取得了突破性的进展,天河2号和神威太湖之光连续6次和4次拿到了冠军,连续5年占据榜首。今年,才刚刚被美国Summit超过,行内人透露,用不了多久,也许就是半年之后,就会被国产机超过。
这个成绩是怎么取得的呢?
答案就是抓住了“异构并行计算”的机会。其中,GPU、FPGA和APU功不可没,从百万亿次,千万亿次,都是靠这样的一个技术。
HPC接下里的目标是E级计算,靠“异构并行计算”,靠花钱是没有办法突破E级计算的,接下来要面临“访存墙、通信墙、可靠性墙、能耗墙、并行计算可扩展性”等一系列难题。
简单说就是互联、网络、可靠性和功耗。
E级计算有用吗?
除了象征意义之外,计算能力也是非常重要的。
诺禾致源高级副总裁吴俊
在采访中,诺禾致源高级副总裁吴俊表示,作为一家开展基因测序服务和研究的公司,从测序仪产生的海量数据处理,到最终结果的分析判定,都需要强大的数据处理能力。
此前,1台基因测序仪产生的数据量是200GB~300GB,如今已经快速发展到6TB,时间也从7天~8天,缩短到2.5天。基因测序的成本,也从1万人民币暴跌到1000元左右,具备了商业化应用的前景。
HPC计算性能的提升,显然有助于服务流程的优化,快速相应需求。但是与此同时,也要根据商业模式选择合理的方案,没有办法无限制的追逐高性能。
相比于性能,诺禾致源更加看重的可靠性、稳定性以及节能的水平。联想在温水冷却等节能技术上独树一帜,在IBM x86服务器的基础上,有很多读到技术和可靠性、稳定性保障,这也是他们选择联想高性能计算的原因。
吴俊表示,现有基因测序分析软件并不适用于GPU。但在AI助力方面,HPC的计算能力、数据处理能力仍然是可以信赖的基础。
联想数据中心业务集团制造行业总监许子牛表示:HPC助力AI是一个方面,另外AI也可以助力HPC,例如能耗问题,访存效率的提升,都可以借助AI技术。这对于E级计算机的实现,也具有重要意义。
即使对于E级计算,“异构并行计算”仍然是首选的技术,各种XPU加速技术也有助于目标的实现。
未来的HPC不仅针对科学计算,将同样适用于大数据、AI的应用场景,这将会是一个应用领域兼顾的过程。
本次联想全球超算峰会,联想发布自主研发的AI产品家族:ThinkSystem SR670、ThinkSystem HG680、ThinkSystem HG690共3款产品,其实是HPC、AI优化的结果。联想还推出第三代温水水冷解决方案“海王星”系统,其中包括Direct-to-Node温水水冷技术、后门热交换器、以及由空气和液体冷却组成的混合冷却技术,使数据中心的运行效率提升高达50%。
这就是联想接地气的结果。
在本次峰会上,联想没有披露更多E级计算机进展,但其并不遥远。
小结
AI技术思路的突破,正在颠覆、改变就有的格局。以HPC为例,也在从科学计算、工程计算,渗透到大数据和AI,HBM(High Bandwidth Memory)、XPU、3D NAND、Optane等新技术产品的出现,也会极大改变现有的商业格局。
世界正在快速变化中,HPC当然也不例外!
欢迎订阅:
光阴荏苒,岁月如梭!消失的不仅是时间,随之而来的是纷繁变化的世界!追赶时代步伐,透视风云变化,把握产业脉络!这是作为一个“有态度”自媒体的永恒不变的主题!
欢迎交流、合作:
请加,
- ?
高性能计算硬件比肩国际水平 业内:中国更需要世界级工业软件公司
汤觅松
展开
中科院遗传所博士生导师梁承志 图片来源:采访对象供图
9月14日,中科院遗传所与联想数据中心相关人员在北京举办了一场小型沟通会,希望在高性能计算领域,科研界与产业界能架起更为紧密的桥梁。
“我们的日常工作以计算为主,分析生物大数据,没有高性能的计算机群来支撑的话,整个工作没有办法开展。”中科院遗传所博士生导师梁承志如此介绍高性能计算对现代生物信息学研究的重要性。今年五月份,在国际著名学术刊物《Nature》上,梁承志课题组首次揭示了小麦A基因组序列精细图谱,其实验过程中涉及大量的生物数据计算分析。
联想数据中心中国区方案营销总监李炜表示,中国企业目前基本上可以补全高性能计算机硬件领域所有空白点,无论性能是否足够好,国内已经可以做了。但是在软件领域国内很多地方是空白,中国需要世界级工业软件公司。
科研少不了自主高性能计算机
HPC是高性能计算机群的简称,是执行一般个人电脑无法处理的大资料量与高速运算的电脑,运算力更为强大的被称之为超级计算机。气候气象、海洋、航空航天、生物、材料、高能物理、药物、生命科学等领域的发展都少不了它,高性能计算机曾为天宫系列卫星路径预测、国产大飞机C919精细数值模拟立下汗马功劳。
梁承志在接受《每日经济新闻》记者采访时表示,2000年左右生物信息学科开始起步发展,呼唤更多研究人才。加之少年时代对于计算机的强烈兴趣,自己所在的群体遗传的分析又需要最新的方法、技术,最终选择了遗传学和生物信息的交叉领域。
1995年梁承志于中科院遗传所获得遗传学博士学位,而在2001年,梁承志在加拿大Waterloo大学又获得数学与计算机科学硕士学位。实现了从生物学到计算机科学的跨越,主要研究方向是基因组学和生物信息分析,这也成为梁承志学术生涯最重要的选择之一。梁承志于《Nature》所刊发的文中,绘制了小麦A基因组序列精细图谱,可以加速栽培小麦的遗传改良和分子设计育种。
在研讨会上,梁承志表示,生物大数据有着 “三高”的特征:高复杂性、高不确定性和高维度。这就导致了计算量的复杂,需要高性能计算机集群。如果没有高性能集群支撑的话,对数据的分析是没有办法实现的,因为数据量太大,对存储和计算都有很高的要求。
“以前我们做生物研究,相对来讲实验为主,做实验过程漫长,花费很高,积累数据量有限。现在实验能力提高了,十年前你要做实验可能要花费一年,现在一个月或者一周,甚至一两天就做完了。” 梁承志指出,现在我们得到了越来越多的数据,通过生物信息学的方法和分析过程,可以产生更多规律性的东西。
梁承志指出,随着生物信息技术的爆发,高性能计算力的提升更为迫切。其同时指出,科研及其他高精尖技术研发的特殊性决定了安全性上的保证更为重要。
软件应用需发力
在中科院遗传所的一处小小的机房所在地,一位科研人员介绍,中科院和联想合建的计算机集群,16年之间在这里不断更换,更新到了现在第四代深腾8810。计算力也从当时的万亿次,提升了千万亿次,提升了千倍。
深腾8810高性能计算机系统 图片来源:采访对象供图
回顾历史,我国高性能计算机确实实现了迅猛发展。1983年,我国“银河Ⅰ号”的运算速度达每秒1亿次,同时标志着我国巨型计算机研制成功。2002年8月,联想研制成功了深腾1800超级计算机,实际运算速度超过万亿次。这是中国超算系统首次进入全球TOP500,排名第43位。
新华社报道,在2017年新一期的全球超级计算机500强榜单中,中国超算“神威·太湖之光”和“天河二号”连续第四次分列冠亚军。
不过,“跑”得快、性能好的国产高性能计算机,在实现应用落地上仍需发力。李炜对《每日新闻记者》介绍,性能上我国产品已经足够好,但国产的高性能集群应用领域比较窄,硬件之外,需要软件层面的升级。
在高性能集群最早诞生的时候,最大的技术挑战在于计算能力的损耗。李炜解释,一个计算节点是两万亿次,一百个节点是两百万亿次,但计算的时候不能做到一加一等于二,会有能量的损耗。牛顿的能量转化定律决定了,现实状况下不可能实现理想状态下的能量转化的话,计算力转化就有流失,这就要靠软件。
梁承志对生物信息研究领域所面临的瓶颈进行了介绍。其表示,生物数据复杂性的特点使得其对软件的要求越来越高,目前很多软件能力比较弱。市场上现在生物信息的软件比十年前好太多了,但总的来讲,生物信息学分成不同的小的领域,每个小的领域的软件大家都是各做各的,还没有真正的好的融合,这需要一个过程。梁承志这样表达目前所遇到的阻碍,希望在HPC软件应用生态上更为协同完善。
中国有华为、联想等这些大的硬件企业,也有阿里巴巴、百度这样的互联网巨头,现在中国更需要世界级的工业软件公司。李炜指出,联想当时做集群的时候,已经自己开发了集群调优并行软件,特别是数学计算、遗传、物理、气象等领域里有专项团队在做算法开发,努力保证集群效率做到更高。
华金证券在研究报告中指出,从高性能计算机应用机构来看,HPC 应用正在从政府、研究机构转向商用,互联网企业渐渐成为HPC 应用的主战场。这主要得益于人工智能研发对高性能计算需求的增加,随着互联网、工业物联网等新兴负载的出现,有望改变高性能计算软件应用的短板。
每日经济新闻
- ?
数据中心部署HPC?还真得好好考虑考虑
粱以丹
展开
通常情况下,高性能计算(HPC)只有一些科研人员,科学家和工程师等使用,但随着云计算,物联网和大数据等技术的发展,HPC越来越受到行业的广泛欢迎,而其在数据中心行业的应用也越来越多。
根据最近的研究表明,高性能计算(HPC)2022年的市场规模将达到330亿美元,从2016年到2022年的复合增长率(CAGR)为5%.那么,数据中心运营商需要考虑哪些因素才能符合HPC的标准呢?
资本支出
首先,从资本支出的角度来看,最需要考虑的因素是采用这种技术所需的空间。数据中心往往建在城市的繁荣地区,其空间成本很高。因此,利用新技术改造这些现有设施并不总是可行的,更加可行的选择通常是建设一个新的数据中心,在新的数据中心里部署适当的基础设施来满足HPC的规模需求和客户需求。
显然,这将需要企业再次增加大量的支出,所以建设之前,了解市场对HPC服务的需求是很重要的。
除了考虑空间因素之外,还需要进行其他设施升级来满足HPC的需求。例如:冷却。
数据中心供应商将竭尽全力降低冷却成本,一些供应商在寒冷的地区建设并运营数据中心。而数据中心设备通常在20-30°C之间的温度下是服务器运行的最佳环境。
如果要部署高性能计算机,虽然其处理能力要高得多,但会带来散热的难题,因此热管理至关重要。
冷却需求
一些高性能计算(HPC)提供商试图通过液冷技术或者更强劲的风扇为服务器持续降温。然而,高性能计算(HPC)设备产生热量的速率通常大于机房空调或风扇的散热速率。所以,计划未来安装部署HPC系统的数据中心,需要构建一个远远超过最大制冷要求的冷却系统。
对于那些已经部署并且运营HPC技术的用户,需要投入大量资本来升级数据中心以满足所需的热管理需求。
电力需求
在满足部署HPC系统的空间和冷却需求后,提供足够能量来保证处理能力就至关重要。因此数据中心运营商需要提高必要的电力基础设施以满足高性能计算(HPC)和中端服务器的要求。部署HPC的企业需要考虑提供高密度电源,并且考虑是否能满足冷却要求,以及对环境的影响。
考虑新建数据中心的企业,即使当前没有安装部署HPC,也需要考虑到HPC可能对冷却和电源需求的影响。那些改造现有数据中心以适用于HPC的企业需要注意的是,如果不能满足大量的资本支出,那么说明要运行高性能计算机的时机还不成熟。
- ?
目标AI、云计算、高性能计算,AMD推出全球首款7nm数据中心GPU!
夏烟
展开
在AMD“跑步进入7nm时代”的行动中,GPU扮演了开路先锋的角色。在今天召开的Next Horizon技术大会上,AMD就宣布了全球首款7nm制程GPU产品:主要用于人工智能、云计算和高性能计算的AMD Radeon Instinct MI60和MI50数据中心GPU。MI是Machine Intelligence的缩写,可以很清晰地反映AMD Radeon Instinct产品线的定位。
在看到竞争对手凭借专业计算卡在人工智能和高性能计算领域混得风生水起后,AMD在一年多前正式推出了Radeon Instinct系列,用以取代之前的FirePro S。而在今年,Radeon Instinct随着7nm制程的升级也进行了产品升级,从之前的MI25升级为MI60和MI50。
我们先来看看AMD Radeon Instinct MI60和MI50的具体指标。从现场展示的PPT来看,MI60和MI50的规格差距并不大,二者的计算单元数量分别为64个和60个,流处理器数量分别为4096个和3840个。
MI60和MI50依然是基于VEGA GPU架构,但是AMD在采用7nm制程工艺的同时,对其核心架构进行了部分优化升级。比如优化了ALU算术逻辑单元,也增加了ECC完全校验功能,采用PCIe 4.0接口标准等。
其核心规模从14nm VEGA 10的125亿晶体管增加至7nm VEGA核心的132亿晶体管,不过因为其制程工艺的提升,核心面积从484平方毫米降低到了331平方毫米。同时其核心尺寸仅相当于竞争对手的大约40%,因此MI60和MI50在部署成本和密度方面具备相当的优势。
相比之前的MI25,MI60将内存带宽提高到了夸张的1TB/s,集合32GB HBM2存储,其数据单款基本达到了顶峰。同时,其还实现了包括GPU和存储在内的全面ECC校验,以及PCIe 4.0接口。
架构的优化、制程的提升以及存储带宽的扩大,使得MI60可以提供强大的混合精度FP16、FP32和INT4/INT8能力,从而满足动态工作负载的需求,特别是从训练复杂神经网络到运行针对这些训练网络的推理。同时,MI60还是目前世界上最快的双精度PCIe 4.0加速器,提供了高达7.4TFLOPS的峰值FP64性能,能够更有效地处理包括生命科学、能源、金融、汽车、航空航天、学术、政府、国防等行业的高性能应用。
相比MI25,MI60的FP16浮点性能提高了20%,INT8、INT4整数性能分别提高了140%、380%。凭借在INT8和FP64方面的性能改进,AMD得以将其Radeon Instinct产品线的应用场景从MI25时代的神经网络训练和虚拟化,扩展到了推理计算和高性能计算领域。
另外,通过PCIe 4.0接口和Infinity Fabric Link GPU互连技术,AMD可以通过硬件桥接的方式,实现八张加速卡分成两组的彼此互联。通过桥接,MI60可以实现高达6倍的快速数据传送,每个GPU的两个Infinity Fabric链路拥有多达200GB/s的对等带宽。
而在8张加速卡可以基于硬件虚拟化实现灵活组合,从一张加速卡支持16个虚拟机,到一台虚拟机拥有8张加速卡。
同时,其组合方式也非常灵活。1台服务器内拥有的8张加速卡可以采用灵活分组的方式,配置成为拥有1张、2张、4张以及8张加速卡的虚拟机。
在推出全新加速卡之外,AMD还宣布了用于加速计算的ROCm开放软件平台的新版本,该平台支持新加速卡的体系结构特性,包括众多开源体系下的新套件和库。它允许客户在开放环境中部署高性能、节能的异构计算系统。AMD Radeon Technologies Group高级副总裁David Wang在接受零镜网记者采访时表示:目前AMD拥有接近2000人的软件开发团队,会通过内部开发和外部协同的方式,不断支持ROCm开放软件平台的改进和升级。显然,在英特尔CUDA的成功案例在前,AMD也希望凭借更高费效比的硬件和免费开源的软件来抢回更多的市场。
高性能计算数据中心
-
1、只需3秒快速实现求和
-
2、如何快速填充序号
-
3、如何自动填充序号(公式法)
-
4、数据条的神奇应用
-
5、多文本快速合并
-
6、查找与替换的不同玩法
-
7、快速定位到指定区域
-
8、数据排序、工资条制作
-
9、快速筛选(模糊、精确筛选)
-
10、快速插入空行
-
11、快速删除空行
-
12.快速跳转到天涯海角
-
13、.同时查看两个Excel文件
-
14、用条件格式扮靓报表
-
15、一键插入Excel图表
-
16、批量处理行高、列宽
-
17、利用拆分功能查看数据
-
18、批量录入相同内容
-
19、工作表快速跳转
-
20、批量录入表格模板(精品课程)
-
21、Excel函数与公式的应用、公式循环引用的查找
-
22、IF函数单条件判断同比增长
-
23、用sum函数 格式相同,连续多表数据汇总
-
24、excel快捷键
-
25、VLOOKUP函数——根据销售员匹配销售额
-
26、统计各部门销售总额
-
27、统计指定条件个数
-
28、怎样输入当前日期和时间、星期数
-
29、销售业绩排名
-
30、Sumproduct函数-万能函数(销售额汇总求和)
-
31、根据销售员,地区,商品名称汇总
-
32、批量替换PPT字体
-
33、给销售额数据批量添加万元单位
-
34、一秒快速核对两列数据
-
35、快速定位到指定单元格或区域
-
36、快速制作双行标题工资条
-
37、给你的表格做个瘦身
-
38、快速打开常用的Excel文件
-
39、快速打开多个Excel文件
-
40、利用创建组—快速隐藏/展开多列数据
-
41、快速制作下拉菜单
-
42、复制粘贴表格,如何保留数据源列宽格式一致?
-
43、两列数据位置互换
-
44、1秒钟扮靓报表——如何实现表格隔行换色
-
45、快速删除重复记录——保留唯一值
-
46、快速向下填充、向右填充,文本或公式
-
47、给Excel文件添加密码
-
48、插入带图片的批注
-
49、输入公式后不计算?
-
50、如何设置单元格缩进
-
51、快速解决Excel表格总显示货币格式
-
52、批量添加万元单位
-
53、你会四舍五入么?
-
54、用RAND函数机选彩票
-
55、冻结首行你会么?
-
56、超链接的高级应用
-
57、IFERROR函数-屏蔽错误值
-
58、批量填充颜色
-
59、录入数据
-
60、快速输入工号
-
61、快速行列转置
-
62、自定义缩放界面
-
63、多个单元格同时输入
-
64、如何计算立方米?
-
65、快速制作双行标题工资条
-
66、输入带方框的√和×
-
67、快速将姓名对齐
-
68、快速输入性别
-
69、按单位职务排序
-
70、自动计算合同到期日期
-
71、计算时间间隔
-
72、日期和时间的拆分
-
73、快速处理不规范的日期格式
-
74、快速填充合并单元格
-
75、效率加倍的快捷键
-
76、快速复制表格和对象
-
77、快速创建工作表副本
-
78、快速复制序列号
-
79、快速显示公式
-
80、多个单元格同时输入
-
81、快速调整显示比例
-
82、快速自动填充
-
83、快速填充(Ctrl+E)
-
84、Ctrl与数字键结合
-
85、快速将多列数据整理为1列
-
86、快速将1列数据拆分为多列
-
87、快速定位公式
-
88、快速录入数据
-
89、快速累计求和
-
90、身份证号码显示为0怎么办?
-
91、快速制作斜线表头
-
92、文本竖向显示
-
93、神奇的监视窗口
-
94、不一样的格式刷
-
95、快速美化图表
-
96、快速生成当前日期
-
97、快速找出循环引用
-
98、快速提取信息
-
99、二维表快速转换为一维表
-
100、快速多表合并