打开网易新闻 查看更多图片

5月9日,数云原力大会2024在神州数码国际创新中心(IIC)召开。

在开幕式上,神州数码副总裁、神州数码信创控股董事长韩智敏发布新一代神州鲲泰绿色异构智算中心全液冷整机柜新品,在异构智算的时代,通过软硬件协同创新,为客户提供性能强、能效高、节能环保的新选择。

会上,神州鲲泰推出HISO异构智算调度运营平台、HICA异构智算加速平台,来有效解决智算集群间以及集群内面临的复杂异构兼容问题,显著提升算力资源的利用率。

据介绍,HISO异构智算调度运营平台,基于云原生技术,整合GPU硬分片和虚拟分片技术,能实现GPU资源虚拟化或池化,完成跨集群之间的算力调度。根据用户业务需求,该平台可以在整个异构智算资源池中匹配优选算力组合,提升GPU服务器集群的资源使用率。

HISO异构智算调度运营平台拥有将国内外GPU资源混合组网、混搭调度,算力精细隔离等关键能力,可以“像管理一台GPU主机一样,管理和调度多个集群的GPU资源”。通过GPU容器直通、IaaS卸载,该平台加速了模型加载时间,相比传统方式,模型加载速度提升3倍,同时还能实时收集智算中心全栈、全链路指标,发现和定位软硬件故障,实现算力可观测性。

HICA异构智算加速平台则着重解决集群内部的算力调度优化问题,通过屏蔽集群内底层算力生态差异,突破关键计算效率瓶颈,有效提升算力利用率与可用性。

通过自研的服务层、中间适配层以及调度编排算法,采用数据并行、模型并行等方式,HICA异构智算加速平台把并行计算任务进行有效分解,匹配相应的软件栈和算力资源来承接。当GPU资源变化,该平台可以实时动态调度计算子任务并调整模型拓扑和架构,以充分聚合各种算力资源。

据悉,HICA异构智算加速平台具有一云多芯特性,支持国内外主流AI芯片,可实现训练推理任务在不同品牌、不同型号芯片组成的智算集群中的混合训练推理,预计可降低20%闲置算力。

此外,针对节点间互联的能耗问题,神州鲲泰采用硅光技术,通过单光源多调制器,降低调制器电压,同时采用分布式反馈激光器等一系列技术,有效降低25%的互联能耗。

同时,针对节点的能耗问题,神州鲲泰推出液冷服务器,通过一体化冷板,智能流量调节来提升系统的散热效率,采用负压管线系统,漏液近端探测技术,并联动服务管控系统提升冷却系统的可靠性,有效降低30%的节点能耗。

而为了帮助客户规避接口多、接头复杂、现场实施部署难度大、实施周期长等难题,数云原力大会2024开幕式上,神州鲲泰还正式发布“KunTaiPod2000全液冷整机柜”方案产品,采用一体化交付方式,来有效降低部署和运维的复杂度,同时该整机柜还能实现100%全液冷及高性价比液冷方案,助力数据中心PUE迈向1.15。