通信世界网消息(CWW)

AI集群的Scale-out网络之路

AI大模型的“智能涌现”,背后是算力规模的暴力美学。分布式训练的效率并非GPU数量的简单堆砌,一个核心的性能瓶颈在于网络的通信开销,当数万乃至十万GPU集群协同工作时,网络可能成为最大瓶颈。因此,AI服务器之间的网络互联技术,即Scale-out组网,成为业界关注的焦点之一。

一、常见Scale-out网络架构

AI集群Scale-out组网根基来自HPC高性能网络,其网络基础拓扑、RDMA、集合通信、无阻塞设计等均是HPC成熟技术迁移。但两者在流量模型、组网拓扑、设备选型等方面还是有很多不同。智算中心组网形式很多,如Dragonfly、Clos(Fat-Tree)、Slim Fly、Torus等,此外还演进出了多种变种的组网方式,如Rail-only、Rail-optimized、MPFT、ZCube等。其中,Fat-Tree架构由于其高效的路由设计、良好的可扩展性及方便管理等优势,在大模型训练场景下被广泛应用。通常采用Spine-Leaf两层Clos架构,当两层架构无法满足规模扩展时,可以增加一层Super-Spine来进行扩展。

1、两层Spine-Leaf(二级Fat-Tree)

当前最常见的Scale-out网络拓扑,属于二层Clos无阻塞架构,通常采用1:1无收敛设计,小到几十台GPU服务器,大到上千台AI服务器集群,均有大量应用案例。

  • 分层互联:Leaf层交换机向下直连GPU服务器,向上所有Leaf全互联全部Spine交换机,任意两台服务器最大两跳转发。

  • Scale-out 扩容逻辑:新增GPU服务器仅新增Leaf交换机,提升全局总带宽直接扩容Spine,可线性扩展。

  • 无阻塞设计:Leaf下行总带宽 = Leaf上行总带宽

  • 适配场景:几十至数千卡(取决于交换机的带宽容量)小/中/大型训练、推理集群,IB/RoCE 通用。

2、三层 Core-Spine-Leaf(三级Fat-Tree)

Fat-Tree架构的单POD容量完全取决于单设备端口数量,假设单台交换机端口数量为K,那么单Pod所能支持的最大GPU数量为:二层:Nmax=/2; 三层:Nmax= /4。当前商用的主流交换机为64口-128口400G, 由此可见,两级Spine-Leaf架构交换机端口容量暂不足以支撑万卡(以单GPU出一个400G网卡为例)规模,增加Core核心层实现跨Pod扩展,可将集群规模扩展到万卡乃至十万卡以上。

  • 分层互联:Leaf(接入GPU)→Spine(Pod内汇聚)→Core(跨Pod全局转发),任意两台服务器最大4跳转发。

  • Scale-out扩容逻辑:按Pod模块化横向堆叠,每个Pod独立2层 Spine-Leaf,Pod间通过Core互联。

  • 无阻塞设计:Leaf下行总带宽 = Leaf上行总带宽 = Spine下行总带宽 = Spine上行总带宽。

  • 典型落地:NVIDIA DGX SuperPod、曙光万卡超算集群,单集群可扩展至上万 GPU。

  • 缺点:交换机、光纤数量较多,布线复杂,CAPEX高,跨Pod通信延迟高于Pod内,拥塞及PFC死锁概率较两层组网高。

二、单轨/多轨接入方式

一个节点的若干张网卡如何接入Leaf交换机更适合AI集群的训练和推理呢?目前接入主流拓扑有两种。

单轨接入:将一台服务器的所有网卡接入到同一台Leaf,如图1所示。

打开网易新闻 查看更多图片
图1 单轨接入典型组网

  • 优势:组网连线短,可以用低成本的电缆接入,有效降低组网成本。同一Leaf接入的是同一节点的GPU,因此同节点的GPU之间通信可以只经过Leaf一跳即可达。当leaf出现故障时,影响的服务器数量较少。

  • 缺点:Scale-out最优流量路径与Scale-up的HBD(高带宽域)重叠。由于Scale-up的带宽远高于Scale-out网路,时延也更低,集合通信库在选路的时候,会优先选择Scale-up网络,这样Scale-out网络中通往同Leaf的最优路径不会被选中,而被浪费。

多轨接入:HPC以CPU、少量节点间All-to-All均匀流量为主,而大模型训练TP张量并行同号GPU(不同服务器的同编号GPU)互通最多,有极强的同卡号GPU局部性流量特征,因此演化出多轨(Rail-only/ Rail-Optimized)架构。将若干服务器同号网卡接入同一台Leaf,这种拓扑连线会比较长,因此一般只能使用光纤接入,造成组网成本较高。不过这种组网与单轨接入最大不同在于Scale-out的最优路径与Scale-up的HBD是正交的,能够充分发挥Scale-up和Scale-out网络的最优性能。

PXN(PCI×NVLink)是NCCL为多轨拓扑量身设计的通信优化能力,GPU不用经过CPU、QPI/UPI跨NUMA转发,依托服务器内部NVSwitch全互联,先通过NVLink把数据转发到目标网卡的同轨GPU,再走本机对应网卡出去,全程GPU直连转发,规避CPU内存拷贝瓶颈,最大化每张网卡的满带宽利用率。通过PXN/类PXN机制,用本机GPU跨卡转发实现跨轨流量中转,弥补跨卡号通信延迟。

多轨组网规则:同编号GPU网卡接入同一Leaf,天然隔离TP流量,大幅降低跨交换机拥塞。为解决LLM张量/数据并行通信局部化痛点,多轨组网分纯轨道Rail-Only、轨道优化Rail-Optimized两类。

1、Rail-Only一层轨道

打开网易新闻 查看更多图片

图2 多轨Rail-Only典型组网

  • 架构:服务器每张高速网卡独立接入一套Leaf交换机,无Spine层,同轨道网卡通信单跳直达。

  • 优势:流量物理隔离,跨轨拥塞不扩散,All-Reduce局部通信效率极高,成本低

  • 扩容:横向新增轨道平面线性提升总聚合带宽,单节点8×400G网卡标配8轨。

  • 集群规模:按照目前主流的51.2T交换机组网,8台交换机(128X400G端口),可以组成一个千卡集群。

Rail-Only特点是无Spine交换机,单层Leaf组网,同卡号GPU全部接入同一台Leaf交换机,构成一条独立Rail轨道(所有服务器GPU0连Leaf0=Rail0、GPU1连Leaf1=Rail1,…)。同服务器内多张GPU属于同一个HBD,依靠 NVLink 全互联互通。为什么要这样设计?

(1)大模型绝大部分以上高带宽通信(TP张量并行)都发生在同服务器HBD、同Rail同卡号GPU,跨轨流量占比低,中转开销可接受;

(2)砍掉Spine层,交换机、光模块数量直接减半,大幅降低智算集群建设成本;

(3)牺牲跨轨任意GPU一跳互通能力,换取主要流量的极致低延迟、满带宽无阻塞,效率更高。

Rail-Only组网下,同服务器不同卡号GPU(本机)之间,不走外部网络,直接走NVLink/NVSwitch本机通信。不同服务器不同卡号GPU(跨Rail)之间,由于没有Spine,不同Leaf(不同Rail)之间没有物理直连链路,无法一跳直达,必须通过本机HB域做GPU中转实现跨轨通信,转发路径为:源GPU(服务器A,卡号X,接入RailX)→ 本机 NVLink转发到同服务器目标卡号Y对应的本地GPU Y→本地GPU Y通过本机接入的RailY(LeafY交换机)→ 一跳转发到远端服务器B的GPU Y→远端服务器B内NVLink转发到目标GPU(卡号Z)。可见Rail-Only跨轨转发本质是节点内NVLink中转 + 同轨Leaf一跳转发,所有跨不同GPU编号的跨机流量,一定会经过源、目的两台服务器内部的一次 NVLink 转发,会带来两点开销:多一次本机显存间数据拷贝,轻微增加延迟;占用本机NVLink带宽。因此大模型并行策略会尽量把大流量TP张量并行约束在同Rail,避免频繁跨轨转发。

Rail-Only的每条Rail一般独立设置VLAN/子网,Leaf交换机作为对应网段网关,跨轨通信依靠本机多网卡多网段路由,把跨网段流量交给本机同服务器其他GPU绑定的网卡转发,属于主机侧三层路由转发逻辑。那么NCCL是如何做通信调度适配Rail-Only的呢?NCCL会自动识别Rail拓扑,优先调度同Rail同卡号GPU通信,最大化网络性能,必须跨轨时,自动选择本机NV路径做跨轨流量中转,完成跨服务器异号GPU的数据收发。

2、Rail-Optimized轨道 + Spine

单层轨道规模受限,增加Spine层做跨轨全局转发,兼顾本地低延迟与超大规模扩展,是目前更常见的组网选择。Rail-Optimized组网架构如图3所示。

打开网易新闻 查看更多图片

图3 多轨Rail-Optimized典型组网

  • 架构:服务器每张高速网卡独立接入一套Leaf交换机,有Spine层,相比传统二层Fat-Tree架构,每台Leaf只服务单一编号GPU,同轨道网卡通信单跳直达。

  • 优势:更匹配 NCCL All-Reduce分布式训练流量模型。

  • 扩容:横向新增轨道平面线性提升聚合带宽,单节点8×400G网卡标配8轨,可通过Spine层扩展。

  • 集群规模:按照目前主流的51.2T交换机组网,8台交换机(128X400G端口),可以组成一个八千卡集群。

通过对比可知,Rail-Only和Rail-Optimized的核心区别:

  • Rail-Optimized:不同Rail通过Spine交换机互通,跨服务器不同卡号GPU可网络层一跳直达,不需要本机GPU中转;

  • Rail-only:无Spine,跨不同卡号GPU必须本机HB域GPU中转转发,多一跳 NV链路开销。

三、Scale-out网络负载均衡技术

Scale-out网络,可以选择采用IB(InfiniBand)和RoCE(RDMA over Converged Ethernet)技术,均以RDMA技术为基础,而基于标准以太网的RoCEv2技术,具备更开放的生态,更低的成本等优势,逐渐成为AI集群Scale-out组网的主流技术。由于以太网本身并不是无损网络,意味着必须在有损的以太网上构建一个无丢包的网络环境。通过精细组合和调优PFC、ECN及DCQCN这“三驾马车”,实现这一目标。

  • PFC (优先级流控):作为基础保障,是一种逐跳的链路层流控机制,通过发送PAUSE帧来防止缓存溢出丢包,但可能引发队头阻塞。

  • ECN (显式拥塞通知):一种更主动的端到端拥塞管理机制,通过在IP头中标记拥塞位,通知发送端主动降速。

  • DCQCN (数据中心量化拥塞通知):一种将PFC和ECN有机结合的先进拥塞控制算法,其核心是“用ECN来避免PFC的触发”,在保证无损的同时,最大限度减少了PFC带来的性能抖动。

智算网络中通常同时承载大流量“大象流”和小流量“老鼠流”,以及常出现多入口多出口场景下流量分布不均、出口端口拥塞等问题,传统的负载均衡机制等价路由ECMP(Equal-Cost Multi-Pathrouting)的方式在这种情况下往往效果不佳,引发严重拥塞,导致带宽利用率低下。正因如此,各种新的负载均衡技术成为业界研究的重点,层出不穷。从报文转发的角度看,有增强逐流调度、逐包调度、信元调度,从重点优化点看,有端侧优化、网侧优化、端网协同优化等,简单介绍以下几种负载均衡方案。

1、SprayLink

打开网易新闻 查看更多图片

SprayLink(逐包喷洒)技术,通过端网协同的逐包负载分担机制,实现流量在多条路径上的均匀分布,显著提升链路带宽利用率,缓解拥塞压力。SprayLink通过识流分类、动态选路和乱序重组三个步骤,保障RoCEv2网络负载均衡与报文有序,提升吞吐、降低时延,实现高性能可靠传输。

图4 SprayLink实现机制

在数据中心RoCE网络中,流量特征如下:

  • RoCE业务“大象流”:主要用于AI训练,约占总带宽的70%;

  • 普通业务“老鼠流”:包含HTTPS请求与响应、应用间API调用及少量数据的查询、增删改操作,约占总带宽的20%;

  • RoCE协议报文“老鼠流”:用于RoCE网络的建立与维护,约占总带宽的10%。

传统负载分担方式中,大象流往往集中于单一路径,导致部分链路负载过高,而其他链路利用率偏低。负载不均不仅降低整体带宽利用率,还可能引发高负载链路上的业务异常和性能瓶颈。应用SprayLink技术后,可实现流量的逐包动态负载分担:

  • 大象流与老鼠流根据链路实时负载指标(如带宽利用率和队列深度)被智能分配至多条路径,确保精细化且均衡的流量调度。

  • 针对RoCE协议报文,SprayLink保证按流负载均衡,避免报文乱序,保障网络的无损传输和高可靠性。

2、LBN

LBN(Load Balance Network),主要用于解决多入口多出口场景下流量分布不均、出端口拥塞的问题,尤其适用于AI智算网络上行下行带宽1:1的高性能网络环境。LBN通过对入端口和出端口进行分组和智能编排,并建立一对一的映射关系,确保来自同一入口的流量始终固定转发到指定的出口。这种方式不仅保持了逐流转发的数据包顺序,还能让多个出口端口承担均衡的流量负载,从而提升网络整体吞吐率。

LBN的工作机制分为三个阶段:

(1) 用户将入端口加入LBN组后,设备为LBN 组中每个入端口设置LBN值,例如为Port 1设置LBN值为0。

打开网易新闻 查看更多图片

(2) 对出端口进行编号。根据路由表中每个等价路由组内的出端口顺序或二层聚合口成员端口的加入顺序,为出端口从0开始编号。例如,Port 4,Port 5,Port 6 的编号依次为0,1,2。

图5 对出端口进行编号

(3)每个等价路由组与每个LBN组形成映射关系。将每个LBN组中入端口的LBN值依次对每个等价路由组内的出端口数量进行取余运算,形成每个入端口与出端口的映射

打开网易新闻 查看更多图片

关系。例如,Port 1的LBN值为0,等价路由组A中存在3个出端口。LBN 值0对3取余为0,则Port 1对应的流量出端口是编号为0的Port 4。

图6 形成映射关系

3、DLB

DLB(DynamicLoadBalance,动态负载分担)技术,它通过实时感知网络状态与计算节点负载,动态调整流量分布。DLB引入时间戳、实时负载度量(端口带宽负载、队列大小)因子,在时间和带宽空间两个维度优化了负载分担效果。其工作思想就是持续监控链路的负载状态,根据实际情况动态地将报文分配到负载较低的路径上,以实现负载均衡。

打开网易新闻 查看更多图片

图7 DLB动态负载分担

DLB可以将流量根据时间间隔分割成多个部分,根据去往目的地每条路径的空闲情况,智能地分配每段流量的路径,确保整条流最大化利用链路资源并且高效地到达目的地。在业务忙时,DLB流量分担更积极,会更频繁检测各个链路的负载指标,对于流量分配和流量切换更活跃,且调度的粒度更细,并在防止抖动的前提下作动态调整。而在业务闲时,网络整体负载低,各条链路利用率都不高,DLB的调度就会相对保守和平滑,只保持基本的近似均衡和负载分布,且调节动作小、调节间隔更长。

4、FGLB

组网中如果使用通过传统hash或DLB等手段进行负载,则存在如下缺陷:

  • 路径调优时缺乏“全局视野”,即只能以本地链路状态作为依据进行负载分担,对于远端的拥塞则无法处理。

  • 极难感知突发拥塞并捕获拥塞流。

  • 发生拥塞后需要人工干预,在复杂场景中人工调优困难。

FGLB(Flexible Global Load Balance,灵活全局负载分担)技术能够自动感知网络内的拥塞位置,并实时捕获拥塞时刻的流信息,从中挑选出适宜的带宽流进行快速路径切换。同时,FGLB会实时整网同步并计算路径质量,在路径切换和负载分担时可以综合全局状态选取最佳路径,提升整网业务性能。

FGLB技术在Spine和Leaf之间通过协议报文来传播链路信息和流表信息,然后各设备通过报文同步的信息实现负载分担以及路径切换。FGLB技术存在两种流量转发模式:

  • 打开网易新闻 查看更多图片

    调带宽模式:Leaf设备根据LQ报文中携带的链路带宽信息,对发往对端Leaf设备的流量进行类似于UCMP(Unequal Cost Multiple Path,非等价多路径)的负载分担转发,以充分利用链路带宽,减少拥塞发生。

图8 流量转发比例

在此模式下,Spine会收集去往Leaf的链路带宽信息,然后将其通过协议报文通告给其他Leaf。如图所示,链路带宽信息完成全网泛洪后,Leaf1发往Leaf4的流量会在途径不同Spine的路径之间进行不等价的负载分担转发。负载分担的原则是:链路带宽级别更高的路径将承载更大比例的流量。Leaf 1到Leaf 4的流量有两条路径可选——通过Spine 1和通过Spine 2的两条路径。假设通过Spine 2的链路具有更高的带宽级别,两条链路的带宽级别之比为1:3,那么Leaf 1发往Leaf 4的流量中,25%会通过Spine 1转发,而75%会通过Spine 2转发。

  • 调流模式:多条链路等价负载分担,某条链路出现拥塞时,将流量切换至其他链路质量良好的链路中。

打开网易新闻 查看更多图片

图9 设备间负载分担链路发生拥塞时流量切换示意图

链路状态或链路质量值正常时,Leaf之间的东西向流量通过途经多个Spine的链路进行等价负载分担转发。当转发路径中出现部分链路拥塞时(是否发生拥塞由设备自动判断),会生成流表,将流量切换到剩余未拥塞且链路质量优的链路中。

打开网易新闻 查看更多图片

图10 路径切换示意图

如图10所示,如果Spine1和Leaf4之间只有一条链路,或所有链路的链路质量均较差,则Spine会通过协议报文向Leaf 1通告流表,使得Leaf 1将去往Leaf 4的流量切换到链路质量较好的路径。

链路Down 时的处理:如图11所示,当Leaf 4与Spine 1之间的链路Down时,Spine 1会向除了Leaf 4之外的三台Leaf设备都发送协议报文,Leaf设备收到协议报文后会将故障的下一跳进行失效处理,并通过剩下的下一跳负载分担转发流量,借此实现链路Down后的快速路径切换。

打开网易新闻 查看更多图片

图11 链路Down时路径切换

5、Traffic Matrix

Traffic Matrix(流量矩阵)是一种由一条或多条流表组成,每条流表中可以定义报文的五元组作为流量的标识信息,同时流表中还指定了该条流量对应的出接口和下一跳用于控制流量的转发。当业务流量匹配到Traffic Matrix流表中的标识信息时,流量优先按照流表中指定的出接口和下一跳查表转发。

打开网易新闻 查看更多图片

图12 Traffic Matrix示意图

打开网易新闻 查看更多图片

动态Traffic Matrix是指由FGLB方式的自适应路由功能触发生成的Traffic Matrix表项,在这种场景下,无需SDN控制器也可以实现流量的全局负载均衡。

图13 自适应路由动态生成Traffic Matrix示意图

如图13所示,Leaf 1去往Leaf 4的业务流量为例,Leaf 1上存在ECMP等价路径:

  • 通过Spine 1转发的Link 1和Link 2

  • 通过Spine 2转发的Link 3和Link 4

当Spine 1监测到Leaf 1的远端链路Link 2发生拥塞(链路带宽利用率超限、端口队列深度过长)或故障时,Spine 1会生成基于UDP的ARN(Adaptive Routing Notification,自适应路由通知)报文,并通知Leaf 1。Leaf 1根据ARN报文中携带的Device ID和下一跳信息,排除ECMP等价路径中拥塞或故障的转发路径,再基于剩下的可用路径生成动态Traffic Matrix流表,指导业务流量转发。

6、路径导航

常见的负载均衡改进方案,一般仅在网络侧调整交换机调度策略,或只在计算节点改进任务分发方式,缺少对全局状态的统筹感知,在适用范围、稳定性和性能一致性上存在明显不足。路径导航技术,全局规划最佳业务路径,从而实现网络流量的均衡分布,为大规模AI模型训练提供了稳健的网络支撑。路径导航技术分为如下两种:

  • 打开网易新闻 查看更多图片

    端网协同路径导航技术:通过端侧主动上报运行状态,结合网络控制器对全局链路状态的持续监测,动态预判潜在拥塞节点,并基于实时负载情况调整数据流向,从而保障数据传输的高效性与稳定性。

图14 端网协同路径导航

其工作步骤为:

(1) AD-DC控制器对组网进行拓扑采集,收集网络结构信息。

(2) 训练任务启动。

(3) 交换机采集流量数据后,发送给AD-DC控制器。

(4) AD-DC控制器智能建模和选路,最后将优化后的路由策略下发至交换机,完成业务路径规划。

  • 端侧解耦路径导航技术:该技术采用纯网侧实现方案,无需端侧设备参与或适配,通过NFLB(Network Flow Load-Balance,网络流负载均衡)机制实现全局路径优化。其核心是基于网侧链路状态与拓扑信息进行集中式决策,动态调整流量路径,确保负载均衡与高效传输。相比端网协同方案,NFLB无需端侧代理部署或状态上报,降低了实施复杂度,同时仍能在大规模AI训练等场景下提供高性能的流量调度能力,尤其适用于端侧封闭或受限的环境。

四、Scale-out网络工程实践

组网设计方面,阿里云2024年提出双端口双平面组网架构,目前已经成为很多互联网厂商的重要组网方案。该架构的目的主要是为了提升性能、增加可靠性、避免哈希极化,这种多轨双平面的设计,在ROFT(Rail-Optimized Fat-Tree)架构基础上,将每个网卡的400G端口拆分成两个200G端口,分别连接到两个不同的Leaf交换机上,Leaf交换机下行400G端口拆分成两个200G端口,连接不同网卡。随着NVIDIA ConnectX-8(CX8 SuperNIC)网卡的成熟商用,将一个网卡的800G端口拆分成两个400G端口,也成为DGX GB200/B300 SuperPod及其他大规模RoCE智算集群双平面组网的重要选择。

打开网易新闻 查看更多图片

图15 双平面组网

双平面组网具有以下主要优势:

  • 消除哈希极化:在传统大模型训练网络中,容易导致哈希极化,流量分布不均。双平面设计将Leaf交换机分为两组,流量进入两个独立组后路径固定,在一定程度上避免了哈希极化,确保流量均匀分布,提升网络性能。

  • 扩展性提升和成本降低:按照51.2T交换机两层组网计算,最大可达到15K规模的GPU集群,相比传统单平面组网扩大了一倍,对比三层CLOS架构减少了大量的交换机和光模块,极大降低部署成本的同时,也提高了网络的时延及拥塞的发生。

  • 增强可靠性与容错能力:GPU双上联到两个独立的Leaf交换机,消除单点故障风险,提高了网络的容错能力,保障大模型训练的稳定性。

因此在Scale-out组网扩展方面,三层组网变二层组网、二层万卡、多端口多平面组网可能是未来一段时间的发展趋势。

五、Scale-out发展展望

未来,Scale-out 横向互联将围绕超高带宽、端网协同、开放异构、全光低碳演进。端口从400G普及800G,中长期落地1.6T,CPO光电共封装降低互联功耗与成本。协议上RoCE持续追赶IB,UEC、GSE新一代无损以太网逐步标准化。端网深度协同,网卡硬件卸载集合通信、交换机内置动态负载均衡算法等技术协同使用。网络将支撑十万卡级集群横向扩容,Scale-up与Scale-out融合并延伸Scale-Across 跨机房长距无损互联,形成全域算力组网底座。