Giga-Scale AI 与以太网演进:Spectrum-X 如何改写规则
生成式 AI 的爆发式增长从根本上重塑了数据中心的架构。当分布式模型训练扩展到数十万张 GPU 时,连接这些节点的 Scale-out 网络已成为首要的性能瓶颈。
数十年来,传统现成以太网一直是企业网络和云网络的绝对王者:成本低、标准统一,处理高熵通用 Web 流量非常高效。然而,当传统以太网被迫应对 AI 架构所需的巨量、高度同步的通信模式时,它撞上了物理极限。
为填补这一空白,NVIDIA 推出了 Spectrum-X Ethernet——一种从底层为 Giga-Scale AI 工厂设计硬件加速网络架构。不同于依赖几十年旧有路由和拥塞控制范式传统以太网,Spectrum-X 对高性能交换机与宿主机侧网络接口卡(NIC)进行协同设计,在极端负载和压力下提供可预测的低延迟、高拓扑利用率和强大的弹性。
本文探讨传统以太网为何难以适配 AI 负载的结构化局限,剖析 Spectrum-X 以太网的独特架构原则,并解释 Spectrum-X Multiplane 技术如何最大化二分带宽、加速 Time-to-AI。
迎面相撞:传统以太网为何无法承载 AI 负载
标准数据中心流量具有高熵特性:数百万条小型、独立的流以不同方向穿梭。Equal-Cost Multi-Path(ECMP)路由通过静态流哈希将它们分散到并行路径上,通常能实现均衡的利用率。
AI 训练流量则低熵得多。GPU 持续通过 All-Reduce、All-Gather、All-to-All 等集合操作进行同步,形成数量相对少但规模巨大且高度同步的流。这暴露了传统以太网的三大局限:
- 哈希冲突与掉队者:ECMP 无法感知实时拥塞,导致大流可能在某条链路上碰撞,而其他链路却闲置。由于同步集合操作的完成时间取决于最慢的那条流,一旦某条路径拥塞,整个集合操作就会受阻,大量 GPU 因此空转。
解构Spectrum-X以太网:三重叠加的控制环路
在每秒 800 Gbps(Gigabit)乃至更高的速率下,传播延迟由光速决定且固定不变,但带宽-延迟积极为庞大。为避免队列堆积和丢包,网络Fabric必须以微秒级时延实时响应拥塞。
由于基于软件的控制路径无法在这一严苛窗口内作出反应,Spectrum-X Ethernet 将全硬件加速作为核心架构要求。其基本设计原则是:按作用域、信号和责任分离硬件加速控制环路。通过将网络控制分解为三个独立且互不干扰的环路,Spectrum-X Ethernet 能在其自然时延尺度上解决拥塞,同时避免产生破坏Fabric稳定性的反馈环路。
交换机内自适应路由
不同于传统以太网静态哈希ECMP路由,Spectrum-X Ethernet 交换机实现了逐包自适应路由(Adaptive Routing, AR)。交换机采用 Join-Shortest-Queue(JSQ)算法的量化硬件近似版本,以亚微秒间隔对 ECMP 组中每个出端口的队列深度进行采样。数据包到达时,交换机动态将其导向拥塞程度最低的物理端口。这一无状态、与流无关的机制可在数百纳秒内对瞬态本地不平衡作出响应,保持交换机队列精简,防止局部热点形成。
目标式拥塞控制
虽然 AR 可在 Fabric 内部均衡路径利用率,却无法解决端点 incast 问题——即多个发送方同时向单个接收方传输数据、导致接收方出端口饱和的场景。为此,Spectrum-X Ethernet 实现了先进的硬件加速拥塞控制(Congestion Control, CC)机制。
关键在于,Spectrum-X Ethernet 协同设计了交换机与 SuperNIC 的响应行为:交换机仅在自适应路由能力完全耗尽且队列持续积压时才发出显式拥塞通知(ECN)标记。发送端结合精确的 RTT 探测与 ECN 标记,在 RTT 时间尺度上调整发送速率。这既避免了网络对短暂微突发(AR 即可轻松平衡)过度反应,又能在真正的端点级拥塞发生时实现快速、精准的降速。
基于网卡的负载均衡
平面负载均衡器(PLB)位于主机边缘,是 Spectrum-X 以太网 SuperNIC(如 NVIDIA ConnectX)内置的专用硬件引擎。PLB 结合本地队列反馈与端到端、逐平面的拥塞遥测数据,动态将数据包分发至多个网络平面。该机制将在下文详细阐述。
揭秘 Multiplane Topology 与 Spectrum-X 多平面技术
若要将 AI 工厂扩展至数万张 GPU,传统网络架构通常只能不断增加层级(例如从二层 fat-tree 升级为三层)。然而,堆叠层级弊端显著:不仅会引入延迟与抖动、导致负载不均,还会令光模块、线缆及功耗成本大幅飙升。
为突破这一扩展瓶颈,现代 AI 数据中心采用了 Multiplane Topology。它不再构建单一庞杂的多层网络,而是将单台主机的海量带宽(例如 8 通道 ConnectX SuperNIC 提供的 800 Gbps)拆分为多条低速且物理独立的网络平面(例如四个独立的 200 Gbps 平面)。每个平面均采用高效扁平的二层 fat-tree 结构搭建。
在主机边缘,系统通过 shuffle-boxes 或 trunk cables 等无源光器件实现主机与平面的连接。这些器件将多端口网卡的各条光纤分别路由至所有独立平面,既在主机侧提供了极其丰富的路径多样性,又保障了网卡间的完整互通。因此,仅凭简单的二层拓扑即可扩展至 12.8 万以上的终端节点;若改用三层拓扑,规模更可拓展至 1600 万终端,且完全避免了传统多层架构固有的延迟与抖动瓶颈。
oblivious packet spraying 的缺陷
Multiplane Topology 虽具备巨大的理论带宽潜力,但其实际效能完全依赖于流量在各平面间的完美均衡。部分标准架构试图通过 oblivious spraying 来解决这一问题,即在传输层按顺序将数据包轮转到各个平面,却无法感知任何平面的实时状态。
解决方案:Spectrum-X 多平面技术
要充分发挥多平面架构的潜力,Spectrum-X Multiplane 技术直接在 SuperNIC 芯片中实现了硬件加速的 Plane Load Balancer(PLB)。PLB 让多平面架构对应用层完全透明——操作系统和集合通信库只会看到一个统一单一的 RoCE 设备。所有的流量分发、负载均衡和故障切换均由 Spectrum-X 以太网硬件自行处理。
与 Spectrum-X 以太网交换机协同工作时,PLB 对每一枚发送的数据包执行一种独特的、有状态的、两阶段层级选择机制:
- 端到端拥塞过滤:针对每块目标 GPU,SuperNIC 均为每个物理平面独立维护有状态的 Congestion Control 上下文。各上下文独立监测 RTT probes 并处理 Congestion Notification Packets (CNPs),以此计算出对应平面的实时速率配额。发包前,SuperNIC 将所需传输速率与各平面配额进行比对。若某平面出现端到端拥塞或链路故障,则临时将其从可用集中剔除。
- 本地队列选择:在剩余健康且无拥塞的平面中,SuperNIC 硬件挑选本地 egress queue 最浅的那一个。这与主机边缘交换机的 Adaptive Routing 机制如出一辙。
通过将各平面的 CC 状态隔离,并结合本地 egress queue 深度,Spectrum-X Ethernet 能够将拥塞严格限制在故障平面内。以平面 2 发生链路故障为例,Connect-X SuperNIC 会立即检测到 RTT timeout,自动将平面 2 从可用集中屏蔽,并在 3 毫秒内透明地将所有流量重新分发至其余三个正常平面,从而保留 75% 的总 line-rate bisection bandwidth。
实际影响:弹性、隔离性与 Time-to-AI
为验证上述架构设计,NVIDIA 联合研究人员在生产级集群与高保真仿真环境中对 Spectrum-X Ethernet 进行了严格测试。结果清晰表明,在高位利用率、故障场景及多租户环境下,Spectrum-X Ethernet 与传统现成以太网存在着显著差距:
- 多平面韧性:例如,在8平面网络的一个平面上出现20%的交换机间连接故障时,传统以太网多平面网络会立即遭遇瓶颈。由于依赖无感知负载均衡,所有平面的性能都会坍塌至与故障平面相同的80%水平,整个网络被限制在80%容量。相比之下,Spectrum-X Multiplane 利用其状态感知的PLB动态绕过局部瓶颈,让七个健康平面保持100%容量运行,仅故障平面以80%运行。通过充分利用所有可用健康容量而非跌落到最低公分母,Spectrum-X Multiplane 在故障期间提供高出1.2倍的All-to-All collective带宽,实现容量按比例递减的优雅降级,确保大规模AI训练任务持续推进。
- 可预测的高利用率性能:在最坏情况的 RDMA 二分基准测试下,传统以太网的静态 ECMP 路由会因流哈希冲突而崩溃,部分 GPU 对的吞吐量可降至 25 Gbps。Spectrum-X 以太网利用 AR 和 PLB 技术,在所有 GPU 对之间实现稳定且可预测的带宽分布,维持理论线速率的 98%。此外,传统以太网在 75% 网络负载下表现出严重的延迟抖动,P99 尾延迟高达 22 µs,而 Spectrum-X 以太网的 P99 尾延迟仅保持在紧凑的 8~9 µs。
- 无缝故障切换韧性:当主机到叶交换机的链路出现抖动时,传统以太网基于软件或非加速负载均衡器需要超过1.08秒才能恢复并重新路由流量,这会导致大规模通信停滞,使GPU集体通信操作陷入冻结。相比之下,Spectrum-X以太网的硬件加速PLB(可编程负载均衡器)能在2.68毫秒内完成故障切换。这400倍的提速可以透明地吸收瞬时故障,不会打断正在进行的LLM训练步骤。
此外,链路故障在所难免,但其性能影响应与物理连接丢失程度成比例。然而这一目标的实现十分困难,因为路径上出现的多个故障可能严重影响多个源-目的对之间的连通性。
传统以太网在电缆故障和链路闪断时会呈现非比例性降级——10%的叶节点上联链路中断即可因路由不对称导致整体带宽骤降50%以上。而Spectrum-X以太网的降级严格遵循容量比例原则:在10% Fabric链路故障场景下,其带宽仅按比例下降11%,尾部延迟也仅增加7%,整体性能近乎理想。
这种强大的弹性保障使运营商即便在所有物理基础设施问题尚未完全排除的情况下,也能以接近最优的效率运行训练工作负载,从而大幅缩短"AI就绪时间"。
今日AI工厂的蓝图
从通用云计算向Giga-Scale生成式AI的转型,标志着网络需求的根本性转变。传统商用以太网建立在高熵流量、静态路由和软件控制拥塞环路的假设之上,根本无法满足同步AI集合操作对微秒级零抖动的严苛要求。
Spectrum-X Ethernet 重新书写了网络规则手册。通过将关键控制环路解耦并硬件加速——涵盖 fabric 内的自适应路由、传输层的精准拥塞控制,以及主机边缘的 PLB——Spectrum-X Ethernet 能够满足 giga-scale AI 对可预测、稳定且超低延迟性能的需求。此外,Spectrum-X Multiplane 技术提供了一个稳健、高弹性且运维可视的网络 fabric,简化集群扩展、保护多租户工作负载,并将"Time-to-AI"压缩至最短。对于任何正在构建 AI 工厂的组织而言,Spectrum-X Ethernet 已不只是性能优化手段——它是一种架构层面的必然选择。进一步阅读
要了解 Spectrum-X Ethernet 和 Spectrum-X Multiplane 的更多信息,请阅读已发布的白皮书 here。
参考资料
- Khashab, S., et al. (2025). 《面向 Giga-Scale AI 工厂的高速网络》. NVIDIA 技术白皮书
- Bai, W., et al. (2023). 《赋能 Azure 存储的 RDMA》. USENIX 网络系统与实现研讨会论文集 (NSDI)
- Gangidi, A., et al. (2024). 《面向 Meta 规模分布式训练的以太网 RDMA》. ACM SIGCOMM 会议论文集
- DeepSeek-AI. (2024). 《DeepSeek-V3 技术报告》. arXiv 预印本
- Khashab, S., et al. (2025). 《NSX:基于 AI 服务器的大规模网络仿真》. ACM 人工智能网络会议论文集