这是 8 月 24 日 NVIDIA 网络系列里最技术的一篇,作者 Scot Schultz,二十五年以上高性能计算背景。文章把 Spectrum-X 定位成为巨型规模 AI 工厂从零设计的硬件加速网络架构,核心想法是按作用域、信号和职责把硬件加速的控制环拆开。
规模先摆出来。单主机 NIC 侧,8 lane 的 ConnectX SuperNIC 给 800 Gbps,示例把它分解成四个独立的 200 Gbps 平面。两层组网可以超过 12.8 万端点,三层最高 1600 万端点。参考架构给的是 51.2 万个 Rubin GPU,每 GPU 1.6 Tb/s scale-out,100 Tb/s 交换机,512 端口乘 200 Gb/s,8 平面 4 rail。
故障场景的数字最有说服力。平面故障时流量在 3 毫秒内重定向,保留 75% 线速对分带宽。链路抖动恢复从 1.08 秒缩到 2.68 毫秒,相当于 400 倍。10% 链路故障时 Spectrum-X 带宽掉 11%、尾延迟涨 7%,传统方案原文写的是可能崩掉一半以上。
训练侧拿 DeepSeek-V3 的 step time 做对照。标准以太网独占环境 735 毫秒,加进噪声流量后变成 1.18 秒,慢了 1.6 倍,Spectrum-X 稳定在 668 毫秒。多租户下传统以太网的 All-to-All 带宽损失超过 80%,八平面里坏两成时 Spectrum-X 是七个平面满速加一个降级到 80% 的平面,All-to-All 带宽高 1.2 倍。对分带宽基准里传统以太网有部分节点对跌到 25 Gbps,Spectrum-X 维持 98% 线速。尾延迟 P99 方面,传统方案中位约 13 微秒并扩散到 22 微秒,Spectrum-X 在 75% 负载下是 8 到 9 微秒。
实现上,自适应路由做亚微秒队列采样,几百纳秒内响应,官方描述为最短队列优先算法的量化硬件近似。多平面这一层对软件透明,操作系统和集合通信库只看到一个统一的 RoCE 设备。结论句写得不客气,Spectrum-X 不只是性能优化,它是架构上的必需品。