单纯堆叠 GPU 数量,已经很难让 AI 算力同步增长。英伟达宣布,作为 Vera Rubin 平台组成部分设计的以太网交换机 Spectrum-6,正在进入全球超大规模 AI 数据中心[1]。单套系统提供 102.4Tb/s,相当于上一代的 2 倍。CoreWeave、微软等公司被列为首批引入的客户[1]。

瓶颈已经从 GPU 转移到网络

在数十万块 GPU 和 CPU 作为一台机器运转的超大规模 AI 工厂里,凑齐峰值性能最高的 GPU 已经不能直接换来结果。大规模训练与推理依赖成千上万个加速器持续交换数据[1]。

麻烦在于,这种流量与常见的企业应用完全不同。GPU 之间对齐计算结果的集合通信中,大量节点会在同一时刻一起发送数据。以太网最初主要是为用户、服务器与存储之间的南北向流量设计的,并非为超大规模 AI 这种同步且集中的通信模式而生[1]。只要一条链路拥塞,整个作业都要跟着等待。

英伟达在标准以太网之上叠加 Spectrum-X 这一专用体系,正是为了补上这段差距,而 Spectrum-6 就是新一代方案的核心[1]。

102.4Tb/s 是怎么做出来的

Spectrum-6 采用 200G PAM4 SerDes,将单颗交换芯片的带宽翻倍至 102.4Tb/s,可汇聚 512 个 200Gb/s 端口[2]。更高的端口密度,便于搭建面向 AI 流量特征优化的大规模网络。

光互连是另一个重点。Spectrum-6 既支持传统可插拔光模块,也支持将光引擎与交换芯片封装在一起的共封装光学(CPO)形态[1]。CPO 版本内置 32 个各 3.2Tb/s 的硅光光引擎,配合微环调制器与可拆卸光纤连接器[2]。它同时支持液冷,使得包含网络设备在内的整座 AI 工厂可以纳入同一套散热方案[1]。

这颗芯片并非独立使用。它与 ConnectX-9 SuperNIC 搭配,构成新一代 Spectrum-X 以太网。在 Vera Rubin 体系中,Spectrum-6 与 Vera CPU、Rubin GPU、NVLink 6 交换机、ConnectX-9 SuperNIC、BlueField-4 DPU 同属一代[1]。

拿掉光模块带来了什么

去掉可插拔光模块与 DSP 重定时器,回报相当直接。英伟达表示,Spectrum-X Ethernet Photonics 将网络电源效率提升约 5 倍,把光损耗从约 22dB 降到约 4dB,信号完整性最高提升 64 倍[2]。元件数量和故障点减少,对于连续运行数周的训练作业来说,作用不显眼却持续存在。

在整体网络层面,英伟达称 Spectrum-X 以太网相比通用以太网可带来最高 1.6 倍的 AI 网络性能,在超过 10 万块 GPU 的部署中仍能维持最高 95% 的网络效率[1]。该公司还表示,硬件加速的多平面拓扑可将数据中心所需交换机数量减少至原来的 1.7 分之一[1]。

不过这些数字全部来自英伟达自身。作为对比基准的通用以太网如何配置、测试条件如何,均未公开,实际部署中能否复现并无保证。更有参考价值的,还是首批用户后续给出的反馈。

首批客户既有云厂商也有自建基础设施的企业

英伟达列出的首批引入 Spectrum-6 的企业包括 CoreWeave、微软、Nebius、SpaceXAI 和特斯拉[1]。其中 CoreWeave、微软和 Nebius 被称为最早部署搭载 Spectrum-6 的 Vera Rubin 基础设施的服务商[1]。

CoreWeave 网络产品总监 Min Jun 表示,把 Spectrum-6 与液冷 Spectrum-X 以太网基础设施引入自家 AI 工厂,有助于提供客户训练前沿模型、更快部署推理所需的带宽、韧性与效率[1]。Nebius 全球合作副总裁 Laurelle Roseman 称,超大规模下的性能最终取决于协同,关键是让每块 GPU 保持同步,避免一条慢链路拖住整个作业[1]。

对云厂商而言,吸引力在于更多算力可以作为统一的高性能资源来使用。对自建基础设施的企业来说,收益则体现为更多 GPU 同步工作、在高负载集合通信时保持更高利用率,以及长时间作业更强的韧性[1]。

总结

Spectrum-6 是作为 Vera Rubin 平台一部分设计的 102.4Tb/s 以太网交换机,容量为上一代的 2 倍。它通过 200G PAM4 SerDes 汇聚 512 个 200Gb/s 端口,并支持共封装光学与液冷。英伟达宣称其相比通用以太网最高可带来 1.6 倍性能,在 10 万块 GPU 以上规模保持最高 95% 的效率,但这些数据均由厂商提供,尚待独立验证。首批引入名单包括 CoreWeave、微软、Nebius、SpaceXAI 和特斯拉。

来源:https://blogs.nvidia.com/blog/nvidia-spectrum-six-arrives-in-gigascale-ai-factories/

来源:https://developer.nvidia.com/blog/inside-the-nvidia-rubin-platform-six-new-chips-one-ai-supercomputer/