單靠堆疊 GPU 數量,已經難以讓 AI 算力同步成長。NVIDIA 宣布,作為 Vera Rubin 平台一環所設計的乙太網路交換器 Spectrum-6,正陸續進入全球超大規模 AI 資料中心[1]。單套系統提供 102.4Tb/s,是前一代的 2 倍容量。CoreWeave 與微軟等公司被列為首批導入的客戶[1]。

瓶頸已經從 GPU 移到網路

在數十萬顆 GPU 與 CPU 當成一台機器運作的超大規模 AI 工廠裡,湊齊峰值效能最高的 GPU 已經無法直接換來成果。大規模訓練與推論仰賴成千上萬個加速器持續交換資料[1]。

麻煩之處在於,這種流量與一般企業應用完全不同。GPU 之間對齊運算結果的集合通訊中,大量節點會在同一時刻一起送出資料。乙太網路最初主要是為使用者、伺服器與儲存之間的南北向流量而設計,並非為了超大規模 AI 這種同步且集中的通訊模式[1]。只要一條連結壅塞,整個工作都得跟著等待。

NVIDIA 在標準乙太網路之上疊加 Spectrum-X 這套專用架構,正是為了補上這段落差,而 Spectrum-6 就是新一代方案的核心[1]。

102.4Tb/s 是怎麼做出來的

Spectrum-6 採用 200G PAM4 SerDes,將單顆交換晶片的頻寬翻倍至 102.4Tb/s,可匯聚 512 個 200Gb/s 連接埠[2]。更高的連接埠密度,便於搭建針對 AI 流量特性最佳化的大規模網路架構。

光互連是另一個重點。Spectrum-6 既支援傳統可插拔光模組,也支援將光引擎與交換晶片封裝在一起的共封裝光學(CPO)形態[1]。CPO 版本內建 32 組各 3.2Tb/s 的矽光子光引擎,搭配微環調變器與可拆卸光纖接頭[2]。它同時支援液冷,讓包含網路設備在內的整座 AI 工廠可以納入同一套散熱方案[1]。

這顆晶片並非單獨使用。它與 ConnectX-9 SuperNIC 搭配,構成新一代 Spectrum-X 乙太網路。在 Vera Rubin 架構中,Spectrum-6 與 Vera CPU、Rubin GPU、NVLink 6 交換器、ConnectX-9 SuperNIC、BlueField-4 DPU 同屬一個世代[1]。

拿掉光模組帶來了什麼

去掉可插拔光模組與 DSP 重定時器,回報相當直接。NVIDIA 表示,Spectrum-X Ethernet Photonics 將網路電源效率提升約 5 倍,把光損耗從約 22dB 降到約 4dB,訊號完整性最高提升 64 倍[2]。元件數量與故障點減少,對於連續運行數週的訓練工作而言,作用不顯眼卻持續存在。

在整體網路層面,NVIDIA 稱 Spectrum-X 乙太網路相較通用乙太網路可帶來最高 1.6 倍的 AI 網路效能,在超過 10 萬顆 GPU 的部署中仍能維持最高 95% 的網路效率[1]。該公司還表示,硬體加速的多平面拓樸可將資料中心所需的交換器數量減少為原本的 1.7 分之一[1]。

不過這些數字全部出自 NVIDIA 自己。作為比較基準的通用乙太網路如何配置、測試條件為何,都未公開,實際部署能否重現並無保證。更有參考價值的,還是首批使用者後續提出的回報。

首批客戶涵蓋雲端業者與自建基礎設施的企業

NVIDIA 列出的首批導入 Spectrum-6 的企業包括 CoreWeave、微軟、Nebius、SpaceXAI 與特斯拉[1]。其中 CoreWeave、微軟與 Nebius 被稱為最早部署搭載 Spectrum-6 的 Vera Rubin 基礎設施的服務商[1]。

CoreWeave 網路產品總監 Min Jun 表示,把 Spectrum-6 與液冷 Spectrum-X 乙太網路基礎設施帶進自家 AI 工廠,有助於提供客戶訓練前沿模型、更快部署推論所需的頻寬、韌性與效率[1]。Nebius 全球合作副總裁 Laurelle Roseman 則指出,超大規模下的效能最終取決於協同,關鍵在於讓每顆 GPU 保持同步,避免一條慢速連結拖住整個工作[1]。

對雲端業者而言,吸引力在於更多運算資源可以當成統一的高效能資源來使用。對自建基礎設施的企業來說,效益則展現在更多 GPU 同步運作、在高負載集合通訊時維持更高使用率,以及長時間工作更強的韌性[1]。

總結

Spectrum-6 是作為 Vera Rubin 平台一環所設計的 102.4Tb/s 乙太網路交換器,容量為前一代的 2 倍。它透過 200G PAM4 SerDes 匯聚 512 個 200Gb/s 連接埠,並支援共封裝光學與液冷。NVIDIA 宣稱其相較通用乙太網路最高可帶來 1.6 倍效能,在 10 萬顆 GPU 以上規模維持最高 95% 的效率,但這些數據皆由廠商提供,尚待獨立驗證。首批導入名單包括 CoreWeave、微軟、Nebius、SpaceXAI 與特斯拉。

來源:https://blogs.nvidia.com/blog/nvidia-spectrum-six-arrives-in-gigascale-ai-factories/

來源:https://developer.nvidia.com/blog/inside-the-nvidia-rubin-platform-six-new-chips-one-ai-supercomputer/