自行設計 AI 晶片的超大規模業者越來越多,但晶片做出來之後,若少了像工廠一樣的整套設施,效能一樣發揮不出來。NVIDIA 在官方部落格再次說明 NVLink Fusion 的用意,這項技術把稱為 XPU 的自研加速器接進 NVIDIA 的機櫃級基礎設施[1]。作法是把晶片設計以外的沉重工作交給成熟方案,讓團隊只專注在真正想做出差異的地方。

AI 工廠看的是產出

NVIDIA 先整理了 AI 工廠的經濟性由什麼衡量。列出的指標包括每秒產生的 token 數、每瓦特的 token 數、單一 token 的成本、使用率,以及能夠持續運轉的時間[1]。決定收益的並不是單顆加速器的速度,而是整座設施能夠取出多少產出。

因此,投入自研 XPU 的企業無法只停在晶片設計。向上擴展與向外擴展的兩套網路、機櫃級架構、支撐量產的軟體,以及能夠穩定供貨的供應商生態,都得一併處理[1]。NVIDIA 認為,正是這些負擔拖慢了 XPU 上市的速度。

把 72 顆 XPU 放進同一個網域

NVLink Fusion 的核心,是把 XPU 拉進 NVLink 的向上擴展網域。第六代 NVLink 將 72 顆 XPU 視為一個網域,以高頻寬、低延遲互相連接。NVIDIA 指出,相較於以通用乙太網路為基礎的替代方案,XPU 之間傳輸的端到端延遲降到三分之一,封包速率則提高到 10 倍[1]。

產品資料也給出具體數字:NVLink 6 以每顆 XPU 3.6TB/s 的速度讓 72 顆加速器全互連,NVL72 網域整體頻寬達到 260TB/s,透過 SHARP 的 FP8 支援,頻寬效率提升到 4 倍[2]。未來的產品藍圖會把網域規模擴大到最多 1,152 顆加速器,並納入共同封裝光學元件的設計[1][2]。

另一項要素是 NVLink-C2C。它讓 XPU 與 NVIDIA Vera CPU 或其他生態系 CPU 進行晶片間直連,能源效率最高可達 PCIe 介面的 6 倍[1]。代理型系統在控制端與運算端之間往返頻繁,這裡一旦塞住,整體都會被拖住。

機櫃、散熱與電力都用現成的

採用 NVLink Fusion 的業者可以使用 NVIDIA MGX 機櫃級架構,以及 Vera Rubin NVL72 等 MGX 機種所使用的同一條供應鏈。機櫃、散熱、供電以及新的 800VDC 設計所需的元件由 MGX 供應商提供,製造夥伴則負責設計與整合[1]。

QCT 與廣達電腦產品暨解決方案主管 Jack Luoh 表示,在 Vera Rubin NVL72 上,產線的系統組裝可望達到接近 100% 的自動化,若 XPU 採用 NVLink Fusion,這些投資大多能夠沿用[1]。Intel 資料中心晶片工程副總裁暨總經理 Tim Wilson 也肯定可以依照工作負載選擇 CPU 架構、效能等級與軟體功能這一點[1]。

機櫃內部同樣為維運著想。參考運算託盤採用不含風扇、線材與軟管的全液冷設計,可以在機櫃持續運轉的情況下單獨抽出託盤。NVLink 交換器託盤同樣是液冷,支援維護期間繼續運作[1]。

晶片還沒定案,建築可以先蓋

資料中心的建置,從電力取得、建物設計、散熱、機櫃配置到網路架構,都要在最終採用哪種加速器確定之前展開。若設計被綁死在單一晶片上,那顆晶片一旦延期,整個計畫都會停擺[1]。

NVLink Fusion 以統一架構來處理這個問題。以 XPU 為基礎的系統,與 Vera Rubin NVL72 這類以 GPU 為基礎的系統,可以共用機櫃空間、網路、散熱與供電以及管理系統,因此可以先推進建置,把晶片組合留到後面再決定[1][2]。聯發科資料中心與運算事業群資深副總裁暨總經理 Vince Hu 說明,客戶可以先用 NVIDIA GPU 部署機櫃級方案,再依自己的節奏推進 XPU 開發,這正是這項計畫的價值所在[1]。創意電子董事長暨策略長 Lie-Szu Juang 也提到,NVLink Fusion 能把 NVIDIA 的技術與第三方製程銜接起來,形成統一的機櫃級架構[1]。

Amazon 旗下 Annapurna Labs 資深硬體開發經理 CC Lee 表示,使用已獲驗證的 NVL72 機櫃設計有助於縮短上市時間,也能接觸到多家供應商[1]。實際上,AWS 已在 Trainium4 的部署中採用 NVLink Fusion[2]。

動工前先驗證,運轉中可維護

設施重做的代價很高,因此動工前的驗證格外重要。NVLink Fusion 對齊 NVIDIA 為 AI 工廠設計的 DSX 參考架構,把建物、電力、散熱、運算與網路放在一起協同設計。NVIDIA Omniverse DSX AI Factory Blueprint 為 GW 級 AI 工廠提供數位分身與開放參考設計,讓夥伴能把設施與技術一起建模[1]。

軟體面同樣完整。用於分散式工作負載的 NVIDIA NCCL、負責解耦的 NVIDIA Dynamo 與 NIXL,以及承擔叢集管理與遙測的 NVIDIA Mission Control 搭配起來,可以把混合了不同加速器的設施當成一個協調運作的系統來管理[1]。

生態系持續擴大

參與的企業穩定增加。CPU 端有 Arm、Intel、富士通與 SiFive;自研晶片端有 Alchip、Astera Labs、創意電子、Marvell、聯發科與 SAMSUNG。設計工具廠商 Cadence 與 Synopsys,以及光學互連夥伴 Ayar Labs 與 Lightmatter 也在其中[2]。

其中與 Marvell 的關係最深。2026 年 3 月 31 日,NVIDIA 宣布與 Marvell 建立策略合作,並投資 20 億美元(約 3,200 億日圓)。Marvell 提供自研 XPU 與相容 NVLink Fusion 的向上擴展網路,NVIDIA 則提供 Vera CPU、ConnectX 網路卡、BlueField DPU、NVLink 互連、Spectrum-X 交換器以及機櫃級運算平台[3]。

※1 美元 = 159 日圓

總結

NVLink Fusion 對想要擁有自研晶片的企業提出的建議是:差異化以外的部分,都可以用現成的。把 72 顆 XPU 收進同一個網域的第六代 NVLink、MGX 的機櫃與供應鏈、以 DSX 進行的事前驗證,以及含 Mission Control 在內的軟體,整套一次提供。不必等晶片完成就能推進資料中心建置這一點,和目前電力與土地先行的 AI 投資節奏相當契合。

來源: https://blogs.nvidia.com/blog/nvlink-fusion-xpu-ai-factory/

來源: https://www.nvidia.com/en-us/data-center/nvlink-fusion/

來源: https://nvidianews.nvidia.com/news/nvidia-ai-ecosystem-expands-as-marvell-joins-forces-through-nvlink-fusion