NVIDIA新一代機架級AI系統「Vera Rubin NVL72」已進入量產階段。CoreWeave、Google Cloud、Microsoft Azure與Oracle Cloud Infrastructure的資料中心已有機架投入運轉,供應鏈橫跨30個國家、超過350個生產基地[1]。同一天,Microsoft與Mistral也發表了將動用數千顆該GPU的歐洲合作案[2]。

主打每百萬瓦Token數提升10倍

NVIDIA為Vera Rubin主打的指標並非尖峰效能,而是每百萬瓦能處理多少Token。對電力取得有上限的AI資料中心來說,這個數字更直接影響是否擴建的判斷。

早期導入的CoreWeave在DeepSeek-R1上的效能測試顯示,相較前一代Grace Blackwell NVL72,每百萬瓦的吞吐量提升到10倍[1]。NVIDIA本身也說明,與GB200 NVL72相比,每百萬瓦的Token數最多提升10倍,每百萬Token的成本降到十分之一[1]。

背後的原因在於,代理型系統的Token消耗量最高可達傳統AI應用的15倍[1]。若單位成本沒有下降而消耗量持續膨脹,營運預算會比運算容量更早觸頂。

不過,這些數值都是NVIDIA與導入企業自行提出的。比較條件與模型的執行設定並未公開,無法保證在其他工作負載上同樣成立,仍需等待第三方驗證。

把7顆晶片當成單一系統來設計

NVIDIA說明,Vera Rubin並不是把7種晶片與5種機架托盤當成個別產品組裝而成,而是從一開始就以單一系統的方式設計[1]。

核心是全新的NVIDIA Vera CPU。它採用名為Olympus的自研核心,鎖定代理時代的AI工廠,相較競爭對手的小晶片設計,單執行緒效能提升2倍、核心間頻寬提升3倍、記憶體延遲降低40%[1]。在GPU周邊執行的前處理、排程與代理控制迴圈,正是單執行緒效能容易發揮的領域。

網路方面,第六代NVLink負責向上擴展,在複雜工作負載上吞吐量提升2倍以上、延遲降到三分之一[1]。向外擴展則由102.4Tbps的Spectrum-6交換系統搭配1.6Tbps的ConnectX-9 SuperNIC完成,NVIDIA表示其RDMA頻寬比通用乙太網路高出1.6倍[1]。跨站點的Spectrum-XGS則可將多站點吞吐量提升1.9倍[1]。

此外,NVLink Fusion也向第三方XPU開放了NVLink的向上擴展基礎[1]。這與完全鎖定自家晶片的路線相反,為外部加速器保留了接入的窗口。

托盤裡不再有線材與風扇

在實體結構上最醒目的,是運算托盤拿掉了線材、風扇與水管。NVIDIA將此歸功於三個世代的機架級協同設計,並表示托盤組裝時間從數小時縮短為1分鐘[1]。在需要部署數萬台的資料中心,這個差距會直接反映在上線時程上。

散熱設計也有所改變。將液冷進水溫度設定在攝氏45度,使得只靠乾式冷卻器、不使用冰水主機的運轉方式成為可能[1]。對新建的AI工廠而言,搭配閉迴路液冷系統,每百萬瓦每年可節省數百萬加侖的水[1]。水資源正逐漸成為左右資料中心選址的條件,這是效能數字之外的另一項說服材料。

在歐洲成為Mistral的運算基礎

7月21日,Microsoft與Mistral宣布擴大策略合作[2]。這項針對歐洲AI基礎設施擴張的數十億美元規模(約數千億日圓規模)合約中,Mistral將把數千顆Vera Rubin GPU納入自家運算容量,並提供用於訓練、推論與大規模部署的共用平台[1][2]。Microsoft方面則將運用Mistral擴充後的歐洲GPU基礎設施,支撐自家雲端與AI服務的供應[2]。

※1美元=162日圓換算(截至2026年7月21日)

在模型層面,Mistral Medium 3.5與OCR 4已可在Microsoft Foundry中使用,Mistral Medium 3.5也已整合進Microsoft Copilot Studio[1][2]。透過Azure Local與Foundry Local,客戶可以在雲端與自行掌控的環境中執行相同的模型與工具[1]。

鎖定的是金融、醫療、製造等法規嚴格的產業[2]。在資料存放位置與運作流程受法規約束的領域,光是效能出色的模型往往不容易被選中,能否從公有雲一路提供到完全離線的環境才是判斷依據。對NVIDIA而言,向歐洲的開放模型路線供應運算資源,等於為量產確保了一個明確的出海口。

總結

Vera Rubin NVL72已進入量產階段,並在四家主要雲端業者投入運轉。橫跨30國350個以上基地的供應鏈、CoreWeave提出的每百萬瓦10倍吞吐量、1分鐘完成托盤組裝,以及免冰水主機的散熱設計,是這次的重點。在歐洲,它將支撐Microsoft與Mistral數十億美元規模的合作。所有效能數值都是廠商方面公布的,仍有必要等待第三方驗證。

來源