NVIDIA 宣布,在最新一輪 MLPerf Training 6.0 中,其平台於全部七個項目都締造了最快的訓練時間[1]。它也是唯一一個將提交規模擴展到 8,192 顆 GPU 的平台,而最新一代的「GB300 NVL72」系統相較前一代達成最高 1.6 倍的訓練加速。在 AI 模型規模持續擴張之際,NVIDIA 藉這一輪把訓練基礎設施的效能、規模與可靠性一併端了出來。
什麼是 MLPerf Training 6.0
MLPerf Training 是一項經過同儕審查的業界標準基準測試,以一致的條件比較 AI 模型的訓練效能[1]。由於各家都在相同任務上比拼誰能更快達到目標品質,因此能橫向衡量某一運算平台的真實實力。
本次 6.0 版本新增了兩個 MoE(混合專家,依輸入只啟動部分專家網路的方式)預訓練任務:「DeepSeek-V3 671B」與「GPT-OSS-20B」,反映出 MoE 架構正逐漸成為大規模模型的核心[1]。
七項全部最快,唯一全項目提交
NVIDIA 是唯一一個在測試套件全部七個項目都提交結果的平台,並且在所有項目上都締造了最快的訓練時間[1]。本輪中,公司以「GB200 NVL72」與「GB300 NVL72」兩種機架級系統進行提交。
在每個機架內部,第五代 NVLink 交換器以高頻寬將 72 顆 GPU 連成一個統一的運算與記憶體資源池,使這 72 顆 GPU 宛如一顆巨型 GPU 般運作[1]。大規模 MoE 訓練需要在 GPU 之間進行全連接式通訊,把輸入詞元(token)路由到正確的專家子網路,而 NVLink 的頻寬正是高效完成這項工作的關鍵。NVIDIA 也展示了名為「NVFP4」的低精度訓練手法,能在滿足嚴格精度要求的同時提升效能;最近它便以 NVFP4 預訓練了擁有 5,500 億參數的大模型「NVIDIA Nemotron 3 Ultra」[1]。
GB300 NVL72 較前代最高快 1.6 倍
在本輪中,GB300 NVL72 在相同規模下相較 GB200 NVL72 達成最高 1.6 倍的訓練加速[1]。NVFP4 帶來的更高運算密度、擴充後的記憶體容量,以及讓 GPU 更易維持尖峰效能的更高功耗上限等 Blackwell Ultra 世代的強化點,共同造就了這項差距。NVIDIA 另外發布了針對相關結果更深入的技術解析[2]。
擴展至 8,192 顆 GPU 與合作夥伴紀錄
面向大規模分散式訓練,NVIDIA 提供兩種橫向擴展網路平台:「NVIDIA Quantum InfiniBand」與「NVIDIA Spectrum-X Ethernet」,資料中心可據此打造契合自身架構的大規模叢集[1]。
在套件中最大的 MoE 模型 DeepSeek-V3 671B 上,NVIDIA 以 GB200 NVL72 系統將提交規模擴展到 8,192 顆 GPU,這是 MLPerf Training 至今規模最大的 Blackwell 平台提交。在套件中最大的密集型 LLM 之一 Llama 3.1 405B 上,它也以 5,120 顆 GPU 提交了結果[1]。
合作夥伴的紀錄同樣亮眼。微軟 Azure 在 GB200 NVL72 上將 Llama 3.1 405B 訓練擴展到 8,192 顆 GPU,以 7.07 分鐘達到參考品質目標,締造該項目的最快訓練時間。CoreWeave 在該項目中拿下 DeepSeek-V3 671B 的最快訓練時間,使用以 Spectrum-X Ethernet 連接的 GB300 NVL72,在 8,192 顆 GPU 規模下以 2.02 分鐘達到品質目標[1]。
支撐大規模運行的可靠性
在生產環境中,訓練任務可能橫跨數十萬顆 GPU,並持續數週甚至數月。在這種規模下,有效訓練吞吐量不僅取決於系統效能,也取決於讓任務能長期重現的容錯能力[1]。
NVIDIA 表示,它從兩個方向打磨容錯能力。其一是減少故障本身:每顆 GPU 在進入資料中心之前,都要經過 30 多道製造測試工序的篩選,部署之後,「RAS(可靠性、可用性、可維護性)引擎」會監控晶片的幾乎整個區域,自我修復功能則在不中斷工作負載的情況下繞過偵測到的故障。在網路層面,Spectrum-X Ethernet 能以毫秒級速度繞過故障鏈路,在不影響任務的前提下維持網路健康[1]。
其二是加快故障發生後的復原。「NVIDIA Resiliency Extension(NVRx)」會在效能下滑的節點拖累整個叢集之前就加以偵測與管理,一旦發生中斷,它會從最近的檢查點(訓練狀態的儲存快照)復原,而非重啟整個任務,藉此把損失的時間降到最低[1]。
持續壯大的 Blackwell 生態
本輪合作夥伴參與踴躍,共有 19 家機構提交結果,包括微軟 Azure、CoreWeave、Dell Technologies、Google Cloud、富士通與 Supermicro 等[1]。
具體成果也已公開。Cohere 在 GB200 NVL72 上為其代理型 AI 平台「North」達成 3 倍的訓練加速。曾在 Blackwell 叢集上訓練影像生成模型「v8」的 Midjourney,如今正在 CoreWeave 上擴展大規模 Blackwell Ultra GPU 叢集,用於即將推出的影像與影片模型。Thinking Machines Lab 在 Google Cloud 的 GB300 NVL72 上,相較前一代獲得 2 倍的訓練與服務速度。Nebius 則在 Blackwell 基礎設施上將 Higgsfield 的訓練時間縮短 30%,支撐起一個如今服務 2,200 萬名使用者、每天生成超過 600 萬則 AI 內容的平台[1]。
總結
在 MLPerf Training 6.0 中,NVIDIA Blackwell 於全部七個項目都締造最快訓練時間,並且是唯一擴展到 8,192 顆 GPU 的平台。GB300 NVL72 相較前一代提升最高達 1.6 倍,再加上新增的 MoE 任務、NVFP4 低精度訓練,以及毫秒級繞過故障的可靠性,這些結果展現了該平台作為訓練基礎設施的綜合實力。
來源:https://blogs.nvidia.com/blog/blackwell-mlperf-training-6-0/
