9 月 15 日,NVIDIA 在美國加州聖塔克拉拉舉行的 AI Infra Summit 上,公開了 AI 工廠能源效率的最新實測結果與合作進展[1]。最新平台 Vera Rubin NVL72 在還原真實代理式工作負載的基準測試中,每百萬瓦吞吐量達到前一代的 30 倍。衡量 AI 基礎設施的標準,正從尖峰運算效能轉向每百萬瓦電力能產出多少 token。
評估指標從尖峰效能轉向每百萬瓦 token
上台演說的是 NVIDIA 超大規模與高效能運算副總裁 Ian Buck。今年的 AI Infra Summit 參與人數超過 8,000 人,遠高於去年的 3,500 人[1]。現場關注的核心,是如何在電力限制之下持續運轉 AI 基礎設施。
背後的推力是代理式 AI 的普及。代理會把推理步驟串接起來,並不斷呼叫外部工具來組織答案。NVIDIA 表示,單一工作階段累積數十萬個輸入 token 並不罕見,約為一般聊天請求的 15 倍[1]。處理量增加,耗電量也跟著上升。
因此 NVIDIA 提出從晶片到電網一體協同設計的思路。Vera Rubin 系統、推論軟體 Dynamo、NeMo 函式庫,以及包含 NVLink、Spectrum-X 乙太網路、ConnectX SuperNIC 與 BlueField DPU 的網路與儲存基礎,被整體視為一座 AI 工廠[1]。
Lambda 實測:相同電力預算下運行 19 個節點
負責動態最佳化電力分配的軟體是 NVIDIA DSX MaxLPS。它持續監測 GPU 與機櫃的耗電,把閒置電力調度到最需要的地方,回收靜態配置下被閒置的容量[1][2]。由於訓練與推論的耗電特性不同,混合負載的 AI 工廠效果最明顯。
AI 雲端服務業者 Lambda 在峰會上公布了在 Blackwell 世代伺服器上驗證 DSX MaxLPS 的結果。在通常只分配給 16 個節點的電力範圍內,Lambda 運行了 19 個節點,叢集整體 token 吞吐量從每秒約 400 萬提升到 500 萬,成長 24%,每瓦效能改善 23%[1]。對於下一代以 Vera Rubin NVL72 打造的 AI 工廠,NVIDIA 預期在合適的部署環境下,相同的百萬瓦預算可多容納最高 40% 的 GPU 容量[1][3]。
在機櫃層級,名為 Intelligent Power Smoothing 的軟體搭配擴充的儲能緩衝,可吸收短時間的功率尖峰。不必為瞬間峰值預留過多餘裕,系統就能更貼近持續負載運轉[1]。
真實代理式負載實測達前一代的 30 倍
最受矚目的是 SemiAnalysis AgentX 的量測結果。AgentX 會記錄真實的代理式程式開發工作階段,並完整保留脈絡成長、工具呼叫延遲與子代理產生的過程來衡量推論效能,捕捉單次請求型基準難以呈現的代理式負載樣貌[1]。
在 AgentX 上執行 DeepSeek V4 Pro 模型時,Vera Rubin NVL72 相較 GB300 NVL72 達到最高 30 倍的每百萬瓦吞吐量,每百萬 token 成本最多降至四十五分之一[1]。在電力受限的部署環境中,每百萬瓦吞吐量決定了 AI 工廠的營收上限,每百萬 token 成本則決定其利潤率。NVIDIA 將這項成果歸功於極致的協同設計:NVL72 的縱向擴展架構、第六代 NVLink、第五代 Tensor Core 的 NVFP4 精度,以及由 TensorRT LLM 與 Dynamo 構成的推論堆疊[1]。
在低延遲推論方面,NVIDIA Groq 3 LPX 與 Vera Rubin 相輔相成。在長脈絡下執行 2 兆參數以上的模型時,組合平台的每百萬瓦 token 吞吐量最高可達 GB200 NVL72 的 35 倍;在 10 萬脈絡長度的 Qwen 3.8 27B 工作負載中,Groq 3 LPX 達到每位使用者每秒 2,529 個輸出 token[1]。
AI 工廠與電網協同運作
另一項發表是把 AI 工廠變成電網的彈性調節資源。Emerald AI 與 NVIDIA 合作,在電力公司 Silicon Valley Power 的彈性負載併網計畫中示範自動降載。系統回應了數百次需求訊號,同時維護了 AI 工作負載的效能[1]。
支撐這項能力的是 DSX Flex。它接收電網的降載要求、需量反應事件與電價訊號,再依照事先設定的工作負載優先順序自動調整。最關鍵的任務持續執行,優先度較低的任務則暫時停止、之後再恢復[1]。資料中心因此從單純的耗電方,轉變為能依電網狀況調整用電的資源。
NVIDIA 同時揭露,Amazon 旗下的 Annapurna Labs 正與其合作開發 NVHBM 客製化高頻寬記憶體技術,d-Matrix 正把 NVLink Fusion 整合到自家的 Raptor XPU,Pinterest 則運用 Blackwell 與 Dynamo 把對話式 AI 帶進視覺探索[1]。
Vera CPU 的實測結果與 NVLink 6 的可靠性
CPU 端同樣繳出成績。Perplexity 針對代理式 AI 的安全沙箱平台 SPACE 評測 Vera CPU,沙箱啟動速度加快 1.9 倍。Redpanda 表示延遲僅為其他 CPU 的五點五分之一、吞吐量高出 73%,Starburst 指出查詢吞吐量提升 3 倍,Kinetica 量得分析查詢快 2.7 倍。ClickHouse 則說,在自家開放基準 ClickBench 上,Vera 是團隊目前測過最快的機器[1]。
規模越大,能否不中斷運轉就越關鍵。當數十萬顆 GPU 串在一起,暫時性錯誤、訊號衰減與硬體故障難以避免。NVLink 6 採用多層韌性架構:實體層提供客製前向錯誤更正、實體層重送與鏈路復原;網路層則以信用式流量控制、動態路由與鏈路重新平衡,把故障侷限在局部[1]。不讓單一故障拖垮整體運算,對 AI 工廠的實際產出與能源效率同樣重要。
總結
AI Infra Summit 傳達的訊息是,AI 基礎設施的標準正從比拼速度,轉向比拼每百萬瓦能完成多少工作。Vera Rubin NVL72 搭配 DSX MaxLPS,在相同的電力範圍內容納更多 GPU,並在真實代理式負載下錄得最高 30 倍於前一代的每百萬瓦吞吐量。加上與電網協同的 DSX Flex 實證,AI 工廠正把設計重心移向如何用好每一瓦電力這個課題。
來源[2]:https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps
來源[3]:https://blogs.nvidia.com/blog/vera-rubin-nvl72-efficiency-ai-agents/
