NVIDIA 在官方部落格中主張,在電力限制日益收緊的 AI 時代,「每瓦效能」(效能/瓦)才是決定 AI 工廠獲利能力的最重要指標[1]。其核心邏輯是,在固定的電力預算內能產生多少 token,直接決定了營收與利潤。NVIDIA 表示,在最新一代主流開放模型上,Blackwell 世代的 GB300 NVL72 實現了較前一代 Hopper 最高 25 倍的每瓦效能。在實際生產環境中,Anthropic、OpenAI 等前沿 AI 公司也已採用 Blackwell 進行推論。
為何「每瓦效能」是最關鍵指標
對 AI 基礎設施而言,電力是無法迴避的限制。NVIDIA 解釋,在固定電力預算內能產生的 token 數量決定了 AI 工廠的營收與利潤率。僅憑 token 單價或晶片的理論峰值無法衡量真實效率,而每瓦效能只能透過真實運行結果取得、難以人為操縱,因此成為 AI 工廠的根基[1]。
隨著自主運行的智慧代理(agentic)AI 推動 token 需求進一步走高,各機構如今所做的基礎設施決策,將在受電力限制的世界中區分出「能擴張」與「無法擴張」的一方。目前幾乎所有前沿模型都採用將多個專家模型組合的 MoE(Mixture-of-Experts)架構,而要在機架規模上高效運行,就必須對從晶片到軟體的每一層進行一體化協同設計[1]。
Blackwell 實現的最高 25 倍效率提升
據 NVIDIA 表示,在最新一代主流開放模型上,GB300 NVL72 可實現較 Hopper 世代最高 25 倍的每瓦效能。不過該公司指出,這個數值只是 Blackwell 目前所處的起點,改進仍在持續[1]。
由於偏重低延遲的工作負載,與偏重吞吐量、成本的工作負載其最佳運行點各不相同,NVIDIA 並未以單一數值,而是用每個模型的效率曲線(帕累托曲線)來呈現效能,並提供 DynoSim 等工具,讓團隊在投入任何一個 GPU 小時進行驗證之前,就能找到最佳運行點[1]。
這樣的效率,是晶片到軟體一體化「協同設計」的成果。決定機架規模效能的 NVLink Switch 在 Vera Rubin 平台上已進入第 6 代,其 SHARP 可在交換器內部完成網路內運算,替 GPU 分擔負載。軟體方面,NVIDIA Dynamo、TensorRT LLM、SGLang 與 vLLM 疊加了 NVFP4 量化、拆分式服務(disaggregated serving)、大規模專家平行等最佳化,而且僅靠軟體改進效率也持續提升。在 DeepSeek V4 模型上,每瓦效能在短短一個月內提升了最高 5 倍[1]。
「僅六成可用」的問題與 DSX MaxLPS
NVIDIA 指出,在 AI 工廠中,由於冷卻與機架層級的損耗,從電網取得的電力真正用於 AI 處理的可能僅約 60%[1]。
彌補這項落差的,是 DSX 平台中的電力與效率控制軟體 DSX MaxLPS。它可在 GPU 與機架之間即時調配電力,並結合溫水液冷與電力最佳分配等手法,讓營運方能在相同電力預算下多運行最高 40% 的 GPU[1]。
生產環境的實績與採用案例
NVIDIA 強調,要在 AI 工廠規模上穩定運行所需的可靠性並非一蹴可幾。機架規模系統會出現單節點部署中不會遇到的故障型態,因此生產環境中的運行經驗本身就是一種優勢。其 Blackwell NVL72 在多樣的模型與用途中持續展現穩定效能與機架級可靠性,正因如此,Anthropic、OpenAI 等前沿 AI 公司才將其用於推論[1]。
具體部署也在擴大。CoreWeave 在 GB300 NVL72 上運行 Kimi K2.6 模型,結合 NVFP4 量化與推測式解碼技術 EAGLE3 以提升推論效能。Perplexity 在 GB200 NVL72 上運行 Qwen3 235B 以及經過後訓練的 Qwen3.5-397B-A17B,每天處理數百萬次查詢。Fireworks AI 在 Blackwell 上運行 GLM 5.2 模型,支撐 Cursor、Factory AI 等客戶的生產環境。這些累積下來的生產經驗,為下一代 NVIDIA Vera Rubin 帶來了先行者優勢[1]。
總結
NVIDIA 提出的,是把 AI 基礎設施的評價標準從「絕對效能」轉向「每瓦效能」。Blackwell 世代的 GB300 NVL72 展現出較 Hopper 最高 25 倍的每瓦效能,DSX MaxLPS 則能在相同電力預算下多運行最高 40% 的 GPU。隨著 Anthropic、OpenAI、CoreWeave、Perplexity 等在生產環境中的採用不斷擴大,在電力成為最大限制的時代,基礎設施的優劣或將直接左右 AI 服務本身的競爭力。
來源:https://blogs.nvidia.com/blog/performance-per-watt-ai-infrastructure-efficiency/
