NVIDIAが公式ブログで、電力の制約が強まるAI時代には「ワットあたり性能(性能/ワット)」こそがAI工場(AIファクトリー)の収益性を左右する最重要指標だと主張しました[1]。決まった電力枠の中でどれだけのトークンを生み出せるかが売上と利益を決めるという考え方で、最新世代のオープンモデル群では、Blackwell世代のGB300 NVL72が前世代のHopper比で最大25倍のワットあたり性能を示したとしています。推論の実運用ではAnthropicやOpenAIもBlackwellを採用しているとのことです。

なぜ「ワットあたり性能」が最重要指標なのか

AIインフラにとって電力は避けられない制約です。NVIDIAは、決まった電力枠の中で生成できるトークン数がAI工場の売上と利益率を決めると説明します。トークン単価やチップの理論値だけでは実際の効率は測れず、実運用の結果としてしか得られない「性能/ワット」は操作しづらい指標であるため、AI工場の土台になるという主張です[1]。

自律的に動くエージェント型AIの普及でトークン需要が一段と高まるなか、いま各組織が下すインフラの判断が、電力に縛られた世界で「規模を伸ばせる側」と「伸ばせない側」を分けるとしています。現在の最先端モデルのほとんどは複数の専門家モデルを組み合わせるMoE(Mixture-of-Experts)構成を採用しており、これをラック規模で効率よく動かすには、半導体からソフトウェアまで全階層を一体で設計する必要があると強調しました[1]。

Blackwellが実現した前世代比25倍の効率

NVIDIAによると、最新世代の主要なオープンモデル群において、GB300 NVL72はHopper世代と比べて最大25倍のワットあたり性能を発揮します。ただし、この数値は現時点のBlackwellの立ち位置を示す出発点であり、改善は続いているとのことです[1]。

同社は、遅延を重視する処理と、スループットやコストを重視する処理では最適な動作点が異なるとして、単一の数値ではなくモデルごとの効率曲線(パレート曲線)で性能を示しています。GPUの実機検証に入る前に最適点を探せる「DynoSim」などのツールも提供しています[1]。

この効率は、半導体からソフトウェアまでを一体で設計する「コデザイン」の成果だと説明します。ラック規模の性能を左右する「NVLink Switch」はVera Rubinプラットフォームで第6世代となり、スイッチ内でネットワーク処理をこなす「SHARP」でGPUの負荷を肩代わりします。推論ソフト側でも、NVIDIA DynamoやTensorRT LLM、SGLang、vLLMがNVFP4量子化や処理を分割する分散サービング、大規模なエキスパート並列などの最適化を積み重ねており、ソフトの改良だけでも効率は伸び続けます。実際にモデル「DeepSeek V4」では、わずか1カ月でワットあたり性能が最大5倍に向上したとしています[1]。

電力の6割しか使えない問題と「DSX MaxLPS」

NVIDIAは、AI工場では冷却やラック単位の無駄によって、電力網から引いた電力のうち実際にAI処理へ使えるのは約60パーセントにとどまる場合があると指摘します[1]。

この差を埋めるのが、DSXプラットフォームの電力・効率制御ソフト「DSX MaxLPS」です。GPUやラックの間で電力を実時間で融通し、温水による液冷や電力の最適配分といった手法を組み合わせることで、同じ電力枠のままGPUを最大40パーセント多く動かせるようになるとしています[1]。

本番運用での実績と採用事例

NVIDIAは、AI工場の規模で安定して動かすための信頼性は一朝一夕には得られないと強調します。ラック規模のシステムは単一ノードでは起きない障害の形が出るため、実運用での経験がそのまま強みになるという考え方です。同社のBlackwell NVL72は多様なモデルと用途で持続的な性能とラック単位の信頼性を示しており、だからこそAnthropicやOpenAIといった先端AI企業が推論に採用しているとしています[1]。

具体的な導入も進んでいます。CoreWeaveはGB300 NVL72上でモデル「Kimi K2.6」を運用し、NVFP4量子化と投機的デコードの「EAGLE3」を組み合わせて推論性能を引き上げました。PerplexityはGB200 NVL72で「Qwen3 235B」や追加学習した「Qwen3.5-397B-A17B」を動かし、日々数百万件の問い合わせをさばいています。Fireworks AIはBlackwell上でモデル「GLM 5.2」を運用し、CursorやFactory AIといった顧客の本番環境を支えているとのことです。こうして積み上げた実運用の経験が、次世代のNVIDIA Vera Rubinに先行者の優位をもたらすとしています[1]。

まとめ

NVIDIAが打ち出したのは、AIインフラの評価軸を「絶対性能」から「ワットあたり性能」へと移す考え方です。Blackwell世代のGB300 NVL72はHopper比で最大25倍のワットあたり性能を示し、DSX MaxLPSは同じ電力枠でGPUを最大40パーセント増やせるとしています。AnthropicやOpenAI、CoreWeave、Perplexityなど実運用での採用も広がっており、電力が最大の制約になる時代には、インフラの優劣がそのままAIサービスの競争力を左右していきそうです。

出典:https://blogs.nvidia.com/blog/performance-per-watt-ai-infrastructure-efficiency/