NVIDIAが次世代のラック型AIシステム「Vera Rubin NVL72」の量産に入りました。CoreWeave、Google Cloud、Microsoft Azure、Oracle Cloud Infrastructureのデータセンターですでにラックが稼働しており、供給網は30カ国350カ所以上の生産拠点に広がっています[1]。同じ日には、このGPUを数千基規模で使うMicrosoftとMistralの欧州向け提携も発表されました[2]。
電力あたりのトークン数で10倍を主張
NVIDIAがVera Rubinで前面に押し出しているのは、ピーク性能ではなく1メガワットあたりで何トークン処理できるかという指標です。電力の調達に上限があるAIデータセンターでは、こちらのほうが増設の判断に直結するという理屈になります。
初期導入したCoreWeaveがDeepSeek-R1で測ったベンチマークでは、前世代のGrace Blackwell NVL72に対して1メガワットあたりのスループットが10倍になったとしています[1]。NVIDIA自身も、GB200 NVL72と比べて1メガワットあたりのトークン数が最大10倍、100万トークンあたりのコストが10分の1になると説明しています[1]。
背景にあるのは、エージェント型のシステムが従来のAIアプリケーションに比べて最大15倍のトークンを消費するという事情です[1]。処理の単価が下がらないまま消費量だけが膨らめば、運用コストが先に限界を迎えます。
もっとも、これらはいずれもNVIDIAと導入企業側が示した数値です。比較条件やモデルの実行設定までは公開されておらず、他のワークロードでそのまま再現される保証はありません。第三者による検証は今後を待つ必要があります。
7つのチップを1つのシステムとして設計する
Vera Rubinは、7種類のチップと5種類のラックトレイを個別の製品として組み合わせるのではなく、最初から1つのシステムとして設計したとNVIDIAは説明しています[1]。
中心にあるのが新しいNVIDIA Vera CPUです。エージェント時代のAI工場向けに設計したという独自コア「Olympus」を採用し、競合のチップレット設計と比べてシングルスレッド性能が2倍、コア間の帯域が3倍、メモリの遅延が40パーセント低いとしています[1]。GPUの周辺で走る前処理やスケジューリング、エージェントの制御ループはシングルスレッド性能が効きやすい領域で、そこを狙った設計といえます。
ネットワーク側では、第6世代のNVLinkがスケールアップを担い、複雑なワークロードで2倍以上のスループットと3倍低い遅延を実現するとしています[1]。スケールアウト側は102.4TbpsのSpectrum-6スイッチと1.6TbpsのConnectX-9 SuperNICを組み合わせた構成で、汎用イーサネットに対してRDMAの帯域が1.6倍になるとされています[1]。拠点をまたぐSpectrum-XGSでは複数サイト間のスループットが1.9倍になるという説明です[1]。
あわせて、NVLink FusionによってサードパーティのXPUをNVLinkのスケールアップ基盤に載せられるようにしています[1]。自社チップで固める方向とは逆に、外部のアクセラレータを取り込む窓口を残した形です。
トレイからケーブルとファンが消えた
物理的な作りで目を引くのは、コンピュートトレイからケーブル、ファン、ホースをなくした点です。NVIDIAはこれを3世代にわたるラック規模の協調設計の成果だとしており、トレイの組み立て時間が数時間から1分に短縮されたと説明しています[1]。数万台規模で並べるデータセンターでは、この差はそのまま立ち上げ期間に効いてきます。
冷却の設計も変わりました。液冷の入口温度を摂氏45度に設定することで、チラーを使わないドライクーラーだけの運用が可能になります[1]。新設のAI工場であれば、閉ループの液冷と組み合わせることで1メガワットあたり年間数百万ガロンの水を節約できるとしています[1]。水資源の確保はデータセンターの立地条件を左右する要素になりつつあり、性能の数字とは別の説得材料になります。
欧州ではMistralの計算基盤として使われる
7月21日には、MicrosoftとMistralが戦略的提携を拡大すると発表しました[2]。欧州のAIインフラ拡張に向けた数十億ドル規模(約数千億円規模)の契約で、Mistralが数千基規模のVera Rubin GPUを自社のGPU容量に追加し、学習と推論、大規模展開のための共通基盤として提供します[1][2]。Microsoft側は、拡張されたMistralの欧州GPU基盤を自社のクラウドとAIサービスの提供能力に充てるとしています[2]。
※1ドル162円換算(2026年7月21日時点)
モデル側では、Mistral Medium 3.5とOCR 4がMicrosoft Foundryで利用可能になり、Mistral Medium 3.5がMicrosoft Copilot Studioにも統合されます[1][2]。Azure LocalとFoundry Localを使えば、クラウドと顧客管理下の環境で同じモデルとツールを動かせる構成です[1]。
狙いは、金融や医療、製造といった規制の厳しい業種です[2]。データの所在や運用手順に規制がかかる領域では、性能が高いだけのモデルは選ばれにくく、公開クラウドから完全に切り離された環境まで選択肢を用意できるかどうかが判断材料になります。欧州が進めるオープンモデル路線に計算基盤を供給する立場を確保するという意味で、NVIDIAにとっては量産の出口を1つ確保した動きでもあります。
まとめ
Vera Rubin NVL72が量産段階に入り、主要クラウド4社ですでに稼働しています。30カ国350拠点以上という供給網の規模、CoreWeaveが示した1メガワットあたり10倍というベンチマーク、組み立て1分とチラー不要の冷却設計が今回の要点です。欧州ではMicrosoftとMistralの数十億ドル規模の提携を支える基盤として使われます。示された性能値はいずれもベンダー側の発表であり、第三者の検証を待つ姿勢は必要です。
