NVIDIAが、AI学習の性能を測る業界標準ベンチマーク「MLPerf Training 6.0」の最新結果で、全7項目の最速記録を独占したと発表しました[1]。8,192基のGPUを使った過去最大規模の学習にも唯一対応し、最新世代の「GB300 NVL72」は前世代比で最大1.6倍の高速化を示しています。AIモデルの大規模化が止まらないなか、学習基盤の性能・規模・信頼性をまとめて押し出した格好です。

MLPerf Training 6.0とは

MLPerf Trainingは、AIモデルの学習(トレーニング)にかかる性能を、共通の条件で比較できるようにした査読付きの業界ベンチマークです[1]。各社が同じ課題でどれだけ速く目標品質に到達できるかを競うため、計算基盤の実力を横並びで見られるのが特徴です。

今回のバージョン6.0では、新たに2つのMoE(混合エキスパート、入力に応じて一部の専門家ネットワークだけを動かす方式)型の事前学習課題が加わりました。「DeepSeek-V3 671B」と「GPT-OSS-20B」で、MoEアーキテクチャが大規模モデルの中心になりつつある流れを反映しています[1]。

全7項目で最速、唯一の全項目提出

NVIDIAは、ベンチマークに含まれる7項目すべてに結果を提出した唯一のプラットフォームであり、そのすべてで最速の学習時間を記録しました[1]。今回は「GB200 NVL72」と「GB300 NVL72」という2種類のラック規模システムで提出しています。

各ラックの内部では、第5世代のNVLinkスイッチが72基のGPUを高帯域で結び、計算とメモリを1つの大きなプールとして扱える設計です。これにより、72基のGPUがあたかも巨大な1基のGPUのように振る舞います[1]。大規模なMoE学習では、入力(トークン)を適切な専門家ネットワークへ振り分けるためにGPU間で総当たり的な通信が発生しますが、NVLinkの帯域がこれを効率よくさばく鍵になっています。

NVIDIAは、厳しい精度要件を満たしながら性能を高める「NVFP4」と呼ぶ低精度学習の手法も披露しました。直近では、この手法を使って5,500億パラメータの大規模モデル「NVIDIA Nemotron 3 Ultra」を事前学習しています[1]。

GB300 NVL72は前世代比最大1.6倍

今回のラウンドで、GB300 NVL72は同じ規模のGB200 NVL72と比べて最大1.6倍速い学習を実現しました[1]。NVFP4によって高まった計算密度、拡張されたメモリ容量、そしてピーク性能を維持しやすくする高い電力上限といった、Blackwell Ultra世代の強化点がこの差を生んでいます。より詳細な技術解説はNVIDIAが別途公開しています[2]。

8,192基規模への拡張とパートナーの記録

大規模な分散学習に向けて、NVIDIAは2種類のスケールアウト用ネットワーク基盤を用意しています。「NVIDIA Quantum InfiniBand」と「NVIDIA Spectrum-X Ethernet」で、データセンターは自社の構成に合わせて大規模クラスターを構築できます[1]。

規模の面では、ベンチマーク中で最大のMoEモデルであるDeepSeek-V3 671Bにおいて、GB200 NVL72システムを使い8,192基のGPUまで拡張しました。これはMLPerf TrainingにおけるBlackwell基盤の提出として過去最大規模です。大規模な密結合型LLMの一つであるLlama 3.1 405Bでも、5,120基のGPUで結果を提出しています[1]。

パートナー各社の記録も目を引きます。Microsoft Azureは、GB200 NVL72で8,192基規模までLlama 3.1 405Bの学習を拡張し、基準品質に7.07分で到達して同項目の最速を記録しました。CoreWeaveは、Spectrum-X Ethernetで接続したGB300 NVL72を8,192基規模で用い、DeepSeek-V3 671Bを2.02分で基準品質に到達させて最速の学習時間をたたき出しています[1]。

大規模運用を支える信頼性

実際の本番環境では、学習が数十万基規模のGPUにまたがり、数週間から数か月続くこともあります。この規模では、実効的な学習スループットがシステムの性能だけでなく、長期にわたって再現できる耐障害性にも左右されます[1]。

NVIDIAは耐障害性を2つの方向から作り込んでいると説明します。1つは障害そのものを減らす取り組みで、GPUはデータセンターに届く前に30以上の製造テスト工程で選別され、稼働後も「RAS(信頼性・可用性・保守性)エンジン」がチップのほぼ全体を監視し、検知した不具合を自己修復機能が処理を止めずに迂回します。ネットワーク層では、Spectrum-X Ethernetが故障したリンクをミリ秒単位で迂回し、処理を妨げずに健全性を保ちます[1]。

もう1つは、障害が起きたときの復旧を速める仕組みです。「NVIDIA Resiliency Extension(NVRx)」は、性能が落ちたノードを周囲を巻き込む前に検知・管理し、障害が起きてもジョブ全体を再起動するのではなく、直近のチェックポイント(学習状態の保存スナップショット)から再開して、失われる時間を最小化します[1]。

広がるBlackwellのエコシステム

今回はパートナーの参加も活発で、Microsoft Azure、CoreWeave、Dell Technologies、Google Cloud、富士通、Supermicroなど19の組織が結果を提出しました[1]。

具体的な成果も公開されています。Cohereは、自社のエージェント型AIプラットフォーム「North」でGB200 NVL72を用い、3倍速い学習を達成しました。画像生成モデル「v8」をBlackwellクラスターで学習したMidjourneyは、今後の画像・動画モデルの学習に向けてCoreWeave上でBlackwell Ultraの大規模運用を進めています。Thinking Machines LabはGoogle Cloud上のGB300 NVL72で、前世代比2倍の学習・提供速度を得たとしています。さらにNebiusは、Blackwell基盤でHiggsfieldの学習時間を30%削減し、2,200万人が利用し1日600万件超のAIコンテンツを生み出すプラットフォームを支えています[1]。

まとめ

MLPerf Training 6.0で、NVIDIAのBlackwellは全7項目の最速記録を独占し、8,192基規模の学習にも唯一対応しました。GB300 NVL72は前世代比で最大1.6倍に伸び、新たに加わったMoE課題や低精度学習のNVFP4、ミリ秒単位で障害を迂回する信頼性まで含めて、学習基盤としての総合力を示した結果と言えます。

出典:https://blogs.nvidia.com/blog/blackwell-mlperf-training-6-0/

出典:https://developer.nvidia.com/blog/nvidia-blackwell-enables-3x-faster-training-and-nearly-2x-training-performance-per-dollar-than-previous-gen-architecture/