NVIDIAが8月4日、自動運転向けの推論モデル「NVIDIA Alpamayo 2 Super」を商用利用できる形で公開しました。パラメータ数は340億で、重みはHugging Faceに置かれています。ライセンスはLinux Foundationの寛容型ライセンスOpenMDW-1.1で、追加の許諾なしに微調整も派生モデルの再配布もできる点が今回の要点です[1]。
研究用から「そのまま量産に使える」へ
Alpamayo 2 Super自体は5月31日、台北で開かれたNVIDIA GTCで発表されたモデルです[2]。当時は夏頃にGitHubで推論コード、Hugging Faceで重みを公開する予定と説明されていました。今回はその公開が実際に行われ、あわせてライセンスの扱いがはっきりしたという流れになります。
初期のAlpamayoは研究開発向けとして提供されていました。今回はOpenMDW-1.1がAlpamayoファミリー全体に適用され、どのモデルも追加の許諾を取らずに商用展開できるようになっています[1]。微調整、派生モデルの作成、商用での再配布までライセンスの範囲に入り、蒸留した小型モデルもNVIDIAの許可なしに商用利用できます。モデルの出力自体にはライセンス条件が付きません[3]。
ここが自動車メーカーやサプライヤーにとっては大きい部分です。自社の走行データや運転ポリシーに合わせてモデルを作り込んでも、その成果を手元に置いたまま製品に載せられます。基盤側の能力を一から学習し直す必要がなく、タスクごとにフロンティアモデルの利用料を払い続ける構図からも外れます。
320億+20億の2段構成、カメラは最大7台
Alpamayo 2 Superは、320億パラメータの「NVIDIA Cosmos 3 Super Reasoner」と、20億パラメータの拡散モデルベースの「Action Expert」を組み合わせた構成です。合計で340億パラメータになり、仕上げに強化学習による事後学習が入っています[3]。
役割分担ははっきりしています。Reasonerが複数カメラの映像、言語による文脈、直前までの自車の動きを解釈し、Action Expertがその内部表現を将来の走行軌道に変換します。
知覚の範囲は最大7台のカメラによる360度で、前方中心だった従来世代から広がりました[3]。車線変更、合流、信号のない右左折、複雑な交差点といった、そもそも危険が生まれやすい場面ほど側方と後方の情報が効いてきます。
規模の面では、100億パラメータだった前世代のAlpamayo 1とAlpamayo 1.5に対して3倍になりました[1]。NVIDIAは、容量の増加によって少ない事例からの一般化が効くようになったと説明しています。日常的な場面ではなく、めったに起きない多車両の絡んだ状況こそが自動運転の難所なので、そこを狙った増強だと読めます。
1回の入力に対して5種類の出力を返す
Alpamayo 2 Superは、1つの走行場面に対して次の5つを同時に出力できます[1]。
- 自車がこれから取る軌道
- その判断の理由を説明するChain-of-Causation(CoC、因果の連鎖)トレース
- 譲る、車線変更する、停止するといった上位の意図を表すメタアクション
- 学習・検証データ向けのCoC注釈を自動生成する推論オートラベル
- カメラ画像内の該当領域と回答を結び付ける、2Dグラウンディング付きの視覚質問応答(VQA)
軌道が「何をするか」で、CoCトレースが「なぜそうするか」です。両方が出てくると、モデルが何を見て何を選んだのかを開発者が追えるようになります。失敗が知覚で起きたのか、推論で起きたのか、行動生成で起きたのかを切り分ける作業も、ここが分かれていると進めやすくなります。
オートラベラーとしての使い方も想定されています。自社車両で集めた大量の走行クリップに対してCoCラベルと2Dグラウンディング付きのVQAを回すことで、生の映像を学習データに変えられます。NVIDIAは、これによって注釈作業のサイクルが数か月から数日に縮むとしています[1][3]。
ベンチマークでの位置づけ
NVIDIAが公開した数値を並べると、前世代のAlpamayo 1.5 Nanoからの積み上げ幅と、汎用の大規模モデルとの差が見えてきます[3]。
| 評価 | 指標 | Alpamayo 2 Super | 比較対象 |
|---|---|---|---|
| LingoQA | Lingo-Judgeスコア | 79.2 | Alpamayo 1.5 Nano 74.2/Qwen3-VL 32B 72.2/Qwen2.5-VL 72B 62.2/Gemini 2.5 Pro 64.1/GPT-4o 56.0 |
| 軌道予測 | minADE_6(6.4秒) | 0.911m | Alpamayo 1.5 Nano 0.916m |
| 自動運転の推論 | 推論スコア | 0.433 | Alpamayo 1.5 Nano 0.414/GPT-5.5 0.502 |
| 閉ループ評価 | AlpaSimスコア | 1.50±0.13 | Alpamayo 1.5 Nano 1.37±0.10 |
自動運転の推論を測るLingoQAでは、評価された37モデルの中で1位です[3]。Qwen2.5-VL 72Bに17.0ポイント、Gemini 2.5 Proに15.1ポイント、GPT-4oに23.2ポイントの差を付けています。パラメータ数で倍以上あるモデルを上回っている点は、専用に鍛えたモデルの強さが出た結果と言えます。
一方で、Physical AI AV Reasoning Benchmarkの推論スコアではGPT-5.5の0.502に届いていません。用途を絞った基盤モデルが、あらゆる指標で最新の汎用モデルを上回るわけではないということです。
そのほか、94,000本のクリップを使ったメタアクションの評価では、横方向74.59、縦方向61.91、車線単位73.55のIoUを記録しています[3]。VQAの回答類似度は0.652で、Qwen3-VL 32Bの0.450を上回ります。2Dグラウンディングの精度はIoUで0.71と、同じ比較対象の0.17から大きく開きました。
クラウドで考え、車内では蒸留したモデルを動かす
340億パラメータのモデルをそのまま車に載せるわけではありません。NVIDIAが示しているのは、クラウドで大きなモデルに推論トレースや合成学習データを作らせ、それを教師として小型モデルに蒸留し、車内ではNVIDIA DRIVE AGX Thorで動く軽いモデルを走らせるという流れです[1][2]。ファミリー内でも、Alpamayo 1.5とAlpamayo 1はクラウド側の開発と蒸留向けに、より安く使える選択肢として残されています。
安全検証との接続も用意されています。CoCトレースはNVIDIA Halosの安全検証ワークフローに組み込め、ISO/PAS 8800の要件に沿ったAIの安全性の検討に使えるとされています[1]。判断の理由が文章として残る形式は、規制当局とのやり取りを想定すると効いてくる部分です。
周辺の道具立ても揃っています。閉ループのシミュレーションを担うNVIDIA AlpaSim、高スループットの強化学習を回すNVIDIA AlpaGym、学習と評価用のNVIDIA Physical AI Open Datasets、そして事後学習のレシピとオートラベリングのパイプラインが公開されています[1]。Alpamayoファミリーのダウンロード数はHugging Faceで50万回を超えました[1]。
まとめ
NVIDIAは8月4日、340億パラメータの自動運転向け推論モデルAlpamayo 2 Superを商用利用可能な形で公開しました。ライセンスはOpenMDW-1.1で、微調整・派生モデル・商用再配布までを含み、Alpamayoファミリー全体に適用されています。320億パラメータのCosmos 3 Super Reasonerと20億パラメータのAction Expertで構成され、最大7台のカメラで360度を見て、軌道・CoCトレース・メタアクション・オートラベル・VQAの5種類を出力します。LingoQAでは37モデル中1位ですが、自動運転の推論スコアではGPT-5.5に及んでおらず、用途特化と汎用の差はまだ指標ごとに違う形で残っています。
参考リンク
[1] NVIDIA Alpamayo 2 Super, the Frontier Open Model for Robotaxis and Autonomous Vehicles, Now Available for Commercial Use - NVIDIA Blog
[2] NVIDIA Launches Alpamayo 2 Super Open Reasoning Model for Robotaxis - NVIDIA Newsroom
[3] Generate Trajectories, Reasoning Traces, and Auto-Labels with NVIDIA Alpamayo 2 Super - NVIDIA Technical Blog
