NVIDIA 於 8 月 4 日以可商用的形式釋出了自動駕駛用的推理模型 NVIDIA Alpamayo 2 Super。模型參數量為 340 億,權重放在 Hugging Face 上。這次的重點在授權條款:採用 Linux 基金會的寬鬆授權 OpenMDW-1.1,不需額外取得許可就能進行微調,衍生模型也可以再散布[1]。
從研發用途走向量產落地
Alpamayo 2 Super 本身是 5 月 31 日在台北舉行的 NVIDIA GTC 上發表的模型[2]。當時的說法是,推理程式碼會在夏季前後放上 GitHub,模型權重放上 Hugging Face。這次釋出真的發生了,授權條件也一併明朗。
早期的 Alpamayo 是以研發用途提供。這次 OpenMDW-1.1 套用到整個 Alpamayo 系列,任何一款模型都可以在不另外取得許可的情況下商用部署[1]。微調、製作衍生模型、商業再散布都在授權範圍內,蒸餾後的小型模型同樣不需要 NVIDIA 的許可就能商用。模型的輸出本身也不附帶任何授權條件[3]。
這一點對車廠與供應商來說相當重要。就算針對自家的行駛資料與駕駛策略把模型調到很細,成果依然握在自己手上,而且可以直接放進產品裡。既不必從零重新訓練基礎能力,也不用為每一項任務持續支付前沿模型的使用費。
320 億加 20 億的兩段式架構,最多支援 7 顆鏡頭
Alpamayo 2 Super 由 320 億參數的 NVIDIA Cosmos 3 Super Reasoner 與 20 億參數的擴散模型 Action Expert 組合而成,合計 340 億參數,最後再以強化學習完成後訓練[3]。
分工相當清楚。Reasoner 負責解讀多鏡頭影片、語言脈絡以及本車先前的運動歷程,Action Expert 則把由此得到的內部表徵轉換成本車未來的行駛軌跡。
感知範圍擴大到最多 7 顆鏡頭涵蓋的 360 度,先前世代則以前方為主[3]。變換車道、匯流、無號誌轉彎、複雜路口這些本來就容易出現風險的場景,最需要的正是側向與後方的資訊。
在規模上,相較於前一代 100 億參數的 Alpamayo 1 與 Alpamayo 1.5 成長為 3 倍[1]。NVIDIA 表示,容量增加後,模型能更好地從稀疏的例子中類推。自動駕駛的難處不在日常場景,而在極少發生的多車互動,這次擴充正是衝著這裡而來。
一次輸入可回傳 5 種輸出
針對一個行駛場景,Alpamayo 2 Super 可以同時給出以下 5 種輸出[1]。
- 本車接下來要走的軌跡
- 說明該判斷理由的 Chain-of-Causation(CoC,因果鏈)推理軌跡
- 禮讓、變換車道、停車等代表高層意圖的元動作
- 為訓練與驗證資料自動產生 CoC 標註的推理自動標註
- 把回答與鏡頭影像中對應區域連結起來、帶 2D 定位的視覺問答(VQA)
軌跡回答的是要做什麼,CoC 推理軌跡回答的是為什麼。兩者一起輸出,開發者就能追溯模型看到了什麼、又選了什麼。失誤究竟出在感知、推理還是動作生成,也因為輸出被拆開而更容易判斷。
當成自動標註器來用同樣在設計之內。對自家車隊蒐集到的大量行駛片段跑 CoC 標註與帶 2D 定位的 VQA,就能把原始影像轉成訓練資料。NVIDIA 表示,這可以把標註週期從數個月壓縮到數天[1][3]。
在基準測試中的位置
把 NVIDIA 公布的數字排在一起,既看得到相對於前一代 Alpamayo 1.5 Nano 的提升幅度,也看得到與通用大型模型之間的落差[3]。
| 評測 | 指標 | Alpamayo 2 Super | 比較對象 |
|---|---|---|---|
| LingoQA | Lingo-Judge 分數 | 79.2 | Alpamayo 1.5 Nano 74.2/Qwen3-VL 32B 72.2/Qwen2.5-VL 72B 62.2/Gemini 2.5 Pro 64.1/GPT-4o 56.0 |
| 軌跡預測 | minADE_6(6.4 秒) | 0.911 公尺 | Alpamayo 1.5 Nano 0.916 公尺 |
| 自動駕駛推理 | 推理分數 | 0.433 | Alpamayo 1.5 Nano 0.414/GPT-5.5 0.502 |
| 閉迴路評測 | AlpaSim 分數 | 1.50±0.13 | Alpamayo 1.5 Nano 1.37±0.10 |
在衡量駕駛推理能力的 LingoQA 上,這款模型在受評的 37 個模型中排名第一[3]。它領先 Qwen2.5-VL 72B 達 17.0 分,領先 Gemini 2.5 Pro 15.1 分,領先 GPT-4o 23.2 分。能壓過參數量超過自己兩倍的模型,顯示專門訓練過的模型確實有其強項。
不過在自動駕駛推理的基準上,它沒有追上 GPT-5.5 的 0.502。用途聚焦的基礎模型,並不會在所有指標上都勝過最新的通用模型。
此外,在 94,000 段片段上的元動作評測中,橫向、縱向、車道維度的 IoU 分別是 74.59、61.91、73.55[3]。VQA 的回答相似度為 0.652,高於 Qwen3-VL 32B 的 0.450。2D 定位的精度以 IoU 計算達到 0.71,同一比較對象則只有 0.17。
雲端負責思考,車內跑蒸餾後的模型
340 億參數的模型不會原封不動搬上車。NVIDIA 提出的路線是:在雲端讓大型模型產生推理軌跡與合成訓練資料,再把它當成教師模型蒸餾出小型模型,車內則運行以 NVIDIA DRIVE AGX Thor 驅動的輕量模型[1][2]。在系列內部,Alpamayo 1.5 與 Alpamayo 1 也被保留下來,作為雲端開發與蒸餾時成本更低的選項。
與安全驗證的銜接也已備妥。CoC 推理軌跡可以接進 NVIDIA Halos 的安全驗證流程,用於符合 ISO/PAS 8800 要求的 AI 安全論證[1]。把判斷理由以文字形式留下來的做法,一旦考慮到與主管機關的溝通就會顯出價值。
周邊的工具也都齊備。負責閉迴路模擬的 NVIDIA AlpaSim、跑高吞吐強化學習的 NVIDIA AlpaGym、供訓練與評測使用的 NVIDIA Physical AI Open Datasets,以及後訓練腳本與自動標註流程都已公開[1]。Alpamayo 系列在 Hugging Face 上的下載次數已突破 50 萬次[1]。
總結
NVIDIA 於 8 月 4 日以可商用的形式釋出了 340 億參數的自動駕駛推理模型 Alpamayo 2 Super。授權為 OpenMDW-1.1,涵蓋微調、衍生模型與商業再散布,並套用於整個 Alpamayo 系列。模型由 320 億參數的 Cosmos 3 Super Reasoner 與 20 億參數的 Action Expert 構成,透過最多 7 顆鏡頭達成 360 度感知,輸出軌跡、CoC 推理軌跡、元動作、自動標註與 VQA 這 5 種結果。它在 LingoQA 的 37 個模型中排名第一,但自動駕駛推理分數未能追平 GPT-5.5,專用模型與通用模型之間的差距仍會隨指標而不同。
參考連結
[1] NVIDIA Alpamayo 2 Super, the Frontier Open Model for Robotaxis and Autonomous Vehicles, Now Available for Commercial Use - NVIDIA Blog
[2] NVIDIA Launches Alpamayo 2 Super Open Reasoning Model for Robotaxis - NVIDIA Newsroom
[3] Generate Trajectories, Reasoning Traces, and Auto-Labels with NVIDIA Alpamayo 2 Super - NVIDIA Technical Blog
