英伟达于 8 月 4 日以可商用的形式发布了面向自动驾驶的推理模型 NVIDIA Alpamayo 2 Super。该模型参数量为 340 亿,权重托管在 Hugging Face 上。本次的关键在于许可证:采用 Linux 基金会的宽松许可证 OpenMDW-1.1,无需额外授权即可进行微调,也可以再分发衍生模型[1]。

从研发用途走向量产落地

Alpamayo 2 Super 本身是 5 月 31 日在台北举行的英伟达 GTC 上发布的模型[2]。当时的说明是,推理代码将在夏季前后放上 GitHub,模型权重放上 Hugging Face。这次发布真正落地,许可条款也随之明确。

早期的 Alpamayo 面向研发提供。这次 OpenMDW-1.1 适用于整个 Alpamayo 系列,任何一款模型都可以在无需追加授权的情况下商用部署[1]。微调、制作衍生模型、商业再分发都在许可范围之内,蒸馏出的小模型同样无需英伟达许可即可商用。模型的输出本身不附带任何许可条件[3]。

这一点对车企和供应商意义重大。即便针对自有行驶数据和驾驶策略对模型做深度打磨,成果依然掌握在自己手中,并且可以直接落到产品上。既不必从零重新训练基础能力,也不用为每一项任务持续支付前沿模型的调用费用。

320 亿加 20 亿的两段式结构,最多支持 7 路摄像头

Alpamayo 2 Super 由 320 亿参数的 NVIDIA Cosmos 3 Super Reasoner 与 20 亿参数的扩散模型 Action Expert 组合而成,合计 340 亿参数,最后通过强化学习完成后训练[3]。

分工非常清晰。Reasoner 负责解读多路摄像头的视频、语言上下文以及本车此前的运动历史,Action Expert 则把由此得到的内部表征转换为本车未来的行驶轨迹。

感知范围扩展到最多 7 路摄像头覆盖的 360 度,此前几代主要集中在前向[3]。变道、汇流、无保护转弯、复杂路口这些本就容易产生风险的场景,恰恰最依赖侧向和后向信息。

在规模上,相比上一代 100 亿参数的 Alpamayo 1 和 Alpamayo 1.5 提升到了 3 倍[1]。英伟达表示,容量的增加让模型能够从稀疏样本中更好地泛化。自动驾驶的难点不在日常场景,而在极少发生的多车交互,这次扩容正是冲着这里去的。

一次输入返回 5 类输出

针对一个行驶场景,Alpamayo 2 Super 可以同时给出以下 5 类输出[1]。

  • 本车接下来要走的轨迹
  • 解释该判断依据的 Chain-of-Causation(CoC,因果链)推理轨迹
  • 让行、变道、停车等表示高层意图的元动作
  • 为训练与验证数据自动生成 CoC 标注的推理自动标注
  • 把回答与摄像头图像中相应区域关联起来的、带 2D 定位的视觉问答(VQA)

轨迹回答的是做什么,CoC 推理轨迹回答的是为什么。两者同时输出,开发者就能追溯模型看到了什么、又选择了什么。故障究竟出在感知、推理还是动作生成,也因为输出被拆开而更容易定位。

作为自动标注器的用法同样在设计之内。对自有车队采集的大量行驶片段跑 CoC 标注和带 2D 定位的 VQA,就能把原始视频转化为训练数据。英伟达称,这可以把标注周期从数月压缩到数天[1][3]。

基准测试中的位置

把英伟达公布的数字排在一起,既能看到相对上一代 Alpamayo 1.5 Nano 的提升幅度,也能看到与通用大模型之间的差距[3]。

评测 指标 Alpamayo 2 Super 对比对象
LingoQA Lingo-Judge 分数 79.2 Alpamayo 1.5 Nano 74.2/Qwen3-VL 32B 72.2/Qwen2.5-VL 72B 62.2/Gemini 2.5 Pro 64.1/GPT-4o 56.0
轨迹预测 minADE_6(6.4 秒) 0.911 米 Alpamayo 1.5 Nano 0.916 米
自动驾驶推理 推理分数 0.433 Alpamayo 1.5 Nano 0.414/GPT-5.5 0.502
闭环评测 AlpaSim 分数 1.50±0.13 Alpamayo 1.5 Nano 1.37±0.10

在衡量驾驶推理能力的 LingoQA 上,该模型在参评的 37 个模型中位列第一[3]。它领先 Qwen2.5-VL 72B 达 17.0 分,领先 Gemini 2.5 Pro 15.1 分,领先 GPT-4o 23.2 分。能够压过参数量超过自身两倍的模型,说明专门训练的模型确实有其优势。

不过在自动驾驶推理基准上,它没有达到 GPT-5.5 的 0.502。用途聚焦的基础模型,并不能在所有指标上都超过最新的通用模型。

此外,在 94,000 条片段上的元动作评测中,横向、纵向、车道维度的 IoU 分别为 74.59、61.91、73.55[3]。VQA 的回答相似度为 0.652,高于 Qwen3-VL 32B 的 0.450。2D 定位精度的 IoU 达到 0.71,而同一对比模型仅为 0.17。

云端负责思考,车内运行蒸馏后的模型

340 亿参数的模型不会原样搬到车上。英伟达给出的路径是:在云端让大模型生成推理轨迹和合成训练数据,再把它作为教师模型蒸馏出小模型,车内则运行基于 NVIDIA DRIVE AGX Thor 的轻量模型[1][2]。在系列内部,Alpamayo 1.5 和 Alpamayo 1 也保留下来,作为云端开发与蒸馏时成本更低的选择。

与安全验证的衔接同样已经就位。CoC 推理轨迹可以接入 NVIDIA Halos 的安全验证工作流,用于符合 ISO/PAS 8800 要求的 AI 安全论证[1]。把判断理由以文字形式留存下来的做法,在需要与监管机构沟通时会显出价值。

周边工具也已配齐。承担闭环仿真的 NVIDIA AlpaSim、运行高吞吐强化学习的 NVIDIA AlpaGym、用于训练和评测的 NVIDIA Physical AI Open Datasets,以及后训练脚本和自动标注流水线均已公开[1]。Alpamayo 系列在 Hugging Face 上的下载量已超过 50 万次[1]。

总结

英伟达于 8 月 4 日以可商用的形式发布了 340 亿参数的自动驾驶推理模型 Alpamayo 2 Super。许可证为 OpenMDW-1.1,涵盖微调、衍生模型与商业再分发,并适用于整个 Alpamayo 系列。模型由 320 亿参数的 Cosmos 3 Super Reasoner 与 20 亿参数的 Action Expert 构成,通过最多 7 路摄像头实现 360 度感知,输出轨迹、CoC 推理轨迹、元动作、自动标注和 VQA 这 5 类结果。它在 LingoQA 的 37 个模型中排名第一,但自动驾驶推理分数未能追平 GPT-5.5,专用模型与通用模型之间的差距仍会因指标而异。

参考链接

[1] NVIDIA Alpamayo 2 Super, the Frontier Open Model for Robotaxis and Autonomous Vehicles, Now Available for Commercial Use - NVIDIA Blog
[2] NVIDIA Launches Alpamayo 2 Super Open Reasoning Model for Robotaxis - NVIDIA Newsroom
[3] Generate Trajectories, Reasoning Traces, and Auto-Labels with NVIDIA Alpamayo 2 Super - NVIDIA Technical Blog