英伟达在计算机视觉国际会议"CVPR 2026"上,公开了三篇关于物理AI(用于在现实世界中运转的机器的AI)的研究论文[1]。核心成果包括:让机器人用从未握过的工具也能抓起物体的"抓取"基础模型、在车载硬件上也能快速判断的自动驾驶模型,以及用超过 1,000 款游戏训练出来的智能体AI[1]。三者都贯穿着同一个思路——只要大规模地训练,系统就能泛化到从未见过的情况[1]。

共同点在于"通过大规模训练实现泛化"

CVPR(Computer Vision and Pattern Recognition)是计算机视觉领域规模最大的国际会议之一,今年于 6 月 3 日至 7 日在美国丹佛举办[1]。英伟达研究团队发表的这三篇论文,分别针对机器人抓取、自动驾驶、虚拟智能体训练这些不同的课题,却共享同一种思路:通过尽可能大规模地学习多样的情况,构建出能够应对从未遇到过的场景的系统[1]。

适配任意夹爪的首个"抓取"基础模型"GraspGen-X"

机器人抓取AI大多是"专用品"[1]。为两指夹爪(相当于机器人之手的抓取机构)训练的AI只能用那两根手指抓取,每当出现新的手部形态,就必须重新进行数据采集、微调和验证[1]。因此,许多机器人企业一般会锁定一种确定的手部形态来持续开发[1]。

GraspGen-X 是旨在消除这一限制的首个"抓取"基础模型(可应用于各种用途的大规模模型)[1]。正如大语言模型无需追加训练就能把对语言的理解应用到新任务上,GraspGen-X 也能把对几何形状与接触的理解,套用到从未遇到过的夹爪上[1]。给定新夹爪的形状和一个从未见过的物体,它就能生成可靠地抓起该物体的抓握姿态候选[1]。

它的训练需要在现实中无法大规模采集的数据[1]。研究团队生成了跨越数千种物体形状与合成夹爪配置的 20 亿次抓取仿真,覆盖了实机可能遇到的多样形态[1]。对开发者而言,这省去了针对每种手部形态重新训练的工夫,对几款常用夹爪可以直接使用[1]。GraspGen-X 与新公开的、支持 CUDA 加速的运动规划库"curoboV2"结合,即便在未知环境中也能实现目标抓握姿态[1]。此外,作为相关论文,在 ICRA 2026 上发表的"Grasp-MPC",把从抓握姿态生成推进到实际持续抓取的闭环控制这一下一阶段[1]。

在车载硬件上快速思考的自动驾驶模型"LCDrive"

近年的研究发现,让AI在给出答案之前先走一遍思考过程的"推理(已训练的AI得出答案的处理过程)",能够切实提升判断质量[1]。但就自动驾驶车而言,要在车内的硬件上实际运行这种思考是个难题[1]。在用文字组织思考的方式中,每一个词都会成为一个 token(AI处理文本的最小单位),生成需要时间[1]。在车内的处理器上,这一 token 数量会成为左右响应速度的现实制约[1]。

LCDrive 通过把这些词替换为压缩后的潜在表示(内部压缩的表示)来应对这一问题[1]。它不再写出人类可读的思考步骤,而是在捕捉了空间信息的压缩空间中进行思考[1]。其机制是:提出行动候选,再预测采取该行动后世界会如何变化,交替进行这两种思考,并基于预测出的状态来打磨下一步[1]。这是把同样的推理循环,以比自然语言计算效率更高的形式运转起来的思路[1]。结果,它用大约一半的 token 数量,实现了与文字思考方式相当的行驶轨迹质量[1]。该模型以 NVIDIA Alpamayo 为基础,用从既有车辆数据中得到的监督信息进行训练[1]。

用超过 1,000 款游戏锤炼的具身AI智能体"NitroGen"

英伟达面向人形机器人的开放基础模型"Isaac GR00T",建立在一个简单的原则之上:只要让模型接触足够多样的情况,它就能泛化到从未见过的情况[1]。NitroGen 把这一原则扩展到虚拟环境,借助 GR00T 的架构,训练出一个能在广泛虚拟世界中运转的具身AI智能体(学习在现实世界中行动的AI)的基础模型[1]。

电子游戏能够大规模地提供结构化且多样的世界,并具备明确的目标与达成条件[1]。NitroGen 把游戏当作"训练场",用来培养那些日后将应对现实或其他仿真环境中新情况的智能体[1]。这一思路指向的,比如是为依据"把这些东西收进储物间"这类笼统指令来帮忙做家务的机器人打下基础[1]。把基于 GR00T 的模型在超过 1,000 款游戏和 4 万小时的操作中训练后,所产生的智能体能够跨环境地通用行动[1]。它在动作角色扮演游戏、平台跳跃、Roguelike、开放世界等广泛的游戏中接受评测,展现出战斗、移动、探索等行为[1]。

同样的方法还有望用于实现游戏内更具适应性的NPC(非玩家角色)、AI伙伴和玩法系统,乃至对复杂游戏环境进行更广泛的测试[1]。在仅见过新环境少量示例的"少数据"条件下,从 NitroGen 起步会让智能体占据很大优势,相比以往的最先进方法,性能最高提升了 52%[1]。该模型为开源,已在 GitHub 与 Hugging Face 上公开[1]。

加速研究的物理AI新技能

在 CVPR 上,除了这三篇论文,英伟达还公开了能加速自动驾驶车、机器人和视觉AI系统开发的全新物理AI智能体技能[1]。其目的,是让研究者与开发者更容易把模型的能力,串联成可在现实世界中部署的一整套工作流程[1]。

总结

这三篇论文的特点,在于把抓取、自动驾驶、虚拟智能体这些不同的课题,用"通过大规模学习获得通用性"这一共同思路捆绑在了一起。适配任意夹爪的 GraspGen-X、在车载硬件上快速判断的 LCDrive,以及用超过 1,000 款游戏锤炼的 NitroGen,都看重不被特定用途束缚的应用能力。其中尤其是 NitroGen 已作为开源在 GitHub 等平台公开,机器人与游戏AI的开发者可以在自己的环境里试用,这一点也有望拓宽这项研究的覆盖面[1]。

来源:https://blogs.nvidia.com/blog/cvpr-research-grasping-driving-agent-training/