阿里巴巴 Qwen 团队于 9 月上旬开源了面向自动驾驶的视觉语言模型 Qwen-Drive-1.0-4B。该模型与华中科技大学联合开发,把周围环境的 3D 感知、驾驶场景问答、行驶轨迹生成这 3 项工作整合进同一个模型。代码、权重和演示数据均以 Apache 2.0 许可证发布。
一个底座承担 3 项工作
Qwen-Drive-1.0 的底座是该团队原生多模态的视觉语言模型 Qwen3.5-4B。团队没有改动这个结构,而是在外部挂上两个模块。
第一个是 BEV Perception Head。它在 BEV(Bird's Eye View,即从正上方俯视车辆周围的平面图)上统一处理 3D 目标检测、语义占据预测和地图分割,既是衡量共享表征中能提取出多少 3D 信息的探针,也是让人得以查看 3D 场景结构的接口。
第二个是 Planning Expert,它接收同样的共享表征,输出自车接下来要走的轨迹。输出为覆盖 5 秒、以 10Hz(每秒 10 次)采样的 50 个点,每个点包含 x 坐标、y 坐标和车身朝向。
由于原模型的语言解码器保持不变,它既能回答驾驶相关问题,也能回答一般的图像问题。训练采用分阶段混合感知、语言和规划目标的策略,团队还在数据侧做了整备,例如把多个公开驾驶数据集的轨迹统一成同一种表示。
经过强化学习的规划模块更胜一筹
Planning Expert 提供两个版本:以模仿驾驶范例方式训练的 planner-sft,以及在此基础上按奖励进一步优化的 planner-rl。
在规划性能上,NAVSIM v1.1 navtest 的 PDMS,sft 为 88.2,rl 为 90.7;在取 6 次最优的条件下,两者分别提升到 89.3 和 91.4。Waymo Open Dataset 端到端测试所用的 RFS 分别为 7.78 和 7.91,同样是 rl 领先。
不过在 NVIDIA PhysicalAI 的开环评测中结果反了过来,3 秒的 minADE,sft 为 0.34 米,rl 为 0.38 米。看重哪个指标,决定了该选哪个版本。另外,planner-rl 只在带推理的规划模式下做过奖励优化,因此需要在该模式下运行。两种模式都支持的是 planner-sft。
学会开车,通用视觉能力却没有下滑
值得关注的是,为驾驶做专门化之后,底座的通用能力几乎没有被削弱。
在驾驶场景问答上,原始 Qwen3.5-4B 的 LingoQA 为 70.4,而 Qwen-Drive-1.0-SFT 达到 77.8。表示 3D 位置估计误差的 Ego3D RMSE 从 13.17 降到 7.78,考察因果链条的 CoC 则从 2.6 跃升到 41.3,量级发生了变化。
与此同时,通用图像理解的 MMStar 从 75.3 微升至 75.9,RealWorldQA 从 76.3 升到 79.0,MMMU 也只是从 73.4 小幅降至 72.7。一旦做驾驶专用微调、通用图像理解就崩坏的常见副作用,在这里被较好地避开了。
本地运行需要什么条件
发布内容集中在一个目录里:视觉语言模型本体 9.1GB,planner-sft 和 planner-rl 各 2.1GB,感知头 0.5GB。需要哪个头,在加载模型时指定并挂接即可。
推荐环境为显存 24GB 以上的 GPU。仓库内附带 4 个演示场景,分别是信号灯转绿的夜间路口、左转、右转,以及避让路边停放卡车的减速,只要准备好权重,无需额外采集数据就能验证行为。
export PYTHONPATH=src
python scripts/demo.py --model Qwen-Drive-1.0-4B --planner Qwen-Drive-1.0-4B/planner-rl \
--scenes data/demo/planning_scenes.jsonl --image-archive data/demo/frames.parquet \
--plot demo.png
执行这条命令后,会输出一张图,把场景的相机画面、预测轨迹与真值的对比,以及生成的推理过程汇总在一起。权重可从 Hugging Face 或 ModelScope 任一处获取。
总结
Qwen-Drive-1.0-4B 是在通用视觉语言模型之上叠加 3D 感知与轨迹生成的开源自动驾驶模型。规划性能整体上强化学习版占优,但也有指标由模仿学习版胜出,而通用图像理解能力基本得以保留。全套权重以 Apache 2.0 发布,加上 24GB 级别的 GPU 就能在本地复现其行为,作为研究与验证的底座应该相当好用。
