阿里巴巴 Qwen 團隊於 9 月上旬開源了針對自動駕駛的視覺語言模型 Qwen-Drive-1.0-4B。這款模型與華中科技大學共同開發,把周遭環境的 3D 感知、駕駛場景問答、行駛軌跡生成這 3 項工作整合到同一個模型裡。程式碼、權重與示範資料皆以 Apache 2.0 授權釋出。
一個底座扛起 3 項工作
Qwen-Drive-1.0 的底座是該團隊原生多模態的視覺語言模型 Qwen3.5-4B。團隊並未更動這個架構,而是在外部掛上兩個模組。
第一個是 BEV Perception Head。它在 BEV(Bird's Eye View,也就是從正上方俯瞰車輛周圍的平面圖)上一併處理 3D 物件偵測、語意佔據預測與地圖分割,既是用來衡量共享表徵中能取出多少 3D 資訊的探針,也是讓人得以檢視 3D 場景結構的介面。
第二個是 Planning Expert,它接收同一份共享表徵,輸出自車接下來要走的軌跡。輸出為涵蓋 5 秒、以 10Hz(每秒 10 次)取樣的 50 個點,每個點帶有 x 座標、y 座標與車身朝向。
由於原模型的語言解碼器維持不變,它既能回答駕駛相關問題,也能回答一般的影像問題。訓練採用分階段混合感知、語言與規劃目標的做法,團隊也在資料端做了整備,例如把多個公開駕駛資料集的軌跡統一成同一種表示方式。
經過強化學習的規劃模組略勝一籌
Planning Expert 提供兩個版本:以模仿駕駛範例方式訓練的 planner-sft,以及在此基礎上依獎勵進一步最佳化的 planner-rl。
在規劃效能方面,NAVSIM v1.1 navtest 的 PDMS,sft 為 88.2,rl 為 90.7;在取 6 次最佳的條件下,兩者分別提升到 89.3 與 91.4。Waymo Open Dataset 端到端測試所用的 RFS 分別是 7.78 與 7.91,同樣由 rl 領先。
不過在 NVIDIA PhysicalAI 的開迴路評測中結果反了過來,3 秒的 minADE,sft 為 0.34 公尺,rl 為 0.38 公尺。看重哪個指標,就決定了該挑哪一版。另外,planner-rl 只在帶推理的規劃模式下做過獎勵最佳化,因此必須在該模式下執行。兩種模式都支援的是 planner-sft。
學會開車,通用視覺能力卻沒有退步
值得留意的是,針對駕駛做專門化之後,底座的通用能力幾乎沒有被削弱。
在駕駛場景問答上,原始的 Qwen3.5-4B 於 LingoQA 為 70.4,而 Qwen-Drive-1.0-SFT 達到 77.8。代表 3D 位置估計誤差的 Ego3D RMSE 從 13.17 縮小到 7.78,考察因果鏈的 CoC 則從 2.6 躍升至 41.3,量級整個改變。
同時,通用影像理解的 MMStar 從 75.3 微幅升到 75.9,RealWorldQA 從 76.3 升到 79.0,MMMU 也僅從 73.4 略降至 72.7。做了駕駛專用微調後、通用影像理解就崩壞的常見副作用,在這裡被相當程度地避開了。
在本機執行需要什麼條件
釋出的檔案集中在一個目錄裡:視覺語言模型本體 9.1GB,planner-sft 與 planner-rl 各 2.1GB,感知頭 0.5GB。需要哪一個頭,在載入模型時指定並掛接即可。
建議環境為記憶體 24GB 以上的 GPU。儲存庫內附帶 4 個示範場景,分別是號誌轉綠的夜間路口、左轉、右轉,以及避開路邊停放卡車的減速,只要備妥權重,不必額外蒐集資料就能確認行為。
export PYTHONPATH=src
python scripts/demo.py --model Qwen-Drive-1.0-4B --planner Qwen-Drive-1.0-4B/planner-rl \
--scenes data/demo/planning_scenes.jsonl --image-archive data/demo/frames.parquet \
--plot demo.png
執行這道指令後,會輸出一張圖,把場景的相機畫面、預測軌跡與真值的比對,以及生成的推理過程整合在一起。權重可從 Hugging Face 或 ModelScope 任一處取得。
總結
Qwen-Drive-1.0-4B 是在通用視覺語言模型之上疊加 3D 感知與軌跡生成的開源自動駕駛模型。規劃效能整體上以強化學習版占優,但也有指標由模仿學習版勝出,而通用影像理解能力大致獲得保留。整套權重以 Apache 2.0 釋出,只要有 24GB 等級的 GPU 就能在本機重現其行為,作為研究與驗證的底座應該相當好用。
