AlibabaのQwenチームが9月上旬、自動運転向けの視覚言語モデル「Qwen-Drive-1.0-4B」をオープンソースで公開しました。華中科技大学との共同開発で、周囲の3次元認識、運転シーンへの質問応答、進路の生成という3つの役割を1つのモデルにまとめたのが特徴です。コードと重み、デモデータがApache 2.0ライセンスで配布されています。
3つの仕事を1つの土台でこなす
Qwen-Drive-1.0の土台になっているのは、同チームのマルチモーダル対応の視覚言語モデルQwen3.5-4Bです。この構造には手を入れず、外付けのモジュールを2つ足すという作りになっています。
1つ目がBEV Perception Headです。BEV(Bird's Eye View、車の周囲を真上から見下ろした平面図)の上で、3次元の物体検出、空間がどう占有されているかの予測、地図のセグメンテーションをまとめて処理します。共有された内部表現から3次元の情報をどれだけ取り出せるかを測る探針であり、同時に3次元の空間構造を人間が覗き込める窓口にもなっています。
2つ目がPlanning Expertで、同じ内部表現を受け取って自車がこれから通る軌跡を出力します。出力は5秒ぶんを10Hz(1秒あたり10回)で刻んだ50点の並びで、各点はx座標、y座標、車体の向きを持ちます。
元のモデルの言語デコーダーはそのまま残っているため、運転に関する質問にも一般的な画像の質問にも答えられます。学習は知覚、言語、計画という目標を段階的に混ぜる方式を採り、公開されている複数の運転データセットの軌跡を共通の表現に揃えるなど、データ側の整備も並行して進めたと説明されています。
強化学習を通した計画モジュールが一段上
Planning Expertは2種類が配布されています。運転の実例を真似る形で学習させたplanner-sftと、そこからさらに報酬に沿って最適化したplanner-rlです。
計画性能の指標では、NAVSIM v1.1 navtestのPDMSがsftで88.2、rlで90.7。6回試して最良を採る条件では、それぞれ89.3と91.4まで伸びます。Waymo Open Datasetのend-to-endテストで使うRFSは7.78と7.91で、こちらもrlが上回りました。
一方、NVIDIA PhysicalAIの開ループ評価では、3秒先のminADEがsftの0.34メートルに対してrlは0.38メートルと逆転しています。どの指標を重く見るかで選ぶべき版が変わる、という結果です。なおplanner-rlは推論を挟む計画モードでのみ報酬最適化されているため、その前提で動かす必要があります。両方のモードに対応するのはplanner-sftの方です。
運転を覚えても汎用の視覚能力は落ちていない
興味深いのは、運転に特化させたあとも土台の汎用性能がほとんど削られていない点です。
運転シーンの質問応答では、素のQwen3.5-4BがLingoQAで70.4だったところ、Qwen-Drive-1.0-SFTは77.8を記録しました。3次元の位置推定の誤差にあたるEgo3D RMSEは13.17から7.78へ縮み、因果の連鎖を問うCoCでは2.6から41.3へと桁が変わっています。
その一方で、一般的な画像理解のMMStarは75.3から75.9、RealWorldQAは76.3から79.0とわずかに上がり、MMMUが73.4から72.7へ下がった程度に収まりました。運転向けの微調整をかけると汎用の画像理解が崩れるという定番の副作用を、うまく避けられていることになります。
手元で動かすための条件
配布物は1つのディレクトリにまとまっており、視覚言語モデル本体が9.1GB、planner-sftとplanner-rlがそれぞれ2.1GB、知覚用のヘッドが0.5GBという内訳です。必要なヘッドは読み込み時に指定して接続する形になります。
推奨環境はメモリ24GB以上のGPUです。リポジトリには、信号が青に変わる夜間の交差点、左折、右折、路上駐車のトラックを避ける減速という4つのデモシーンが同梱されており、重みさえ用意すれば追加のデータ収集なしに挙動を確認できます。
export PYTHONPATH=src
python scripts/demo.py --model Qwen-Drive-1.0-4B --planner Qwen-Drive-1.0-4B/planner-rl \
--scenes data/demo/planning_scenes.jsonl --image-archive data/demo/frames.parquet \
--plot demo.png
このコマンドを実行すると、シーンのカメラ映像、予測した軌跡と正解の比較、生成された推論過程を1枚にまとめた図が書き出されます。重みはHugging FaceとModelScopeのどちらからでも入手できます。
まとめ
Qwen-Drive-1.0-4Bは、汎用の視覚言語モデルを土台に3次元認識と経路生成を足した、自動運転向けのオープンソースモデルです。計画性能は強化学習版が優勢な一方、指標によっては模倣学習版が勝つ場面もあり、汎用の画像理解能力はほぼ維持されています。重み一式がApache 2.0で公開されているため、24GB級のGPUがあれば手元で挙動を追える点も含めて、研究や検証の土台としては扱いやすい部類に入りそうです。
