AlibabaのAI研究チームQwenが、ロボットを動かすための基盤モデル群「Qwen-Robot Suite」を2026年6月16日に公開しました。開発を担ったのは同社のTongyi Labで、目的地までの移動を担う「Qwen-RobotNav」、ロボットアームの操作を担う「Qwen-RobotManip」、周囲の状況を理解し先を読む「Qwen-RobotWorld」の3モデルで構成されます。会話するチャットボットから一歩進み、現実世界で体を動かすフィジカルAIへ軸足を移す動きです。
言語モデルの次は「身体を持つAI」へ
これまで生成AIの主戦場は、文章や画像を扱うソフトウェアの領域でした。Qwen-Robot Suiteはその技術を現実空間に持ち込み、ロボットが「移動する」「物をつかむ」「環境を理解する」という3つの基本動作をこなせるようにすることを狙っています。Alibaba側はこれを、機械が物理世界で振る舞うための一通りのソフトウェア基盤と位置づけており、特定の1台のロボットに縛られない汎用的な土台を用意した点が特徴です。
3モデルはそれぞれ役割が分かれていますが、組み合わせて使うことで「指示を受けて目的地まで移動し、対象物を見つけて操作する」といった一連の流れを通しでこなせる設計になっています。言葉での指示を起点に動ける点が、従来のロボット制御との大きな違いです。
Qwen-RobotNavは、ロボットを目的地へ導くためのナビゲーション用モデルです。視覚と言語を同時に扱うQwen3-VLをベースに、1560万件分のデータで学習しています。注目したいのは、指示に沿った移動、地点を指定しての移動、対象物の探索、ターゲットの追跡、そして自動運転という性質の異なる5種類のタスクを、1つのモデルにまとめて担わせている点です。指示を起点に複数の役割を切り替えられる設計です。
性能を測るベンチマークでも数字が示されています。現実環境に近い条件で言語指示に従って移動するVLN-CE RxRでは76.5パーセントの成功率を記録し、対象を追い続ける能力を評価するEVT-Benchでは90パーセントの追跡精度を達成したとしています。初めて訪れる場所でも、自然な言葉での指示をもとに行動できることを目指したモデルです。
Qwen-RobotManip 構造の違うアームを横断して操る
Qwen-RobotManipは、ロボットアームに物をつかませたり動かしたりする操作を担うモデルです。Qwen3.5-4Bを土台とし、公開されているロボットのデータセットと人間の作業動画を合わせて、およそ3万8100時間分のデータで学習しています。自社の機体だけで集めた専用データに頼るのではなく、広く出回っているデータを活用してスケールさせた点が、開発の工夫として挙げられます。
ロボットアームはメーカーや製品ごとに、関節の数やアームの長さ、動かし方の仕組みがばらばらです。この機種ごとの違いが、これまで操作モデルを使い回すうえでの壁になっていました。Qwen-RobotManipは構造の異なるアームをまたいで扱えるよう設計されており、テーブル上の作業を評価するRoboChallenge Table30-v1では首位の成績を収め、従来手法を20パーセント上回ったと説明されています。
Qwen-RobotWorld 行動する前に「この先どうなるか」を読む
3モデルの中で最も挑戦的なのが、世界モデルにあたるQwen-RobotWorldです。これは、ロボットが実際に動き出す前に「この環境がこの先どう変化するか」をシミュレーションして予測するためのモデルです。視覚言語モデルを使って周囲の状況を言葉で表現でき、移動・運転・操作といった場面をまたいで、物理的に筋の通った未来の展開を見通せるとしています。
応用例として、人が手作業する動画をもとにロボットアームの動きを生成したり、1つの指示から時間と空間の両面で一貫性のある複数アングルの映像を作り出したりといった使い方が挙げられています。行動の結果を事前に頭の中で描けるようになることは、フィジカルAIを安全かつ効率よく動かすうえで重要な土台になります。
まずは法人向けに試験提供、中国勢のフィジカルAI競争が加速
Qwen-Robot Suiteは現時点で、Alibaba Cloudを通じて一部の法人顧客を対象にした試験提供の段階にあります。Alibabaは今回の3モデルを、さまざまなロボットが共通して使える土台にしたい考えで、報道では「ロボティクス版のAndroid」を目指す動きとも評されています。言語モデルで先行してきた中国の大手テック企業が、現実世界で体を動かすロボットの領域でも存在感を強めようとしている流れがうかがえます。
ロボット向けの基盤モデルは、世界中の企業や研究機関が開発を競う分野です。1社が移動・操作・予測という主要な機能を一式そろえて提示した意味は小さくなく、今後、対応するロボットや実際の導入事例がどこまで広がるかが次の注目点になりそうです。
まとめ
AlibabaのQwenは2026年6月16日、ロボット向けの基盤モデル群「Qwen-Robot Suite」を公開しました。移動を担うQwen-RobotNav、アーム操作を担うQwen-RobotManip、未来を予測する世界モデルのQwen-RobotWorldという3本柱で構成され、言葉での指示から一連の動作までを通してこなすことを狙います。各モデルはベンチマークで具体的な成績も示しており、現状はAlibaba Cloud経由で法人向けに試験提供中です。チャットボットから現実世界へとAIの主戦場が移りつつあることを示す発表と言えます。
