Alibabaが2026年8月20日、画面を見て操作するエージェントの基盤モデル「Qwen-UI-Agent」を公開しました。スマートフォン、パソコン、ウェブブラウザー、そして情報を掘り下げるディープサーチまでを1つのモデルで担う設計で、実機を使ったスマホ操作のベンチマークでは競合を10ポイント以上引き離しています。一方でデスクトップ操作では他社が上回る項目もあり、得意不得意がはっきり出た結果になりました。

スマホ操作では明確に先行

公開された評価結果のうち、差が大きいのはモバイル領域です。画面情報だけでタスクを完遂できるかを測る「MobileWorld」では82.1パーセントを記録しました。次点はByteDance Seedの「Seed 2.1 Pro」で73.2パーセント、OpenAIの「GPT-5.6 Sol」が70.1パーセント、Anthropicの「Claude Opus 4.8」が67.5パーセントと続きます。GPT-5.6 Solとは12.0ポイント、Claude Opus 4.8とは14.6ポイントの開きです。

シミュレーターではなく実際の端末で試す「MobileWorld-Real」では92.2パーセントに達し、Seed 2.1 Proの88.7パーセント、Googleの「Gemini 3.1 Pro」の86.2パーセントを上回りました。日常的な操作を集めた「AndroidDaily」に至っては97.5パーセントで、ほぼ取りこぼしがない水準です。

スマホの画面はアプリの更新で頻繁にレイアウトが変わり、ログイン状態や通信環境によっても見え方が変わります。そうした揺らぎに強いことが、この差として出ていると考えられます。

デスクトップでは勝ち負けが分かれる

対してパソコン操作の結果は一様ではありません。「OSWorld-Verified」は79.5パーセントで、Seed 2.1 Proの78.8パーセントやGPT-5.5の78.7パーセントは上回るものの、Claude Opus 4.8の83.4パーセントには届いていません。手数の多い長時間タスクをどこまで進められたかを見る「OSWorld-v2」では40.0パーセントにとどまり、Claude Opus 4.8の54.8パーセント、GPT-5.5の49.5パーセントに水をあけられています。

ブラウザー操作の「WebArena」は73.6パーセントで首位に立ちました。画面上の要素を正確に指し示せるかを測るGUIグラウンディングでは、拡大処理ありの「ScreenSpot-Pro」で81.5パーセント、拡大なしでも76.6パーセントを記録しています。

つまり、スマホとブラウザーは強く、腰の据わったデスクトップ作業ではまだ改善の余地がある、という読み方になります。ベンチマークは開発チームの環境で再計測した値も含まれるため、数字は目安として見ておくのが妥当です。

実機100台超を回して育てた

性能を支えているのは学習と評価の環境です。開発には100台を超える実機と150以上のアプリを使い、タスクの生成から追跡、学習、評価までを一続きで回せる仕組みを組んだとしています。あわせて100以上のアプリにまたがる400を超えるタスクを収録した「MobileWorld-Real」を新設し、シミュレーターと現実の間にある差を埋める狙いを掲げました。

学習面では、100手を超えるような長い操作列を対象にしたオンライン強化学習を採用しています。並列環境をおよそ1万規模で走らせることで、途中で迷子にならずに長い手順を最後まで通す力を鍛えたという説明です。

画面操作とコマンドを1回の判断で混ぜる

もう1つの特徴が、画面のクリックや入力とコマンドライン操作を同じ流れの中で使い分ける点です。1回の判断で複数の操作をまとめて出力でき、デスクトップのタスクではおよそ40パーセントでコマンドをまとめて実行する形が使われたとしています。

ファイル操作や設定変更のように、画面をたどるより1行打ったほうが速い作業は少なくありません。人間が手癖でターミナルに切り替えるのと同じ判断をモデル側でやらせる発想で、手数が減れば失敗する箇所も減ります。

GUI操作に寄せたモデルは汎用的な推論力が落ちがちですが、この点も抑えられているようです。マルチモーダル推論の「MMMU-Pro」は72.4、指示追従の「IFEval」は90.2で、ベースとなるモデルとほぼ同等の値を保っています。ターミナル作業を測る「Terminal-Bench 2.0」では50.1と、ベースの41.1から伸びました。

決済や削除の手前で止まる

自律的に画面を操作するエージェントで気になるのは、勝手に何かを買われたり消されたりしないかという点です。Alibabaは、違法または高リスクなタスクは拒否し、決済、データ削除、プライバシー権限の付与といった重要な操作の手前ではいったん処理を止めてユーザーに通知する、と説明しています。

公開されているデモでも、配車の予約は金額と所要時間を提示したうえで承認を求める流れになっており、確定操作は人が押す設計です。エージェントに任せる範囲をどこで区切るかは各社が試行錯誤している領域で、止める場所を明示している点は実運用を意識した作りと言えます。

まとめ

Qwen-UI-Agentは、スマホの実機操作で他社を10ポイント以上引き離した一方、長時間のデスクトップ作業ではClaude Opus 4.8などに及ばないという、輪郭のはっきりした結果を示しました。100台超の実機と150以上のアプリで回した学習環境、画面操作とコマンドラインの併用、そして決済や削除の手前で止まる安全設計が主な論点です。技術レポートとデモが公開されているので、GUIエージェントの現在地を測る材料として見ておく価値があります。