阿里巴巴於 2026 年 8 月 20 日發表了 Qwen-UI-Agent,這是一款看著畫面進行操作的代理人基礎模型。單一模型涵蓋手機、電腦、網頁瀏覽器以及深度搜尋等場景,在以真機執行的手機操作基準測試中領先對手 10 分以上。不過在桌面操作方面,仍有數個項目被其他業者的模型超越,強項與弱項的輪廓相當清楚。

手機操作明顯領先

在公開的評測結果中,差距最大的是行動裝置領域。衡量能否僅憑畫面資訊完成任務的 MobileWorld 基準上,Qwen-UI-Agent 取得 82.1 分。其後依序是字節跳動 Seed 的 Seed 2.1 Pro(73.2 分)、OpenAI 的 GPT-5.6 Sol(70.1 分),以及 Anthropic 的 Claude Opus 4.8(67.5 分)。相較 GPT-5.6 Sol 領先 12.0 分,相較 Claude Opus 4.8 則領先 14.6 分。

在使用實體手機而非模擬器的 MobileWorld-Real 上,該模型達到 92.2 分,超越 Seed 2.1 Pro 的 88.7 分與 Google Gemini 3.1 Pro 的 86.2 分。彙整日常操作的 AndroidDaily 更達到 97.5 分,幾乎沒有失手。

手機畫面會隨著應用程式更新頻繁改版,登入狀態與網路環境也會改變介面的呈現方式。能夠適應這類變動,正是拉開差距的原因。

桌面端互有勝負

相對地,電腦操作的成績並不一致。OSWorld-Verified 為 79.5 分,雖然勝過 Seed 2.1 Pro 的 78.8 分與 GPT-5.5 的 78.7 分,卻沒有追上 Claude Opus 4.8 的 83.4 分。衡量長流程任務推進程度的 OSWorld-v2 僅有 40.0 分,落後 Claude Opus 4.8 的 54.8 分與 GPT-5.5 的 49.5 分。

瀏覽器操作的 WebArena 則以 73.6 分居冠。在衡量能否精準指向畫面元素的介面定位能力上,ScreenSpot-Pro 在啟用放大處理時為 81.5 分,未使用放大時也有 76.6 分。

換句話說,手機與瀏覽器是強項,而需要長時間推進的桌面作業仍有改善空間。由於部分基準包含在開發團隊環境中重新量測的數值,這些數字比較適合當作參考。

用 100 多台真機養出來的能力

支撐效能的是訓練與評測環境。開發過程動用了 100 多台實體手機與 150 個以上的應用程式,把任務生成、追蹤、訓練與評測串成一個連續的迴圈。阿里巴巴同時新建了 MobileWorld-Real 基準,收錄橫跨 100 多個應用程式的 400 多項任務,目標是縮小模擬環境與真實條件之間的落差。

在訓練方面,團隊針對超過 100 步的長操作序列採用線上強化學習,並行環境規模約為 1 萬,藉此訓練模型把冗長的流程完整走完而不會中途走偏。

把介面操作與命令列混在同一次判斷裡

另一項特徵是,模型會在同一段流程中交替使用畫面點擊輸入與命令列操作。一次判斷可以輸出多個動作,在桌面任務中約有 40% 採用了批次執行命令的方式。

像檔案操作與設定變更這類工作,敲一行指令往往比一路點擊更快。這等於讓模型具備人類切換到終端機的直覺,步驟少了,出錯的環節也跟著減少。

偏向介面操作的模型通常會犧牲通用推理能力,但這一點似乎有被控制住。多模態推理的 MMMU-Pro 為 72.4,指令遵循的 IFEval 為 90.2,與基礎模型幾乎持平。衡量終端機作業的 Terminal-Bench 2.0 則從基礎模型的 41.1 提升到 50.1。

在付款與刪除之前停下來

面對會自行操作畫面的代理人,最令人在意的是會不會擅自購買或刪除東西。阿里巴巴表示,模型會拒絕違法或高風險的任務,並在付款、資料刪除、隱私權限授予等關鍵操作之前先暫停處理並通知使用者。

公開的示範也採取相同做法:叫車會先提示金額與所需時間再請求確認,最後的確定操作交由本人執行。代理人的自主範圍該畫在哪裡,是各家仍在摸索的領域,明確標示停止位置的設計,看得出是為了實際運用而做的考量。

總結

Qwen-UI-Agent 呈現出輪廓分明的結果:在真機手機操作上領先對手 10 分以上,但在長流程的桌面作業上不及 Claude Opus 4.8 等模型。主要看點在於以 100 多台真機與 150 個以上應用程式打造的訓練環境、介面操作與命令列的並用,以及在付款與刪除之前停下來的安全設計。技術報告與示範皆已公開,值得拿來衡量介面代理人目前所在的位置。