阿里巴巴于 2026 年 8 月 20 日发布了 Qwen-UI-Agent,这是一款看着屏幕进行操作的智能体基础模型。单一模型覆盖手机、电脑、网页浏览器以及深度检索场景,在真机运行的手机操作基准上领先竞争对手 10 分以上。不过在桌面操作方面,仍有多个项目被其他公司的模型超越,强项与短板的轮廓相当清晰。
手机操作上明显领先
在公开的评测结果中,差距最大的是移动端。衡量仅凭屏幕信息能否完成任务的 MobileWorld 基准上,Qwen-UI-Agent 取得 82.1 分。其后依次是字节跳动 Seed 的 Seed 2.1 Pro(73.2 分)、OpenAI 的 GPT-5.6 Sol(70.1 分)和 Anthropic 的 Claude Opus 4.8(67.5 分)。相比 GPT-5.6 Sol 领先 12.0 分,相比 Claude Opus 4.8 领先 14.6 分。
在使用真实手机而非模拟器的 MobileWorld-Real 上,该模型达到 92.2 分,超过 Seed 2.1 Pro 的 88.7 分和谷歌 Gemini 3.1 Pro 的 86.2 分。在汇集日常操作的 AndroidDaily 上更是达到 97.5 分,几乎没有遗漏。
手机屏幕会随着应用更新频繁改版,登录状态和网络环境也会改变界面的呈现方式。能够适应这种不确定性,正是拉开差距的原因。
桌面端各有胜负
相比之下,电脑操作的成绩并不一致。OSWorld-Verified 为 79.5 分,虽然超过 Seed 2.1 Pro 的 78.8 分和 GPT-5.5 的 78.7 分,但没有追上 Claude Opus 4.8 的 83.4 分。衡量长流程任务推进程度的 OSWorld-v2 仅为 40.0 分,落后于 Claude Opus 4.8 的 54.8 分和 GPT-5.5 的 49.5 分。
浏览器操作的 WebArena 则以 73.6 分位居首位。在衡量能否精确指向屏幕元素的界面定位能力上,ScreenSpot-Pro 在启用放大处理时为 81.5 分,不使用放大时也有 76.6 分。
也就是说,手机和浏览器是强项,而需要长时间推进的桌面工作仍有改进空间。由于部分基准包含在开发团队环境中重新测量的数值,这些数字更适合作为参考。
用 100 多台真机训练出来
支撑性能的是训练与评测环境。开发过程使用了 100 多台真机和 150 多个应用,把任务生成、追踪、训练和评测串成一个连续的循环。阿里巴巴还新建了 MobileWorld-Real 基准,收录横跨 100 多个应用的 400 多项任务,目标是缩小模拟环境与真实条件之间的差距。
在训练层面,团队针对超过 100 步的长操作序列采用了在线强化学习,并行环境规模约为 1 万,以此训练模型把冗长的流程完整走完而不中途迷失。
把界面操作和命令行混在一次决策里
另一个特点是,模型会在同一流程中交替使用屏幕点击输入与命令行操作。一次决策可以输出多个动作,在桌面任务中约有 40% 采用了批量执行命令的方式。
像文件操作和配置修改这类工作,敲一行命令往往比一路点击更快。这一设计相当于让模型具备人类切换到终端的直觉,步骤减少了,出错的环节也随之减少。
偏向界面操作的模型通常会损失通用推理能力,但这一点似乎得到了控制。多模态推理的 MMMU-Pro 为 72.4,指令遵循的 IFEval 为 90.2,与基础模型基本持平。衡量终端作业的 Terminal-Bench 2.0 则从基础模型的 41.1 提升到 50.1。
在支付和删除之前停下来
对于自主操作屏幕的智能体,人们最担心的是会不会擅自购买或删除东西。阿里巴巴表示,模型会拒绝违法或高风险任务,并在支付、数据删除、隐私授权等关键操作之前暂停处理并通知用户。
公开的演示也遵循同样的模式:叫车会先给出价格和所需时间再请求确认,最终的确定操作交由人来完成。智能体的自主边界划在哪里,是各家仍在摸索的领域,明确标出停止位置的做法体现了面向实际使用的考量。
总结
Qwen-UI-Agent 呈现出轮廓分明的结果:在真机手机操作上领先对手 10 分以上,而在长流程桌面作业上不及 Claude Opus 4.8 等模型。主要看点在于依托 100 多台真机和 150 多个应用搭建的训练环境、界面操作与命令行的并用,以及在支付和删除之前停下来的安全设计。技术报告与演示均已公开,值得作为衡量界面智能体当前水平的素材。
