谷歌宣布,将查看屏幕并进行操作的「计算机操作(computer use)」作为内置工具加入了 AI 模型「Gemini 3.5 Flash」[1]。此前该功能以独立模型的形式提供,如今被整合进主力的 Flash 模型,开发者可以借此构建跨浏览器、移动端与桌面环境自主运行的 AI 智能体[1]。该功能通过 Gemini API 与 Gemini Enterprise Agent Platform 提供[1]。

整合进主力模型的「计算机操作」

计算机操作如今成为 Gemini 3.5 Flash 默认具备的内置工具[1]。谷歌将其定位为该公司在智能体式计算机操作任务上「迄今最出色的性能」[1]。

Gemini 本就擅长调用外部功能的 function calling(函数调用),以及使用搜索、地图等内置工具[1]。此次新增了直接操作屏幕的能力后,开发者可以使用 3.5 Flash 构建能够查看、推理并操作浏览器、移动端与桌面环境的智能体[1]。谷歌表示,这将提升长流程作业与企业业务自动化的性能[1]。

能做什么

作为设想中的用途,谷歌列举了软件的持续测试,以及跨专业应用的知识工作(knowledge work)等步骤较多的自动化场景[1]。在官方示例中,3.5 Flash 会解析 Gemini 应用的屏幕并返回分类后的功能列表,还会操作自家文档以自检无障碍(accessibility)方面的问题[1]。

这里所说的计算机操作,是一个不断往复的循环:将屏幕状态交给模型,模型返回「点击」「输入」「滚动」等操作,其结果再以新的屏幕信息反馈给模型,如此反复直到任务完成[2][3]。可以理解为,AI 代替人完成了原本要用鼠标和键盘进行的同样步骤。

从专用模型到主力模型的内置功能

该功能最初以专用模型「Gemini 2.5 Computer Use」的形式提供,于 2025 年 10 月公开[2][3]。这一预览版以 Gemini 2.5 Pro 为基础,主要面向网页浏览器与移动应用的操作而设计,对桌面操作系统的操控尚未进行优化[3]。

如今谷歌将这一角色从独立模型中剥离,内置进主力的 3.5 Flash[1]。谷歌列出的支持环境中包含桌面,可处理的范围有所扩大[1]。在试用方面,谷歌介绍了由浏览器自动化公司 Browserbase 提供的演示环境,同时通过 Gemini API 公开了实现参考示例与文档[1]。

防范提示词注入

自动操作屏幕的智能体虽然便利,却也面临着从外部混入恶意指令的「提示词注入(prompt injection)」风险。谷歌表示,针对 3.5 Flash 的计算机操作,进行了假想此类攻击的对抗性训练[1]。

同时,谷歌面向企业以可选方式提供了两项安全功能[1]。其一,是在执行无法撤销或需要谨慎的操作前,要求用户进行明确确认的机制[1]。其二,是在检测到间接提示词注入时自动中止处理的机制[1]。谷歌将其视为「纵深防御」的思路,并建议开发者将其与安全隔离环境(沙箱)中的执行、人工确认以及严格的访问控制结合使用[1]。

总结

谷歌将最初以专用模型起步的计算机操作整合进主力的 3.5 Flash,并将其定位为构建跨浏览器、移动端到桌面的智能体的标准功能[1]。在性能提升的同时,把提示词注入防护与企业级安全功能摆在突出位置,可以看出这是为了让智能体更贴近实际业务使用的考量[1]。

来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-computer-use-gemini-3-5-flash/

来源:https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-computer-use-model/

来源:https://ai.google.dev/gemini-api/docs/models/gemini-2.5-computer-use-preview-10-2025