Google 宣布,將查看畫面並加以操作的「電腦操作(computer use)」作為內建工具加入 AI 模型「Gemini 3.5 Flash」[1]。此功能先前以獨立模型的形式提供,如今整合進主力的 Flash 模型,開發者可藉此打造能跨瀏覽器、行動裝置與桌面環境自主運作的 AI 代理[1]。該功能透過 Gemini API 與 Gemini Enterprise Agent Platform 提供[1]。

整合進主力模型的「電腦操作」

電腦操作如今成為 Gemini 3.5 Flash 預設具備的內建工具[1]。Google 將其定位為該公司在代理式電腦操作任務上「至今最出色的效能」[1]。

Gemini 原本就擅長呼叫外部功能的 function calling(函式呼叫),以及使用搜尋、地圖等內建工具[1]。此次新增了直接操作畫面的能力後,開發者便能運用 3.5 Flash 打造可查看、推論並操作瀏覽器、行動裝置與桌面環境的代理[1]。Google 表示,這將提升長流程作業與企業業務自動化的效能[1]。

能做什麼

作為設想中的用途,Google 舉出了軟體的持續測試,以及跨專業應用程式的知識工作(knowledge work)等步驟繁多的自動化情境[1]。在官方範例中,3.5 Flash 會解析 Gemini 應用程式的畫面並回傳分類後的功能清單,也會操作自家文件以自我檢查無障礙(accessibility)相關問題[1]。

這裡所說的電腦操作,是一個不斷往返的迴圈:把畫面狀態交給模型,模型回傳「點擊」「輸入」「捲動」等操作,其結果再以新的畫面資訊回饋給模型,如此反覆直到任務完成[2][3]。可以想成是 AI 代替人完成原本要用滑鼠與鍵盤進行的相同步驟。

從專用模型到主力模型的內建功能

此功能最初以專用模型「Gemini 2.5 Computer Use」的形式提供,於 2025 年 10 月公開[2][3]。這個預覽版以 Gemini 2.5 Pro 為基礎,主要針對網頁瀏覽器與行動應用程式的操作而設計,對桌面作業系統的操控尚未進行最佳化[3]。

如今 Google 將這項角色從獨立模型中拆分出來,內建進主力的 3.5 Flash[1]。Google 列出的支援環境中包含桌面,可處理的範圍有所擴大[1]。在試用方面,Google 介紹了由瀏覽器自動化公司 Browserbase 提供的示範環境,同時透過 Gemini API 公開了實作參考範例與文件[1]。

防範提示詞注入

自動操作畫面的代理雖然便利,卻也面臨從外部混入惡意指令的「提示詞注入(prompt injection)」風險。Google 表示,針對 3.5 Flash 的電腦操作,進行了假想此類攻擊的對抗式訓練[1]。

同時,Google 面向企業以選用方式提供兩項安全功能[1]。其一,是在執行無法復原或需要謹慎的操作前,要求使用者明確確認的機制[1]。其二,是在偵測到間接提示詞注入時自動中止處理的機制[1]。Google 將其視為「縱深防禦」的思維,並建議開發者將其與安全隔離環境(沙箱)中的執行、人工確認以及嚴格的存取控管結合運用[1]。

總結

Google 將最初以專用模型起步的電腦操作整合進主力的 3.5 Flash,並將其定位為打造跨瀏覽器、行動裝置到桌面之代理的標準功能[1]。在效能提升的同時,把提示詞注入防護與企業級安全功能擺在顯眼位置,可看出這是為了讓代理更貼近實際業務運用的考量[1]。

來源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-computer-use-gemini-3-5-flash/

來源:https://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-computer-use-model/

來源:https://ai.google.dev/gemini-api/docs/models/gemini-2.5-computer-use-preview-10-2025