OpenAI 於 7 月 23 日(美國時間)宣布,已更新 ChatGPT 桌面應用程式,新增可透過說話來操作的「ChatGPT Voice」。使用者能以語音向 AI 代理下達指令,在電腦上完成各種工作。其底層採用本月推出的新語音模型系列「GPT-Live」,並率先在 macOS 版與 Windows 版應用程式中提供。
能真正「動手做事」的桌面版
過去 ChatGPT 的語音功能以問答對話為主。這次的桌面版則可用語音下達包含多個步驟的複雜指令,當 ChatGPT 需要確認時,使用者也能以語音回應。它從單純的語音聊天,升級為透過說話推進實際工作的操作方式。
ChatGPT Voice 同時支援面向日常業務的「ChatGPT Work」與程式設計助手「Codex」。它還能呼叫「電腦操作(computer use)」技能,自行前往網站與應用程式查找資訊,因此從查詢到執行都能只靠語音完成。在 OpenAI 公開的示範影片中,開發者以一句話下達「新增一個討論串、送出一個拉取請求,並找出某個錯誤的根本原因」,ChatGPT 便完成了這一整套作業。
底層是能同時聆聽與說話的新模型「GPT-Live」
新功能所使用的,是 OpenAI 本月推出的語音模型系列「GPT-Live(ChatGPT-Live)」。傳統語音助理通常是「你說完我再回」的輪流方式。GPT-Live 對此加以改良,採用一邊聆聽、一邊說話的全雙工方式。它能在不打斷對方的前提下插入「我了解了」之類的附和,同時把耗時較長的複雜推理交給後台模型處理,藉此在對話的自然度與處理的複雜度之間取得平衡。
在 macOS 上還能參考畫面內容,鎖定開發場景
macOS 版新增了名為「Appshots」的畫面辨識功能。在使用者授權後,ChatGPT Voice 可參考目前最前方的視窗及其顯示內容(包含替代文字)。由於能結合手邊的檔案與程式碼結構進行互動,其設想的用法是:開發者一邊以語音討論,一邊讓 AI 代理同時推進實際處理。這接近看著畫面口頭商量的體驗,讓人能雙手離開鍵盤繼續推進工作。
至於 Codex,OpenAI 表示還可透過 iOS 應用程式的遠端存取,在外出時以語音操作。
與手機版的差異,以及競爭對手 Anthropic 的動向
ChatGPT Voice 的手機版雖然在對話流暢度,以及被打斷時的處理自然度上有所提升,但並未設計成能在手機上實際代為操作。這次的桌面版更進一步,邁向「以語音執行工作」,這正是兩者的重要差異。
在語音代辦這個方向上加碼的,並非只有 OpenAI。Anthropic 也革新了對話助理「Claude」的語音模式,讓使用者可在 Opus、Sonnet、Haiku 各模型中選擇,並能以語音在 Gmail、Google 日曆、Slack 等已連接的應用程式中完成操作。以語音下達指令、推進實際工作的助理,正成為各家明確的競爭焦點。
總結
OpenAI 在 ChatGPT 桌面應用程式中新增了語音操作「ChatGPT Voice」,可用語音操控 ChatGPT Work 與 Codex 的 AI 代理。其底層是能同時聆聽與說話的新模型「GPT-Live」,在 macOS 上還能參考畫面內容。能以語音下達多步驟指令、甚至將開發工作交給它,正是它與以往不同之處。圍繞「以語音完成實際工作」的助理之爭,連同 Anthropic 的動向,正日益激烈。
