2026 年 7 月 8 日(美國時間),OpenAI 發表了新一代語音 AI 模型「GPT-Live」[1]。這款模型採用能同時聆聽與說話的全雙工(full-duplex)架構,支援附和語與自然的插話,帶來更貼近與真人交談的對話體驗。GPT-Live 已於同日開始在全球陸續上線,成為 ChatGPT 語音功能「ChatGPT Voice」的新基礎;其設計是在幕後將複雜問題交由 GPT-5.5 處理,同時讓對話不中斷[1]。

「邊聽邊說」的全雙工架構

過去的語音 AI 大致可分為兩個世代。最初的 ChatGPT Voice 採用串接式設計,把語音辨識、大型語言模型與語音合成 3 個模型依序串聯,因此回應緩慢又生硬。之後的 Advanced Voice Mode 改為在單一模型內直接處理音訊,延遲降低了,但仍是等使用者說完才回應的回合制。由於以靜音判斷發言結束,短暫的思考停頓或背景噪音都可能被誤判為「說完了」,導致模型在不自然的時機插話[1]。

GPT-Live 以全雙工設計化解了這些限制。它在產生輸出的同時持續處理輸入,因此每秒能多次做出判斷:要開口說話、繼續聆聽、保持安靜、插話,還是呼叫工具。對話中它會以「嗯嗯」之類的附和表示自己正在聽,在使用者整理思緒時安靜等候,實現節奏明快的往返交流。OpenAI 表示,時間感的提升也讓即時翻譯等用法成為可能[1]。

深度處理交給 GPT-5.5,對話不中斷

另一大支柱是將對話與「深度工作」分離。遇到需要網路搜尋、複雜推理或代理式處理的問題時,GPT-Live 會在幕後把任務委派給 GPT-5.5 等前沿模型,在結果出爐前繼續維持交談。受委派的模型會隨新模型的推出持續更新,兼顧自然對話與最新智慧[1]。

在效能方面,OpenAI 以 5 至 10 分鐘的實際對話與 Advanced Voice Mode 進行對比評測,GPT-Live 在整體偏好、話輪交替、對話流暢度與自然度上獲得明顯更高的支持。在衡量專家級科學推理的 GPQA,以及衡量代理式網路搜尋能力的 BrowseComp 上,也都展現大幅進步[1]。

ChatGPT Voice 將有哪些改變

每週有超過 1.5 億人在 ChatGPT 使用語音功能或語音輸入,這次革新將涵蓋整體語音體驗。新版助理能靈活因應談話途中的提問與「說慢一點」之類的要求,9 種語音也針對 GPT-Live 重新打磨。回答前的思考深度可從 Instant(即答)、Medium、High 3 檔中選擇[1]。

聆聽方面,當使用者陷入思考時,ChatGPT Voice 不再貿然插話,而是耐心等待;被要求「安靜聽著」時也會照辦。即使有過路車聲或旁人交談等背景噪音,它也能更專注於使用者的聲音。此外,在天氣、股票、體育等話題中,它還能一邊對話一邊顯示視覺化資訊卡片[1]。

針對語音的安全措施與提供範圍

因應即時語音對話的安全設計也是一大特色。當系統在模型說話的過程中偵測到可能不安全的輸出時,可以將其引導至更安全的回應、顯示提醒訊息或求助資源,在高風險情況下還能結束對話。針對青少年使用者,模型本身經過符合年齡的行為訓練,家長可透過家長監護功能決定是否開放 ChatGPT Voice。系統也內建防止模仿真人聲音的機制,僅使用預先設定的語音[1]。

GPT-Live 正在 iOS、Android 與網頁版 ChatGPT 陸續推送。Go、Plus 與 Pro 使用者的預設模型為 GPT-Live-1,免費使用者的預設模型為 GPT-Live-1 mini。API 也預計近期開放。要注意的是,發表時語音尚無法與影像或螢幕分享同時使用,部分語言可能有口音或流暢度不足的情況,傳統的 Standard 與 Advanced Voice Mode 仍可繼續使用[1]。

總結

GPT-Live 象徵語音互動從回合制邁向「邊聽邊說」連續對話的轉捩點。它將對話的自然流暢與幕後前沿模型的智慧分離並兼顧的設計,可望成為未來語音代理的標準樣板。不妨在手邊的 ChatGPT 試試這個會邊附和邊聽你說話的全新 Voice。

來源:https://openai.com/index/introducing-gpt-live