OpenAI於2026年9月10日宣布,能夠同時進行聆聽與說話的語音AI模型GPT-Live-1將透過API正式提供。這款模型將語音辨識、回應生成、語音合成這三個環節整合進單一模型,得以處理接近真人對話的節奏與插話方式。整體設計明顯是針對電話預約、客服中心等實際語音業務場景而打造。
語音辨識、推理、語音合成整合於單一模型
過去大多數語音AI代理,都是將多個模型串接使用:一個負責把語音轉成文字,一個負責理解內容並生成回覆,另一個再把回覆轉換回語音。由於每個環節都由不同模型處理,系統往往要等對方講完才能開始回應,容易出現反應遲鈍、插話不自然的問題。
GPT-Live-1採用全雙工架構,將上述三個環節整合進同一個模型,能夠同時處理輸入與輸出的音訊。這讓它可以在對方話說到一半時插入更正或附和,更貼近真人對話的自然感。面對需要複雜處理的問題時,對話本身仍由GPT-Live-1負責,較重的推理工作則可交由GPT-6 Astra等後端模型處理。
回應速度與對話自然度大幅提升
根據OpenAI公布的評測結果,在衡量同時聆聽與說話能力的基準測試中,GPT-Live-1較前代模型提升了30個百分點。對話輪替的回應延遲,也從先前的1.41秒縮短到0.798秒,幾乎減半。在衡量語音代理實際任務表現的測試中,正確率從45.7%提升到86.2%,已導入該模型的企業也回報,因思考停頓而造成的插話減少了約80%。
從電話客服到語言學習,應用場景廣泛
OpenAI列舉的應用場景相當廣泛,包括餐廳訂位、客服中心、銀行業務、語言學習對話練習,以及醫療機構的病患溝通等。一家針對住宅與醫療領域提供AI服務的企業,已將其用於訂位業務,在大幅刪減程式碼的同時提升了通話品質。一項針對餐飲業的服務也回報,在處理點餐與訂位電話時實現了自然的對話體驗,此外也有程式設計AI代理與該模型完成整合。
語音介面部分的費用為每分鐘0.05美元(約7.7日圓),負責推理的後端模型費用則另計※1美元=154日圓(截至2026年9月15日)。語氣與語速可透過系統提示詞調整,模型也能在長時間對話中維持脈絡,這些設計顯然是考量實際商業使用而設計的。
語音種類更豐富,支援電話線路對接
可選的語音種類也有所擴充,涵蓋多種口音與說話風格。內建的電話線路對接功能,也讓希望將語音代理整合進既有電話系統的企業更容易導入。GPT-Live-1還能妥善處理長時間的沉默與環境噪音,避免出現過去語音AI常見的多餘附和語。
總結
GPT-Live-1從過去語音辨識、推理、語音合成分別由獨立模型串接處理的方式,轉向由單一模型同時處理三個環節的全雙工架構。回應速度與對話自然度的大幅提升,讓電話客服、訂位受理等實際場景中的語音AI應用變得更加可行。
