Google於當地時間9月15日推出兩款用於語音對話的AI模型「Gemini 3.8 Live」與「Gemini 3.8 Live Extended Thinking」。前者負責規模化與成本效率,後者負責處理複雜工作所需的推理能力。兩款模型自當天起,陸續在開發者用的API與一般使用者的服務中開放。
同樣名為Live,定位卻不同
語音代理需要什麼樣的個性,取決於實際用途。像接單或客服問答這類需要大量處理簡短往來的場景,回應速度與營運成本最為關鍵。而在需要一步步釐清條件、推進手續的場景裡,即使多等一下,能仔細思考的模型反而更實用。
這次的兩款模型正是依照這條界線來劃分。Gemini 3.8 Live以大規模部署與成本效率為前提設計,同時兼顧對話的自然度與視覺資訊的理解。Gemini 3.8 Live Extended Thinking則鎖定複雜度較高的任務,主打多步驟推理。
邊說邊看,邊說邊在背景處理
Gemini 3.8 Live最引人注意的,是它在「不讓對話中斷」這件事上做了相當具體的設計。
首先是語言切換。模型會在對話進行中自動偵測目前使用的語言,並在支援的97種語言之間切換。即使說話者中途混用語言,使用者也不需要重新設定。
其次是視覺。來自相機等裝置的畫面會以接近即時的速度處理,模型能依照眼前的實際狀況回答。一邊用鏡頭對著手邊的裝置、一邊詢問操作方式,就是預設的使用情境之一。
第三是在背景執行工具與API呼叫的機制。過去的語音助理在等待外部處理時往往陷入沉默。Gemini 3.8 Live會先以語音回應已收到請求,在背景作業進行的同時繼續對話。
「邊想邊說」的Extended Thinking
Extended Thinking的特色在於推理與發話同時進行。
它不會在思考時安靜下來,而是先丟出「我確認一下」這類鋪陳,接著一邊用語音播報進度,一邊推進多步驟的處理。人與人通電話時,如果對方查資料時突然沒了聲音,聽的一方會感到不安,這款模型處理的正是類似的問題。
Google公開的示範包括:依據手繪草圖與語音回饋組出React元件;非同步處理多筆預約的同時讓對話不中斷;僅靠對話就完成商業計畫與行銷工具組。
在基準測試中的位置
從數字來看,Extended Thinking的表現特別突出。
在Artificial Analysis的Speech to Speech Quality Index中取得82.6分,拿下總榜第一。在代理任務完成率方面,τ-Voice為68.6%,Sierra的τ-Voice-banking為35.1%。在衡量音訊推理能力的Big Bench Audio中則為97.7%。Google表示,這樣的水準是在與其他前沿模型相比仍保有價格競爭力的前提下達成的。
Gemini 3.8 Live則在依使用者偏好排名的Speech Agent Arena中位居第二。在語音代理的評測基準ServiceNow「EVA-Bench」上,Google指出兩款模型在準確度與對話品質的平衡上推高了上限。另外,EVA-Bench的測試是在Gemini Enterprise Agent Platform上的Live API所執行。
基準測試的數字會受評測設計影響,未必能直接反映實際使用的感受。不過,在維持價格帶的同時擠進前段班這樣的說法,對想把語音代理真正放進營運環境的業者而言,是很難忽略的判斷材料。
開發者的接口與安全措施
透過Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents等開發者平台已提供支援。即時串流那些麻煩的部分可以交給這些平台處理,開發端便能專注於使用者體驗的設計。Google也提到Salesforce、Genspark、Lumeris等公司對這兩款模型抱持高度興趣。
安全方面,模型生成的所有音訊都會嵌入數位浮水印「SynthID」。浮水印以人耳無法辨識的方式織入音訊本身,因此事後可以用機器確認是否為AI生成的音訊。語音合成的品質愈高,這類辨識手段的分量也就愈重。
可以在哪裡使用
Gemini 3.8 Live對開發者透過Gemini API與Google AI Studio提供。企業端先以Gemini Enterprise的私人預覽形式開放,之後也預計登上Gemini Enterprise for Customer Experience。一般使用者可在Search Live中接觸到。
Gemini 3.8 Live Extended Thinking對開發者同樣透過Gemini API與Google AI Studio提供。企業端自Gemini Enterprise的私人預覽開始,接著擴及Gemini Enterprise for Customer Experience與Google Workspace的企業使用者。一般使用者可在Gemini Live使用,Google AI Pro與Ultra訂閱者可在Workspace的Docs使用,所有Google AI訂閱者則可在Gmail與Keep使用。
總結
Gemini 3.8 Live負責規模與成本效率,Gemini 3.8 Live Extended Thinking負責推理能力,兩者組成雙軌的語音AI模型。97種語言的自動切換、接近即時的視覺理解、背景執行工具等機制都在減少對話中斷,而Extended Thinking更以82.6分拿下Speech to Speech Quality Index總榜第一。開發者可從Gemini API與Google AI Studio著手,一般使用者則能透過Search Live與Gemini Live陸續體驗。
