Google 於當地時間 2026 年 8 月 26 日發表語音辨識模型 Gemini 3.5 Transcribe。它不只是把聲音換成文字,而是會濾掉說到一半改口的內容,以及嗯、呃這類沒有實際意義的語助詞,直接輸出排版完成的文字。開發者端提供兩套 API,同時也已經運作在 Android 的 Gboard 與 macOS 版 Gemini 應用程式等一般使用者接觸得到的地方。
從聽得清楚,走向幫你整理
以往的語音辨識在背景噪音、產業專有名詞,以及口語特有的不流暢面前都不夠可靠。Gemini 3.5 Transcribe 正面處理了這些弱點,能把原始音訊直接轉成規整、已完成格式的文字。
最好懂的例子是改口的處理。當說話者先說星期二、接著又改成星期三時,模型不會把兩種說法照單全收,而是依照說話者的意圖整理成一句。語助詞的移除與自動排版也是同樣的思路,目的在於減少轉寫完成後還要人工修飾的工序。
另一項能力是自訂詞彙。事先登錄自己的詞條後,模型就能跟上公司內部用語與特殊拼法。Google 表示在噪音較多的實際環境中,郵遞區號、訂單編號這類英數字混排的字串也能準確擷取。
依用途分成兩套 API
提供方式配合開發流程分為兩條路線。
即時類使用 Live API,模型名稱為 gemini-3.5-transcribe-live。它能以低於 1 秒的延遲維持雙向串流,設定的情境是語音代理人與即時字幕這類互動式應用。
處理已錄製音訊的則是 Interactions API,對應的模型名稱為 gemini-3.5-transcribe。它會把會議錄音、通話紀錄依說話者切開,並附上單字層級的時間戳記。說話者辨識正式支援到 3 人,4 人以上屬於實驗性支援。語言方面可自動判別並轉寫 85 種以上語言,也把各地口音與方言納入考量。
此外,在 macOS 版 Gemini 應用程式中還能使用函式呼叫,把影像生成、檔案分析這類較重的工作交給背景的其他 Gemini 模型處理。語音輸入正從打字的替代手段,轉向操作應用程式的入口。
精確度與速度都比 Chirp 3 更上一層
數字方面,Artificial Analysis 的量測顯示平均單字錯誤率(WER)在串流時為 4.0%,非串流時為 2.6%。在多語言基準 FLEURS 上,針對主要語言與地區設定,串流模式為 5.50%,非串流模式為 5.04%。
與前一代轉寫模型 Chirp 3 相比,最終轉寫結果確定所需的時間縮短了 70%。對即時應用而言,這段等待時間的壓縮恐怕和精確度的提升同樣關鍵。
不過 WER 是數值越低越好的指標,會隨測試條件與音源而有落差。公布的數字比較適合視為特定量測環境下的結果。
現在能用的地方,以及接下來的規劃
一般使用者這邊,Android 的入口是 Gboard 新增的 Rambler 功能。它會把口述內容轉成排版完成的文字,也能用語音下達編輯、修正錯字、調整文風等指示,目前先在部分國家與語言開放。
macOS 版 Gemini 應用程式支援英語,可以把語音指令與畫面內容搭配使用。摘要本機檔案、跨應用程式重複運用文字、在游標位置生成影像,這些操作都設計成只靠聲音就能完成。Chrome 也預計近期支援,屆時可以在任何網頁欄位以語音輸入。
開發者與企業端都處於公開預覽階段。開發者可透過 Google AI Studio 的 Gemini API 與 Google Antigravity 試用,企業可透過 Gemini Enterprise Agent Platform 導入,針對 Gemini Enterprise for Customer Experience 的提供也在規劃中。Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 等開發平台已經透過 Live API 完成支援,即時串流的底層工程可以交給它們負責。
總結
Gemini 3.5 Transcribe 的重點不只在辨識準確度,而是把語助詞移除、自動排版這些後製工序一起省掉。非串流 WER 2.6%、支援 85 種以上語言、相較 Chirp 3 縮短 70% 的確定時間,實用面的條件大致到齊。由於 Gboard 與 macOS 版 Gemini 應用程式已經可以先行體驗,最快的判斷方式就是用自己的說話方式試試看,看它能整理到什麼程度。
