xAI 發布了語音轉文字 API「Grok Voice Transcribe 2.0」,在維持原本價格的同時,將辨識準確度提升至上一代的近兩倍。根據第三方基準測試,該模型在主流串流式語音辨識模型中排名第一,在電話語音與短句辨識方面的表現也有明顯進步。
短句辨識錯誤率降至三分之一以下
新模型在涵蓋 19 種語言的短句辨識測試中,單字錯誤率從 20.6% 降至 6.8%。在客服通話、日常對話、口頭驗證資訊等多個類別中準確度均有提升,其中短句類別的改善幅度最為明顯。在模擬 8kHz 電話音質的測試中,該模型在英語客服通話辨識方面的表現,也超越了所有受測的其他模型。在某獨立基準測試網站公布的串流式語音辨識模型排行榜中,該模型在 32 款模型中排名第一。
價格維持在每小時數十日圓的水準
使用費用維持原價:批次處理為每小時 0.10 美元(約 16 日圓),即時串流處理為每小時 0.20 美元(約 31 日圓),與上一代價格相同。※以 1 美元=157 日圓換算(截至 2026 年 9 月 19 日) 此價格已包含說話者分離、時間戳記標註、關鍵字校正等功能。
支援說話者分離與多聲道處理
新模型具備可辨識不同說話者的說話者分離功能、逐字時間戳記標註功能,並能同時處理最多 8 個聲道的音訊。在提升特定專有名詞與專業術語辨識率的「關鍵字偏置」功能中,最多可登錄 100 個關鍵字。此外,新模型還新增了自動整理文字格式使內容更易讀、去除口語中特有的贅字、以及透過判斷停頓來確定語句斷句位置等功能。支援語言達數十種,可自動偵測所使用的語言,並能在一次處理過程中辨識對話中途出現的語言切換。文字自動格式化功能支援 25 種語言。批次處理模式下,單一檔案最大支援 500MB,可處理 12 種音訊格式。
僅透過 API 提供,舊版本將於數週內停用
Grok Voice Transcribe 2.0 僅透過 API 提供,沒有開放模型權重的版本,使用者也無法在自有伺服器上自行部署運行。影片留言服務 Atlassian Loom 已率先採用該模型,據稱其評價認為該模型比現有的語音辨識方案更為準確。上一代版本「Grok Voice Transcribe 1.0」預計將於數週內停止提供,但在此之前,使用者仍可透過指定模型 ID 繼續使用舊版本。
總結
xAI 發布了語音辨識 API「Grok Voice Transcribe 2.0」,在大幅提升短句與電話語音辨識準確度的同時,將價格維持在與上一代相同的水準。該模型還新增了說話者分離、多聲道支援、關鍵字偏置等面向實務應用的功能,未來能否在客服中心、會議錄音等場景中獲得更廣泛的採用值得關注。
