xAI 发布了语音转文字 API「Grok Voice Transcribe 2.0」,在维持原有价格的同时,将识别准确率提升至上一代的近两倍。据第三方基准测试显示,该模型在主流流式语音识别模型中位居榜首,在电话语音和短句识别方面的表现也有明显提升。

短句识别错误率降至三分之一以下

新模型在覆盖 19 种语言的短句识别测试中,单词错误率从 20.6% 降至 6.8%。在客服通话、日常对话、口头验证信息等多个类别中准确率均有提升,其中短句类别的改善幅度最为突出。在模拟 8kHz 电话音质的测试中,该模型在英语客服通话识别方面的表现也超过了所有参与测试的其他模型。在某独立基准测试网站发布的流式语音识别模型排行榜中,该模型在 32 款模型中位列第一。

价格维持在每小时几十日元的水平

使用费用维持原价:批处理为每小时 0.10 美元(约合 16 日元),实时流式处理为每小时 0.20 美元(约合 31 日元),与上一代价格相同。※按 1 美元=157 日元换算(截至 2026 年 9 月 19 日) 该价格已包含说话人分离、时间戳标注、关键词校正等功能。

支持说话人分离与多声道处理

新模型具备识别不同说话人的说话人分离功能、逐词时间戳标注功能,并可同时处理最多 8 个声道的音频。在提升特定专有名词和专业术语识别率的「关键词偏置」功能中,最多可登记 100 个关键词。此外,新模型还新增了自动整理文本格式使内容更易读、去除口语中特有的语气词、以及通过判断停顿来确定语句断句位置等功能。支持语言达数十种,可自动检测所使用的语言,并能在一次处理过程中识别对话中途出现的语言切换。文本自动格式化功能支持 25 种语言。批处理模式下单个文件最大支持 500MB,可处理 12 种音频格式。

仅通过 API 提供,旧版本将于数周内停用

Grok Voice Transcribe 2.0 仅通过 API 提供,没有开放模型权重的版本,用户也无法在自有服务器上自行部署运行。视频留言服务 Atlassian Loom 已率先采用该模型,据称其评价认为该模型比现有语音识别方案更为准确。上一代版本「Grok Voice Transcribe 1.0」预计将在数周内停止提供,但在此之前,用户仍可通过指定模型 ID 继续使用旧版本。

总结

xAI 发布了语音识别 API「Grok Voice Transcribe 2.0」,在大幅提升短句及电话语音识别准确率的同时,将价格维持在与上一代相同的水平。该模型还新增了说话人分离、多声道支持、关键词偏置等面向实际业务场景的功能,未来能否在呼叫中心、会议录音等场景中获得更广泛的应用值得关注。