谷歌于当地时间 2026 年 8 月 26 日发布了语音识别模型 Gemini 3.5 Transcribe。它并非单纯把声音转成文字,而是会去掉重复更正,以及嗯、呃这类无实义的语气词,直接输出排好版的文本。面向开发者提供两套 API,同时已经在 Android 的 Gboard 与 macOS 版 Gemini 应用等消费级场景中投入使用。
从听清走向整理
传统语音识别在背景噪声、行业术语以及口语特有的不流畅面前一直存在短板。Gemini 3.5 Transcribe 正是针对这些痛点设计的,可以把原始音频直接转换成规范、已完成格式化的文本。
最直观的是对自我更正的处理。当说话人先说周二又改口说周三时,模型不会把两种说法原样记录,而是按照说话人的真实意图落笔。语气词删除和自动排版同理,目的是减少转写完成后仍需人工修改的环节。
另一项能力是自定义词汇。预先登记专有词条后,模型可以适配企业内部术语和特殊拼写。谷歌称在噪声较多的真实环境中,邮政编码、订单号这类字母数字混排的内容也能准确捕捉。
按用途划分的两套 API
提供方式按照开发流程分为两条线。
实时场景使用 Live API,模型名称为 gemini-3.5-transcribe-live。它可以以低于 1 秒的延迟持续进行双向流式传输,面向语音智能体和实时字幕等交互式用途。
处理录制音频的是 Interactions API,对应模型名称为 gemini-3.5-transcribe。它能把会议录音、通话记录按说话人区分,并输出词级时间戳。说话人识别正式支持 3 人,4 人及以上属于实验性支持。语言方面支持自动检测并转写 85 种以上语言,同时兼顾地域口音与方言。
此外,在 macOS 版 Gemini 应用中还可以使用函数调用,把图像生成、文件分析等较重的任务交给后台的其他 Gemini 模型处理。语音输入正在从打字的替代手段,转向驱动应用的入口。
精度与速度较 Chirp 3 明显提升
从数据看,Artificial Analysis 的测算显示平均词错误率(WER)在流式场景为 4.0%,非流式场景为 2.6%。在多语言基准 FLEURS 上,针对主要语言与区域,流式模式为 5.50%,非流式模式为 5.04%。
与上一代转写模型 Chirp 3 相比,最终转写结果确定所需的时间缩短了 70%。对实时应用来说,这段等待时间的压缩恐怕与精度提升同样关键。
需要留意的是,WER 数值越低越好,但会随测试条件和音源而波动。公布的数据更适合理解为特定测量环境下的结果。
现在能用的地方与后续计划
面向普通用户,Android 一侧的入口是 Gboard 新增的 Rambler 功能。它把口述内容转换为排好版的文本,还能通过语音完成编辑、纠正错字和调整文风,目前先在部分国家和语言开放。
macOS 版 Gemini 应用支持英语,可以把语音指令与屏幕内容结合使用。总结本地文件、跨应用复用文本、在光标位置生成图像,这些操作都被设计为仅凭语音即可完成。Chrome 端也将在近期支持,届时可以在任意网页输入框中口述输入。
开发者与企业侧均处于公开预览阶段。开发者可通过 Google AI Studio 中的 Gemini API 以及 Google Antigravity 试用,企业可通过 Gemini Enterprise Agent Platform 接入,面向 Gemini Enterprise for Customer Experience 的提供也在计划中。Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 等开发平台已经通过 Live API 完成适配,实时流媒体的底层工程可以交给它们处理。
总结
Gemini 3.5 Transcribe 的看点不只是识别准确率,而是把语气词删除、自动排版这些后处理环节一并压缩掉。非流式 WER 2.6%、支持 85 种以上语言、相较 Chirp 3 缩短 70% 的确定时间,实用层面的材料已经比较完整。由于 Gboard 和 macOS 版 Gemini 应用可以先行体验,最快的判断方式就是用自己的说话方式试一试,看它能整理到什么程度。
