谷歌宣布推出全新语音翻译模型「Gemini 3.5 Live Translate」,可将说出的话几乎实时地转换成另一种语言的语音[1]。该模型能自动识别70多种语言,并在保留说话者语调、语速和音高的同时,生成自然流畅的翻译语音[1]。它将通过谷歌翻译应用、Google Meet以及面向开发者的API陆续开放使用[1]

"边说边译"的连续翻译机制

Gemini 3.5 Live Translate是谷歌最新的语音对语音(speech-to-speech)实时翻译音频模型[1]。据谷歌介绍,它能从输入语音中自动检测70多种语言,并生成流畅自然的翻译语音[1]

以往不少方案采用"轮流式",要等说话者说完才开始翻译[1]。相比之下,3.5 Live Translate会连续不断地生成语音[1]。它在"等待更多上下文以提升质量"和"立即翻译以跟上说话者"之间取得平衡,因此不会出现尴尬的停顿,整个会话期间输出仅比说话者落后几秒[1]

谷歌表示,翻译从其机器学习的早期阶段起就是一项重要工作,如今每月通过旗下各产品为数十亿用户翻译超过1万亿个词[1]

面向开发者、企业与普通用户的分阶段推出

Gemini 3.5 Live Translate当天起通过谷歌旗下各产品陆续推出,不同类型的用户开放方式有所不同[1]

面向开发者,它通过Gemini Live API和Google AI Studio以公开预览形式提供[1]。面向企业,本月起在Google Meet中开启私有预览[1]。而普通用户则可通过Android版和iOS版的谷歌翻译应用使用[1]

抗噪能力强,支持多语言输入

对开发者而言,其优势在于能直接处理以流式传输的语音[1]。无需手动切换设置即可处理多语言输入,且具备抗噪能力,可让应用在嘈杂、难以预测的环境中正常工作[1]。谷歌表示,它可用于多语言通话、会议、授课、直播等场景中的实时口译[1]

借助Gemini Live API,Agora、Fishjam、LiveKit、Pipecat、Vision Agents等开发者平台让语音翻译应用的构建与发布变得更加容易[1]。这些集成方案承担了实时媒体传输基础设施这一复杂部分,使开发者能够专注于打磨使用体验[1]

实证测试也已展开。出行服务商Grab正在试用该模型,以便在上车汇合时让司机与乘客能够近乎实时地进行多语言交流[1]。Grab的用户每月通过该服务进行的语音通话超过1000万次[1]。此外,CJ ENM、LiveKit等公司也给出了正面反馈,称赞其翻译质量、准确度以及较低的延迟[1]

在Google Meet与谷歌翻译应用中的体验

Google Meet的语音翻译不久后也将采用3.5 Live Translate[1]。支持的语言从此前的5种扩展到70多种,一场会议可支持超过2000种语言组合[1]。以往翻译仅限于与英语之间互译,如今这一限制被取消[1]。界面也进行了更新,以便快速使用语音翻译[1]。该更新本月起面向部分企业版Google Workspace客户以私有预览形式提供,更大范围的推出预计在今年晚些时候进行[1]

在谷歌翻译应用中,该功能将在Android和iOS上面向全球推出[1]。使用Live translate功能时,只需连接任意一副耳机,即可体验在70多种语言间反映说话者语气的翻译[1]

在Android上,谷歌还开始推出全新的"聆听模式(listening mode)"[1]。该功能可让翻译语音直接通过手机听筒播放[1]。像普通通话那样把手机贴近耳朵,翻译后的语音便会直接传来,在手边没有耳机、又想快速且不被旁人听到地确认翻译的场景中尤为实用[1]

生成语音带有SynthID水印

Gemini 3.5 Live Translate生成的所有语音都会带有电子水印「SynthID」[1]。这是一种直接嵌入语音输出、人耳无法察觉的水印[1]。谷歌表示,通过让AI生成的内容保持可检测,旨在帮助防止虚假信息扩散[1]。关于安全与负责任地提供服务的理念,该公司在模型卡(model card)中作了说明[1]

总结

Gemini 3.5 Live Translate是谷歌推出的全新语音翻译模型,能在保留说话者语气的同时,连续翻译70多种语言。它通过开发者API、Google Meet和谷歌翻译应用分阶段提供,有望在会议、通话以及出行途中的对话等存在语言障碍的场景中投入实用。生成的语音带有SynthID水印,是一项兼顾安全性的设计。

来源:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-live-3-5-translate/