谷歌发布了两款新的文本转语音模型:"Gemini 3.8 Flash TTS"可以仅凭文字描述从零创造出全新的声音,而"Gemini 3.8 Flash-Lite TTS"则专为高速、低成本的大批量处理而设计。此前的谷歌语音合成模型只能从固定的预设声音中挑选,而新模型可以根据角色设定、口音、音色等文字指令直接生成一个全新的声音,为游戏、有声书和播客制作等场景带来了新的可能性。

从"挑选声音"到"设计声音"

以往谷歌的语音合成模型主要提供约30种预设声音供用户选择。此次发布的Flash TTS在保留这些预设声音的基础上,最大的变化在于用户只需用自然语言描述角色、口音、音色等特征,就能生成一个全新的声音。谷歌还提供了涵盖不同地区口音差异、总数超过2000种的声音库,并计划在近期推出"声音混合"功能,让用户可以通过提示词调整现有声音库中声音的音色、音高、语速和口音。Flash TTS支持130种语言,面向大批量处理的Flash-Lite TTS支持101种语言,两者均支持日语。

新模型还搭载了"声音复刻"功能,可以通过约30秒的音频样本还原说话者的声音。该功能仅限用于本人的声音,或用户拥有使用权的声音,使用时需要提交声音所有者口头同意的录音,系统还会验证该录音中的说话人是否与参考音频一致。需要说明的是,在Google AI Studio中,美国伊利诺伊州、得克萨斯州、欧洲经济区(EEA)、英国、瑞士和印度目前无法使用该声音复刻功能。

演绎指令与长内容生成

两款模型都支持在脚本中逐行插入类似舞台提示的指令,从而精细控制语速和情感表达。即便是长达数小时的音频,也能保持声音质感和自然的停顿节奏,还可以由单一脚本生成两位说话者之间的对话。笑声、叹息、倒吸一口气等非语言声音,以及"嗯"等附和词,都可以通过脚本中的标签插入。所有生成的音频都嵌入了谷歌的数字水印技术"SynthID",而通过声音复刻生成的音频还会附加标示内容来源的"C2PA"认证信息。

提供范围与价格体系

两款模型已于发布当天陆续开放使用。开发者可通过Gemini API和Google AI Studio使用,普通用户则可以通过"Gemini Notebook"的语音讲解功能使用Flash TTS,通过"Google Vids"使用Flash-Lite TTS。面向企业客户的"Gemini Enterprise" API接入也将很快推出。Agora、LiveKit、Pipecat、Vercel等开发者平台正通过Gemini API接入该功能,Figma、HeyGen等公司也在将其整合进自家产品。

在Gemini API的付费方案中,Flash TTS每百万输入token收费0.5美元(约合79日元),每百万输出token收费9美元(约合1400日元);Flash-Lite TTS每百万输入token收费0.5美元(约合79日元),每百万输出token收费6美元(约合940日元)。以上价格有效期至2026年12月31日,2027年1月1日起将分别上调约一倍。此外还提供免费额度,异步处理的Batch和Flex模式可以享受标准价格的五折优惠。

在性能方面,Flash TTS在专业语音评测机构Hume AI的语音设计基准测试中获得综合第一,在口音表现单项测试中同样排名第一;在该机构的综合质量指标中,Flash TTS排名第一,Flash-Lite TTS排名第二。在由真人进行听感比较的"Voice Arena"评测中,两款模型在包括日语在内的多种语言测试中都名列前茅。这两款模型也加入了谷歌"Gemini Audio"语音模型系列,与支持实时语音对话的"Gemini 3.8 Live"、语音转文字的"Gemini 3.5 Transcribe"等模型并列。

总结

谷歌此次发布的"Gemini 3.8 Flash TTS"和"Gemini 3.8 Flash-Lite TTS",让语音合成从单纯挑选预设声音,进化到可以用自然语言描述从零设计一个全新的声音。新模型在增强演绎指令控制能力和长内容生成稳定性的同时,也通过SynthID水印和C2PA溯源信息保障了内容的真实性,并从开发者API到Gemini Notebook、Google Vids等大众化工具,提供了多样化的使用渠道。

※1美元=157日元(截至2026年9月25日)