谷歌于当地时间9月15日发布了两款用于语音对话的AI模型「Gemini 3.8 Live」和「Gemini 3.8 Live Extended Thinking」。前者负责规模化与成本效率,后者负责处理复杂任务所需的推理能力。两款模型均从当天起,在面向开发者的API和面向普通用户的服务中陆续开放。

同为Live,定位却不同

语音智能体需要什么样的性格,取决于具体用途。像接单或问答这种需要大量处理简短交流的场景,响应速度和运行成本最为关键。而在需要一步步梳理条件、推进流程的场景中,哪怕多等一会儿,一个能认真思考的模型更有用。

这次的两款模型正是沿着这条分界线划分的。Gemini 3.8 Live以大规模部署和成本效率为前提设计,兼顾对话的自然度与视觉信息的理解。Gemini 3.8 Live Extended Thinking面向复杂度较高的任务,主打多步骤推理能力。

边说边看,边说边在后台干活

Gemini 3.8 Live最值得注意的地方,是它在「不让对话中断」这件事上做了不少具体设计。

首先是语言切换。模型会在对话进行中自动识别当前使用的语言,并在支持的97种语言之间切换。即使说话者中途混用语言,用户也不需要重新设置。

其次是视觉。来自摄像头等设备的画面会以接近实时的速度被处理,模型可以结合眼前的实际情况作答。一边用摄像头对着手上的设备、一边询问操作方法,就是设想中的用法之一。

第三是在后台执行工具和API调用的机制。以往的语音助手在等待外部处理时往往陷入沉默。Gemini 3.8 Live会先用语音确认已收到请求,在后台处理进行的同时继续对话。

「边想边说」的Extended Thinking

Extended Thinking的特点在于推理与发声同时进行。

它不会在思考时陷入沉默,而是先给出「我确认一下」这类铺垫,随后一边用语言播报进度,一边推进多步骤处理。人与人打电话时,如果对方查资料时突然没了声音,听的一方会不安,这款模型应对的正是类似的问题。

谷歌公开的演示中包括:根据手绘草图和语音反馈搭建React组件;异步处理多项预约的同时保持对话不中断;仅通过对话生成商业计划和营销工具包。

基准测试中的位置

从数据上看,Extended Thinking的成绩尤为突出。

在Artificial Analysis的Speech to Speech Quality Index中,它取得82.6分,位居总榜第一。在智能体任务完成率方面,τ-Voice为68.6%,Sierra的τ-Voice-banking为35.1%。在衡量音频推理能力的Big Bench Audio中,成绩为97.7%。谷歌表示,这一水平是在与其他前沿模型相比保持价格竞争力的前提下达成的。

Gemini 3.8 Live则在依据用户偏好排名的Speech Agent Arena中位列第二。在语音智能体评测基准ServiceNow的EVA-Bench上,谷歌称其在准确度与对话质量的平衡方面提升了上限。需要说明的是,EVA-Bench的测试是在Gemini Enterprise Agent Platform上的Live API中完成的。

基准测试的数字会受评测设计的影响,未必能直接对应实际体验。不过,在维持价格区间的同时跻身前列这一说法,对希望把语音智能体真正投入运营的企业来说,是很难忽视的信息。

开发者生态与安全措施

通过Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents等开发者平台已提供支持。实时流媒体方面繁琐的部分可以交给这些平台,开发者能够专注于用户体验的设计。谷歌还提到Salesforce、Genspark、Lumeris等公司对这两款模型抱有积极态度。

在安全方面,模型生成的所有音频都会嵌入数字水印「SynthID」。水印以人耳无法分辨的方式织入音频本身,因此事后可以通过机器确认音频是否由AI生成。随着语音合成质量不断提高,这类识别手段的分量只会越来越重。

在哪里可以使用

Gemini 3.8 Live面向开发者通过Gemini API和Google AI Studio提供。面向企业先以Gemini Enterprise的私有预览形式开放,后续还将登陆Gemini Enterprise for Customer Experience。普通用户可以在Search Live中体验。

Gemini 3.8 Live Extended Thinking面向开发者同样通过Gemini API和Google AI Studio提供。企业端从Gemini Enterprise的私有预览开始,随后扩展到Gemini Enterprise for Customer Experience以及Google Workspace的企业用户。普通用户可在Gemini Live中使用,Google AI Pro和Ultra订阅者可在Workspace的Docs中使用,所有Google AI订阅者可在Gmail和Keep中使用。

总结

Gemini 3.8 Live负责规模与成本效率,Gemini 3.8 Live Extended Thinking负责推理能力,两者构成了双线布局的语音AI模型。97种语言的自动切换、接近实时的视觉理解、后台执行工具等功能都在减少对话中断,Extended Thinking更是以82.6分位居Speech to Speech Quality Index总榜第一。开发者可从Gemini API和Google AI Studio入手,普通用户则可通过Search Live和Gemini Live陆续体验。