OpenAI于2026年9月10日宣布,可同时进行倾听和说话的语音AI模型GPT-Live-1将通过API正式提供。该模型将语音识别、应答生成、语音合成这三个环节整合到一个模型中,能够处理接近真人对话的节奏和打断方式。这一设计明显是面向电话预约、客户支持等实际语音业务场景。
语音识别、推理、语音合成整合进同一个模型
此前的大多数语音AI代理都是将多个模型串联使用:一个负责将语音转成文字,一个负责理解内容并生成回复,另一个再将回复转换回语音。由于每个环节都由独立模型处理,系统往往要等对方说完话才能开始响应,容易出现反应迟缓和打断不自然的问题。
GPT-Live-1采用了全双工方式,将上述三个环节整合进一个模型,可以同时处理输入和输出的音频。这使得它能够在对方话说到一半时插入更正或附和,更接近真人对话的自然感。在需要处理复杂问题的场景下,对话本身仍由GPT-Live-1负责,而更重的推理任务则可以交给GPT-6 Astra等后端模型处理。
响应速度与对话自然度大幅提升
根据OpenAI公布的评测结果,在衡量同时倾听与说话能力的基准测试中,GPT-Live-1相比前代模型提升了30个百分点。对话轮换的响应延迟也从此前的1.41秒缩短到0.798秒,几乎减半。在衡量语音代理实际任务表现的测试中,正确率从45.7%提升到86.2%,已经部署该模型的企业也反馈,因思考停顿导致的打断减少了约80%。
从电话客服到语言学习,应用场景广泛
OpenAI列举的应用场景相当广泛,包括餐厅预约、呼叫中心客服、银行业务、语言学习对话练习以及医疗机构的患者沟通等。一家面向住房与医疗领域提供AI服务的企业已将其用于预约业务,在大幅削减代码量的同时提升了通话质量。一项面向餐饮行业的服务也反馈称,在处理点餐和预约电话时实现了自然的对话体验,此外还有编程AI代理与该模型完成了集成。
语音接口部分的费用为每分钟0.05美元(约7.7日元),负责推理的后端模型费用另计※1美元=154日元(截至2026年9月15日)。语气和语速可以通过系统提示词进行调整,模型还能在长时间对话中保持上下文,这些设计都明显是为实际业务使用而考虑的。
语音种类更丰富,支持电话线路对接
可选的语音种类也有所扩充,涵盖多种口音和说话风格。内置的电话线路对接功能,也让希望将语音代理接入现有电话系统的企业更容易落地。GPT-Live-1还能妥善处理长时间的沉默和环境噪音,避免出现此前语音AI常见的多余附和语。
总结
GPT-Live-1从此前语音识别、推理、语音合成分别由独立模型串联处理的方式,转向由单一模型同时处理三个环节的全双工方式。响应速度与对话自然度的大幅提升,让电话客服、预约受理等实际场景中的语音AI应用变得更加现实可行。
