2026 年 7 月 8 日(美国时间),OpenAI 发布了新一代语音 AI 模型「GPT-Live」[1]。该模型采用可以同时聆听和说话的全双工(full-duplex)架构,支持附和语和自然的插话,带来更接近与真人交谈的对话体验。GPT-Live 已于当天开始在全球范围内作为 ChatGPT 语音功能「ChatGPT Voice」的新基础逐步上线,其设计思路是在后台把复杂问题交给 GPT-5.5 处理,同时不让对话中断[1]。

「边听边说」的全双工架构

此前的语音 AI 大致可分为两代。最初的 ChatGPT Voice 采用级联方式,把语音识别、大语言模型和语音合成 3 个模型串联起来,导致响应缓慢且生硬。随后的 Advanced Voice Mode 改为在单一模型内直接处理音频,延迟有所降低,但仍然是等用户说完才回应的回合制。由于依靠静音来判断发言结束,短暂的思考停顿或背景噪音都可能被误判为「说完了」,造成模型在不自然的时机插话[1]。

GPT-Live 通过全双工设计解决了这些限制。它在生成输出的同时持续处理输入,因此每秒可以多次做出判断:是开口说话、继续聆听、保持安静、插话,还是调用工具。对话中它会用「嗯嗯」之类的附和表示自己在听,在用户整理思路时安静等待,实现节奏轻快的往复交流。OpenAI 表示,时间感的提升还使实时翻译等用法成为可能[1]。

深度处理交给 GPT-5.5,对话不中断

另一大支柱是把对话与「深度工作」分离。遇到需要网络搜索、复杂推理或智能体式处理的问题时,GPT-Live 会在后台把任务委托给 GPT-5.5 等前沿模型,在结果返回之前继续保持交谈。受托模型会随着新模型的发布持续更新,从而兼顾自然对话与最新智能[1]。

性能方面,OpenAI 在 5 至 10 分钟的实际对话中与 Advanced Voice Mode 进行了对比评测,GPT-Live 在整体偏好、话轮转换、对话流畅度和自然度等方面获得了明显更高的支持。在衡量专家级科学推理能力的 GPQA 和衡量智能体式网络搜索能力的 BrowseComp 上,它也展现了大幅提升[1]。

ChatGPT Voice 将有哪些变化

每周有超过 1.5 亿人在 ChatGPT 中使用语音功能或语音输入,此次革新将覆盖整个语音体验。新版助手可以灵活应对谈话中途的提问和「说慢一点」之类的请求,9 种语音也针对 GPT-Live 重新打磨。回答前的思考深度可在 Instant(即答)、Medium、High 3 档中选择[1]。

在聆听方面,当用户陷入思考时,ChatGPT Voice 不再贸然插话,而是耐心等待;被要求「安静听着」时也会照做。即便存在过路车辆声或旁人交谈等背景噪音,它也能更专注于用户的声音。此外,在天气、股票、体育等话题中,它还能一边对话一边展示可视化信息卡片[1]。

面向语音的安全措施与提供范围

针对实时语音对话的安全设计也是一大特点。当系统在模型说话过程中检测到可能不安全的输出时,可以将其引导至更安全的回应,显示提醒信息或求助资源,在高风险情况下还能结束对话。面向青少年用户,模型本身经过了符合年龄的行为训练,家长可通过家长控制功能决定是否允许使用 ChatGPT Voice。系统还内置了防止模仿真人声音的机制,仅使用预设的语音[1]。

GPT-Live 正在 iOS、Android 和网页版 ChatGPT 上逐步推送。Go、Plus 和 Pro 用户的默认模型为 GPT-Live-1,免费用户的默认模型为 GPT-Live-1 mini。API 也计划于近期开放。需要注意的是,发布时语音尚不能与视频或屏幕共享同时使用,部分语言可能存在口音或流利度不足的问题,传统的 Standard 和 Advanced Voice Mode 仍可继续使用[1]。

总结

GPT-Live 标志着语音交互从回合制迈向「边听边说」的连续对话的转折点。它把对话的自然流畅与后台前沿模型的智能分离并加以兼顾的设计,有望成为未来语音智能体的标准范式。不妨在手边的 ChatGPT 上试试这个会一边附和一边听你说话的全新 Voice。

来源:https://openai.com/index/introducing-gpt-live