OpenAI 在其 API 上开始提供面向实时语音对话的新模型「gpt-realtime-2.1」和「gpt-realtime-2.1-mini」。最值得关注的是小型的 mini 版:在价格与此前的 gpt-realtime-mini 保持一致的前提下,新增了应答前在内部思考的推理功能和工具调用能力。同时,Realtime 系列语音模型整体的 p95 延迟(反映用户实际体感卡顿的指标)缩短了 25% 以上。对于希望以低成本将电话客服或语音助手投入实际应用的开发者来说,这是一次不容错过的更新。

旗舰版与 mini 版:两个模型的定位

本次新增的两个模型定位各不相同。高端的 gpt-realtime-2.1 是旗舰型号,是对 GPT-Realtime-2 的更新。字母与数字的识别精度得到提升,像「8-3-5-7-1」这样的型号或电话号码不容易听错。对静音和噪声的处理、用户中途打断时的应对方式也得到改善,并支持可调节推理深度的 speech-to-speech(语音到语音的直接应答)。

另一方面,gpt-realtime-2.1-mini 定位为面向实时语音的小型推理模型。它通过实时连接对语音和文本输入做出响应,适合注重速度和成本效率的场景。推理和工具调用下放到 mini 级别,可以说是本次发布的核心。

Realtime API 的设计并非将语音识别和语音合成拆分为独立系统再串联,而是用单一模型完成从语音处理到生成的全部流程。这样既能控制延迟,又能保留语音的细微差别。连接方式也很齐全:浏览器端使用 WebRTC,服务器端处理使用 WebSocket,电话网络接入则使用 SIP。

「先思考再开口」解决语音智能体的老毛病

语音智能体一直存在一个典型问题:在调用外部函数(工具)期间会陷入沉默。无声时间一长,用户就会以为通话中断而重新开口,导致处理半途而废、对话状态混乱。

支持推理的新模型可以先说一句「我现在为您查询订单状态」,然后再执行函数。由于在处理过程中也能持续说话,即使是跨多个步骤的语音任务,对话也不容易崩坏。

推理深度(reasoning effort)可在 minimal、low、medium、high、xhigh 五档中选择。默认值为 low,在简单交互中可以控制延迟。设置越深,应答越聪明,但延迟和输出 token 也随之增加,因此 OpenAI 建议正式上线的语音智能体先从 low 档开始。

延迟缩短 25% 以上,缓存带来大幅折扣

对实时语音来说,重要的不是平均值,而是「慢的时候有多慢」。本次改进使 Realtime 系列语音模型整体的 p95 延迟(最慢的 5% 应答)缩短了 25% 以上。这一提升来自缓存机制的改良,属于能切实减少用户体感卡顿的改进。

缓存在价格上同样有效。已缓存的输入 token 按大幅折扣计费:gpt-realtime-2.1-mini 的语音输入通常为每 100 万 token 10 美元(约 1,620 日元),缓存后仅需 0.30 美元(约 49 日元)。系统提示词从第一轮之后即被缓存,因此会话越长受益越大。

价格约为旗舰版的三分之一,适用场景有哪些

语音输出方面,mini 为每 100 万 token 20 美元(约 3,240 日元),旗舰版 gpt-realtime-2.1 为 64 美元(约 10,400 日元),差距约 3 倍。语音输入方面,mini 为 10 美元,旗舰版为 32 美元(约 5,200 日元)。由于推理和工具调用这两项核心功能 mini 也能使用,接受一定的能力差距来换取更低成本已成为现实的选择。

预期的应用场景包括:将账单咨询与账户查询工具结合的客户支持、逐字符确认日期的预约变更、嵌入手机应用的语音助手,以及现场作业人员读出零件编号进行记录的业务场景等。特别是字母数字识别的改进,在处理型号和单据编号的业务系统中应该会发挥明显作用。

※1 美元 = 约 162 日元(截至 2026 年 7 月 9 日)

总结

gpt-realtime-2.1 系列在提升旗舰版听取精度和对话自然度的同时,将推理和工具调用以价格不变的方式带到了 mini 级别。加上 p95 延迟缩短 25% 以上和缓存折扣,将语音智能体从「原型」推进到「正式运营」的条件正在逐步齐备。如果正在考虑开发语音对话服务,不妨先从 mini 的 low 档开始尝试。