OpenAI 于 8 月 13 日发布了面向 AI 智能体开发者的技术指南《The builder's guide to GPT-5.6》[1]。该指南汇总了创业公司在生产环境中积累的经验,指出只要把「所有环节都交给顶级模型」的做法,改为按需选择模型并配合 API 新功能,成本就会大幅下降。
把全部工作交给旗舰模型已不再是最优解
以往面对长周期任务,业界的惯例是用旗舰模型搭配最高推理档位。原因在于前沿模型在处理长上下文和工具调用上,明显强于成本优化型模型[1]。
OpenAI 认为,GPT-5.6 系列打破了这一前提。只要增加测试时的计算量,体量更小的 Luna 和 Terra 往往就能接近上一代 GPT-5.4 与 GPT-5.5 的表现,而单价低得多[1]。
该公司举出的一个例子是衡量智能体能力的 Agents' Last Exam。在运行环境保持一致的前提下,GPT-5.6 Sol 使用 low 推理档位的成绩超过了 GPT-5.5 使用 high 档位的成绩[1]。生产环境的测试也显示,仅仅把推理档位调到低于此前默认值,多类工作流的成本就有明显改善。
同等精度成本降至约二十五分之一,BrowseComp 的数据
最直观的例子是 BrowseComp,这是一项衡量模型能否检索冷门事实的基准[1]。
3 个月前,GPT-5.5 在 Extra High 推理档位下得分 84.36%,总成本为 33.27 美元(约 5,300 日元)。GPT-5.6 Luna 在同样的 Extra High 档位下得分 84.04%,成绩基本持平,成本却只有 1.33 美元(约 210 日元),约为原来的二十五分之一。OpenAI 还补充说,此后价格又进一步下调[1]。
※1 美元 = 159 日元(依据 2026 年 8 月 14 日纽约市场收盘价)
小模型的适用场景包括高并发的批量任务、对延迟敏感的交互,以及智能体流程中反复执行的环节[1]。指南给出的具体例子是一家法律科技公司,它在进行智能体分析前需要先识别手写备忘录。只要把识别这一步从前沿模型拆出来,交给 Terra 或 Luna,成本就会下降。
Responses API 新增的 3 项机制
GPT-5.6 在训练阶段就围绕以下 3 项架构设计做了端到端优化,它们都以 Responses API 功能的形式开放[1]。
第一项是不丢弃已完成的工作。推理内容可以跨模型轮次保留,过长的对话则由原生压缩机制进行精简。这样一来,模型在长周期任务中不会混乱,也无需重建此前的上下文。
第二项是把可拆分的工作并行推进。借助原生的多智能体编排,多个智能体可以并行工作,从而更快完成复杂任务。
第三项是把确定性的处理交给代码。使用程序化工具调用后,模型会自行编写 JavaScript 来编排工具,并在上下文窗口之外完成结果的筛选与汇总。模型的 token 只留给需要判断的部分,从而同时降低成本、延迟,以及上下文变长后精度下滑的问题[1]。
比如抓取 100 份文件、按日期筛选、找出相关交易这类工作,并不需要让模型逐条阅读中间结果。这种界限越清晰的处理,收益就越大。
不换模型也能让分数提升约 3 倍,ARC-AGI-3 的例子
把上述机制组合起来,差距相当明显。在 ARC-AGI-3 上,GPT-5.6 Sol 使用标准运行环境时得分为 13.3%[1]。启用推理保留与压缩后,分数跃升至 38.3%,输出 token 还减少到约六分之一。
模型本身没有任何改动,只是调用方式变了,分数就提升到约 3 倍。反过来说,如果一直沿用默认设置,很可能会低估模型的真实水平。看基准数据时,最好一并确认它是在什么设置下跑出来的。
指南也谈到了多智能体的运作方式。主智能体负责编排子智能体并分派任务,子智能体并行推进,最后由主智能体汇总结果[1]。OpenAI 指出,ChatGPT 中的 ultra 档位在内部就是这样运行的。GPT-5.6 本身对该派出多少子智能体、何时派出已有不错的判断,但这一行为高度可控,因此明确要求模型只在额外 token 消耗确实划算时才派出子智能体,是有效的做法。
提示缓存时长延长至至少 30 分钟
另一项不起眼但对运维影响很大的变化是提示缓存。GPT-5.6 全系模型的缓存保留时间已延长至至少 30 分钟[1]。同时,缓存断点可以在上下文窗口内确定性地指定,OpenAI 表示这让部分创业公司的缓存命中率大幅提升。
此外,持续使用合适的 prompt_cache_key,可以提高请求落到此前处理过相同前缀的推理引擎上的概率,从而缩短延迟[1]。
这份指南由 Samarth Madduru、Prashant Mital、Dave Leo 和 Julien Reiman 4 人撰写,他们从早期测试到生产落地全程参与了创业公司基于 GPT-5.6 的开发工作[1]。
总结
OpenAI 发布的 GPT-5.6 实战指南归结为一点:构建智能体的经济账已经变了。在 BrowseComp 上,基本相同的精度从 33.27 美元降到 1.33 美元,约为原来的二十五分之一。在 ARC-AGI-3 上,仅启用推理保留与压缩,分数就从 13.3% 提升到 38.3%,输出 token 减少约六分之一。既然用旗舰模型跑最高档位不再是标准答案,那么选对模型、重新审视调用方式,本身就等于降本。
