OpenAI 发布了一篇技术文章,说明 GPT-5.6 的效率是如何提升的[1]。值得关注的是,承担优化工作的正是旗舰模型 GPT-5.6 Sol 本身。它通过 Codex 改写生产环境的 GPU 内核,将端到端的服务成本降低了 20%。文章披露的内容不只涉及模型本身,还涵盖推理堆栈与智能体框架两方面的效率积累。

效率并非由模型单独决定

GPT-5.6 由 Sol、Terra、Luna 三个层级构成,设计上兼顾能力与成本。OpenAI 表示,在最高推理配置下,Sol 在 Artificial Analysis 的 Coding Agent Index 上超过 Claude Fable 5,而成本不到其一半。Terra 以一半的价格达到与 GPT-5.5 相当的智能基准成绩,Luna 则定位为最快且最便宜的型号,价格比 Sol 低 80%[1]。

支撑这些数字的并不只有模型训练。过去 4 年间,该公司的规模已扩展到 10 亿用户和超过 200 万家企业,因此用同样的硬件产出更多 token 成为设计上的首要目标。即便模型本身效率很高,如果请求分配不当、硬件闲置或数据搬运拖慢计算,运营成本依然降不下来[1]。

为此,OpenAI 在多个层面同时着手:决定请求发往何处的路由、决定何时发送的调度、在 GPU 上运行的内核、用于复用计算结果的缓存,以及涉及 GPU 代码执行顺序的模型实现。全局层面按地理位置、可用容量和加速器类型分流,集群内部则依据负载、上下文长度和缓存命中情况来分配[1]。

改写内核的是 AI 自己

GPT-5.6 Sol 在这里走到台前。Sol 分析生产流量,找出此前被忽视的负载失衡来源,尝试新的路由策略,并持续调整判断标准。据称仅这部分负载均衡的改进,就已大幅降低了模型的服务成本[1]。

更进一步的是对前向传播的优化,也就是把输入转换为下一个 token 预测的计算过程。Sol 在 Codex 上找出可以预先计算、可以省略或可以并行的处理,并自主改写了生产用内核。内核是执行构成模型的数学运算的核心代码。这之所以可行,是因为 GPT-5.6 经过训练,能够熟练使用 OpenAI 维护的两种开源 GPU 编程语言 Triton 和 Gluon 编写并改进代码。这一系列内核改进使端到端服务成本下降了 20%[1]。

AI 写出的代码不能直接投入生产,因此验证环节也同步得到投入。该公司开源了浮点运算验证工具 FpSan,用于确认 Sol 所写内核的正确性[1]。海外技术媒体也指出,这一系列工作始终处于由人主导的流程之内交由 Sol 完成,强调这并非完全自动化的运作[2]。

投机解码与缓存配置的精细打磨

作为同时提升速度与效率的手段,投机解码也得到了改进。其做法是在主模型旁运行一个较小的草稿模型,提前提出多个 token,由主模型并行验证。一旦提议被接受,主模型的一次处理就能输出多个 token,从而减少昂贵的串行计算[1]。

改进这个草稿模型的同样是 Sol。它自行设计并执行了数百次改变规模、结构和特性的实验,还负责启动和监控训练过程。据称在出现硬件故障或训练不稳定时,它会自主介入。最终 token 生成效率提升了 15% 以上[1]。

缓存方面也是如此。处理未命中缓存的输入时,模型会在一次计算密集的处理中构建键值(KV)缓存,生成输出时则反复读取并扩展它。批处理粒度、分片方式、KV 管理方法等最优配置随工作负载而变,但组合数量过于庞大,此前只能依赖粗略的经验法则。Codex 上的 Sol 分析生产工作负载并生成、评估候选配置后,针对具体场景的精细调优才变得可行[1]。

智能体框架着力抑制上下文膨胀

另一根支柱是 Codex 与 ChatGPT Work 共用的智能体框架。它以 Rust 编写的编排层实现,连接模型、工具和用户环境[1]。

智能体的处理会在一轮交互中反复调用模型,例如查看源代码、检索部署历史、读取故障报告、编辑文件、运行测试。如果一项任务需要 30 次请求,每次多浪费 1 秒,整体就会膨胀到 30 秒。正因如此,除了让模型更快,削减系统整体的重复工作同样关键[1]。

具体做法之一是延迟发现,即在真正需要之前不暴露集成功能、自定义 MCP 工具、技能和插件。此外,工具输出默认设有 1 万 token 的上限,只有模型主动要求时才会调整,以防单个工具意外吃光上下文窗口[1]。

为让提示缓存生效,设计上也做了彻底的取舍。模型可见的历史一律按追加方式处理,新消息和工具执行结果都添加在末尾,而不插入既有上下文之中。工具的呈现顺序固定,审批策略之类的运行时设置不嵌入工具定义,而是在执行阶段应用。OpenAI 认为,正是这些积累带来了 Codex 与 ChatGPT Work 较高的缓存命中率[1]。

总结

OpenAI 说明,GPT-5.6 的效率来自模型、推理和智能体框架三个方向的共同积累。其中最引人注目的成果是,GPT-5.6 Sol 通过 Codex 改写生产内核,使服务成本下降 20%,并通过改进投机解码将 token 生成效率提升 15% 以上。在算力持续紧张的背景下,这可以视为优化工作正在向 AI 一侧转移的一个例证。

来源[1]:https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency

来源[2]:https://thenewstack.io/gpt-5-6-serving-efficiency/