OpenAI 发布文章,分析了自家 GPT-5.6 Sol 在交互式推理基准 ARC-AGI-3 上得分偏低的原因[1]。结论是问题不在模型能力,而在运行评测的框架(harness)设置。只要开启该公司在 ChatGPT 和 Codex 中本就使用的两项 API 设置,公开任务集上的分数就提高到约 3 倍,输出 token 减少为原来的六分之一。
把智能体丢进陌生游戏的基准
ARC-AGI-3 是 ARC Prize 打造的交互式推理基准。智能体在没有任何说明的情况下被投入首次见到的 2D 游戏,只能通过操作推测规则,自行找出目标并达成[1][2]。它不是解静态题目,而是衡量模型能否随时间从经验中学习,公开的 25 款演示游戏对人类来说都可以直接上手[1][2]。
在这项基准上,GPT-5.6 Sol 只拿到 7.8%。上一代 GPT-5.5 几乎无法推进游戏,成绩为 0.4%[1]。ARC Prize 公布的已验证分数更能看出落差:Sol 的最高推理档在 ARC-AGI-1 上为 96.5%,在 ARC-AGI-2 上为 92.5%,而 ARC-AGI-3 上只有 7.78%[3]。
在 OpenAI 看来这个数字也不合常理。该公司提到,GPT-5.6 Sol 曾着手循环双重覆盖猜想等长期未解问题,在仅提供视觉信息的框架下通关《精灵宝可梦 火红》,还借助 Codex 的计算机操作功能打通了《杀戮尖塔》[1]。很难认为它偏偏对 2D 益智游戏极度不擅长。
每一步都丢弃推理,历史还被从旧到新截断
OpenAI 检查 ARC-AGI-3 的框架后,发现了两处设定[1]。
第一,每执行一次游戏动作,模型的内部推理都会被全部丢弃。过去的操作记录和简短备注仍在,但促成这些操作的计划与洞察消失了,模型只能每一步都重新解读游戏。第二,框架采用滚动截断窗口,上下文超过 17.5 万字符后会丢掉最旧的消息。这样一来,不仅思考被丢弃,过去的动作也会逐渐看不到[1]。
这种通用设计是有意为之。ARC 的理由是,不带工具与特殊功能的简单框架更容易暴露模型的短板,比较也更公平;而商业开发者会针对每个模型的特性去优化框架[1]。这一差别直接体现在分数上。
改用 Responses API 重建后,学习得以积累
OpenAI 的模型在训练时,就是先写出内部推理消息再给出回复或工具调用,并把这些消息保留在对话历史中,历史过长时再做摘要继续。为贴近这一线上配置,该公司用 Responses API 重新实现了 ARC-AGI-3 的框架。对 GPT-5.6 而言,只要传入上一次响应的 ID,推理就会在工具调用与多轮对话之间自动保留[1]。
随之出现两点变化:由于不必每一步重新理解游戏,模型在每次动作前思考的时间变短;能够参考此前的思考后,它开始随时间积累学习成果,并采用前后一致的策略[1]。
接下来是把滚动截断换成 compaction。compaction 是 Responses API 的功能,不是简单丢掉旧历史,而是把必要的状态与推理以压缩形式承接下来,从而减少 token 消耗[4]。截断有两个缺点:早期的观察与动作会丢失,而且模型在大部分时间里都在接近占满的上下文窗口中运行,可能略微损害性能。启用 compaction 后,Sol 在更长的尝试中也能保住对每款游戏学到的内容,用更少的输出 token 取得了更高分数[1]。
OpenAI 表示,保留推理与 compaction 结合起来,让最高推理档的 GPT-5.6 Sol 分数提高到约 3 倍,输出 token 减少为六分之一[1]。
评测数字衡量的不只是模型本身
文章的核心主张可以归结为一点:基准很少只衡量模型本身,同时也在衡量 API 设置、框架设计与提示词这些不易察觉的选择。OpenAI 还写道,因公开基准的低分而感到意外、进而发现评测运行方使用了会丢弃推理消息的通用框架,这并不是第一次[1]。
对使用 API 的开发者,建议很明确:使用 Responses API 而非旧的 Chat Completions API,保留推理,并开启 compaction。比较模型时,也应参考采用上述设置运行的评测,因为它们最接近 ChatGPT 与 Codex 中的真实用法[1]。
OpenAI 说明,这次调查是受到 ARC 对 GPT-5.5 短板分析的启发,并对 ARC 多年来在 AGI 评测上的工作表示感谢[1]。考虑到 ARC 的框架本身就是为公平而做的有意设计,更合理的理解不是判断谁对谁错,而是在解读分数时确认哪些条件被固定、哪些在变动。
总结
GPT-5.6 Sol 在 ARC-AGI-3 上得分偏低,主因是框架每一步都丢弃内部推理并截断较旧的历史。开启保留推理与 compaction 这两项 API 设置后,分数提高到约 3 倍,输出 token 减少为六分之一。基准数字并不只反映模型的原始实力,还需要连同用哪个 API、用什么设置运行一起来看。
来源[1]:https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
来源[2]:https://arcprize.org/arc-agi/3
来源[3]:https://arcprize.org/results/openai-gpt-5-6-sol
来源[4]:https://developers.openai.com/api/docs/guides/compaction
