OpenAIが、対話型の推論ベンチマークであるARC-AGI-3で自社のGPT-5.6 Solが低いスコアに留まった理由を検証した記事を公開しました[1]。原因はモデルの能力ではなく、評価を動かす土台(ハーネス)の設定にあったという内容です。ChatGPTやCodexで実際に使っている2つのAPI設定を有効にしただけで、公開課題セットのスコアは約3倍になり、出力トークンは6分の1に減ったとしています。
初見のゲームを手探りで攻略させるベンチマーク
ARC-AGI-3は、ARC Prizeが用意した対話型の推論ベンチマークです。エージェントは説明を与えられないまま初見の2Dゲームに放り込まれ、操作しながら仕組みを推測し、目標を自分で見つけて達成を目指します[1][2]。静的な問題を解く形式ではなく、時間をかけて経験から学べるかどうかを測る設計で、公開されている25本のデモゲームは人間なら誰でも遊べます[1][2]。
このベンチマークで、GPT-5.6 Solのスコアは7.8パーセントに留まりました。前世代のGPT-5.5はほとんどゲームを進められず、0.4パーセントという結果です[1]。ARC Prizeが公開している検証済みスコアを見ると、Solの最大推論設定はARC-AGI-1で96.5パーセント、ARC-AGI-2で92.5パーセントを取っている一方、ARC-AGI-3では7.78パーセントという落差があります[3]。
OpenAI側から見ても、この数字は不自然でした。同社によればGPT-5.6 Solは、循環二重被覆予想のような長年の未解決問題に手を付け、視覚情報だけを与えたハーネスでポケモンのファイアレッドを攻略し、Codexのコンピュータ操作機能でSlay the Spireもクリアしています[1]。2Dのパズルゲームだけが極端に苦手とは考えにくい、というのが出発点です。
推論を毎回捨て、履歴を古い順に切っていた
そこでOpenAIがARC-AGI-3のハーネスを調べると、2つの仕様が見つかりました[1]。
1つ目は、1手ごとにモデルの内部推論がすべて破棄されていたことです。過去の手順と短いメモは残るものの、その手を選んだ思考や立てた計画は消えるため、モデルは毎回ゲームを初めから読み解き直すことになります。2つ目は、履歴が伸びると古いメッセージから順に切り捨てるローリング切り詰めが使われていた点です。コンテキストが17万5,000文字を超えると最も古い部分が消えるため、思考だけでなく過去の行動そのものも見えなくなっていきます[1]。
ARC-AGI-3のハーネスは、ツールや特別な機能を持たない汎用的な作りを意図的に選んでいます。作りを単純にすればモデルの弱点が見えやすく、比較も公平になるという考え方です。一方で商用の開発者は、モデルごとの特性に合わせてハーネスを最適化します[1]。この差が、そのままスコアの差になっていたわけです。
Responses APIで組み直すと学習が続いた
OpenAIのモデルは、返答やツール呼び出しの前に内部推論を書き、それを会話履歴の一部として保持したまま進む前提で訓練されています。履歴が長くなれば要約して続ける設計です。この本番構成に近づけるため、同社はARC-AGI-3のハーネスをResponses APIで実装し直しました。GPT-5.6では直前のレスポンスIDを渡すだけで、ツール呼び出しやターンをまたいで推論が保持されます[1]。
推論が残るようにすると、変化は2つ現れました。1手ごとにゲームを解釈し直す必要がなくなったため考える時間が短くなり、過去の思考を参照できることで学習が積み上がり、一貫した戦略を取れるようになったといいます[1]。
次に手を付けたのが、ローリング切り詰めをコンパクションに置き換える変更です。コンパクションはResponses APIの機能で、古い履歴を単純に捨てるのではなく、必要な状態と推論を引き継ぐ形にまとめ直してトークン消費を抑えます[4]。切り詰めには、過去の観察と行動が失われるうえ、常に埋まりぎみのコンテキストで動き続けることになり性能にも響くという2つの弱点がありました。コンパクションを有効にしたSolは、長い試行の中でも各ゲームについて学んだ内容を保てるようになり、より少ない出力トークンで高いスコアに到達しています[1]。
推論の保持とコンパクションを合わせると、GPT-5.6 Sol(最大推論設定)のスコアはおよそ3倍、出力トークンは6分の1になったとOpenAIは説明しています[1]。
評価の数字はモデル単体を測っていない
記事の主張は、ベンチマークがモデルだけを測っているわけではない、という点に集約されます。API設定・ハーネスの設計・プロンプトという見えにくい選択も同時に測ってしまう、という指摘です。OpenAIは、公開ベンチマークの低いスコアに驚いて調べたら評価実行側が推論メッセージを捨てる汎用ハーネスを使っていた、という経験が今回だけではないとも書いています[1]。
APIを使う開発者に向けた推奨は明快で、旧来のChat Completions APIではなくResponses APIを使い、推論を保持し、コンパクションを有効にするという3点です。モデルを比較する場合も、ChatGPTやCodexでの実際の使い方に近いこれらの設定で走らせた評価を参考にすべきだとしています[1]。
なおOpenAIは、今回の調査がARCによるGPT-5.5の弱点分析に触発されたものだと明記し、AGIの評価に長年取り組んできたARCの仕事に謝意を示しています[1]。ARC側のハーネスが公平さを狙った意図的な設計である点も踏まえると、どちらが正しいかという話ではなく、スコアを読むときに何が固定され何が動いているのかを確認する必要がある、と受け取るのが妥当でしょう。
まとめ
GPT-5.6 SolのARC-AGI-3スコアが低かった主因は、1手ごとに内部推論を捨て、古い履歴を切り捨てるハーネスの設定でした。推論の保持とコンパクションという2つのAPI設定を有効にすると、スコアは約3倍、出力トークンは6分の1になっています。ベンチマークの数字はモデルの素の実力だけを表すものではなく、どのAPIとどの設定で走らせたかまで含めて見る必要があるという教訓です。
出典[1]:https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
出典[2]:https://arcprize.org/arc-agi/3
出典[3]:https://arcprize.org/results/openai-gpt-5-6-sol
出典[4]:https://developers.openai.com/api/docs/guides/compaction
