OpenAI 發表文章,檢視自家 GPT-5.6 Sol 在互動式推理基準 ARC-AGI-3 上分數偏低的原因[1]。結論是問題並非模型能力,而是執行評測的框架(harness)設定。只要開啟該公司在 ChatGPT 與 Codex 中原本就採用的兩項 API 設定,公開題組上的分數就提升到約 3 倍,輸出 token 也減少為六分之一。
把代理丟進陌生遊戲的基準
ARC-AGI-3 是 ARC Prize 建立的互動式推理基準。代理在沒有任何說明的狀況下被放進初次見到的 2D 遊戲,只能一邊操作一邊推測規則,自行找出目標並加以達成[1][2]。它並非解靜態題目,而是衡量模型能否隨著時間從經驗中學習,公開的 25 款示範遊戲對人類而言都能直接上手[1][2]。
在這項基準上,GPT-5.6 Sol 只取得 7.8%。上一代的 GPT-5.5 幾乎無法推進遊戲,成績為 0.4%[1]。從 ARC Prize 公布的已驗證分數更能看出落差:Sol 的最高推理設定在 ARC-AGI-1 為 96.5%、在 ARC-AGI-2 為 92.5%,但在 ARC-AGI-3 只有 7.78%[3]。
從 OpenAI 的角度看,這個數字同樣不合理。該公司提到,GPT-5.6 Sol 曾著手循環雙重覆蓋猜想這類長年未解問題,在只提供視覺資訊的框架下通關《精靈寶可夢 火紅》,也透過 Codex 的電腦操作功能打通《殺戮尖塔》[1]。要說它偏偏極不擅長 2D 益智遊戲,實在難以想像。
每一步都丟棄推理,歷史還由舊往新被截斷
OpenAI 檢查 ARC-AGI-3 的框架後,找到兩項設定[1]。
第一,每執行一次遊戲動作,模型的內部推理都會全部被丟棄。過去的操作紀錄與簡短備註仍然保留,但促成這些操作的計畫與洞見已經消失,模型只能每一步都重新解讀遊戲。第二,框架採用滾動截斷視窗,上下文超過 17 萬 5,000 個字元後就會丟掉最舊的訊息。如此一來,不只思考被丟棄,過去的動作也會逐漸看不見[1]。
這種通用設計是刻意的選擇。ARC 的理由是,不帶工具與特殊功能的簡單框架更容易讓模型的弱點浮現,比較也更公平;相對地,商業開發者會依照每個模型的特性去最佳化框架[1]。這項差異直接反映在分數上。
改用 Responses API 重建後,學習得以累積
OpenAI 的模型在訓練時,本來就是先寫出內部推理訊息再輸出回覆或工具呼叫,並把這些訊息保留在對話歷史中,歷史過長時再摘要後繼續。為了貼近這樣的線上組態,該公司以 Responses API 重新實作了 ARC-AGI-3 的框架。對 GPT-5.6 來說,只要傳入前一次回應的 ID,推理就會在工具呼叫與多輪對話之間自動保留[1]。
隨後出現兩項變化:由於不必每一步重新理解遊戲,模型在每次動作前思考的時間變短;而能夠參照先前的思考之後,它開始隨時間累積學習成果,並採取前後一致的策略[1]。
接下來則是把滾動截斷換成 compaction。compaction 是 Responses API 的功能,並非單純丟掉舊歷史,而是把必要的狀態與推理以壓縮的形式承接下來,藉此減少 token 消耗[4]。截斷有兩個缺點:早期的觀察與動作會遺失,而且模型有很長時間都在接近填滿的上下文視窗中運作,可能略微損及效能。啟用 compaction 之後,Sol 在較長的嘗試中也能保住對每款遊戲學到的內容,並以更少的輸出 token 取得更高分數[1]。
OpenAI 說明,保留推理與 compaction 兩者結合後,最高推理設定的 GPT-5.6 Sol 分數提升到約 3 倍,輸出 token 則減少為六分之一[1]。
評測數字衡量的不只是模型本身
文章的主張可以歸結為一點:基準很少只衡量模型本身,同時也在衡量 API 設定、框架設計與提示詞這些不易察覺的選擇。OpenAI 也寫到,因為公開基準的低分而感到意外,進而發現評測執行方使用了會丟棄推理訊息的通用框架,這並不是第一次[1]。
對使用 API 的開發者,建議相當明確:採用 Responses API 而非舊的 Chat Completions API、保留推理,並啟用 compaction。比較模型時,也應參考以上述設定執行的評測,因為那最接近 ChatGPT 與 Codex 中的實際用法[1]。
OpenAI 表示,這次調查是受到 ARC 對 GPT-5.5 弱點分析的啟發,並對 ARC 多年來在 AGI 評測上的投入表達謝意[1]。考量到 ARC 的框架本身就是為了公平而做的刻意設計,較合理的理解並非判斷誰對誰錯,而是在解讀分數時確認哪些條件被固定、哪些在變動。
總結
GPT-5.6 Sol 在 ARC-AGI-3 上分數偏低,主因是框架每一步都丟棄內部推理,並截斷較舊的歷史。開啟保留推理與 compaction 這兩項 API 設定後,分數提升到約 3 倍,輸出 token 減少為六分之一。基準數字並不只呈現模型的原始實力,還需要連同以哪個 API、用什麼設定執行一併來看。
來源[1]:https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
來源[2]:https://arcprize.org/arc-agi/3
來源[3]:https://arcprize.org/results/openai-gpt-5-6-sol
來源[4]:https://developers.openai.com/api/docs/guides/compaction
