OpenAI 於 8 月 13 日發布了給 AI 代理開發者參考的技術指南《The builder's guide to GPT-5.6》[1]。內容整理自新創公司在正式環境中累積的經驗,指出只要把「所有環節都交給頂級模型」的做法,改成依需求挑選模型並搭配 API 的新功能,成本就會明顯下降。
把所有工作丟給旗艦模型已經不是最佳解
過去面對長時間的任務,業界慣例是用旗艦模型搭配最高的推理檔位。原因在於前沿模型在處理長上下文與工具呼叫上,明顯優於成本取向的模型[1]。
OpenAI 認為,GPT-5.6 系列打破了這個前提。只要增加測試階段的運算量,體積較小的 Luna 與 Terra 往往就能接近上一代 GPT-5.4 與 GPT-5.5 的表現,而單價低上許多[1]。
該公司舉出的例子是衡量代理能力的 Agents' Last Exam。在執行環境維持一致的前提下,GPT-5.6 Sol 用 low 推理檔位跑出的成績,超過了 GPT-5.5 用 high 檔位的成績[1]。正式環境的測試也顯示,光是把推理檔位調到低於先前的預設值,多種工作流程的成本就有明顯改善。
同等精度成本降到約二十五分之一,BrowseComp 的數據
最容易理解的例子是 BrowseComp,這是一項衡量模型能否找出冷門事實的基準[1]。
3 個月前,GPT-5.5 在 Extra High 推理檔位下拿到 84.36%,總成本為 33.27 美元(約 5,300 日圓)。GPT-5.6 Luna 在同樣的 Extra High 檔位下拿到 84.04%,成績幾乎持平,成本卻只要 1.33 美元(約 210 日圓),約為原本的二十五分之一。OpenAI 還補充,之後價格又進一步調降[1]。
※1 美元 = 159 日圓(依據 2026 年 8 月 14 日紐約市場收盤價)
小型模型適合的場景包括大量執行的批次工作、對延遲敏感的互動,以及代理流程中反覆執行的環節[1]。指南舉的具體例子是一家法律科技公司,它在進行代理分析之前得先辨識手寫備忘錄。只要把辨識這一段從前沿模型拆出來交給 Terra 或 Luna,成本就會下降。
Responses API 新增的 3 項機制
GPT-5.6 在訓練階段就圍繞以下 3 項架構設計做了端對端最佳化,並且都以 Responses API 功能的形式開放[1]。
第一項是不丟掉已經做完的工作。推理內容可以跨模型回合保留,過長的對話則交給原生的壓縮機制精簡。如此一來,模型在長時間的任務中不會迷失,也不必重新建立先前的上下文。
第二項是把可以拆開的工作並行推進。透過原生的多代理編排,多個代理能同時運作,讓複雜的任務更快完成。
第三項是把固定的處理交給程式碼。使用程式化工具呼叫之後,模型會自己寫 JavaScript 來編排工具,並在上下文視窗之外完成結果的篩選與彙整。模型的 token 只留給需要判斷的部分,因此能同時壓低成本、延遲,以及上下文變長後精度下滑的問題[1]。
舉例來說,抓取 100 份文件、依日期篩選、再找出相關交易這類工作,並不需要讓模型逐筆閱讀中間結果。界線越清楚的處理,效果就越明顯。
不換模型也讓分數提升約 3 倍,ARC-AGI-3 的例子
把上述機制組合起來,差距相當可觀。在 ARC-AGI-3 上,GPT-5.6 Sol 使用標準執行環境時只有 13.3%[1]。啟用推理保留與壓縮之後,分數一口氣拉到 38.3%,輸出 token 還減少到約六分之一。
模型本身完全沒有更動,只是呼叫方式改了,分數就變成約 3 倍。反過來說,一直沿用預設值的話,很可能會低估模型的真實實力。看基準數據時,最好一併確認它是在什麼設定下跑出來的。
指南也談到多代理的運作方式。主代理負責編排子代理並分派任務,子代理並行推進,最後由主代理彙整結果[1]。OpenAI 指出,ChatGPT 的 ultra 檔位在內部就是這樣運作的。GPT-5.6 本身對於該派出多少子代理、什麼時候派出已經有不錯的判斷,但這個行為可控性很高,因此明確要求模型只在多花 token 確實划算時才派出子代理,是有效的做法。
提示快取時間延長到至少 30 分鐘
另一項不起眼但對維運影響很大的變更是提示快取。GPT-5.6 全系列模型的快取保留時間已延長到至少 30 分鐘[1]。同時,快取的切點可以在上下文視窗內明確指定,OpenAI 表示這讓部分新創公司的快取命中率大幅提升。
此外,持續使用適當的 prompt_cache_key,可以提高請求落在先前處理過相同前綴的推論引擎上的機率,進而縮短延遲[1]。
這份指南由 Samarth Madduru、Prashant Mital、Dave Leo 與 Julien Reiman 4 人撰寫,他們從早期測試到正式上線,全程參與了新創公司以 GPT-5.6 進行的開發工作[1]。
總結
OpenAI 發布的 GPT-5.6 實戰指南可以歸結為一點:打造代理的成本結構已經改變。在 BrowseComp 上,幾乎相同的精度從 33.27 美元降到 1.33 美元,約為原本的二十五分之一。在 ARC-AGI-3 上,光是啟用推理保留與壓縮,分數就從 13.3% 提升到 38.3%,輸出 token 減少約六分之一。既然用旗艦模型跑最高檔位不再是標準答案,挑對模型、重新檢視呼叫方式,本身就等於省下成本。
