OpenAI 發表了一篇技術文章,說明 GPT-5.6 的效率是如何提升的[1]。值得注意的是,實際執行最佳化工作的正是旗艦模型 GPT-5.6 Sol 本身。它透過 Codex 改寫正式環境的 GPU 核心,使端到端的服務成本下降 20%。文章揭露的內容不僅止於模型本身,也涵蓋推論堆疊與代理框架兩方面累積下來的效率成果。
效率並非由模型單獨決定
GPT-5.6 分為 Sol、Terra、Luna 三個層級,設計上兼顧能力與成本。OpenAI 表示,在最高推論設定下,Sol 於 Artificial Analysis 的 Coding Agent Index 上勝過 Claude Fable 5,成本卻不到其一半。Terra 以半價達到與 GPT-5.5 相當的智慧基準成績,Luna 則定位為最快也最便宜的選項,價格比 Sol 低 80%[1]。
支撐這些數字的並不只有模型訓練。過去 4 年間,該公司的規模已擴展到 10 億使用者與超過 200 萬家企業,因此用同樣的硬體產出更多 token,成為設計上的最優先事項。即使模型本身效率很高,若請求分派不當、硬體閒置,或資料搬移拖慢運算,營運成本依然降不下來[1]。
因此 OpenAI 跨層動手改善:決定請求送往何處的路由、決定何時送出的排程、在 GPU 上執行的核心、用於重複利用運算結果的快取,以及涉及 GPU 程式碼執行順序的模型實作。全域層面依地理條件、可用容量與加速器種類分流,叢集內部則依負載、上下文長度與快取命中狀況來分配[1]。
改寫核心的是 AI 自己
GPT-5.6 Sol 在此走到台前。Sol 分析正式環境的流量,找出先前被忽略的負載失衡來源,測試新的路由策略,並持續調整判斷基準。據稱光是這部分負載平衡的改善,就已大幅降低模型的服務成本[1]。
更進一步的是前向傳播的最佳化,也就是把輸入轉換為下一個 token 預測的運算過程。Sol 在 Codex 上找出可預先計算、可省略或可平行化的處理,並自主改寫了正式環境使用的核心。核心是執行構成模型的數學運算的核心程式碼。這之所以可行,是因為 GPT-5.6 經過訓練,能熟練使用 OpenAI 維護的兩種開源 GPU 程式語言 Triton 與 Gluon 撰寫並改良程式碼。這一連串核心改良讓端到端的服務成本下降了 20%[1]。
AI 寫出的程式碼無法直接投入正式環境,因此驗證面的投入也同步進行。該公司以開源形式釋出浮點運算驗證工具 FpSan,用來確認 Sol 所寫核心的正確性[1]。國外技術媒體也指出,這一連串作業始終是在由人主導的流程之內交由 Sol 執行,強調這並非完全自動化的運作[2]。
推測解碼與快取設定的細部打磨
作為同時提升速度與效率的手法,推測解碼也做了改良。做法是在主模型旁執行較小的草稿模型,提前提出多個 token,由主模型平行驗證。一旦提案被接受,主模型的一次處理就能輸出多個 token,藉此減少昂貴的循序運算[1]。
改良這個草稿模型的同樣是 Sol。它自行設計並執行了數百次改變規模、結構與功能的實驗,還負責啟動並監控訓練流程。據稱在發生硬體故障或訓練不穩定時,它會自主介入。最終 token 生成效率提升了 15% 以上[1]。
快取方面也是如此。處理未命中快取的輸入時,模型會在一次運算量龐大的處理中建立鍵值(KV)快取,產生輸出時則反覆讀取並延伸它。批次處理粒度、分片方式、KV 管理方法等最佳設定會隨工作負載而變,但組合數量過於龐大,過去只能仰賴粗略的經驗法則。Codex 上的 Sol 分析正式環境的工作負載並產生、評估候選設定之後,針對個別情境的細部調校才成為實際可行的作業[1]。
代理框架致力抑制上下文膨脹
另一根支柱,是 Codex 與 ChatGPT Work 共用的代理框架。它以 Rust 撰寫的協調層實作,串接模型、工具與使用者的環境[1]。
代理的處理會在一輪互動中反覆呼叫模型,例如檢視原始碼、搜尋部署歷程、讀取事故報告、編輯檔案、執行測試。若一項任務需要 30 次請求,每次多浪費 1 秒,整體就會膨脹成 30 秒。正因如此,除了讓模型更快之外,削減系統整體的重複作業同樣關鍵[1]。
具體做法之一是延遲探索,也就是在真正需要之前不揭露整合功能、自訂 MCP 工具、技能與外掛。此外,工具輸出預設設有 1 萬 token 的上限,只有模型主動要求時才會調整,以免單一工具意外吃光上下文視窗[1]。
為了讓提示快取發揮作用,設計上也相當講究。模型可見的歷程一律以附加方式處理,新訊息與工具執行結果都加在末端,而不插入既有的上下文之中。工具的呈現順序固定,核准政策這類執行時設定不嵌入工具定義,而是在執行階段套用。OpenAI 認為,正是這些累積帶來了 Codex 與 ChatGPT Work 偏高的快取命中率[1]。
總結
OpenAI 說明,GPT-5.6 的效率來自模型、推論與代理框架三個方向共同累積的成果。其中最引人注目的,是 GPT-5.6 Sol 透過 Codex 改寫正式環境的核心,使服務成本下降 20%,並藉由改良推測解碼將 token 生成效率提升 15% 以上。在運算資源持續吃緊的情況下,這可視為最佳化工作正逐步移往 AI 一側的具體例證。
來源[1]:https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency
