OpenAI 於 9 月 10 日向所有開發者推出 Agents API 公測版,把支撐 Codex 與 ChatGPT 的執行框架與運作基礎設施直接開放出來。只要指定任務、模型、工具與執行環境這 4 項,就能建立可用於正式環境的智慧代理。該 API 本身不另外收費,開發者只需支付代理所消耗的 token 與工具費用。

不必再自行打造的是那套管線

要讓代理真正跑起來時,卡住開發者的往往不是模型呼叫本身,而是周邊的機制:上下文達到上限後的重新整理、愈積愈多的工具定義管理、存放中間產物的工作區,以及讓工作階段連續運作數小時而不中斷的管理邏輯。這套管線過去都由各家團隊自行撰寫。

這次的 Agents API 把這一層整合成由 OpenAI 營運與維護的服務。與既有選項的差別相當清楚:Agents SDK 的執行框架跑在開發者自己的應用程式內,Responses API 則需要開發者自行撰寫協調流程。Agents API 把這一層整個交出去,開發者可以把心力放在工具、知識與業務流程等應用特有的部分。

上下文壓縮與工具搜尋

OpenAI 提到執行框架有 3 項改進。

第一項是上下文自動壓縮。當工作階段接近上下文上限時,系統會自動壓縮前半部內容,同時保留代理繼續作業所需的資訊。橫跨多個上下文視窗的流程,不必再自行實作壓縮邏輯。

第二項是工具搜尋。系統不會一開始就載入所有工具定義,而是在需要時才載入相關定義。重點在於既能降低 token 消耗與成本,又不會破壞模型端的快取。

第三項是程式化的工具呼叫。代理可以並行發出多個呼叫、把相關操作串接起來,並先在程式碼中完成結果的篩選與合併,再把必要的部分帶回上下文。如此一來即使處理大量資料,回到上下文的也只有相關結果。該 API 支援 MCP、自訂函式,以及網頁搜尋等內建工具。

子代理並行運作,上下文各自獨立

複雜的工作可以拆成獨立的單位,委派給子代理並行處理。每個子代理擁有自己的上下文,因此比較不容易偏離被指派的範圍,主代理則負責協調並彙整結果。並行數量可以透過設定控制,像研究、分析、程式開發這類容易切分的作業,所需時間會明顯縮短。

這裡有一點要留意:並行縮短的是等待時間,而不是推論的總量。同時跑 3 條分支,時間會接近三分之一,但 token 消耗大致仍是 3 條分支的總和。

執行環境由開發者自行挑選

代理執行程式碼、處理檔案的位置由開發者決定,共有 3 種選擇:OpenAI 託管的沙箱、自家的基礎設施,或生態系的合作業者。列出的合作對象包括 Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop 與 Vercel,涵蓋 VPC 內部署、特定的檔案與機密資訊儲存方式、不同的 CPU、GPU 與記憶體配置,以及各不相同的冷啟動與成本特性。

託管沙箱與 Codex、ChatGPT 使用同一套基礎設施,可以搭配檔案、套件、技能與外掛進行設定。把執行框架與執行環境分開來看待,正是這套設計的實質內容。

先行案例提出的數字

在 OpenAI 舉出的導入案例中,Ciridae 把評測分數從 0.71 提升到 0.85,並藉由內建的子代理功能把延遲縮短為四分之一。SafetyKit 把案件審查流程移轉過來後,單件成本下降 60%。Hypha 在把執行框架與執行環境分離之後,失敗的回應減少了 86%。

底層是開源的 Codex 執行框架,開發者可以從公開的程式碼庫閱讀協調模型呼叫、工具與上下文的核心邏輯。營運與維護由 OpenAI 承擔,開發者仍然能夠檢視其運作方式。

評估之前要先確認的限制

目前的限制寫得很明確:資料存放地僅限美國,而且不支援零資料保留,即使沙箱跑在自家基礎設施上也一樣。若要用於法規要求嚴格的業務,這兩點必須先行確認。

費用的算法也值得一提。Agents API 本身不加收費用,需要支付的是 token 與工具的實際用量,以及使用託管沙箱時的容器運作時間。不過,這套機制的前提是持續運作數小時甚至數天,token 消耗會不斷累積。省下來的管線開發工時,需要和持續運作的實際費用放在一起衡量。

另外,這是公測階段,OpenAI 表示會依據使用者的回饋快速調整,逐步邁向正式提供。把它當成仍會變動的對象來著手,是比較穩妥的做法。

總結

OpenAI 於 9 月 10 日把支撐 Codex 與 ChatGPT 的執行框架與基礎設施,以 Agents API 公測版的形式開放。上下文自動壓縮、需要時才載入的工具搜尋、並行運作的子代理,以及包含 9 家合作業者的執行環境選項,全都收攏在一次 API 呼叫的背後。雖然沒有額外費用,但僅限美國的資料存放地與不支援零資料保留這兩項限制依然存在,因此從所處理資訊的性質出發來判斷會比較實際。

※縮圖為 AI 生成的示意圖