OpenAI 于 9 月 10 日面向全体开发者推出 Agents API 公测版,把支撑 Codex 与 ChatGPT 的执行框架和运行基础设施直接开放出来。只要指定任务、模型、工具和运行环境这 4 项,就能创建一个可用于生产环境的智能体。该 API 本身不收取额外费用,开发者只需为智能体消耗的 token 和工具付费。
不必再自己搭建的是那套管道
真正把智能体跑起来时,卡住开发者的往往不是模型调用本身,而是周边的机制:上下文达到上限后的重新整理、不断增多的工具定义的管理、存放中间产物的工作区,以及让会话连续运行数小时而不中断的管理逻辑。这套管道此前由各家团队各自编写。
这次的 Agents API 把这一层整合为由 OpenAI 运营和维护的服务。它与既有方案的差别很清晰:Agents SDK 的执行框架运行在开发者自己的应用内,Responses API 则需要开发者自行编写编排逻辑。Agents API 把这一层整体托管出去,开发者可以把精力放在工具、知识和业务流程等应用特有的部分上。
上下文压缩与工具检索
OpenAI 列出了执行框架的 3 项改进。
第一项是上下文自动压缩。当会话接近上下文上限时,系统会自动压缩前半部分内容,同时保留智能体继续工作所需的信息。跨越多个上下文窗口的工作流,不再需要自行实现压缩逻辑。
第二项是工具检索。系统不会在一开始就加载全部工具定义,而是在需要时才加载相关定义。要点在于,这既能降低 token 消耗和成本,又不会破坏模型侧的缓存。
第三项是程序化工具调用。智能体可以并行发起多个调用、把相关操作串联起来,并在代码中先完成结果的筛选与合并,再把必要部分带回上下文。这样即便处理大量数据,回到上下文的也只是相关结果。该 API 支持 MCP、自定义函数,以及网页搜索等内置工具。
子智能体并行运行,上下文各自独立
复杂任务可以拆分为独立的部分,交给子智能体并行处理。每个子智能体拥有自己的上下文,因而更容易专注于分配到的任务,主智能体则负责协调并汇总结果。并发数量可通过配置控制,调研、分析、编码这类容易拆分的工作能明显缩短耗时。
这里有一点需要注意:并行缩短的是等待时间,而不是推理总量。同时跑 3 条分支,耗时会接近三分之一,但 token 消耗大体仍是 3 条分支的总和。
运行环境由开发者自己选择
智能体执行代码、处理文件的位置由开发者决定,共有 3 种选择:OpenAI 托管的沙箱、自有基础设施,或生态合作方。列出的合作方包括 Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop 和 Vercel,覆盖 VPC 内部署、特定的文件与密钥存储方式、不同的 CPU、GPU 和内存配置,以及各异的冷启动和成本特性。
托管沙箱与 Codex、ChatGPT 使用同一套基础设施,可以配置文件、软件包、技能和插件。把执行框架与运行环境分开来考虑,正是这套设计的实质所在。
早期案例给出的数字
在 OpenAI 列举的案例中,Ciridae 把评测分数从 0.71 提升到 0.85,并借助开箱即用的子智能体功能把延迟降到原来的四分之一。SafetyKit 将案件审核流程迁移过来后,单件成本下降 60%。Hypha 在把执行框架与运行环境分离后,失败的响应减少了 86%。
底层是开源的 Codex 执行框架,开发者可以从公开的代码库中读取协调模型调用、工具与上下文的核心逻辑。运营和维护由 OpenAI 负责,开发者仍然可以查看其工作方式。
评估之前要先确认的限制
目前的限制写得很明确:数据存放地仅限美国,且不支持零数据留存,即便沙箱运行在自有基础设施上也是如此。若要用于监管要求严格的业务,这两点需要先行确认。
费用方面也值得一提。Agents API 本身不加收费用,需要支付的是 token、工具的实际用量,以及使用托管沙箱时的容器运行时长。不过,这套机制的前提是持续运行数小时乃至数天,token 消耗会不断累积。省下的管道开发工时,需要与持续运行的实际成本放在一起衡量。
此外,这是公测版本,OpenAI 表示会根据使用者的反馈快速迭代,逐步走向正式发布。把它当作仍会变动的对象来上手,是比较稳妥的做法。
总结
OpenAI 于 9 月 10 日把支撑 Codex 与 ChatGPT 的执行框架和基础设施,以 Agents API 公测版的形式开放。上下文自动压缩、按需加载的工具检索、并行运行的子智能体,以及包含 9 家合作方的运行环境选项,都被收拢到一次 API 调用之后。虽然没有额外费用,但仅限美国的数据存放地和不支持零数据留存这两项限制依然存在,因此从所处理信息的性质出发来判断更为现实。
※缩略图为 AI 生成的示意图
