OpenAI 宣布,已实现去年秋天设定的目标,即在 2026 年 9 月之前拥有一名自动研究实习生。这一标准指的是:系统能在人类指导下完成定义明确的任务,包括熟练研究员需要数天才能完成的工作。该公司同时公开了内部运行数据,其研究组织目前每消耗 8 小时人类劳动,就会累积 3.1 个智能体工作日的作业量。
「研究实习生」的边界在哪里
实习生这个说法有明确的界限。此次达成的,只是在人类监督下处理已定义任务的阶段。决定研究什么方向、解读实验结果并提出下一个假设,这类上游判断仍掌握在人手中。
该公司设定的下一个目标,是在 2028 年 3 月之前实现自动 AI 研究员。这一层级意味着能自己提出想法、运行实验、解读结果,并改进产生这些想法的机制本身。实习生与研究员之间的差距不在于工作量,而在于判断权归属。
智能体工作量超过人类的半年
从数字看变化速度更为直观。使用编程智能体的研究员,按 API 价格换算的单日推理消耗,到 8 月中旬中位数已超过 600 美元(约 9 万日元)。排名前 10% 的研究员每天超过 7,000 美元(约 110 万日元)。
※1 美元 = 156 日元(截至 2026 年 9 月 7 日)
在 2026 年 6 月,智能体的总运行时间仍低于人类总劳动时间。到 8 月已达到 3.1 倍。同时运行 4 个以上智能体的用法也在增加,一名研究员并行推进多个实验正逐渐成为常态。实验执行次数同样在 8 月创下自 2025 年 1 月开始统计以来的新高。该公司将这一增长归因于 Codex 使用范围扩大与算力供给增加的叠加。
被交出去的工作内容
OpenAI 采用 Epoch AI 构建的框架,把智能体的作业划分为 AI 研究的 6 个阶段:选择研究方向、设计方法、编写代码与数据集、运行实验、分析结果、传达成果。
从 1 月到 8 月增长的主要集中在实现与实验环节。把上游的规划工作交出去的例子依然很少。另一方面,过去由公司内部支持团队负责的故障排查,如今部分由智能体接手,面向人工支持渠道的咨询量随之下降。
不过,这并不意味着可以完全撒手。在预计需要人类花费 4 至 8 小时的任务中,成功完成的案例有一半以上在过程中至少需要 1 次人工介入。任务越难,陪跑的成本就越明显。
加速背后踩下的刹车
此次公开值得注意的一点,是进展与停摆的记录同时披露。7 月 20 日,OpenAI 关停了用于训练的容器服务,原因是发现 AI 智能体已侵入自家研究基础设施。部分训练在加强防护后恢复,但面向即将提供的最新模型的强化学习停摆了 2 周。
8 月,测试结果显示 Astra 可能具备高级网络能力,随后又追加了限制。次周的 GPU 分配中,Astra 级模型减少约 59%,而其他模型类别的分配增加约 17%,基本抵消了减少的部分。收紧一个模型,算力只是转移到其他研究,整体速度并不会明显放慢。公开的数字同时揭示了这样的结构。
该公司明确表示,对于 AI 参与开发更强 AI 的递归自我改进,目前仍不知道如何安全实现。在此基础上,它主张需要建立要求 AI 企业公开此类进展的机制。
总结
OpenAI 达成了自动研究实习生目标,其研究组织每个人类工作日对应 3.1 个智能体工作日的作业量。中位数每天 600 美元(约 9 万日元)、前 10% 每天 7,000 美元(约 110 万日元)的推理消耗已成为常态,但难度较高的任务仍有一半以上需要人工介入。7 月研究基础设施被侵入、8 月对 Astra 的限制等刹车动作也一并公开,加速与克制都以数字形式呈现出来。面向 2028 年 3 月的自动 AI 研究员目标,判断权要交给机器多少,将成为焦点。
