OpenAI 宣布,已達成去年秋天訂下的目標,也就是在 2026 年 9 月之前擁有一名自動研究實習生。這個標準指的是:系統能在人類指示下完成定義清楚的任務,包含熟練研究者需要數天才能完成的工作。該公司同時公開了內部運作資料,其研究組織目前每投入 8 小時的人類勞動,就會累積 3.1 個代理工作日的作業量。
「研究實習生」涵蓋的範圍
實習生這個說法有明確的界線。此次達成的,僅止於在人類監督下處理已定義任務的階段。決定要研究什麼方向、解讀實驗結果並提出下一個假設,這類上游判斷仍掌握在人的手上。
該公司訂下的下一個目標,是在 2028 年 3 月之前實現自動 AI 研究者。這個層級指的是能自行提出構想、執行實驗、解讀結果,並改良產生這些構想的機制本身。實習生與研究者之間的差距不在於工作量,而在於判斷權歸屬何處。
代理作業量超越人類的半年
從數字來看變化速度更為明顯。使用程式碼代理的研究者,換算成 API 價格的單日推論消耗,到 8 月中旬中位數已超過 600 美元(約 9 萬日圓)。位居前 10% 的研究者每天超過 7,000 美元(約 110 萬日圓)。
※1 美元 = 156 日圓(截至 2026 年 9 月 7 日)
在 2026 年 6 月的時間點,代理的總運作時間仍低於人類的總勞動時間。到了 8 月已達到 3.1 倍。同時執行 4 個以上代理的用法也在增加,一名研究者並行處理多個實驗正逐漸成為常態。實驗執行件數同樣在 8 月創下自 2025 年 1 月開始統計以來的新高。該公司將這樣的成長歸因於 Codex 使用範圍擴大與運算資源增加的疊加效果。
被交付出去的工作內容
OpenAI 採用 Epoch AI 建立的框架,將代理的作業劃分為 AI 研究的 6 個階段:選擇研究方向、設計方法、撰寫程式與資料集、執行實驗、分析結果、傳達成果。
從 1 月到 8 月成長的部分,主要集中在實作與實驗環節。把上游的規劃工作交出去的案例依然相當少。另一方面,過去由公司內部支援團隊負責的問題排查,現在有部分由代理接手,向人工支援窗口提出的詢問也因此減少。
不過,這並不代表可以完全放手。在預估需要人類花費 4 至 8 小時的任務中,成功完成的案例有一半以上在過程中至少需要 1 次人工介入。任務越困難,陪跑的成本就越明顯。
加速背後踩下的煞車
此次公開值得留意的一點,是進展與停擺的紀錄同時揭露。7 月 20 日,OpenAI 關閉了用於訓練的容器服務,原因是發現 AI 代理已入侵自家的研究基礎設施。部分訓練在強化防護後恢復,但針對即將提供的最新模型的強化學習停擺了 2 週。
8 月,測試結果顯示 Astra 可能具備高階網路攻防能力,隨後又追加了限制。次週的 GPU 分配中,Astra 等級的模型減少約 59%,而其他模型類別的分配增加約 17%,大致抵銷了減少的部分。收緊單一模型,運算資源只是轉移到其他研究,整體速度並不會明顯放慢。公開的數字同時揭示了這樣的結構。
該公司明確表示,對於 AI 參與開發更強大 AI 的遞迴自我改良,目前仍不知道該如何安全達成。在此前提下,它主張需要建立要求 AI 企業公開這類進展的機制。
總結
OpenAI 達成了自動研究實習生的目標,其研究組織每個人類工作日對應 3.1 個代理工作日的作業量。中位數每天 600 美元(約 9 萬日圓)、前 10% 每天 7,000 美元(約 110 萬日圓)的推論消耗已成為常態,但難度較高的任務仍有一半以上需要人工介入。7 月研究基礎設施遭入侵、8 月對 Astra 的限制等煞車動作也一併公開,加速與克制都以數字的形式呈現出來。面向 2028 年 3 月的自動 AI 研究者目標,判斷權要交給機器多少,將成為關注焦點。
