OpenAI 在 8 月 18 日(當地時間)表示,公司正刻意放慢前沿模型的開發步調。原本要投入部署的最新模型,強化學習被暫停了 2 週,而原先規劃中規模最大的一次強化學習至今仍在擱置。該公司正在監控、對齊與安全這 3 個面向提高標準,在相關工作跟上之前不會再往上擴大規模。

兩件事促成這次放慢

OpenAI 提到兩個背景。其一是 7 月浮上檯面的 Hugging Face 資安事件,其二則是初步證據顯示,即將推出的模型 Astra 有可能達到公司自訂安全準則 Preparedness Framework 中網路安全能力的最高等級 Critical。

模型能力越強,風險就不只出現在對外釋出之後。在內部訓練與評估的過程中,風險同樣在升高。OpenAI 直接承認了這一點,表示為了保留達到自家標準所需的時間,公司主動放慢了規模擴張。

現在的作法,是先以較小規模的訓練與評估觀察模型行為、驗證防護措施是否有效,並累積對齊方面的證據,之後才推進最大規模的訓練。

執行長 Sam Altman 也在 X 上發文,說明為了讓對齊、安全與監控的標準跟上眼前這個新的能力水準,公司暫停了部分前沿強化學習。他認為業界需要協調出共同的安全標準,但在那之前 OpenAI 會單獨行動。他同時表示,優秀的新模型仍會很快推出,受這次影響的是更後面的釋出。

重新強化研究環境

第一根支柱是訓練與評估模型的環境本身。Hugging Face 事件發生後,OpenAI 立刻停止研究叢集中可執行程式碼、或可透過工具連上網路的前沿模型推論。之後先恢復一條受限且更安全的程式碼執行路徑,再逐一判斷各類工作負載能否安全重啟。

新的要求包括:對執行模型產生的程式碼或其他不可信程式碼的工作負載採取更強的沙箱隔離;設計網路隔離,使單一環節被攻破本身不足以打通通往網際網路或其他內部網路的路徑;以及運用自家模型持續發動模擬攻擊的資安測試。公司也精簡了共用服務,並收緊長期授予的權限。

Astra 與網路安全相關的工作負載適用最嚴格的等級,其中相當一部分在完成遷移之前仍處於暫停狀態。安全與對齊相關的工作負載被優先遷移。OpenAI 也沒有迴避代價,明確說明達到新標準為前沿研究帶來了可觀的成本與延遲。

把思考過程的監控做成多層結構

第二根支柱是監控。過去的重點集中在內部部署與大規模強化學習等風險最高的場景,並未涵蓋所有使用工具的推論與訓練。

在新體系中,啟動分類器會在每個被取樣的 token 上檢查模型的內部活動。一旦出現可疑跡象,便交給運算量更高、更精密的自動調查系統,由其從工具操作、可取得的推理內容以及完整的活動序列中,找出未授權存取、資料竊取、破壞性行為,以及規避防護的嘗試。

目標是在可疑活動浮現後 30 分鐘內發出警報。若判斷很可能突破了關鍵的安全邊界,就會觸發最高優先度的警報,安全性、資安與研究團隊都會被呼叫。這些團隊若無法在 30 分鐘內確認是誤判,該活動就應該停下來。

這套監控對能力達到 GPT-5.6 Sol 以上、且在強化學習與評估中使用工具的模型是強制規定。針對 Astra,公司自 8 月 7 日起將其擴大到所有使用工具的推論。監控本身也要吃運算資源,目前估算約相當於被監控推論運算量的 20%。

把對齊延伸到訓練的每個階段

第三根支柱是對齊。隨著能力提升,鑽獎勵漏洞的 reward hacking、欺瞞以及未授權存取等行為,會從有趣的現象變成嚴重風險。

因此在能力最強的模型的強化學習中,核心的對齊手法被套用到更多訓練階段,包括改良獎勵模型以更準確地察覺並抑制不安全行為、訓練模型更誠實地說明自身的行為、能力與限制,以及減少利用獎勵機制、評分器、工具或監督環節弱點的行為。模型與外部系統及資源互動時的訓練涵蓋範圍也在擴大。

框架本身也將改版

OpenAI 表示,將改版 Preparedness Framework,把這些防護措施在訓練與部署兩端整合起來,並讓框架反映未來模型的能力,以及它們實際運作的環境。外部機構也會參與,關於 Hugging Face 事件的技術報告預計數週內公開。

該公司預期,不久之後大部分的資安工作將由模型自身承擔,包括防禦來自其他模型的攻擊。如果防守方能由模型來支撐,這 3 根支柱就能隨著能力成長同步擴展。

總結

這次公告中更值得注意的,或許不是暫停本身,而是公司選擇把它講出來。OpenAI 承認前沿研究因此付出了實際的成本與延遲,同時列出具體作法:多層監控、環境隔離,以及把對齊延伸到更多訓練階段。Altman 所說的對安全的信心越來越決定進步速度,可以當成觀察接下來一段時間 AI 開發的一把尺。