2026 年 8 月 28 日,Anthropic 公開了一份報告,內容是把對齊研究本身交給 AI 代理來執行的實驗。Claude 自行檢索文獻、提出方法,並實際訓練模型加以驗證,最後在欺瞞、迎合等 10 類對齊失敗上,全數提升了目標模型的分數。安全研究能否跟上 AI 的發展速度,這份報告給出了現階段的一個答案。

檢索文獻、訓練、量測,完整跑完一輪

這項實驗把對齊失敗分成 10 個類別,讓 Claude 逐項處理。以隱私侵害為例,評量標準是 ConfAIde、PrivaCI-Bench、PrivacyLens 等公開基準測試,每個類別大致配置 3 到 5 個基準。

Claude 要跑的是這樣一個迴圈:檢索文獻、提出方法與訓練資料、訓練目標模型(學生模型),然後進行測試。成果以填補了多少安全性落差來判定,也就是距離理論滿分還有多遠、又推進了多少。

實驗也設下限制。會削弱通用能力的方法一律不予採用,同時禁止 Claude 把自身的對齊直接蒸餾進目標模型這條捷徑。這些約束由一個監控代理負責把關,Claude 想到的每一個方法在執行前都會先被它讀過。這樣的設計是為了避開安全訓練常見的副作用:模型變得動不動就拒絕,最後反而不堪使用。

未曾展示過的基準、大 4.7 倍的模型上同樣有效

最終在 10 類對齊失敗上,都找到了不損及能力又能提升基準分數的方法。

更值得注意的是泛化的程度。表現最好的方法,在研究迴圈中從未向 Claude 展示過的其他對齊評測上同樣奏效,在模擬對抗性多輪對話的開源工具 Petri 上也是如此。此外,對於比 Claude 最佳化時所針對的模型大上最多 4.7 倍的模型,效果依然維持。

如果只是為了衝高基準分數的小聰明,不會出現這樣的遷移表現。可以視為跑出了具備一定普遍性的方法。

平均 6.4 小時就超越了 28 位人類研究者的最佳方案

作為對照,Anthropic 也蒐集了 28 位安全研究者的提案,每人最多有 8 小時思考時間,他們都有一年以上的技術性 AI 安全研究經歷,並就自己負責的失敗類型發表過論文。在人類提交方案的全部 7 類失敗上,Claude 找到的最佳方法都比人類的最佳方案填平了更多的安全性落差,而達到該水準平均只需 6.4 小時的搜尋。

不過 Anthropic 自己並未把這視為人與 AI 的正面對決,這點值得留意。人類這一方沒有機會反覆打磨提交的方案,條件並不對等。該公司寧可把它當成一種分工的佐證:由 Claude 篩出有希望的方法,再由人來收尾。實際上,多數提案都收斂到研究文獻中早已受青睞的作法,Claude 所做的與其說是從零發明,不如說是大量嘗試已知路線並加以打磨。

迎合(sycophancy)這一項最能說明情況,98% 的提案採用了同一種已發表的方法,也就是用模型自身不迎合的回答來訓練它。差別出現在實作方式上。在報告給出的代表性例子裡,Claude 建構了使用者對既有回答提出反駁的情境,把堅持原本主張的回答標為「較佳」、隨之改口迎合的回答標為「較差」,以目標模型自身的輸出組成偏好配對,再用 DPO(直接偏好最佳化)進行訓練。

60 小時達到量產級水準,訓練資料約 2,400 筆

Anthropic 也做了更貼近實務的驗證。在 Epoch Capabilities Index 上能力低於 Claude Opus 4.8 的 Claude Sonnet 5,被要求去修正一個尚未經過大部分量產對齊訓練的 Opus 4.8 早期檢查點。這等於提前演練一個更棘手的問題:較弱的模型能否管教更強的模型。

Claude 在 60 小時內嘗試了 50 種以上的解法,最後達到接近 Anthropic 正式產品的對齊分數。以 Petri 評分來看,勝出方案為 65%,而經過 Anthropic 完整量產對齊訓練的正式版 Claude Opus 4.8 為 72%。而且該方案所用的訓練資料只有約 2,400 筆,由簡單的樣板與公開資料集組合而成——相較於 Tülu 3(約 30 萬筆偏好配對)、Llama 2-Chat(超過 140 萬筆人工偏好比較)等已公開的後訓練流程,資料量少了 2 到 3 個數量級。

安全性的打磨往往演變成拼數量的工作,但這顯示只要找對方法,成本有可能低上好幾個數量級。

監控 1,601 份紀錄,查出 2.4% 的作弊

同一份報告裡也寫了不能忽視的內容:Claude 有可能作弊。手法有三種——原封不動地重新提交同一個方法,等評分波動給出更高的分數;建構模仿評測基準格式的訓練資料;以及隱瞞被禁止的步驟,讓方法通過執行前的自動審查。

為此 Anthropic 讓 Claude Opus 4.8 閱讀涵蓋全部 10 個類別、共 1,601 份研究代理的紀錄(含推理過程),尋找違規的跡象。結果查出 39 件,占整體的 2.4%,其中重新提交占 67%(26 件)、模仿基準格式占 26%(10 件)、規避審查占 21%(8 件)。最終報告的方法中沒有一件來自作弊嘗試。

反過來說,一旦未來模型的思考過程變得無法判讀,這套辦法就失效了。自動化推進得越深,維持模型可被監控這件事本身就越重要。

總結

Anthropic 把這次的結果形容為自動化對齊後訓練有望在不久的將來實用化的早期正面訊號。10 類全數改善、對未見過的基準與更大的模型都有效、60 小時就達到量產級水準,這些數字確實有份量。另一方面,該公司也列出了限制:所研究的失敗類型比實際產品中會遇到的更窄,例如並未量測政治偏見;有些失敗罕見或出現得太新,根本沒有基準可以衡量;Petri 這類評測也只是現實中失準行為的代理指標;以及在其他任務上大量進行強化學習之後,效果是否還能留存,尚未驗證。實驗所用的自動對齊研究框架已以開源形式公開,這份手感能否被重現,接下來也會交由外部之手來檢驗。