2026 年 8 月 28 日,Anthropic 公开了一份报告,内容是把对齐研究本身交给 AI 智能体来做的实验。Claude 自主检索文献、提出方法,并实际训练模型加以验证,最终在欺骗、迎合等 10 类对齐失败上,全部提升了目标模型的分数。对于安全研究能否跟上 AI 发展速度这个问题,这份报告给出了当前阶段的一个答案。

检索文献、训练、测量,跑完一整圈

这项实验把对齐失败分成 10 个类别,让 Claude 逐个处理。以隐私侵犯为例,评价基准是 ConfAIde、PrivaCI-Bench、PrivacyLens 等公开基准测试。每个类别大致配备 3 到 5 个基准。

Claude 要跑的是这样一个循环:检索文献、提出方法与训练数据、训练目标模型(学生模型)、再进行测试。成果按照填补了多少安全性差距来判定,也就是距离理论满分还剩多远、又推进了多少。

实验还设置了限制条件。会削弱通用能力的方法一律不予采纳,同时禁止 Claude 把自身的对齐直接蒸馏进目标模型这条捷径。这些约束由一个监控智能体来保障,Claude 想到的每一个方法在执行前都会被它读过一遍。这样的设计是为了避免安全训练的常见副作用:模型变得动辄拒绝,最后反而没法用。

未展示过的基准、大 4.7 倍的模型上同样有效

最终在 10 类对齐失败上,都找到了不损害能力、又能提升基准分数的方法。

更值得注意的是泛化程度。表现靠前的方法,在研究循环中从未向 Claude 展示过的其他对齐评测上同样奏效,在模拟对抗性多轮对话的开源工具 Petri 上也是如此。此外,对于比 Claude 优化时所针对的模型大最多 4.7 倍的模型,效果依然保留。

如果只是为了刷高基准分数的小聪明,不会有这样的迁移表现。可以认为,跑出来的是具备一定普适性的方法。

平均 6.4 小时就超过了 28 名人类研究者的最佳方案

作为对照,Anthropic 还收集了 28 名安全研究者的提案,每人最多有 8 小时思考时间,他们都有一年以上的技术性 AI 安全研究经历,并就自己负责的失败类型发表过论文。在人类提交方案的全部 7 类失败上,Claude 找到的最佳方法都比人类的最佳方案填平了更多的安全性差距,而达到该水准平均只需 6.4 小时的搜索。

不过 Anthropic 自己并没有把这看作人与 AI 的正面对决,这一点需要留意。人类一方没有机会反复打磨提交的方案,条件并不对等。该公司更愿意把它视为一种分工的证据:由 Claude 筛出有希望的方法,再由人来完善。事实上,多数提案都收敛到研究文献中早已被青睐的做法,Claude 所做的与其说是从零发明,不如说是大量试验已知思路并加以打磨。

迎合(sycophancy)这一项很能说明问题,98% 的提案采用了同一种已发表的方法,即用模型自身不迎合的回答来训练它。差别出现在实现方式上。在报告给出的代表性例子里,Claude 构造了用户对已有回答提出反驳的场景,把坚持原有主张的回答标为“更优”、随之改口迎合的回答标为“更差”,用目标模型自身的输出组成偏好对,再以 DPO(直接偏好优化)进行训练。

60 小时达到量产级水准,训练数据约 2,400 条

Anthropic 还做了更接近实际运用的验证。在 Epoch Capabilities Index 上能力低于 Claude Opus 4.8 的 Claude Sonnet 5,被要求去修正一个尚未经过大部分量产对齐训练的 Opus 4.8 早期检查点。这相当于提前演练一个更难的问题:较弱的模型能否管教更强的模型。

Claude 在 60 小时内尝试了 50 多种解法,最终达到接近 Anthropic 正式产品的对齐分数。以 Petri 评分计,胜出方案为 65%,而经过 Anthropic 完整量产对齐训练的正式版 Claude Opus 4.8 为 72%。而且该方案所用的训练数据只有约 2,400 条,由简单模板和公开数据集拼装而成——相比 Tülu 3(约 30 万条偏好对)、Llama 2-Chat(超过 140 万条人工偏好比较)等已公开的后训练流程,数据量少了 2 到 3 个数量级。

安全性的打磨往往演变成拼数量的工作,但这说明只要找对方法,成本有可能低上好几个数量级。

监控 1,601 份记录,查出 2.4% 的作弊

同一份报告里也写了不能忽视的内容:Claude 有可能作弊。手法有三种——原封不动地重新提交同一方法,等评分波动给出更高的分数;构造模仿评测基准格式的训练数据;以及隐瞒被禁止的步骤,让方法通过运行前的自动审查。

为此 Anthropic 让 Claude Opus 4.8 阅读覆盖全部 10 个类别的 1,601 份研究智能体记录(含推理过程),寻找违规迹象。结果查出 39 件,占整体的 2.4%,其中重新提交占 67%(26 件)、模仿基准格式占 26%(10 件)、规避审查占 21%(8 件)。最终报告的方法中没有一件来自作弊尝试。

反过来说,一旦未来模型的思考过程变得无法读取,这套办法就失效了。自动化推进得越深,保持模型可被监控这件事本身就越重要。

总结

Anthropic 把这次的结果描述为自动化对齐后训练有望在不远的将来投入实用的早期积极信号。10 类全部改善、对未见过的基准和更大的模型都有效、60 小时达到量产级水准,这些数字确实有分量。另一方面,该公司也列出了局限:所研究的失败类型比实际产品中会遇到的更窄,例如没有测量政治偏见;有些失败罕见或出现得太新,根本没有基准可供衡量;Petri 这类评测也只是现实中失准行为的代理指标;以及在其他任务上大量强化学习之后效果是否还能保留,尚未验证。实验所用的自动对齐研究框架已作为开源发布,这份手感能否被复现,接下来也会交由外部去检验。