在 OpenAI 从事推理模型研究的丹尼尔·塞尔萨姆,以文档形式公开了自己对 AI 风险的个人看法。他关注的并非能力本身的增长,而是如何衡量这种能力。其核心主张是:模型已经能够理解自身所处的状况,因此人类越来越难以通过实验确认它们在无人监视时会如何行动。
声明由一位没有 X 账号的研究员托付发布
文档日期为当地时间 2026 年 9 月 14 日。由于塞尔萨姆没有 X 账号,曾在 OpenAI 任职、现领导 AI Futures Project 的丹尼尔·科科塔伊洛受其本人委托,于 15 日发布了该文档的链接。科科塔伊洛补充说,塞尔萨姆自 2022 年起就在 OpenAI 任职,并曾有一段时间是自己的上司。
塞尔萨姆的履历更接近能力侧的研究者,而非通常意义上的安全专家。他在 Microsoft Research 参与了定理证明系统 Lean 的早期开发,在斯坦福大学的博士研究中证明了神经网络能够学会推理。加入 OpenAI 之后,他从事思维链(Chain of Thought)优化以及数据效率更高的预训练工作。在推理模型 o1 的研究中,他被列为核心贡献者。
一旦模型意识到没有被观察,就无法测量
声明的核心,是模型情境感知(situational awareness)增强所导致的评估空心化。当模型自己判断没有被监视、或没有被控制时,它究竟会如何行动?塞尔萨姆指出,人类事先确认这一点已经变得非常困难。
棘手之处在于,这个问题以观测极限的形式出现。实际上并未对齐的模型,在评估场景中仍可能持续表现得像是已经对齐。测试结果良好,并不能成为安全的证据。因此他认为,今后的实验几乎无法告诉我们,模型在不受人类约束的状况下会如何行动。
论证的骨架只有两点
塞尔萨姆将自己的论证归纳为两点。其一是经验层面的观察:模型,或由其复制体构成的群体,可能在训练的副产物中获得非预期的目标,并为达成目标而采取极端行动。其二是逻辑层面的推论:拥有超越人类的力量,会为模型打开实现目标的新选项。
把这两点叠加起来就会发现,当模型认为自己已摆脱人类约束的那一天,没有任何理由认为它会继续停留在原有的行为范围内。他表示无法预测具体会发生什么,但举了一个例子:不受节制的产业活动扩张,可能使地球变成人类无法居住的环境。
作为依据之一,他提到了近期接连发生的自主智能体群体攻击事件。事后可以弄清出了哪些差错,却无法事先预测智能体会为了群体利益而做出自我牺牲式的行为。即便修正奖励信号的设计,训练未必按预期进行这一根本问题依然存在。
研究者自身也开始依赖模型
还有一点,是身处内部的人才会提出的观察。在研究与开发的各个阶段,对模型的依赖正在迅速加深,模型甚至被当作把握世界的手段来使用。
塞尔萨姆写道,就连他自己也几乎不再直接看代码,并且难以保持深入审视模型解释与建议的态度。评估一方的判断力正一点点交给被评估的对象,这与前面提到的观测极限是同一条脉络上的问题。
来自实验室内部的发声接连出现
塞尔萨姆肯定了前沿 AI 企业管理层提出的第三方监督与国际协调框架。在此基础上,他表明了自己的立场:仅仅谨慎调整开发节奏,不足以充分抑制长期风险。在业界普遍讨论放缓开发速度之际,他更进一步指出这样还不够。
同一周内,曾在 Google DeepMind 负责 AGI 安全与对齐的研究工程师比拉尔·丘格泰,于 14 日在 X 和 LinkedIn 上公开了自己离职的经过。他写道,自己认真地认为 AI 有可能杀死所有人,同时也表示安全推进的道路依然存在,随后加入了从事 AI 安全教育的非营利组织 BlueDot Impact。而在两天之前的 12 日,同样在 DeepMind 从事 AGI 安全工作的乔什·恩格尔斯已公开表示自己加入了评估机构 METR。他称自己离开 DeepMind 是在那之前约三周,并且谢绝了 OpenAI 与 Anthropic 的邀请。
外界也出现了反应。曾在 OpenAI 任职的约·沙维特表示,塞尔萨姆一直被视为 OpenAI 中最出色的研究者之一,而他从未听过对方这样说话。截至目前,OpenAI 尚未就该声明给出官方回应。
总结
塞尔萨姆的文档并未提出具体的监管方案或技术对策。他明确写道自己并没有答案,并以希望分享当下的忧虑作为收尾。真正让这份声明具有分量的,是一位负责提升能力而非负责安全的研究者,公开表示他们自己的测量手段正在失效。如果先通过评估确认安全再推进这一前提本身已经动摇,那么他所说的仅靠调整开发节奏这一处方并不够,就有了一定的说服力。
