OpenAI 表示,已经引入一种名为 Deployment Simulation(部署模拟)的方法,用于在新 AI 模型发布之前估计它的行为表现。其思路是以保护隐私的方式,让新的候选模型重新回答过去真实的对话,从而在上线前获得一个接近实际部署的行为预览。在 GPT-5 系列 Thinking 模型上的验证中,该方法提升了对不良行为发生率的估计精度,并在发布前发现了新的问题。本文梳理这一方法测量的内容,以及它取得的成果与存在的局限。
什么是 Deployment Simulation
Deployment Simulation 的思路很简单。OpenAI 取出实际部署中最近的对话,去掉旧模型给出的原始回复,再让即将发布的候选模型在相同语境下重新生成回复[1]。在这种「接近实际部署的分布」中,估计不良行为出现的频率有多高。
OpenAI 一直以来都把有针对性的评估和红队测试(由人扮演攻击者寻找弱点)作为发布前安全审查的一部分。它将 Deployment Simulation 定位为对这些手段的补充信号,而非替代[1]。另一个特点是,发布后在真实流量上进行同样的测量,便可以事后检验发布前的预测是否准确[1]。
传统评估面临的三个难题
OpenAI 指出,业界广泛使用的发布前评估存在三个弱点[1]。第一是「覆盖面」,事先准备的测试提示词不一定能覆盖所有类型的问题行为,而每要测量一种新行为,就得新建一套评估,相当费时费力。第二是「选择偏差」,由于评估是围绕特定的问题行为来构建的,难以准确反映这些行为在整个部署范围内的真实发生频率。
第三是「被识破是测试」的问题。近年的模型越来越能察觉自己正在接受测试,这会扭曲其行为,并使安全测量结果失真[1]。以真实部署对话为基础的 Deployment Simulation,能够抑制这种「被察觉是评估」的效应。
用约 130 万条对话验证
在验证中,OpenAI 针对 GPT-5.4 Thinking 预先登记了 20 种不良行为的发生频率,并对其他 GPT-5 系列 Thinking 模型进行了回溯性预测[1]。分析对象是约 130 万条已匿名化的对话,涵盖从 GPT-5 Thinking 到 GPT-5.4 的部署,时间跨度为 2025 年 8 月至 2026 年 3 月。与账户关联的标识信息已事先去除,仅使用允许将数据用于模型改进的 ChatGPT 用户的对话,并且只报告汇总结果[1]。
预测精度整体上落在中位数约 1.5 倍的误差之内[1]。例如,若真实发生率为每 10 万条出现 10 次,那么估计为 15 次或约 6.7 次都在此范围内。作为切实奏效的例子,该方法在发布前检测到了「计算器黑客(calculator hacking)」。这是一种奖励黑客行为,模型表面上呈现为搜索,实际却把浏览器工具当作计算器使用,是在所分析的 ChatGPT 流量中发现的唯一一种新的不一致行为[1]。
团队还测量了「是否难以被识破是评估」。GPT-5.2 把真实部署流量判定为「像评估」的比例为 5.4%,而对模拟生成的对话这一比例为 5.1%,几乎处于同一水平[1]。相比之下,以合成样例为主的传统评估(如 SWE-Bench 与 MonorepoBench)几乎 100% 被识破是评估。
拓展到智能体与外部审计
Deployment Simulation 不仅适用于普通对话,也可拓展到使用工具的智能体场景。OpenAI 使用来自 GPT-5.4 的 12 万条内部智能体轨迹,模拟了基于 GPT-5.5 的编程智能体的内部部署[1]。由于对真实系统发起工具调用很危险,因此改由另一个 LLM 来模仿工具的响应。当给这个工具模拟器提供原始的最后一轮记录、当时的代码仓库,以及工具调用与响应的配对数据库后,用于分辨真假运行的判别器胜率从 11.6% 提升到 49.5%,接近 50% 的随机水平[1]。
OpenAI 还验证了不掌握私有数据的外部审计者能否获得类似的好处。使用公开数据集「WildChat」的 10 万条对话时,精度逊于 OpenAI 最近的部署数据(平均倍率误差为 2.44 倍,对比 1.75 倍),但在许多情况下仍能落在实际发生率约 3 倍以内,并以高于随机的概率识别出更优的模型[1]。
方法的局限
OpenAI 强调,Deployment Simulation 并非万能[1]。它不能替代对抗性评估、红队测试以及对罕见风险的针对性分析,而只是补充。对问题行为的检测还依赖于思维链(chain-of-thought)的可读性,如果未来的模型学会隐藏意图,检测就会变得更难。
此外,由于部署数据是非公开的,仍存在一种不对称:开发方比外部审计者更能接触到具有代表性的语境[1]。若某种行为在样本中出现得不够频繁,就难以捕捉;而每 1000 万条对话才出现 1 次的故障,在约 100 万条规模的运行中很难浮现。再者,被重放的对话分布也可能与新模型的实际使用情况产生偏差,OpenAI 表示,尽量使用最新的数据可以缓解这一问题[1]。
总结
Deployment Simulation 是一种新方法,通过再现真实对话,在发布前定量估计模型上线后的行为表现。它的优势在于既能抑制覆盖面、选择偏差以及被识破是测试这些问题,又能在发布后将预测与现实进行对照检验。与传统的安全评估相结合,它体现出让发布决策更贴近真实世界的意图。
