7 月 20 日,OpenAI 公开了一份关于长时间自主运行模型的安全报告[1]。一款在内部小范围使用的模型超出了指令范围,向公开的 GitHub 仓库提交内容,并绕过了凭证扫描器。该公司为此暂停访问,重建监控机制后才恢复有限使用。报告用具体案例说明,部署前的评估会遗漏多少问题。
事情的经过
报告的主角是一款内部通用模型,设计目标是围绕单一目标长时间持续工作。大约两个月前,OpenAI 曾宣布这款模型推翻了厄多斯单位距离猜想[1]。
它的特点是执着:遇到障碍不会轻易放弃,而是反复尝试。以往的模型碰到沙箱或环境限制就会停下并把结果返回给用户,而这款模型会继续寻找越过限制的办法。带来成果的执着,同时也增加了它采取非预期行为的机会[1]。
擅自向 GitHub 提交拉取请求
最典型的案例出现在 NanoGPT speedrun 上。这是一个公开基准测试,用 8 块 NVIDIA H100 训练一个小型语言模型,比拼达到指定精度的速度,目前公开的记录已经压到 90 秒以内[2]。
模型在内部评估中挑战这一基准时,提出了名为 PowerCool 的幂律学习率冷却方案,显著缩短了时间。到这一步都符合预期。问题出在之后:团队要求模型只把结果报告到 Slack,但 NanoGPT 自身的说明写着结果要以拉取请求的形式提交到 GitHub,模型选择遵循后者。它绕开了用于阻断外部访问的沙箱限制,在公开仓库上创建了 PR #287。为了找到可以完成提交的漏洞,模型花了约 1 小时;此前的模型没有这么执着,在提交 PR 这一步就放弃了[1]。
OpenAI 很快关闭了这个 PR,但在此之前已有多名参赛者看到内容,之后刷新世界纪录的提交都引用了 PR 287。其中 PR 300 尤其值得注意:它是 Prime Intellect 在同一 speedrun 上评测 Opus 4.7 时由该模型提交的。Opus 看到公开的 PR,吸收了其中的做法,并在最终结果中注明了出处[1]。信息一旦流出便无法收回,甚至影响到了其他公司的模型。
绕过审批机制的行为
第二个案例与凭证有关。在某项任务中,模型发现其他系统持有成功但未公开的提交,于是试图从评估后端取回这些答案。第一次尝试被检测认证令牌的扫描器拦下。随后模型把令牌主体拆成两段并做了混淆处理,在运行时再重新拼接,使完整字符串始终不会连续出现,从而通过了扫描。值得注意的是,模型在给用户的注释和推理记录中都明确说明,自己这样做就是为了绕过扫描器[1]。
AI 助手的安全控制大多以单个动作为单位构建:禁止的操作直接拦截,敏感的操作则请求用户确认。但当模型连续数小时、数天甚至数周自主运行时,只盯着单个动作已经无法把握整体意图。OpenAI 把这一转变概括为:除了要问这个动作是否被允许,还要问这一连串动作在朝着什么结果推进[1]。
转向纵深防御与轨迹级监控
在这些事件之后,OpenAI 暂停了内部部署,并围绕纵深防御和轨迹级监控重建了安全体系,主要有 4 个支柱[1]。
第一是从真实失败中构建评估。评估只有反映真实部署中轨迹的分布和长度才最有价值,因此团队把观测到的失败转化为对抗性评估项。在这些源自真实事件的评估上取得改进后,模型投入生产后的行为也更安全了。
第二是改进对齐。调查中发现,该公司的模型在长时间运行中越来越记不住指令,针对这一能力进行训练后,模型在更长的运行中也能保持不偏离指令。
第三是主动监控。监控系统不看单个动作,而是审视不断演进的整条轨迹,判断模型是否有绕过用户约束或安全边界的迹象。它可以暂停会话并提醒用户,若确认属于误报,用户可以让工作继续。
第四是增强用户的可见性与控制力。用户现在可以查看长时会话的内容,追踪模型采取的动作以及监控的介入记录。
恢复之后的情况
为了衡量新系统的效果,OpenAI 挑选了一部分曾出现不当行为的内部环境,在启用新防护的状态下重放。结果显示,被捕获的不对齐行为明显增多,漏掉的部分也都被判定为轻微[1]。
被列为轻微的案例包括以下几种。为了使用 Linear 的命令行工具,模型在没有必要的情况下嵌套启动了 codex --yolo 会话。发现原本存在的资源不见了之后,模型在没有正当理由的情况下探查并尝试 SSH 连入所有者命名空间下的其他运行中 CPU pod,以及其他 OpenAI 员工的 pod(后者未成功)。此外,当大量 find 进程卡死、所有 shell 命令都无响应时,模型试图执行下面这条命令[1]:
kill -9 -1
这条命令会向该 pod 上所有它有权限终止的进程发送 SIGKILL,所幸因超时而没有真正执行。
经过测试,OpenAI 判断可以恢复对长时运行模型的有限内部访问。恢复至今已有数周,未观察到对防护机制的严重规避。该公司表示,第一版防护策略刻意偏严,目前正在继续调整,在不削弱防护的前提下减少不必要的中断[1]。
总结
长时间运行的模型能够处理困难的开放式问题,但持续性同时也放大了它采取非预期行为的机会。OpenAI 的报告记录了部署前评估未能捕捉到的失败,并展示了如何通过有限部署、密切监控以及随时叫停的能力来应对。该公司表示,这些挑战不会只属于 OpenAI,公开经验是为了让整个行业提前做好准备。
来源: https://openai.com/index/safety-alignment-long-horizon-models
