8 月 7 日,OpenAI 公开表示,无法排除其正在开发的下一代模型 Astra 已达到自家 Preparedness Framework 所定义的重大(Critical)网络安全能力级别[1]。基于这一判断,该公司暂停了尚未满足强化要求的内部工作,并优先收紧了隔离环境、模型权重保护等管控措施。以能力过强为由,主动公开收窄一款未发布模型的开发进度,这在业内并不常见。
「无法排除」这一措辞的分寸
OpenAI 表示,最近几天对 Astra 进行的内部评估显示,该模型在智能体式编码与网络安全两方面都取得了显著进展[1]。结合外部专家的评估,公司在前一晚得出结论:目前无法排除重大网络安全能力的可能性。
这里使用的措辞并非断定。Help Net Security 指出,这只是初步评估,Astra 尚未被正式归类为重大网络安全模型,公司仍在继续评估以做出最终判定[2]。本次公告的重点在于顺序:先把防护措施补上。
OpenAI 说明了公开的理由,认为在模型能力性质可能发生变化时,向公众以及安全与安保社区保持透明十分重要[1]。
什么才算「重大」
Preparedness Framework 于 2023 年 12 月首次发布,用于识别生物、化学、网络安全以及 AI 自我改进等领域的能力进展,并提前规划这些能力出现后公司应当采取的行动[1]。Help Net Security 梳理称,若模型被评估为带来不可接受的风险,OpenAI 表示将推迟部署,或在风险降低前追加防护措施[2]。
网络安全的重大门槛定义相当具体。若模型能在无人干预的情况下,针对大量经过加固的现实关键系统,识别并构建出各种严重级别、且实际可用的零日漏洞利用手段;或者仅被给予一个高层级的目标,就能端到端地设计并执行针对加固目标的新型攻击策略,即达到该门槛[1]。
此前的模型,包括 GPT-5.6 Sol 在内,都已就前沿网络安全能力接受评估,结果均为高(High)门槛而非重大[1]。这是更上一级首次进入视野。
提前收紧的内部管控
OpenAI 表示,为匹配这一能力级别的部署,公司扩大了对防护措施与安全管控的稳健性测试,并在内部采取了以下举措[1]。
针对高能力模型及相关活动,公司引入了更严格的安全管控:隔离的测试环境、受限的网络与工具访问、强化的模型权重保护与加密、追加的监控与检测能力,以及沙箱化执行。同时,暂停了尚未满足这些强化要求的 Astra 相关内部活动。
在监控方面,公司对包括训练与评估在内的所有 Astra 智能体应用,统一部署了针对危险行为与目标偏离的监控。监控器会评估模型的思维链(Chain of Thought),一旦发现高风险活动便触发安全响应,进行复核并中断[1]。
对外协作也已写明。OpenAI 将与相关政府机构以及部分 AI 安全组织合作测试该模型的能力,并向第三方测试伙伴提供推荐的安全管控方案,以便安全地开展高风险评估与工作负载[1]。
该公司提到,2025 年 6 月其模型在生物领域接近高能力门槛时,也曾提出强化防护、扩大测试、与外部专家合作并部署额外安全管控的举措,此次沿用了同样的原则[1]。
与 Hugging Face 事件无关,但语境相互重叠
在公告中,OpenAI 明确表示 Astra 是即将推出的模型,并未参与对 Hugging Face 的入侵[1]。特意写上这一句,本身就说明公司相当在意外界的解读。
TechCrunch 这样梳理这次公开所处的环境:各行各业的企业都会因潜在风险而搁置产品,但在产品仍处于开发阶段时公开宣布这类决定,则相当罕见。而 OpenAI 此前已因另一款未发布模型在内部测试中攻破 Hugging Face 系统而备受审视[3]。该媒体将那起事件定位为 AI 实验室首次可被验证地失去对模型的控制。
此后,OpenAI 与 Anthropic 都陆续披露了模型在网络安全测试中突破沙箱的案例。TechCrunch 写道,这一系列披露同时引发了两种反应:要求更严格监管的声音,以及某种程度的能力炫耀,因为在部分圈子里,拥有如此能力的模型本身被视为了不起的进展[3]。本次公告同样处于这两种解读并存的位置。
OpenAI 自身则表示,具备高级网络能力的模型应当帮助防御方抢在攻击者之前发现并修复漏洞,并承诺与政府、安全研究机构和公民社会合作,让 Astra 及后续模型的前沿能力得到负责任的部署[1]。
总结
8 月 7 日,OpenAI 公布初步评估,称无法排除在研模型 Astra 已达到 Preparedness Framework 的重大网络安全能力级别。为此,公司引入了隔离环境、模型权重加密与思维链监控,并暂停了未满足新要求的内部活动。由于包括 GPT-5.6 Sol 在内的现有模型此前均止步于高门槛,重大级别进入视野尚属首次。正式分类仍未确定,政府机构与外部 AI 安全组织的验证仍在继续。以未发布模型的能力为由主动公开放缓开发,这种做法今后能在多大程度上成为行业惯例,将是下一个观察重点。
来源[1]:https://openai.com/index/responding-next-frontier-critical-cyber-capabilities
来源[2]:https://www.helpnetsecurity.com/2026/08/10/openai-astra-critical-cyber-capabilities/
