Anthropic 宣布,在美国政府解除相关出口管制后,将于日本时间 7 月 1 日起再次面向全球用户提供其最新模型“Claude Fable 5”[1]。该模型此前因 6 月 12 日生效的出口管制而对所有用户暂停提供,如今得以恢复使用。该公司同时公布了安全措施强化以及与美国政府深化合作的细节。
从 6 月 12 日暂停到恢复的经过
Anthropic 于 6 月 9 日发布了“Claude Fable 5”和“Claude Mythos 5”[1]。但在 6 月 12 日,美国政府对这两款模型实施出口管制,要求限制美国境内外外籍用户的访问。由于该命令立即生效,且没有可靠手段实时核验国籍,Anthropic 一度对所有用户暂停了两款模型的访问[1]。
随后,两款模型的出口管制已于 6 月 30 日解除[1][2]。Fable 5 自 7 月 1 日起可在 Claude Platform、Claude.ai、Claude Code 和 Claude Cowork 上供全球用户使用。在 Pro、Max、Team 及部分 Enterprise 套餐中,7 月 7 日前将计入每周使用上限的最多 50%,此后通过使用额度(credits)提供[1]。AWS、Google Cloud 和 Microsoft Foundry 上的提供也将尽快恢复。
至于功能更强的“Mythos 5”,则在 6 月 26 日获得美国政府批准后,面向部分美国机构恢复了访问[1]。
起因是一份绕过安全机制的报告
此次出口管制的导火索,是有报告指出存在绕过 Fable 5 安全机制(safeguard)的方法[1]。亚马逊的研究人员发现了一种引导 Fable 5 识别软件漏洞的方法,其中一例还让模型生成了演示如何利用该漏洞的代码。
不过据 Anthropic 自身的验证,Claude Opus 4.8、GPT-5.5、Kimi K2.7 等能力较弱的其他模型同样可以识别这些漏洞[1]。在漏洞利用演示方面,所有受测模型也都能复现相同结果,因此这份报告并未暴露 Fable 5 独有的危险能力。
拦截率超过 99% 的新分类器
Anthropic 与政府合作,训练了一款专门针对并拦截所报告行为的改进版安全分类器[1]。由此,所报告的手法在超过 99% 的情况下会被拦截。被拦截的请求会通知用户,并转由 Claude Opus 4.8 处理。美国商务部下属的 CAISI(AI 标准与创新中心)也对新旧安全措施进行了检验,认为其极为稳固。
与此同时,新分类器在常规的编程和调试工作中,误拦无害请求的频率也有所上升。Anthropic 表示,今后将持续提升区分真正滥用与正当请求的精度。
迈向行业统一的评估框架
Anthropic 指出,业界目前仍缺乏客观衡量 AI“越狱”(jailbreak,绕过模型安全机制的手法)严重程度的统一标准,并表示已联合亚马逊、微软、谷歌等着手制定评估框架[1]。当前方案从能力提升幅度、该提升的适用范围广度、被用于攻击的难易度,以及获取难易度这 4 个维度进行评分。该公司还将新设一个可供研究人员报告所发现越狱手法的 HackerOne 计划。
总结
“Claude Fable 5”此前因 6 月 12 日的出口管制对所有用户暂停,如今随着 6 月 30 日管制解除,自 7 月 1 日起在全球重新提供。Anthropic 同时推出了安全分类器强化、推动行业统一评估框架以及与美国政府进一步合作等举措,兼顾高性能模型的提供与安全保障的探索料将持续。
