Anthropic于6月30日宣布,将从7月1日起重新部署其最新模型"Claude Fable 5"[1]。此举是在美国政府解除对该模型的出口管制之后作出的,全球用户可再次在 Claude Platform、Claude.ai、Claude Code 和 Claude Cowork 上使用该模型[1]。日本媒体也报道了在管制解除后该模型的回归[2]。

从出口管制到重新部署

Fable 5 与更高阶的"Mythos 5"于6月9日发布,但美国政府在6月12日对这两款模型实施了出口管制[1]。由于针对外国公民的限制立即生效,且当时没有可靠的实时国籍核验手段,Anthropic 对所有用户暂停了这两款模型的访问[1]。该指令源于一份报告:Amazon 的研究人员发现了一种绕过 Fable 5 安全机制的方法,诱导其识别软件漏洞,并在其中一例中生成了演示如何利用该漏洞的代码[1]。不过,Anthropic 自身的测试确认,包括 Claude Opus 4.8、GPT-5.5、Kimi K2.7 在内、能力更弱的现有模型也能识别相同的漏洞并生成相同的演示[1]。

拦截率超过99%的新安全防护

在重新部署时,Anthropic 训练了一个针对上述绕过手法的改进版安全分类器[1]。该公司表示,该分类器现已能在超过99%的情况下拦截该特定手法[1]。当请求被拦截时会通知用户,并转由 Claude Opus 4.8 处理[1]。美国商务部下属的人工智能标准与创新中心(CAISI)对新旧防护措施进行了测试,并认同其"极为强大"[1]。与此同时,更强的分类器在日常编码和调试中可能更频繁地误判正常请求,Anthropic 表示会持续优化[1]。

使用条件与行业通用的越狱评估框架

对于 Pro、Max、Team 及部分 Enterprise 套餐,截至7月7日 Fable 5 可在每周用量上限的最多50%范围内使用,之后将通过用量额度提供[1]。AWS、Google Cloud 和 Microsoft Foundry 上的访问也将分阶段恢复[1]。Anthropic 还透露,正与 Amazon、Microsoft、Google 等 Glasswing 合作伙伴共同制定一套行业通用框架,用于评估 AI"越狱"(绕过模型安全机制的手法)的严重程度[1]。该提案拟从能力提升幅度、提升的适用广度、武器化的难易度以及可发现性四个标准进行评分[1]。

总结

在因出口管制暂停后仅约三周,Claude Fable 5 便以更强的安全防护重新回归。这一系列应对措施,作为在前沿 AI 模型的安全性与可用性之间取得平衡、以及政府与行业如何协作的案例,值得关注。

来源:https://www.anthropic.com/news/redeploying-fable-5

来源:https://www.watch.impress.co.jp/docs/news/2121360.html