Anthropic 更新了 Claude Fable 5 在生物学领域的安全防护[1]。该公司表示,在自家测试中,生物学相关提问被转交给能力较弱模型的"回退"现象减少了约 85%。此前连健康和学习类的普通问题都会被拦下,如今终于回到了可用的水平。

为什么几乎所有生物学提问都被拦截

Fable 5 上线时,几乎所有生物学相关的请求都处于被拦截状态,Anthropic 称这是有意为之,而非疏漏[1]。

原因在于模型本身的能力。按照该公司的评估,Fable 5 在部分高度复杂的生物学任务上已经超过专家水平,在另一些任务上能够提供实操层面的支持[1]。对研发新疗法的研究者而言这是有力的助手,但同样的能力也可能帮助恶意行为者制造生物武器。Anthropic 直言,Fable 5 可能为这类人提供在其他任何地方都得不到的能力[1]。

麻烦之处在于,有益用途和有害用途本身就难以区分。研究某种疾病的疗法,有时必须处理引发该疾病的危险物质。Anthropic 举的例子是活疫苗,研究人员必须培养自己想要预防的同一种病原体[1]。降压药卡托普利同样起步于分离蛇毒中能让人血压骤降的成分[1]。

这种模糊性也方便了想要隐藏意图的一方,危险作业可以被包装成普通研究。Anthropic 引用了美国情报界 2026 年度威胁评估,指出合成生物学与基因组编辑的进展可能带来新型生物威胁,并提到有多个国家行为体可能仍在维持进攻性生物与化学武器计划[1]。

因此该公司选择在生物学入口基本关闭的状态下发布模型,先把它交到其他领域的用户手中。大量误判是预先算进去的成本,理由是这总好过把全面开放推迟数周甚至数月[1]。

重写分类器的"宪法"

Fable 5 的生物学防护由安全分类器承担,这是一类较小的自动判定系统,用于检测模型是否被要求执行受保护的生物学任务或产出有害内容[1]。一旦触发,请求会被转交给 Opus 5,后者不具备 Fable 5 同等的生物学能力,因此对恶意用户的帮助有限。用户看到的"回退"就是这一转交动作。

做出精确的分类器并不容易。它需要学会受保护内容与允许内容之间的边界,同时压低误判与漏判,还要能抵御越狱式的绕过尝试[1]。Anthropic 在网络安全领域也运行着同类分类器,并此前公开过其工作方式[2]。

这次改动的核心是分类器的宪法,即区分受保护内容与允许内容的规则集[1]。Anthropic 用数周时间重写了这套规则,把良性用途逐条明确划出,并向公司内外的多位专家征求了意见。随后依据新规则重新生成训练数据并重训分类器,验证其仍会对有害及两用研究内容触发,同时放行范围更广的良性请求[1]。

放宽了什么,界线又停在哪里

实际使用中变化最明显的是日常健康与教育类提问。解读检查数值、理解症状、以学习为目的了解生物学等场景,触发回退的情况将大幅减少[1]。医疗从业者在临床任务上从 Fable 5 获得的支持也会更多。

包含非生物学原因在内的回退总量预计同样下降。Anthropic 估算,Claude.ai 约减少 67%,Cowork 减少 55%,Claude Code 减少 17%,Claude Platform 减少 7%[1]。各产品差距明显,与生物学类提问原本所占比例不同有关。

另一方面,没有放宽的领域也被明确列出。被判定为两用的请求,包括病毒学、毒理学和分子设计,仍会回退到 Opus 5[1]。换言之,在专业生物学研究和药物研发场景中,Fable 5 目前仍无法直接使用。Anthropic 表示将通过面向经审核研究者开放前沿模型的可信访问通道来弥合这一差距[1]。

该公司也明确表示,源自安全余量的误判不会完全消失[1]。即便风险极低的请求,只要落在分类器的安全边界内,仍有被触发的可能。

总结

Anthropic 通过重写分类器宪法,调整了 Claude Fable 5 的生物学防护,使生物学相关回退减少约 85%。解读检查数值、学习生物学等日常用途中,被转交给较弱模型的情况将明显减少。但病毒学、毒理学与分子设计仍在范围之外,研究用途的全面开放仍要等待可信访问通道落地。这是一个用具体数字呈现的案例:先出于安全考虑把入口收窄,再依据真实数据与专家意见逐步放开。

来源 [1] https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards

来源 [2] https://www.anthropic.com/news/fable-safeguards-jailbreak-framework