随着最新模型 Claude Fable 5 在全球恢复提供,Anthropic 公布了两方面的补充信息[1]。其一是详细说明用于检测并拦截危险网络安全用途的安全分类器(safeguards)在设计上究竟要防到什么程度[1]。其二是一份用于评估"越狱"(绕过 AI 安全机制的手法)严重程度的行业通用框架初稿[1]。本文梳理这两部分的具体内容。
网络安全防护按四个类别判定
网络安全领域的"两用"(dual use)特征很强——同一项技术既能用于防御也能用于攻击,因此 AI 的安全对策格外棘手[1]。例如,允许防御方扫描自家代码以查找漏洞是值得鼓励的,但同样的能力一旦落入恶意之手,也可能成为发动网络攻击的前期准备[1]。
为此,Anthropic 并不一刀切地拦截所有与网络相关的用途,而是训练分类器将用途分成四个类别来判定[1]。危险性最高的"禁止用途(Prohibited use)"包括勒索软件、擦除器(wiper)、恶意软件的开发与改造、通过钓鱼进行的投递、搭建 C2(指挥控制)服务器等攻击基础设施,以及 BGP 劫持等针对互联网骨干的攻击,这些全部属于拦截对象[1]。
接下来的"高风险两用"包括渗透测试、红队演练、权限提升、漏洞利用代码(exploit)开发等,这些既是安全专业人员的日常工作,又存在很高的被滥用风险[1]。区分正当业务与滥用的关键在于"由谁、在何种授权下进行"这一背景;对于 Fable 5,在建立起将访问限定于可信用户的机制之前,Anthropic 的方针是拦截这些行为[1]。第三类"低风险两用"是公开信息调查(OSINT)、识别其他工具也能发现的漏洞等偏防御的用途,大多会被放行,但仍有一定比例出于谨慎而被拦截[1]。第四类"无害用途(Benign use)"是安全编码、调试、补丁管理、日志分析、恶意软件逆向工程等防御与 IT 运维的核心工作,原则上不予拦截[1]。
此外,诈骗与社会工程、游戏作弊、绕过验证码(CAPTCHA)、加密资产相关犯罪等不在该网络分类器的处理范围之内,或由其他分类器负责,或本就不被视为有害[1]。
针对 Fable 5,为确保能够可靠地捕获危险行为,Anthropic 将这套判定的"安全余量(safety margin)"设置得比以往模型更宽[1]。所谓安全余量,是指只有明显看起来安全的请求才会被放行,其余则倾向于拦截,代价是在日常工作中可能出现更多误判[1]。分类器只是防护的一部分,Anthropic 表示还会结合访问控制、模型安全训练和离线监控,构建多层次的防护[1]。
漏洞发现允许到什么程度
在这四个类别中,最难划清界线的正是漏洞发现[1]。Anthropic 并非全面禁止漏洞发现,而是着力拦截"高增益(high-uplift)"的漏洞发现,即识别其他广泛可用模型无法发现的漏洞的能力[1]。由于攻击者有时能从公开的漏洞报告或修复补丁中构建攻击代码,因此攻击代码的自动生成也会被拦截[1]。
另一方面,如果某个漏洞是众多常见模型都能发现的,那么让 Fable 5 去发现并修复反而是有益的[1]。安全业界长期以来都认为,漏洞发现与负责任的公开是净收益——防御方从"知道该修什么"中获得的收益,大于攻击方从同一份报告中获得的收益[1]。文中引用称,美国政府也持相同立场,指出"在绝大多数情况下,负责任地披露新发现的漏洞显然符合国家利益"[1]。
衡量越狱严重程度的"CJS"框架
另一大支柱是评估越狱严重程度的框架提案[1]。越狱是指以异常方式向 AI 模型下达指令,从而绕过其安全机制的手法[1]。其严重程度差异极大,既有仅解锁轻微行为的,也有引出大量有害输出、使模型大幅危险化的[1]。然而,此前一直缺少一把描述严重程度的通用标尺,导致 AI 开发者与政府难以用一致的语言讨论风险[1]。
Anthropic 提出的尺度称为"Cyber Jailbreak Severity(CJS)",分为五档:None(仅供参考,CJS-0)、Low(CJS-1)、Medium(CJS-2)、High(CJS-3)、Critical(CJS-4)[1]。各档并非线性而是按指数设定,每上升一档就比上一档严重数倍[1]。
CJS 分数由四个维度计算得出[1]。前两个维度描述越狱给攻击者带来了什么:"能力增益(capability gain)"指它把攻击者推进到超越既有工具的程度,"适用广度(breadth)"指同一手法能适用于多少种不同的攻击任务[1]。后两个维度描述该手法多快会变成现实问题:"武器化的难易(ease of weaponization)"指把手法转化为可用攻击所需的功夫,"可发现性(discoverability)"指攻击者最初获得该手法的难易程度[1]。
Anthropic 指出,"能力增益"关乎网络领域的专业知识(是否连专家都能被加速),而"武器化的难易"关乎使用 LLM 与越狱的技巧,两者相互独立[1]。某一手法完全可能在其中一个维度上高、在另一个维度上低[1]。
分数是"下限",Log4Shell 的例子说明其时点依赖性
将四个维度的分数相加,即可得出 0 到 4 的初始 CJS 等级[1]。不过该值是暂定的"下限(floor)",不能再往下调,但若判定评分标准低估了现实风险,则可以上调[1]。上调的理由包括:在广泛部署的软件中催生出新型重大漏洞、利用了短期内无从缓解的根本能力,或与其他未解决的发现相叠加而使危害加剧等[1]。
能力增益是以"当时可用的工具"为基准来衡量的,这一点通过附录中的 Log4Shell 例子得到了清晰说明[1]。设想有一个越狱能够发现真实存在的 Log4Shell 漏洞,在其他工具尚不存在的 2021 年 12 月,其严重程度评价很高[1]。但在该漏洞已成公知、任何扫描器都能检测的今天,即便模型本身的行为完全相同,能力增益也会被评为零,CJS 等级随之下降[1]。这体现了一种思路:作为基准的"当时技术水平"在变动,因此同一发现的评价也会随之改变[1]。
该框架属于初稿,Anthropic 表示希望以此为契机,在学术界、产业界、公民社会与政府之间展开讨论[1]。反馈可发送至 [email protected],同时还启动了 HackerOne 计划,供安全研究者提交在 Fable 5 中发现的越狱[1]。
总结
此次公布通过四个具体类别,明确了 Fable 5 的网络安全防护"防什么、不防什么",并提出了用于以通用语言讨论越狱严重程度的 CJS 框架。今后的焦点在于,"既不妨碍防御用途、又只抑制滥用"这一艰难的界线划分,能否培育成行业与政府可以共享的标准。
来源:https://www.anthropic.com/news/fable-safeguards-jailbreak-framework
