Anthropic 于 8 月 21 日起,让其宣称在网络安全能力上处于世界最高水平的模型 Claude Mythos 5,可以通过代码诊断服务 Claude Security 使用。适用对象为签订 Claude Enterprise 方案的组织,目前处于公开测试阶段。用户无法与模型自由对话,只能拿到漏洞指摘与修复建议,这正是本次发布的核心。
刻意不交出提示框
Mythos 一直不在 Anthropic 面向大众提供的模型序列之中。该公司 4 月启动了 Project Glasswing,仅向少数守护关键基础设施软件的组织提供 Mythos Preview 及其后继者 Mythos 5,目的是在攻击方获得同等能力之前,先给防守方留出时间。
反过来说,这也是一个不易随意分发的模型。找出漏洞的能力,同时就是写出攻击代码的能力。广泛提供同一底层模型的 Claude Fable 5,通过分类器把网络安全、生物、化学等具有两用风险的请求分流出去,不让它们进入 Mythos 级的处理。
Anthropic 这次给出的答案,不是削减能力,而是改造用户接触模型的方式。风险集中在用户能够直接向模型下达指令的场景;如果用户只能拿到补丁或告警这类固定产物,风险就会大幅下降。基于这一判断,公司扩大了对结果的访问,同时继续限制对模型本体的直接访问。
选定 GitHub 仓库即可启动扫描
使用方式很简单。企业管理员在管理控制台中启用 Claude Security 后,用户就能在诊断界面选择仓库。之后由 Mythos 5 遍历代码库,把发现的问题逐条返回。
每条报告都会附带 CWE(通用缺陷枚举)分类、严重程度与置信度评级,以及修复建议。它并非简单的模式匹配,而是跨文件追踪数据流向。Anthropic 列出的主要目标是高严重度的问题:内存破坏、注入缺陷、认证绕过,以及横跨多个文件的逻辑错误。
无需额外付费,是否采用由人决定
扫描按现有方案的常规 token 用量计费,不需要为使用 Mythos 5 单独购买附加项。只要持有 Enterprise 合同,就能直接触及最高等级的诊断能力。
不过,修复工作在别处进行。用户打开网页版 Claude Code 来应用补丁,而这一步使用的是组织原本已签约的模型。扫描环节调用了 Mythos 5,并不意味着其他界面也能使用 Mythos 5。并且每一个补丁都必须经过人工审阅与批准才能应用。不把工作整个交给 AI 的界线画得很清楚。
为开源防御投入 3,500 万美元
在同一次发布中,Anthropic 还成立了 Defender Advantage Fund(0xDAF),向守护开源软件的组织提供 3,500 万美元(约 56 亿日元)的 Claude 额度。
※1 美元 = 159 日元换算
资金投向设定为 3 个领域:修补广泛使用的项目中现存的漏洞;把扫描与修复的流程自动化,做成其他项目可以复制的形态;以及尝试更进一步的设计,使整类攻击手法失效。公司表示会先从少数大额试点资助开始,并在数周内公布首批对象。
在 Project Glasswing 中,Anthropic 已经向开源安全组织捐赠了 400 万美元(约 6.4 亿日元),并支持跨项目推进漏洞修复的协作。本次基金是这项工作的延伸。世界上大量核心软件由志愿者和非营利基金会维护,这是从资金与算力两方面介入这一现实的尝试。
嵌入合作伙伴产品,并扩大验证计划
Anthropic 还预告了另外两项动作。其一是把 Mythos 5 嵌入网络安全厂商合作伙伴的产品与服务。守护医院、电力与自来水、金融系统以及软件供应链的一线团队,早已在使用成套的专用工具,从后端接入这些工具显然更快。这种情况下用户接触的仍是产品界面,不会开放直接向模型下达指令的通道。
其二是扩大 Cyber Verification Program。该计划面向通过审核的防守方组织,放宽 Opus 与 Sonnet 上的限制;未来数周内会扩大所涵盖能力的范围,之后再延伸到 Mythos 系列的访问权限。与美国政府合作的 Project Glasswing,也将继续向满足严格安全控制要求的关键基础设施运营方扩展。
总结
这次发布讲的不是新模型出现,而是既有的最高等级能力应该通过什么样的窗口交付才安全。不交出提示框,只返回固定的产物。如果这种取舍能够成立,前沿模型的提供范围将不再只取决于交给谁,还取决于怎么交。对持有 Enterprise 合同的组织来说,等于多了一个无需额外费用就能尝试的选项。
