Sakana AI 的编排模型「Fugu」把多个 AI 汇聚到一个 API 之下,如今又新增了一个专为网络防御打造的端点。这就是 2026 年 7 月 21 日公开的「Fugu-Cyber」。在安全领域的主要基准测试中,它的成绩超过了 GPT-5.5-Cyber 和 Mythos-Preview 等前沿模型。使用前需要提交申请并通过审核,计费方式为按量付费的 Token 方案。
把多个模型当成一个模型来用
Fugu-Cyber 的基础,是 Fugu 从一开始就采用的多智能体编排思路。底层运行着分工不同的多个智能体,但开发者面对的只有一个端点。请求发出后,系统会根据任务内容挑选合适的智能体组合,推进跨越多个步骤的工作。
这种结构还有性能之外的考量。如果把业务完全托付给某一家厂商的单一模型,价格调整、服务终止或性能波动都会直接变成经营风险。Fugu 在内部灵活调用多个模型,正是为了稀释这种依赖。Fugu-Cyber 保留了这一特性,同时针对当代网络防御的复杂程度重新梳理了内部构造。
两项基准测试均超过前沿模型
数据说得很清楚。在衡量真实漏洞验证能力的 CyberGym 上,Fugu-Cyber 拿到 86.9%。同一指标下,GPT-5.5-Cyber 为 85.6%,Mythos-Preview 为 83.1%。在考察能否把原始威胁情报报告转化为可用检测规则的 CTI-REALM 上,Fugu-Cyber 为 72.1%,高于 GPT-5.5-Cyber 的 67.3% 和 Mythos-Preview 的 68.5%。
这两项测试观察的是企业防御的不同侧面。CyberGym 考的是读懂庞大而复杂的代码库、确认其中是否真的存在可成立缺陷的能力;CTI-REALM 则考察能否把外部涌来的零散威胁信息,翻译成自家监控体系可以使用的形式。二者的组合,正对应着防守方工作中读代码与把情报落到运营两条主线。
基准分数只是起点
值得玩味的是,Sakana AI 自己明确点出了分数的局限。该公司指出,围绕前沿模型网络能力的讨论过热,并对「只要拿到强大模型,企业安全问题就会自行解决」这种说法提出了告诫。
其依据是包括大型金融机构在内的大规模组织的真实处境。即便手握具备最先进能力的模型,如果内部没有专业人才,也没有与自家专有代码深度整合,就无法真正挖出并修复现实中的漏洞。该公司表示,在与日本大型企业合作的过程中,也多次撞上同一堵墙。
单独运行的原始模型会产生误报,因为它并不了解生产环境的细枝末节,就贸然举手说「这里可能有漏洞」。因此 Sakana AI 强调这样一条流程:发现可疑之处后,由安全方向的子智能体进行验证,再经人工确认,判定它在真实环境中确实会触发之后,才进入修复方案环节。模型是强大的部件,而不是解决方案本身。
采用申请制,并更新了滥用防范政策
Fugu-Cyber 的 API 以 Token 方案提供。但并非人人都能立即调用,用户需要提交写明使用目的和可验证联系方式的申请表,由该公司团队逐一审核并批准。可接受使用政策也已更新,明确禁止用于攻击性用途。
攻防技术本就一脉相承,为防御打磨得越好的模型,转手用于攻击也越顺手。手续之繁琐,正是这一点的另一面。若要在实际业务中考虑这套 API,需要先把能够通过审核的具体运营方案想清楚。
总结
Fugu-Cyber 是 Sakana AI 的新 API 端点,在保留多模型编排机制的同时专攻网络防御。它在 CyberGym 取得 86.9%、在 CTI-REALM 取得 72.1%,成绩超过竞争对手的前沿模型。不过该公司强调的并非分数本身,而是一条务实的界线:只有配上专业人才与验证机制,这项技术才能在现场发挥作用。对考虑引入的一方而言,如何搭建内部运营体系,与选择哪个模型同样重要。
