Anthropic 于 9 月 10 日发布威胁情报报告,汇总了 2025 年 12 月至 2026 年 8 月期间观察到的滥用行为。最引人注目的是该公司所称非法蒸馏的规模。大量收集 Claude 交互内容并用于训练竞品模型的行为被归因于中国境内的 7 家实验室,累计约 2 亿次交互。报告点名的是 Alibaba、Moonshot AI、DeepSeek、Zhipu(Z.ai)、Xiaomi、SenseTime 与 MiniMax 七家公司。

2 亿次交互意味着什么

蒸馏本身在 AI 开发中并不罕见,即把大模型的输出当作训练数据来打磨小模型。Anthropic 质疑的并非这项技术,而是在未获许可的情况下以产业规模抽取输出这一行为。该公司将此次活动定义为未经授权的隐蔽抽取,与正规训练手法区分开来。

被瞄准的主要是 Claude 的 Opus 系列,包括 4.6 与 4.7。被抽取的能力范围也很广,包括调用工具的智能体式行为、编程、数据分析与逻辑推理,正是各家厂商目前力图拉开差距的领域。这说明相关活动并非一次性试验,而是事先划定了要复制哪些能力。

Alibaba 三个月内超过 1.51 亿次

在细分数据中最为突出的是与 Alibaba 关联的行动。2026 年 5 月至 7 月期间记录到超过 1.51 亿次交互,高峰时单日约 300 万次,使用的账号约 3,500 个。单日 300 万次远超人工所能驱动的量级,意味着背后存在持续运转的自动化流程。

与 Moonshot AI 关联的行动规模同样不小,5 月至 7 月记录到超过 2,300 万次交互,但构造方式不同。在报告列出的 10 天内,约有 30 万次请求经由 5,380 个欺诈账号组成的中继网络被转发。它不把负载集中在少数账号上,而是细密分散以规避检测。以量取胜与把痕迹摊薄两种思路,出现在同一份报告中。

以翻译委托为幌子抽取思考过程

报告描述的手法,是诱导模型输出其得出答案前的推理过程。Anthropic 举出的一个例子中,模型被赋予翻译专家的角色,并被要求把此前的工作记忆译为自然的、仅使用片假名的日语。表面上看只是无害的翻译任务,实际被输出的却是模型内部的推理本身。

这类提示词的棘手之处在于,单看一条很难判定为违规。差异体现在整体形态上,即同一模式的请求从数千个账号源源不断地涌来。Anthropic 之所以把重心放在行为模式分析而非逐条封堵,原因大概正在于此。

Anthropic 采取的应对

该公司表示,已停用相关账号,强化分类器与防护措施,并在必要时与主管机关及业界伙伴共享情报。报告中还表达了这样的判断:近几个月来,未获授权的实验室不断改进绕过防线、收割美国前沿模型能力的手法。

需要说明的是,本次报告并不只涉及蒸馏。其中还并列了嵌入 AI 的网络攻击、舆论操控、国家层面的监控滥用等多个类型,蒸馏只是其中一章。其背后是一个整体判断:生成式 AI 的滥用正在走出试验阶段,进入实际运用阶段。

阅读时应留意的地方

不过,这里给出的数字基于 Anthropic 自身的测量与分析。外界独立核实账号背后主体的手段有限,被点名企业的反驳或说明目前也未包含在报告中。把行为归属到具体企业这一点,究竟有多少具体证据支撑,仍有待观察。

另一点是蒸馏这个词本身的跨度。使用公开输出进行训练,与违反服务条款的大规模抽取,在技术上相邻,处理方式却截然不同。界线划在哪里,业界尚未形成共识,因此这份报告更适合被视为推动划线的一份材料,而非最终结论。

总结

Anthropic 在 9 月 10 日的威胁情报报告中,将 Claude 遭未授权蒸馏归因于中国境内的 7 家实验室、累计约 2 亿次交互。与 Alibaba 关联的部分在 5 月至 7 月超过 1.51 亿次,高峰为单日 300 万次;与 Moonshot AI 关联的部分则使用了由 5,380 个欺诈账号构成的中继网络。手法是伪装成翻译工作以套取推理过程,该公司以停用账号与强化防护作为应对。这份报告显示,如何守住模型能力,正从技术问题转变为运营与规范层面的问题。

参考链接