Anthropic 於 9 月 10 日發布威脅情資報告,彙整 2025 年 12 月至 2026 年 8 月期間觀察到的濫用情形。最引人注意的是該公司所稱非法蒸餾的規模。大量蒐集 Claude 互動內容並用於訓練競爭模型的行為被歸因於中國境內的 7 家實驗室,合計約 2 億次互動。報告點名的是 Alibaba、Moonshot AI、DeepSeek、Zhipu(Z.ai)、Xiaomi、SenseTime 與 MiniMax 七家公司。
2 億次互動代表什麼
蒸餾本身在 AI 開發中並不罕見,也就是把大型模型的輸出當成訓練資料,用來打磨較小的模型。Anthropic 質疑的並非這項技術,而是未取得許可就以產業規模抽取輸出這件事。該公司將這次的行為定位為未經授權的隱密抽取,與正規的訓練手法區隔開來。
被鎖定的主要是 Claude 的 Opus 系列,包括 4.6 與 4.7。被鎖定的能力範圍也相當廣,包含運用工具的代理式行為、程式開發、資料分析與邏輯推理,正好都是各家目前想要拉開差距的領域。由此可以看出,這並非一次性的試驗,而是事先鎖定了要複製哪些能力。
Alibaba 三個月超過 1.51 億次
在細項中特別突出的是與 Alibaba 相關的行動。2026 年 5 月至 7 月之間記錄到超過 1.51 億次互動,高峰時單日約 300 萬次,使用的帳號約 3,500 個。單日 300 萬次遠遠超過人工所能操作的量,意味著背後有持續運作的自動化機制。
與 Moonshot AI 相關的行動規模同樣不小,5 月至 7 月記錄到超過 2,300 萬次互動,組成方式卻不同。在報告列出的 10 天內,約有 30 萬件請求經由 5,380 個不實帳號構成的中繼網路被轉送。它不把負載集中在少數帳號上,而是細密分散以避開偵測。以量取勝與把痕跡攤薄這兩種思路,同時出現在這份報告裡。
假借翻譯委託抽取思考過程
報告描述的手法,是誘導模型輸出它得出答案之前的推理過程。Anthropic 舉出的例子中,模型被賦予翻譯專家的角色,並被要求把先前的工作記憶譯成自然的、只使用片假名的日文。表面上看起來只是無害的翻譯工作,實際被輸出的卻是模型內部的推理本身。
這類提示詞麻煩的地方在於,單看一則很難判定是否違規。差異會出現在整體樣態上,也就是同一種形式的請求從數千個帳號源源不絕地湧入。Anthropic 之所以把重心放在行為樣態分析,而非逐件封鎖,原因應該就在這裡。
Anthropic 採取的因應
該公司表示,已停用相關帳號、強化分類器與防護機制,並在必要時與主管機關及業界夥伴分享情資。報告中也表達了這樣的看法:近幾個月來,未獲授權的實驗室持續精進繞過防線、收割美國前沿模型能力的手法。
另外,這次的報告並不只處理蒸餾。其中並列了嵌入 AI 的網路攻擊、輿論操作、國家層級的監控濫用等多種類型,蒸餾只是其中一章。背後的整體判斷是,生成式 AI 的濫用正在走出實驗階段,進入實際運用階段。
閱讀時值得留意的地方
不過,這裡提出的數字是依據 Anthropic 自身的量測與分析。外界要獨立確認帳號背後主體的手段有限,被點名企業的反駁或說明目前也未收錄在報告中。把行為歸屬到特定企業這一點,究竟有多少具體證據支撐,仍有待後續觀察。
還有一點是蒸餾這個詞涵蓋的範圍。使用公開輸出進行訓練,與違反服務條款的大規模抽取,在技術上相鄰,處理方式卻大不相同。界線該畫在哪裡,業界尚未形成共識,因此這份報告比較適合視為推動畫線的一份材料,而非最終定論。
總結
Anthropic 在 9 月 10 日的威脅情資報告中,將 Claude 遭未授權蒸餾歸因於中國境內的 7 家實驗室、合計約 2 億次互動。與 Alibaba 相關的部分在 5 月至 7 月超過 1.51 億次,高峰為單日 300 萬次;與 Moonshot AI 相關的部分則使用了由 5,380 個不實帳號組成的中繼網路。手法是偽裝成翻譯工作以套取推理過程,該公司以停用帳號與強化防護作為因應。這份報告顯示,如何守住模型能力,正從技術問題轉為營運與規範層面的問題。
參考連結
- Anthropic — Detecting and countering misuse of AI: September 2026
- TechCrunch — Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek
- The Hacker News — Anthropic Says Seven China-Based AI Labs Ran Industrial-Scale Claude Distillation Attacks
- Unite.AI — Anthropic Details Disrupted Claude Misuse Across Seven Harm Areas
