Anthropic 宣布,往後的 Claude 模型在生成文字時會嵌入浮水印,並發布一份說明其原理與極限的問答[1]。讀者無從察覺差異,這種做法既不添加隱藏字元,也不消耗額外的 token。此舉是為了因應 8 月 2 日生效的歐盟透明度規範,Anthropic 表示浮水印將在全球一體適用[1][2]。
只是換掉了亂數的來源
大型語言模型是逐字生成文字的。在「今天天氣很冷,而且」之後,下一個詞幾乎不可能是「含糖的」,但「陰沉的」和「灰濛濛的」都說得通,句意也相差無幾。這類無關緊要的抉擇,通常交由亂數決定[1]。
浮水印正是在這些低風險的抉擇上動手腳。模型不再使用任意的亂數產生器,而是依據金鑰與前面數個詞來決定要選哪個候選詞。用字仍然是隨機挑出的,但持有金鑰的一方可以比對詞序,推估 Claude 參與寫作的機率[1]。
Anthropic 強調,這種做法不會迫使 Claude 選用它本來絕不會考慮的冷僻詞,文字裡沒有嵌入任何東西,也沒有插入不可見字元[1]。
所採用的方法源自 Google DeepMind 於 2024 年發表在《自然》期刊的 SynthID-Text,屬於可上溯至 Scott Aaronson 在 2022 年提出的構想的技術系譜[1][3]。
對品質、速度與價格都沒有影響
Anthropic 表示,內部測試並未發現浮水印對輸出內容、創造性或可讀性造成影響[1]。SynthID-Text 論文也得出相同結論:Google DeepMind 對部分 Gemini 流量提供了帶浮水印的模型,比較按讚與倒讚的比例,並未出現統計上的顯著差異。該分析涵蓋約 2,000 萬則回應[1][3]。
由於不會產生額外的 token,服務成本與使用價格維持不變,對速度的影響也可以忽略[1]。
Anthropic 以大富翁遊戲作比喻。若玩家不擲骰子,改為依序取用圓周率的數字來移動棋子,遊戲過程與勝負都不會改變。但事後回顧全部步驟,就能判斷這一局用的是圓周率。文字浮水印與文字之間,正是這樣的關係[1]。
明白寫出失效的場合
這份問答值得注意之處,在於對極限的描述相當具體。
金鑰只能回答「這段文字有多大機率部分由 Claude 寫成」,既無法證明文字出自人手,也無法辨識由其他 AI 生成的內容,因為對方的金鑰不同,甚至可能採用完全不同的方式[1]。
短文也是弱項。可供挑選的用字愈少,可用的資訊就愈貧乏,因此文字愈長,判斷的信心水準愈高[1]。
陳述事實的句子裡,浮水印同樣稀薄。「艾薩克·牛頓最著名的著作叫《原理》」之後,正確答案只有唯一一個詞,浮水印無從施力。校對也是如此:若只讓 Claude 修改文法與標點,浮水印只能寄身於那寥寥幾處更動[1]。
程式碼是另一處空白。在輸出必須精確的位置不會施加這種輕推,道理與「2 + 2 =」之後只有一個合理答案相同。程式碼中的註解因為用字自由度較高,可以承載浮水印,但對程式碼本身的影響可以忽略[1]。
關於移除浮水印,Anthropic 坦言輕度編輯大概無法完全抹除,逐字置換的徹底改寫則做得到,並補充說到了那個地步,這段文字是否還算 AI 生成本身就有爭議[1]。翻譯則會帶有浮水印,因為每一個字都由 Claude 選定[1]。
無法追溯到個人
浮水印針對的是 Claude 及其輸出,不含任何辨識使用者身分的資訊。無論是浮水印本身或金鑰,都無法還原出使用者、所屬組織或對話內容的任何細節[1]。輸出的所有權與法律責任歸屬也不會因此改變[1]。
TechCrunch 引用 Anthropic 支援頁面的說明指出,由於浮水印是文字的一部分,複製貼上時會一併帶走,經過一定程度的編輯後仍可能留存;而且浮水印是在模型層級施加,因此不論文字來自 Claude 平台 API、Claude、Claude Code、Claude Cowork 或 Claude Tag,都會帶有浮水印[2]。
檔案的處理方式則不同。針對 .png、.jpg、.svg 等支援的格式,Claude 會依據 C2PA 這項開放產業標準,在檔案的中繼資料附上一段經加密簽章的註記。檔案內容本身不會改變,因此這與浮水印是兩回事[1]。
它與 Pangram 這類第三方 AI 偵測服務的原理也不相同。偵測服務沒有金鑰,只能倚賴 AI 行文的用語習慣作為線索。Anthropic 舉的例子包括「this isn't [X], it's [Y]」這個句型,以及 quietly 一詞的高頻使用[1]。
起點是歐盟法規,舊模型也將納入
推動這項改變的是歐盟人工智慧法。2026 年 7 月,Anthropic 與約 190 家簽署方一同簽署了歐盟《AI 生成內容透明度行為準則》[1]。該透明度準則於 8 月 2 日生效,要求面向歐盟市場提供服務的業者,以其他系統可辨識的方式標示 AI 生成內容[2]。
之所以一開始就全球一體適用,是因為目前還沒有可靠的方法依地區區分適用範圍[1]。8 月 2 日之前推出的既有模型享有過渡期,Anthropic 表示會在未來數月內把支援範圍擴及這些模型[1]。用於查驗浮水印的偵測 API 也在準備中[1]。
Black Forest Labs、Google、Meta、微軟、OpenAI 與 Synthesia 也表態參與同一份準則[2]。這並非 Claude 獨有的作為,而是各家業者各自推進內容標示這股整體趨勢的一環[1][2]。
總結
Anthropic 宣布為 Claude 生成的文字加入浮水印,採用的是僅更換選字亂數來源的 SynthID-Text 系方法,並稱這項改動對讀者不可見,對品質、速度與價格也沒有影響。該公司同時寫明了方法失效的場合:短文、事實性敘述、程式碼與校對,以及偵測只能指向「可能參與」這道上限。它無法用來辨識個人,舊模型的涵蓋與偵測 API 的推出仍是待辦事項。這套因法規而生的標示機制究竟會如何改變 AI 生成內容的處理方式,還有待觀察。
[1] 來源: https://www.anthropic.com/news/claude-text-watermark
[2] 來源: https://techcrunch.com/2026/08/11/anthropic-says-it-will-watermark-text-generated-by-its-ai-models/
