Anthropic 宣布,今后的 Claude 模型在生成文本时会嵌入水印,并发布了一份说明其原理与局限的问答[1]。读者无法察觉差异,这种方式既不添加隐藏字符,也不消耗额外的 token。此举是为了应对 8 月 2 日生效的欧盟透明度规则,Anthropic 表示水印将在全球范围内统一启用[1][2]。

只是更换了随机数的来源

大语言模型逐词生成文本。在"今天天气很冷,而且"之后,下一个词几乎不可能是"含糖的",但"阴沉的"和"灰蒙蒙的"都说得通,句子的含义也差别不大。这类无关紧要的选择,通常由随机数来决定[1]。

水印正是在这些低风险的选择上做文章。模型不再使用任意的随机数发生器,而是根据密钥和前面的若干个词来决定选取哪个候选词。词语依然是随机选出的,但持有密钥的一方可以比对词序列,估算 Claude 参与写作的概率[1]。

Anthropic 强调,这种方法不会迫使 Claude 选用它本来绝不会考虑的生僻词,文本中没有嵌入任何东西,也没有插入不可见字符[1]。

所采用的方法源自 Google DeepMind 于 2024 年发表在《自然》上的 SynthID-Text,属于可追溯至 Scott Aaronson 在 2022 年提出的方案的技术谱系[1][3]。

对质量、速度和价格都没有影响

Anthropic 表示,内部测试没有发现水印对输出内容、创造性或可读性产生影响[1]。SynthID-Text 论文也给出了同样的结论:Google DeepMind 向一部分 Gemini 流量提供了带水印的模型,比较点赞与点踩的比例,未发现统计意义上的显著差异。该分析覆盖了约 2,000 万条回复[1][3]。

由于不产生额外的 token,服务成本和使用价格保持不变,对速度的影响也可以忽略[1]。

Anthropic 用大富翁游戏作类比。如果玩家不掷骰子,而是依次使用圆周率的数字来移动棋子,游戏过程和胜负都不会改变。但事后回看全部步骤,就能判断出这局游戏用的是圆周率。文本水印与文本之间就是这样的关系[1]。

明确写出了失效的场景

这份问答值得注意的地方,在于对局限的描述相当具体。

密钥只能回答"这段文字有多大可能部分由 Claude 写成",既无法证明文字出自人类之手,也无法识别由其他 AI 生成的内容,因为对方的密钥不同,甚至可能采用完全不同的方案[1]。

短文本也是难点。可供选择的词越少,可用信息就越贫乏,因此文本越长,判断的置信度越高[1]。

陈述事实的句子里,水印同样稀疏。"艾萨克·牛顿最著名的著作叫《原理》"之后,正确答案只有唯一一个词,水印无从施加。校对也是如此:如果只让 Claude 修改语法和标点,水印只能寄身于那寥寥几处改动[1]。

代码是另一个空白地带。在输出必须精确的位置不会施加这种"轻推",道理和"2 + 2 ="之后只有一个合理答案一样。代码中的注释因为用词自由度较高,可以承载水印,但对代码本身的影响可以忽略[1]。

关于去除水印,Anthropic 承认轻度编辑大概无法完全抹掉,而逐词替换的彻底重写则可以做到,并补充说到了那一步,这段文字是否还算 AI 生成本身就有争议[1]。翻译则会带上水印,因为每一个词都由 Claude 选定[1]。

无法追溯到个人

水印针对的是 Claude 及其输出,不包含任何识别用户身份的信息。无论是水印本身还是密钥,都无法还原出用户、所属机构或聊天内容的任何细节[1]。输出的所有权和法律责任归属也不会因此改变[1]。

TechCrunch 引用 Anthropic 支持页面的说明指出,由于水印是文本的一部分,复制粘贴时会一同转移,经过一定程度的编辑后仍可能保留;而且水印在模型层面施加,因此无论文本来自 Claude 平台 API、Claude、Claude Code、Claude Cowork 还是 Claude Tag,都会带有水印[2]。

文件的处理方式则不同。对于 .png、.jpg、.svg 等受支持的格式,Claude 会依据 C2PA 这一开放行业标准,在文件的元数据中附加一段经过加密签名的记录。文件内容本身不发生变化,因此这与水印是两回事[1]。

它与 Pangram 这类第三方 AI 检测服务的原理也不相同。检测服务没有密钥,只能依靠 AI 行文的用语习惯作为线索。Anthropic 举的例子包括"this isn't [X], it's [Y]"这一句式,以及 quietly 一词的高频使用[1]。

起点是欧盟监管,旧模型也将纳入

推动这一变化的是欧盟人工智能法案。2026 年 7 月,Anthropic 与约 190 家签署方一同签署了欧盟《AI 生成内容透明度行为准则》[1]。该透明度准则于 8 月 2 日生效,要求面向欧盟市场提供服务的厂商,以其他系统可识别的方式标示 AI 生成内容[2]。

之所以一开始就在全球统一启用,是因为目前还没有可靠的方法按地区区分适用范围[1]。8 月 2 日之前发布的既有模型享有过渡期,Anthropic 表示会在未来数月内将支持范围扩展到这些模型[1]。用于查验水印的检测 API 也在准备中[1]。

Black Forest Labs、谷歌、Meta、微软、OpenAI 和 Synthesia 也表态参与同一份准则[2]。这并非 Claude 独有的举措,而是各家厂商各自推进内容标示这一整体趋势的一部分[1][2]。

总结

Anthropic 宣布为 Claude 生成的文本加入水印,采用的是仅更换选词随机性来源的 SynthID-Text 系方法,并称这一改动对读者不可见,对质量、速度和价格也没有影响。该公司同时写明了方法失效的场景:短文本、事实性陈述、代码和校对,以及检测只能指向"可能参与"这一上限。它无法用于识别个人,旧模型的覆盖和检测 API 的推出仍是待办事项。这项因监管而生的标示机制,究竟会如何改变 AI 生成内容的处理方式,还有待观察。

[1] 来源: https://www.anthropic.com/news/claude-text-watermark

[2] 来源: https://techcrunch.com/2026/08/11/anthropic-says-it-will-watermark-text-generated-by-its-ai-models/

[3] 来源: https://www.nature.com/articles/s41586-024-08025-4