Anthropicが、今後のClaudeモデルが生成する文章に電子透かし(ウォーターマーク)を入れると公表し、その仕組みと限界をまとめたFAQを公開しました[1]。読者には見分けがつかず、隠し文字も追加トークンも使わない方式です。8月2日に効力が生じたEUの透明性ルールへの対応で、Anthropicは適用範囲を全世界にすると説明しています[1][2]。
「乱数の出どころ」を差し替えるだけの仕組み
大規模言語モデルは1語ずつ次の単語を選んでいきます。「今日の天気は寒くて」に続く語が「砂糖のような」になる可能性はまず無い一方、「どんよりした」でも「灰色の」でも文の意味はほとんど変わりません。こうした、どちらを選んでも差し支えない場面の決着は乱数が付けています[1]。
電子透かしは、この低リスクな選択の積み重ねに手を入れます。乱数発生器の代わりに、鍵と直前の数語から次の単語を決める方式に切り替えるのです。選ばれる語は依然としてランダムですが、鍵を持つ側は語の並びを照合し、Claudeが関与した確率を推定できます[1]。
Anthropicは、モデルが本来まず使わない珍しい語を無理に選ばせる仕掛けではないと強調しています。文章に何かを埋め込むわけでも、不可視文字を差し込むわけでもありません[1]。
採用したのはGoogle DeepMindが2024年にNatureで発表したSynthID-Textの流れをくむ手法で、2022年のScott Aaronsonの提案にまで遡る系譜に属します[1][3]。
品質・速度・料金には影響しない
Anthropicは社内テストで、内容・創造性・読みやすさのいずれにも影響が見られなかったとしています[1]。SynthID-Textの論文でも、Google DeepMindがGeminiのトラフィックの一部に透かし入りモデルを配信して高評価・低評価の比率を比べたところ、統計的に有意な差は出ませんでした。約2,000万件の応答を分析した規模の検証です[1][3]。
余分なトークンを生まないため、提供コストも利用料金も変わらず、速度への影響も無視できる水準だとしています[1]。
分かりやすい例えとして、Anthropicはモノポリーを挙げています。サイコロの代わりに円周率の数字を順に使って駒を進めても、遊んでいる最中の体験も勝敗も変わりません。ただし後から全手順を見返せば、円周率が使われたゲームだと見抜ける。文章の透かしもこれと同じ関係だという説明です[1]。
効かない場面を隠さず並べている
今回のFAQで目を引くのは、限界の記述が具体的な点です。
まず、判定できるのは「Claudeが部分的に書いた可能性がどの程度あるか」だけで、人間が書いたことの証明にも、別のAIが書いたことの判別にもなりません。鍵が違えば他社の透かしは読めず、そもそも別方式かもしれないためです[1]。
短い文章も苦手です。選択の機会が少ないほど情報が乏しくなるため、文章が長くなるほど確度が上がる性質があります[1]。
事実を述べる文でも透かしは薄くなります。「アイザック・ニュートンの代表作はプリンキピア」に続く語は「マティカ」以外に正解が無く、透かしが働く余地がありません。校正も同様で、人間の原稿に文法と句読点だけ直させた場合、透かしが宿るのは数カ所の修正だけになります[1]。
コードも、出力が厳密に決まる部分には適用されません。「2 + 2 =」の次に「4」以外の選択肢が無いのと同じ理屈です。コメント文のように語の選び方に幅がある箇所には入りうるものの、コード本体への影響は無視できるとしています[1]。
編集による除去についても、軽い手直しでは完全には消えない一方、全語を置き換える書き直しなら消えると認めています。もっともそこまで書き直せば、それをAI生成と呼べるかは議論の余地があるという言い方です[1]。翻訳は全語をClaudeが選ぶため、透かしが入ります[1]。
個人の追跡には使えない
透かしはClaudeとその出力に対して適用されるもので、利用者個人を識別する情報は含みません。透かしにも鍵にも、ユーザーや所属組織、チャット内容を復元できる要素は無いとされています[1]。文章の所有権や法的責任の所在も変わりません[1]。
一方で、TechCrunchはサポートページの記述を引用し、透かしは文章の一部であるためコピー&ペーストしても一緒に移動し、ある程度の編集を経ても残りうる点、そしてモデル単位で適用されるためAPI、Claude、Claude Code、Claude Cowork、Claude Tagのどの経路から出た文章にも付く点を伝えています[2]。
画像などのファイルは別の扱いです。.pngや.jpg、.svgといった対応形式では、ファイルのメタデータに署名付きの記録を付けるC2PAという業界標準を使います。ファイルの中身自体は変わらず、透かしとは別物だと整理されています[1]。
なお、Pangramのような外部のAI検出サービスとは原理が異なります。検出サービスは鍵を持たないため、AI特有の言い回しの癖を手掛かりにします。Anthropicは例として「this isn't [X], it's [Y]」という構文や、quietlyという語の多用を挙げています[1]。
EU規制が起点、対象は旧モデルにも広がる
導入の理由はEU AI Actへの対応です。Anthropicは2026年7月、およそ190の署名者とともにEUのAI生成コンテンツの透明性に関する行動規範に署名しました[1]。この透明性コードは8月2日に効力を持ち、EU市場向けにAIを提供する事業者へ、他システムから識別できる形でAI生成物を標示するよう求めます[2]。
適用が全世界一律になったのは、地域ごとに切り分ける確実な方法が現時点で無いためだと説明されています[1]。8月2日より前に公開された既存モデルには移行期間が設けられており、Anthropicは今後数カ月かけて対応を広げるとしています[1]。透かしの有無を確かめる検出APIも準備中です[1]。
同じ行動規範には、Black Forest Labs、Google、Meta、Microsoft、OpenAI、Synthesiaも参加を表明しています[2]。Claudeだけの取り組みではなく、各社がそれぞれの方式で標示を進める流れの一部という位置づけです[1][2]。
まとめ
AnthropicはClaudeの生成文に電子透かしを入れると公表し、乱数の出どころを鍵に差し替えるSynthID-Text系の方式を採ること、読者には判別できず品質・速度・料金にも影響しないことを明らかにしました。短文や事実記述、コード、校正といった場面では効きにくく、判定できるのは関与の可能性までという限界も自ら記しています。個人の特定には使えず、旧モデルへの適用と検出APIの提供は今後の課題として残ります。規制対応として始まった標示が、AI生成物の扱い方をどう変えるかはこれからです。
[1] 出典: https://www.anthropic.com/news/claude-text-watermark
[2] 出典: https://techcrunch.com/2026/08/11/anthropic-says-it-will-watermark-text-generated-by-its-ai-models/
