ClaudeのAI透かし機能が文章品質を損なうと批判
原題: Anthropic's 'watermark' text adulteration in Claude is a perversion of writing
なぜ重要か
EU規制対応でAI生成コンテンツへの透かし義務化が進む中、品質への影響と透明性の欠如は業界全体の信頼性に関わる重要な課題となる。
2026年8月16日、技術ブログDaring FireballのJohn Gruberは、AnthropicがEU規制対応のためClaudeの全モデルに導入予定のAIテキスト透かし技術について、同社の公式ドキュメントが「意味・品質・可読性を変えない」と明言しているにもかかわらず、実際にはステガノグラフィー手法で単語選択を操作し文章の意味を変化させるものだと指摘し、強く批判した。
Anthropicは、EU規制への対応としてClaudeが生成するテキストにAI透かし(ウォーターマーク)を埋め込む機能を発表した。同社の当初の公式サポートドキュメントには「透かしはテキストに直接織り込まれ、意味・品質・可読性を変えることはない」と明記されていた。
この記述を受けてJohn Gruberは、見えない非印刷Unicode文字を使う手法ではないかと推測していたという。ところが、Anthropicが後日「How Claude's Text Watermark Works」と題した別の記事を公開し、実際の仕組みが明らかになった。
実際の手法は、LLM(大規模言語モデル)の推論時に「どの単語(トークン)を選ぶか」を操作するステガノグラフィー技術であり、その選択パターンが確率的に検出可能な「指紋」を生成するというものだ。つまり、モデルが本来選んだであろう単語とは異なる語が選ばれ得る。
Gruberはこの点を「文章の意味・品質を変えない」という公式説明と明らかに矛盾すると主張。コインを複数回投げてバイアスを統計的に検出するのと同様に、LLMの非決定論的な出力パターンに意図的な偏りを与えてウォーターマークを埋め込む仕組みであると解説した。
同氏は、James Padolseyが公開したインタラクティブ解説記事「How AI Text Watermarking Works」が技術の原理を最もわかりやすく説明していると紹介。その上で、Anthropicが技術の実態を最初のドキュメントで開示せず、別サイトに後から詳細を掲載したことも問題視した。
Gruberは、いかなるツールも文章の明瞭さや意味をわずかでも犠牲にすることは容認できないと述べており、今回のAnthropicの実装方針がその原則に反するとして強く批判している。