VibeTimes
#기술

Anthropic、ClaudeのテキストにAI生成判定技術を実装

모민철모민철 기자· 2026/8/17 1:13:02· Updated 2026/8/17 1:13:02

文章生成AI「Claude」が書いた文章かどうか、今では隠された信号で判別できるようになる。Anthropicは14日(現地時間)、欧州連合(EU)AI法に基づくAI生成コンテンツ表示義務に対応し、目には見えないがパターン分析によってAI作成か否かを判別できる「ウォーターマーク」技術を適用すると明らかにした。この技術は、文章を作成する際に選ばれる単語の確率に微細な信号を混ぜる方式であり、一般の読者は文章の品質や内容において違いを感知できない。

Anthropicによると、今回のウォーターマークシステムはテキスト生成過程で追加のトークンを発生させない。その結果、モデル利用コストが増加することはなく、生成速度に与える影響もわずかなレベルにとどまる。

Anthropicはプライバシー保護に関しても明確な立場を示した。ウォーターマーク自体にはユーザーを識別できる情報は一切含まれない。これにより、ウォーターマークやそれを確認するための鍵を通じて、特定のユーザーや個別の会話内容に関する情報を知ることはできない。これについてAnthropicは、特定の人物がClaudeをどのように使用したかを監視する技術ではなく、当該テキストの生成元がClaudeであるかを事後的に確認する装置であると説明した。

核心的な原理は、大規模言語モデル(LLM)の単語生成におけるランダム性を調整することにある。一般的にモデルは、文脈上意味が似ている複数の単語候補の中から一つを確率的に選択する。ウォーターマークが適用されると、特定の鍵に基づいて単語選択の元となるランダム性のパターンが決定される。個別の単語選択は依然として自然だが、文章全体を分析すると、特定の鍵を使用した場合にのみ現れる独特の選択経路が残る方式である。

Anthropicは、ウォーターマーク技術をボードゲームのサイコロを振ることに例えた。毎回サイコロを振って駒を移動させる代わりに、あらかじめ決められた特定の数字列に従って移動すれば、ゲームをする人にはランダムに見えるしかないが、移動記録全体を把握した状態で特定の数字列と照合すれば、そのゲームがどのようなルールで進行したかを確率的に計算可能だという論理だ。Claudeのウォーターマークも同様に、テキストを読む人が違いを感知することはできないが、鍵を通じて分析すれば事後的な検証が可能となる。

Anthropicは、同技術がGoogle DeepMindが2024年にネイチャー(Nature)誌で発表したSynthID-Textアプローチの一形態であると説明した。SynthID-Textは、AIが単語を選択する際の内部確率分布プロセスに微細な信号を注入する技術として知られている。Anthropicは、2022年にScott Aaronsonが提唱した技術的ルーツを継承しつつも、モデルが不自然または見慣れない単語を強制的に選択しないよう調整した。

ただし、技術的な限界点は依然として存在する。分析する単語数が少ない短いテキストの場合、統計的なパターンを確保しにくく、検出効果が低下する。また、事実関係が明確で単語選択の余地がほとんどない文章でもウォーターマークの適用は限定的となる。例えば、アイザック・ニュートンの特定の著作名に言及する場合、正確性を維持するために決められた単語以外を選ぶことはできない。人間が書いた文章をClaudeが単に校正・編集した場合も、ウォーターマークの効果は限定的とならざるを得ない。

Anthropicは、ウォーターマークが発見されたからといって、当該文書全体をAIが作成したと断定するよりも、Claudeが制作プロセスにどの程度関与したかを確率で判断する用途であると定義した。同社は今後も生成型AIコンテンツの透明性と信頼性を確保するために、技術的な改善を継続する計画だと明らかにした。

쿠팡 파트너스 활동의 일환으로 일정 수수료를 제공받습니다

関連記事