AnthropicのClaudeウォーターマークの解説(2026年)
Claude は現在、テキストに不可視の透かしを埋め込んでいます。その仕組み、何が影響を受けずに残るのか、そして陽性検出が実際に何を証明するのかを解説します。
2026年8月11日、Anthropicは、Claudeが自ら書くテキストに目に見えないウォーターマークを埋め込むようになると発表した。数時間以内に、最も大きな反発を示したのは学生ではなかった。自分の文章をそのままコピーエディットするためにClaudeを使っている弁護士、学者、研究者たちであり、彼らは自分たちの成果物に機械生成のマーカーが付くことを知ったばかりだった。
短い要約: このウォーターマークは、文書に隠し文字を挿入するものではなく、Claudeの語の選択に加えられる統計的なバイアスである。コピー、貼り付け、再フォーマット、プレーンテキストへの変換をしても残る。書き直し、翻訳、大幅な編集では残らない。2026年8月2日以降にリリースされたすべてのClaudeモデルに、世界中で、オプトアウトなしで適用される。そして、陽性の検出結果が示すのは、Claudeがそのテキストを処理した可能性があるということだけだ。誰が書いたかは示さない。
このガイドでは、Anthropicが実際に構築したもの、ほとんど報道されなかった第2のマーキングシステム、そのマークが何を証明し、何を証明しないのか、そして自分の文章にマークが付いた場合にどうすべきかを扱う。
Anthropicは実際に何を発表したのか?
この方針は、AnthropicのヘルプセンターにあるHow Claude marks AI-generated contentという記事で公開された。要点は次のとおり。
| 発表日 | 2026年8月11日 |
| 適用対象 | 2026年8月2日以降にリリースされたすべてのClaudeモデル |
| 旧モデル | Anthropicは移行期間中にマーキングを追加する作業を進めているとしている |
| 対象となる提供形態 | Claude API、claude.ai、Claude Code、Claude Cowork、Claude Tag、ならびにAWS、Google Cloud、Microsoft Foundry経由のClaude |
| 地域 | 世界中 |
| オプトアウト | どのプランでもなし |
| 検出 | Anthropic独自のツールで実施予定、時期は未定 |
背景にあるのは規制だ。Anthropicは、EU AI ActのArticle 50(2)によるAI生成コンテンツの透明性に関する実践規範に署名しており、これは生成システムの提供者に対して、機械生成であると識別できるよう出力にマークを付けることを求めている。義務の対象は欧州だ。AnthropicがこれをEU向けトラフィックだけでなく地球上のすべての利用者に適用することにしたのは、そうではない。
Claudeのウォーターマークはどのように機能するのか?
この部分は、最初の48時間でほぼすべての記事が誤って伝えたものであり、ここを誤解すると、そもそも機能し得ない対処法に人々を導いてしまう。
言語モデルが文章を書くとき、単に唯一の正しい次の単語を選んでいるわけではない。文の多くの箇所では、統計的にほぼ同等な複数の続き方がある。つまり、どれを選んでも自然に読める、いくつかの語が存在する。ウォーターマークは、Anthropicが保有する秘密鍵に従って、その選択にバイアスをかける。個々の選択は目立たない。十分に長い文章になると、選択の蓄積パターンが分布を形成し、鍵を持つ検出器がそれを測定できる。
ここから3つの結果が導かれ、それがこのマークの挙動のほぼすべてを説明する。
テキストに何も追加されない。 ゼロ幅文字も、不可視スペースも、メタデータ欄も、書式の小技もない。ウォーターマークはどの単語が選ばれたかという性質であり、そのためAnthropicは、出力の意味、品質、可読性を変えないと正確に言える。
単語と一緒に移動する。 テキストをメールにコピーしても、Wordに貼り付けても、プレーンテキストに変換しても、ファイル形式を変えてもよい。単語は変わらないので、シグネチャも変わらない。
ある程度の量が必要である。 トークン分布に対して行う統計的な測定には、十分なトークン数が必要だ。Anthropic自身も、ウォーターマークが見つからない理由として、コンテンツが「信頼できる検出には短すぎる」ことを挙げている。
誰も取り上げなかった第二の仕組み: C2PAファイルメタデータ
テキストのウォーターマークが注目を集めたが、Anthropicが発表したのは1つではなく2つの仕組みだった。
Claudeが散文ではなくファイル、具体的には.svg、.png、.jpgを生成する場合、AnthropicはCoalition for Content Provenance and AuthenticityによるC2PA standardに従った、デジタル署名付きの出所メタデータを付与する。これは問題の別の半分を解く別の技術であり、資産の出所と変更履歴を記録するための業界支援フォーマットに、改ざんを検知できるよう暗号学的に署名したものだ。
また、これはテキストの印よりもかなり壊れやすい。Anthropicは、C2PAメタデータは形式変換、標準をサポートしないツールでの再保存、あるいは単にスクリーンショットを撮るだけでも削除されうると認めている。メタデータはファイルのそばに存在し、統計的なウォーターマークは言葉の中に存在する。この耐久性の違いが、テキストの印が議論を呼び、ファイルの印が呼ばなかった理由だ。
ウォーターマークを消すもの、消さないもの
分岐点は、どれだけ手間をかけたかではなく機械的なものだ。ある操作で実際の言葉がそのまま残るか、それとも再構成されるかのどちらかである。
| 操作 | 印は残るか? | 理由 |
|---|---|---|
| コピーして貼り付ける | はい | 言葉は変わらない |
| 再フォーマット、ファイル形式の変更 | はい | 言葉は変わらない |
| 見えない文字の除去 | はい | そもそも除去すべき文字がなかった |
| 軽い校正 | 通常ははい | ほとんどの語の選択は軽い手直しでも残る |
| 大幅な編集 | 残らないことが多い | Anthropicは印は「いくつかの編集を経ても残る可能性がある」と述べている |
| 別の言語への翻訳 | いいえ | トークン列がゼロから再構築される |
| 大幅な書き換え | いいえ | すべての語の選択が、別のモデルによって改めて行われる |
| ごく短い抜粋 | 測定不能 | 信頼できる信号を得るには短すぎる |
商業的に重要なのは3行目だ。現在、AI watermark removersとして売られている無料ツールの多くは、ゼロ幅Unicode文字や不可視の空白を探して見つけたものを削除する。これは本当に別の問題に対する妥当な対応だったが、Claudeのウォーターマークに対してはまったく何も達成しない。そうしたクリーナーの1つをClaudeの出力にかけても、返ってくるものは入力時とまったく同じ値を示す。
正の検出は実際には何を証明するのか?
「検出」という言葉が示唆するよりも少ない。そして、制度上の方針が今まさに急いで作られているので、ここは慎重さが必要だ。
正の結果は、ある一節がClaudeによって処理された可能性があることを示す。Anthropicは、検出されたウォーターマークはClaudeがその内容を著したことを立証するものではないと明言している。人々は自分で書いた文章の編集、翻訳、要約にそのモデルを使うからだ。測定は、Claudeが下書きした文書と、Claudeが整えた文書を区別できない。
負の結果はさらに少ないことしか証明しない。印のないテキストは、人間が書いたものかもしれないし、そもそもウォーターマークを持たないモデルのものかもしれないし、大きく編集されたClaudeの出力かもしれないし、単に短すぎて測定できないだけかもしれない。
知っておく価値のある実際的な制約がもう1つある。汎用AI detectorはこの印を読むことができない。検出にはAnthropicのキーが必要なため、Anthropic自身のツール経由で動作するが、発表時点ではリリース時期は示されていなかった。あなたの組織がすでに使っているdetectorは、今日のところClaudeのウォーターマークを読んではいない。
編集者から反発が起きた理由は、AIを隠す人々ではなかったから
反応は非常に否定的で、その反応のあり方こそが、この話の商業的にも倫理的にも最も興味深い部分だった。
支配的だった不満は、「これでAIの成果を自分のものとして通せなくなった」ではなかった。「これで自分の文章そのものがAIだと印が付くようになった」だった。弁護士のPeter Harrellは率直にこう述べた。自分の文章をコピー編集のためにアップロードすると、Claudeは「私の(人間が書いた、AIでコピー編集された)テキストにAIのウォーターマークを付けることになり、それはばかげているように思える」。政治学者のMaya Senも、この変更によって自分のような人にとってモデルの有用性が下がるという同じ点を指摘した。ラジオ司会者のErick Ericksonは、「私が書いたものに、Claudeが作業したとウォーターマークが付くことになる」と述べた。
彼らが述べているのは、実際に存在する具体的な問題、つまりfalse attributionだ。ウォーターマークは、モデルがトークンの列を生成したことを記録する。それは、誰がアイデアを生み、誰が議論を組み立て、誰が調査し、誰が原稿の初稿を書いたのかを記録しないし、構造上できない。雇用主、出版社、学術誌、大学が、肯定的なシグナルを機械による著作の確定的証拠として読むような書き手にとって、そのギャップは学術的な話ではない。
開発者たちは、それと並行する形の問題を指摘した。コードは日常的に、フォーマッタ、リンター、リファクタリングツールを通る。それぞれが残っているトークン選択を書き換える。通常の開発ワークフローでは、その印はすぐに劣化するため、コードの由来を示す用途に対しては、すぐに思い描かれた一部の人々にとっても信頼しにくい。
これが業界全体の中でどの位置にあるか
Anthropicが最初ではないが、この分野は多くの報道が示唆したほど厚くはない。
GoogleのSynthIDは、大手プロバイダーによって大規模に展開された唯一のテキストウォーターマークであり、生成時にトークン確率を偏らせるという同じ基本的な考え方を使っている。2023年に画像から始まり、テキスト、音声、動画へと拡大した。また、Google以外にも採用が広がっており、画像と音声出力についてはOpenAIにも、さらにElevenLabs、Kakao、NVIDIAにも広がっている。
OpenAIは、注目すべき例外だ。ChatGPTの画像にはSynthIDを埋め込み、音声にも対象を広げているが、現時点ではChatGPT向けのテキストウォーターマークは出していない。この非対称性は、単一の検出結果から結論を引き出す前に念頭に置く価値がある。ウォーターマークのない文書は、単にテキストに印を付けないモデルで書かれただけかもしれない。
自分の文章が印を付けられてしまった場合にどうするか
そのテキストが本当に自分のもので、印がコピー編集の副産物であるなら、修正はトークン列を再構成するように言い換えることだ。周辺だけを直しても、確実にはうまくいかない。なぜなら、軽い修正では大半の語彙選択が残るからだ。
単一の段落やセクションなら、当社のfree Claude watermark removerがまさにそれを行う。別のモデルを通して、事実、数値、日付、留保表現、専門用語を固定したまま、最大500語までを新しい表現で再構成する。さらに、引用や出典も文字単位で再現する。アカウントがあれば無料で使え、機能する唯一の仕組み、つまりテキストをふるい分けるのではなくトークンを再生成する方法で動く。
論文、学位論文の章、報告書全体なら、AI text humanizerのほうが適している。全文のhumanizer処理では、文書全体を部分的に修繕するのではなく丸ごと書き換え、機械的な文体の文章を自然な人間らしい文章へ移し替える。その働きの副産物として、トークンレベルのウォーターマークも取り除く。どちらも引用は保護するが、違いは規模と深さだ。
そして、問題の根本がAI支援編集のたびに自分の仕事が疑われることにあるなら、当社のAI proofreaderは、全文を行ごとに承認できるトラッキング変更付きで編集し、テキストにウォーターマークを付けない。
よくある質問
Q: Claude はすべてのテキスト出力にウォーターマークを付けますか?
2026年8月2日以降にリリースされたすべての Claude モデルは、Claude API、claude.ai、Claude Code、Claude Cowork、Claude Tag、そして AWS、Google Cloud、Microsoft Foundry 経由で利用される Claude 全体において、ウォーターマークを埋め込みます。Anthropic は、移行期間中に旧モデルへもマークを拡張する作業を進めていると述べており、8月以前にリリースされたものは自動的に対象外だと考えるのは危険です。これは世界中で適用され、どのプランにもオプトアウトはありません。
Q: Claude のウォーターマークをオフにできますか?
いいえ。Anthropic はそれを無効化する設定、プラン区分、または API パラメータを提供しておらず、このポリシーは所在地にかかわらずすべてのユーザーに適用されます。このマーク付けは EU AI Act に基づく透明性の約束を実装したものであり、そのためユーザー設定としては提供されていません。
Q: 見えない文字を削除する AI watermark remover ツールは機能しますか?
いいえ。これが今回の発表に関する最も一般的な誤解です。そうしたツールは、ゼロ幅 Unicode 文字や不可視のスペーシングを探します。Claude のウォーターマークは、モデルが選択した単語に関する統計的な偏りであるため、除去すべきその種の文字は存在しません。そのようなクリーナーを通したテキストは、最初に持っていた署名をそのまま保持します。サンプリングバイアス型のウォーターマークに影響するのは、トークンを再生成すること、つまり書き直すことだけです。
Q: ウォーターマークは Turnitin や GPTZero に表示されますか?
現時点では表示されません。マークを読み取るには埋め込みに使われた秘密鍵が必要なため、検出はサードパーティの AI 検出器ではなく Anthropic 独自のツールを通じて行われます。Anthropic は検証を利用可能にする予定だと述べましたが、発表時点で時期は示しませんでした。なお、これはそれらの検出器が他の理由であなたのテキストをフラグ付けするかどうかとは別問題であり、ウォーターマークの有無に関係なくそうなる場合があります。
Q: ウォーターマークは Claude が何かを書いたことを証明しますか?
いいえ。これは、そのテキストが Claude によって処理された可能性があることを示すものです。Anthropic は、検出されたウォーターマークが Claude による著作を確認するものではないと明言しています。というのも、このモデルは人が自分で書いた文章の編集、翻訳、要約に広く使われているからです。モデルが生成した下書きと、コピーエディットした段落を区別することはできず、文書のどの程度が機械生成かも示しません。
Q: 言い換えれば Claude のウォーターマークは除去できますか?
大幅な言い換えなら除去されます。なぜなら、単語列を調整するのではなく、単語列そのものを作り直すからです。軽い言い換えは信頼できません。元の単語選択の大半が残るなら、測定できるだけの信号も十分に残るからです。同じ理屈は翻訳にも当てはまり、翻訳ではマークは完全に消えます。一方、軽い校正では通常は消えません。
Q: Claude が生成した画像やファイルはどうですか?
それらには別の仕組みが使われます。.svg、.png、.jpg などの対応形式のファイルには、統計的ウォーターマークではなく、C2PA 標準に基づくデジタル署名付きの来歴メタデータが付与されます。C2PA メタデータは失われやすく、Anthropic は、形式変換、標準に対応していないツールでの再保存、またはスクリーンショット撮影によって削除され得ると述べています。

Dana は ProofreaderPro のコンテンツ クリエイターで、毎日のブログと執筆活動を行っています。 彼女はオンライン編集プラットフォームがどのように機能するかについて記事を書き、毎日顧客メッセージを処理しており、その満足度スコアは 5 つ星です。