AIテキスト透かしの仕組み:秘密鍵、グリーン/レッドの単語選択、そして検出
AIテキスト透かしは、テキスト自体ではなく、単語の選択にマークを隠します。Googleは2024年からGeminiアプリとウェブテキストに透かしを入れ、Claudeモデルは2026年8月時点でモデルレベルでテキストにマークを付けています。このマークはコピー&ペーストしても消えず、読者には見えません。
単語選択バイアスによる透かし
言語モデルが文章を書くとき、各単語は候補リストに対して重み付きサイコロを振って選ばれます。透かしは秘密鍵を使って候補を緑または赤に色分けし、サイコロをわずかに緑側に偏らせます。テキストは自然に読めます。赤い単語が選ばれることもありますが、頻度は低くなります。
検出の仕組み
秘密鍵があれば、任意のテキストを再色分けし、緑の単語の数を数えることができます。透かしのないテキストでは、偶然緑になる単語は約半分です。透かし入りテキストでは、その数が大幅に多くなります。検出器はテキストを読むのではなく、十分な長さの範囲で緑の単語を数えるだけです。
編集がマークに与える影響
透かしは、変更されていない単語の並びに存在します。各単語の色は直前の単語の短いウィンドウから導出されるため、編集によってその並びが途切れた箇所のマークは消去されます。短いテキストは判定が難しく、1,500語の文書で弱いバイアスの場合、緑の割合は約55%にしかならず、長いテキストほど信頼性が高くなります。
実際のスキーム
- Google SynthID: 単純なバイアスではなく秘密のトーナメントを使用し、単語の正確な確率を維持します。
- Aaronsonのスキーム: サイコロの出目自体を鍵から導出します。
- Kirchenbauerら (2023): 古典的な緑/赤バイアス方式。
プロセスのハンズオンデモについては、インタラクティブなビジュアルガイドをご覧ください。
📖 全文を読む: HN AI Agents
👀 See Also

AIエージェントのガードレールは、積極的なメンテナンスなしでは時間とともに劣化します。
AIエージェントのガードレール(システムプロンプトで定義された安全ルール)は、システムプロンプトの更新が蓄積し、モデルバージョンが変更され、新しいツールが追加されるにつれて時間とともに劣化し、矛盾したルールや無視される安全ルールが生じ、定期的なレビューとテストが必要になることが多い。

クロードの会話検索ツールは、削除されたチャットを依然として返します
Claude Proユーザーが、削除された会話がClaudeの会話検索ツールを通じて依然として取得可能であることを発見しました。チャットリンクは無効になっているにもかかわらず、タイトル、メッセージ数、抜粋などの実質的な内容が返されます。

MetaのAIサポート機能で誰でもInstagramアカウントを乗っ取れる — 脆弱性の詳細
InstagramでABテスト中のAIサポート機能に脆弱性。3ステップでパスワードリセット可能、100以上のアカウントが乗っ取られる。

潜在的なClaudeセキュリティインシデント:自己送信パスワードアラートと不審な.NETプロセス
ユーザーがClaudeにログイン後、自身のアカウントから送信されたように見える不審なパスワードリセット通知を受け取ったと報告。数分後にメールが消失し、異常な.NETプロセスがシステムシャットダウンを妨げた。