AIテキスト透かしの仕組み:秘密鍵、グリーン/レッドの単語選択、そして検出
AIテキスト透かしは、テキスト自体ではなく、単語の選択にマークを隠します。Googleは2024年からGeminiアプリとウェブテキストに透かしを入れ、Claudeモデルは2026年8月時点でモデルレベルでテキストにマークを付けています。このマークはコピー&ペーストしても消えず、読者には見えません。
単語選択バイアスによる透かし
言語モデルが文章を書くとき、各単語は候補リストに対して重み付きサイコロを振って選ばれます。透かしは秘密鍵を使って候補を緑または赤に色分けし、サイコロをわずかに緑側に偏らせます。テキストは自然に読めます。赤い単語が選ばれることもありますが、頻度は低くなります。
検出の仕組み
秘密鍵があれば、任意のテキストを再色分けし、緑の単語の数を数えることができます。透かしのないテキストでは、偶然緑になる単語は約半分です。透かし入りテキストでは、その数が大幅に多くなります。検出器はテキストを読むのではなく、十分な長さの範囲で緑の単語を数えるだけです。
編集がマークに与える影響
透かしは、変更されていない単語の並びに存在します。各単語の色は直前の単語の短いウィンドウから導出されるため、編集によってその並びが途切れた箇所のマークは消去されます。短いテキストは判定が難しく、1,500語の文書で弱いバイアスの場合、緑の割合は約55%にしかならず、長いテキストほど信頼性が高くなります。
実際のスキーム
- Google SynthID: 単純なバイアスではなく秘密のトーナメントを使用し、単語の正確な確率を維持します。
- Aaronsonのスキーム: サイコロの出目自体を鍵から導出します。
- Kirchenbauerら (2023): 古典的な緑/赤バイアス方式。
プロセスのハンズオンデモについては、インタラクティブなビジュアルガイドをご覧ください。
📖 全文を読む: HN AI Agents
👀 See Also

新スキルがリモートサーバーでのOpenClawセキュリティ強化を自動化
コミュニティ開発者が、リモートサーバー上のOpenClawインストールをAIアシスタントが自動的に保護するのに役立つスキルをリリースしました。

ClawScan + VirusTotalを通過した5つの悪意あるOpenClawスキル:Unit 42分析
Unit 42は、ClawScanとVirusTotalの両方を通過した悪意のあるOpenClawスキルを5つ特定しました。手法には、ランタイムリファラルスワッピング、パンプアンドダンプのためのSOLプーリング、AMOSドロッパーを隠すための22MBのREADMEパディングが含まれていました。

AppLovin Mediation Cipher 破綻:デバイスフィンガープリンティングがATTを回避
リバースエンジニアリングにより、AppLovinのカスタム暗号が定数ソルト+SDKキー、SplitMix64 PRNGを使用し、認証がないことが明らかになった。復号されたリクエストには、ATTが拒否されている場合でも約50のデバイスフィールド(ハードウェアモデル、画面サイズ、ロケール、起動時間など)が含まれており、アプリ間での決定論的な再識別が可能となる。

ゼロトラスト・オープンクローアーキテクチャは、実行前認可と実行後検証を追加します。
OpenClawのオープンソースアーキテクチャは、2つのセキュリティチェックポイントを追加します:実行前にツール呼び出しをインターセプトし、サブミリ秒の認可オーバーヘッドを実現するRustサイドカーと、LLMの判断ではなくアサーションを使用した決定論的な実行後検証です。システムには、DOMスナップショットとスクリーンショットによるトレーシング、さらにトークン使用量を90-99%削減するDOM圧縮スキルが含まれています。