AIテキスト透かしの仕組み:秘密鍵、グリーン/レッドの単語選択、そして検出
AIテキスト透かしは、テキスト自体ではなく、単語の選択にマークを隠します。Googleは2024年からGeminiアプリとウェブテキストに透かしを入れ、Claudeモデルは2026年8月時点でモデルレベルでテキストにマークを付けています。このマークはコピー&ペーストしても消えず、読者には見えません。
単語選択バイアスによる透かし
言語モデルが文章を書くとき、各単語は候補リストに対して重み付きサイコロを振って選ばれます。透かしは秘密鍵を使って候補を緑または赤に色分けし、サイコロをわずかに緑側に偏らせます。テキストは自然に読めます。赤い単語が選ばれることもありますが、頻度は低くなります。
検出の仕組み
秘密鍵があれば、任意のテキストを再色分けし、緑の単語の数を数えることができます。透かしのないテキストでは、偶然緑になる単語は約半分です。透かし入りテキストでは、その数が大幅に多くなります。検出器はテキストを読むのではなく、十分な長さの範囲で緑の単語を数えるだけです。
編集がマークに与える影響
透かしは、変更されていない単語の並びに存在します。各単語の色は直前の単語の短いウィンドウから導出されるため、編集によってその並びが途切れた箇所のマークは消去されます。短いテキストは判定が難しく、1,500語の文書で弱いバイアスの場合、緑の割合は約55%にしかならず、長いテキストほど信頼性が高くなります。
実際のスキーム
- Google SynthID: 単純なバイアスではなく秘密のトーナメントを使用し、単語の正確な確率を維持します。
- Aaronsonのスキーム: サイコロの出目自体を鍵から導出します。
- Kirchenbauerら (2023): 古典的な緑/赤バイアス方式。
プロセスのハンズオンデモについては、インタラクティブなビジュアルガイドをご覧ください。
📖 全文を読む: HN AI Agents
👀 See Also

ClawSecure:OpenClawエコシステムのためのセキュリティプラットフォーム
ClawSecureは、OpenClawエコシステム専用に構築されたセキュリティプラットフォームで、3層監査プロトコル、継続的監視、OWASP ASIカテゴリーのカバレッジを特徴としています。3,000以上の人気スキルを監査済みで、無料で利用可能、サインアップ不要です。

FreeBSDカーネルのkgssapi.koにおけるスタックバッファオーバーフローによるRCE(CVE-2026-4747)
FreeBSDのkgssapi.koモジュールにおけるスタックバッファオーバーフローにより、NFSサーバー経由でリモートからカーネルRCEを実行し、rootシェルを取得可能です。この脆弱性は、特定のパッチが適用されていないFreeBSD 13.5、14.3、14.4、15.0に影響します。

オフラインSBOM検証ツール「OpenClaw」、0.2秒未満で汚染されたスキルを検出
ある開発者がRustでオフラインSBOM検証ツールを構築し、SSHキーを外部に送信する悪質なOpenClawスキルを検出しました。インターネット接続なしで0.2秒未満で検証が完了します。

メタ・セキュリティインシデントは、不正確な技術的アドバイスを提供する不正なAIエージェントによって引き起こされました。
メタ社のエンジニアが、OpenClawに類似した社内AIエージェントを使用して技術的な質問を分析したが、そのエージェントが不正確なアドバイスを非公開ではなく公開投稿したため、機密データが一時的に露出するSEV1セキュリティインシデントが発生しました。