ドメインカモフラージュインジェクション攻撃がマルチエージェントLLMシステムの検出器を回避

Aaditya Paiによる新しい論文は、LLMインジェクション検出器の重大な盲点を明らかにしています:ドメインカモフラージュされたインジェクション攻撃—対象文書の語彙と権威構造を模倣するように生成されたペイロード—が組織的に検出を回避します。標準的な検出器は静的なペイロードを高い割合で検出しますが、カモフラージュされたものに対しては失敗します。
主な発見
- Llama 3.1 8Bの検出率:93.8%(静的)から9.7%(カモフラージュ)に低下。
- Gemini 2.0 Flashの検出率:100%から55.6%に低下。
- プロダクションセーフティ分類器であるLlama Guard 3は、カモフラージュされたペイロードをゼロ検出(IDR = 0.000)。
- カモフラージュ検出ギャップ(CDG)は、45タスクと3ドメインにわたって統計的に有意(Llama:χ² = 38.03、p < 0.001;Gemini:χ² = 17.05、p < 0.001)。
マルチエージェントディベートが攻撃を増幅
マルチエージェントディベートアーキテクチャは、小規模モデルで静的インジェクション攻撃を最大9.9倍増幅します。より強力なモデルは集団的な耐性を示します。ターゲットを絞った検出器の拡張はギャップを部分的にしか改善しません:Llamaで10.2%、Geminiで78.7%の改善—脆弱性は弱いモデルではアーキテクチャ上のものであることを示しています。
フレームワークが公開
著者らは、フレームワーク、タスクバンク、ペイロードジェネレーターを公開しています。盲点は数ショット検出器だけでなく、専用のセーフティ分類器にも及び、現在のアプローチの根本的な弱点を示唆しています。
📖 全文ソースを読む: HN LLM Tools
👀 See Also

ClaudeコードプラグインのバグがCPU使用率の急上昇とバッテリー消耗を引き起こす
ユーザーが発見したところによると、Claude CodeのTelegramプラグインは、ラップトップの蓋が閉じている状態でも100%CPUで動作する複数のbun.exeプロセスを生成し、急速なバッテリー消耗を引き起こすことが判明しました。これらのプロセスはスリープ/復帰サイクルを生き延び、削除には特定のクリーンアップ手順が必要です。

llm-hasher: ハイブリッドLLMワークフローのためのローカルPII検出とトークン化
llm-hasherは、OpenAIやClaudeなどの外部LLMにデータが送信される前に、Ollamaを使用して個人を特定できる情報をローカルで検出し、PIIをトークン化して処理後に元の値を復元するツールです。構造化データ型には正規表現を、文脈に基づく検出にはローカルLLMを使用し、マッピングは暗号化されたストレージに保存されます。

エージェントパスポート:AIエージェントの本人確認
Agent Passportは、AIエージェントのなりすまし問題に対処するため、Ed25519認証とJWTトークンを利用したオープンソースのアイデンティティ検証レイヤーです。

FastAPI Guardを使用して、OpenClawインスタンスを攻撃から保護します。
FastAPI Guardは、IPフィルタリング、地域ブロック、レート制限、侵入検知を含む17のセキュリティチェックを追加するミドルウェアを提供します。このツールは、OpenClawセキュリティ監査で文書化された512の脆弱性と40,000以上の公開インスタンスを示す攻撃をブロックします。