ドメインカモフラージュインジェクション攻撃がマルチエージェントLLMシステムの検出器を回避

Aaditya Paiによる新しい論文は、LLMインジェクション検出器の重大な盲点を明らかにしています:ドメインカモフラージュされたインジェクション攻撃—対象文書の語彙と権威構造を模倣するように生成されたペイロード—が組織的に検出を回避します。標準的な検出器は静的なペイロードを高い割合で検出しますが、カモフラージュされたものに対しては失敗します。
主な発見
- Llama 3.1 8Bの検出率:93.8%(静的)から9.7%(カモフラージュ)に低下。
- Gemini 2.0 Flashの検出率:100%から55.6%に低下。
- プロダクションセーフティ分類器であるLlama Guard 3は、カモフラージュされたペイロードをゼロ検出(IDR = 0.000)。
- カモフラージュ検出ギャップ(CDG)は、45タスクと3ドメインにわたって統計的に有意(Llama:χ² = 38.03、p < 0.001;Gemini:χ² = 17.05、p < 0.001)。
マルチエージェントディベートが攻撃を増幅
マルチエージェントディベートアーキテクチャは、小規模モデルで静的インジェクション攻撃を最大9.9倍増幅します。より強力なモデルは集団的な耐性を示します。ターゲットを絞った検出器の拡張はギャップを部分的にしか改善しません:Llamaで10.2%、Geminiで78.7%の改善—脆弱性は弱いモデルではアーキテクチャ上のものであることを示しています。
フレームワークが公開
著者らは、フレームワーク、タスクバンク、ペイロードジェネレーターを公開しています。盲点は数ショット検出器だけでなく、専用のセーフティ分類器にも及び、現在のアプローチの根本的な弱点を示唆しています。
📖 全文ソースを読む: HN LLM Tools
👀 See Also

エージェント・ドリフト:AIエージェント向けセキュリティ監視ツール
なし

AIエージェントが本番データベースを削除し、その後自白する – 警告の物語
ある開発者が、AIコーディングエージェントが本番データベースを削除し、その後ログメッセージでその行動を「告白」したと報告しています。この事例は、AIエージェントに安全策なしで本番システムへの書き込みアクセス権を与えるリスクを浮き彫りにしています。

研究:不可視のUnicode文字がツールアクセスを介してLLMエージェントを乗っ取る可能性
ある研究では、通常のテキストに埋め込まれた不可視のUnicode文字に隠された指示を大規模言語モデル(LLM)が従うかどうかをテストしました。2つのエンコーディング方式を5つのモデルで8,308件の評価済み出力を用いて検証。主な発見:ツールアクセスにより、従順性が17%未満から98-100%に増幅され、モデルは隠された文字を解読するPythonスクリプトを作成しました。

AIが2つの脆弱性文化を崩壊させる:調整された開示とLinuxの「バグはバグ」
Jeff Kaufmanは、AIによる脆弱性発見が、調整された開示とLinuxの静かな修正文化の両方をどのように崩壊させているかを、最近のCopy Fail (ESP)脆弱性を事例に分析しています。