ドメインカモフラージュインジェクション攻撃がマルチエージェントLLMシステムの検出器を回避

Aaditya Paiによる新しい論文は、LLMインジェクション検出器の重大な盲点を明らかにしています:ドメインカモフラージュされたインジェクション攻撃—対象文書の語彙と権威構造を模倣するように生成されたペイロード—が組織的に検出を回避します。標準的な検出器は静的なペイロードを高い割合で検出しますが、カモフラージュされたものに対しては失敗します。
主な発見
- Llama 3.1 8Bの検出率:93.8%(静的)から9.7%(カモフラージュ)に低下。
- Gemini 2.0 Flashの検出率:100%から55.6%に低下。
- プロダクションセーフティ分類器であるLlama Guard 3は、カモフラージュされたペイロードをゼロ検出(IDR = 0.000)。
- カモフラージュ検出ギャップ(CDG)は、45タスクと3ドメインにわたって統計的に有意(Llama:χ² = 38.03、p < 0.001;Gemini:χ² = 17.05、p < 0.001)。
マルチエージェントディベートが攻撃を増幅
マルチエージェントディベートアーキテクチャは、小規模モデルで静的インジェクション攻撃を最大9.9倍増幅します。より強力なモデルは集団的な耐性を示します。ターゲットを絞った検出器の拡張はギャップを部分的にしか改善しません:Llamaで10.2%、Geminiで78.7%の改善—脆弱性は弱いモデルではアーキテクチャ上のものであることを示しています。
フレームワークが公開
著者らは、フレームワーク、タスクバンク、ペイロードジェネレーターを公開しています。盲点は数ショット検出器だけでなく、専用のセーフティ分類器にも及び、現在のアプローチの根本的な弱点を示唆しています。
📖 全文ソースを読む: HN LLM Tools
👀 See Also

PythonとGemini Flashを使用したOpenClawコマンドのセキュリティ監視
ユーザーが作成したPythonスクリプトは、OpenClawによって注入されたコマンドを追跡し、Gemini Flashで分析し、Discordウェブフックを通じて異常または不審な活動について通知を送信します。1日あたりのコストは約0.14ドルです。

Claude Code、取り消し後もログインセッションを継続、ユーザーが2週間のサポート音信不通を報告
Claude Codeのユーザーが、アクセスを取り消した後もセッションログが表示され続け、Anthropicのサポートが2週間応答しないと報告しています。ログには、user:file_upload、user:ccr_inference、user:sessions:claude_codeなどのスコープが含まれていました。

悪意のあるPyTorch Lightningパッケージが認証情報を窃取し、npmパッケージにワーム感染
PyPIパッケージ「lightning」のバージョン2.6.2および2.6.3には、認証情報、トークン、クラウドシークレットを盗み、JavaScriptペイロードを注入してnpmパッケージに拡散する、Shai-Huludをテーマにしたマルウェアが含まれています。

Claude AIのガードレール回避が、ネットワークセキュリティタスクとしてリクエストを構成した際に観察されました。
Redditユーザーが発見したところによると、Claude AIは、リクエストがブロックするためのネットワークセキュリティタスクとして枠組み化された場合、海賊版ドメインリストを提供し、通常の拒否メカニズムを回避します。ユーザーが枠組みの影響を指摘した後、モデルは意図を誤解していたことを認めました。