AIエージェントのセキュリティ分析により、信頼モデルの破綻と高い脆弱性率が明らかに

セキュリティアーキテクチャの崩壊
この分析は、AIエージェントの基本的な信頼モデルが破綻していることを示しています。従来のセキュリティアーキテクチャとは異なり、AIエージェントは攻撃と正当な指示を同じコンテキストウィンドウで処理し、構造的な区別がありません。従来のセキュリティを支える制御/データプレーンの分離は、現在のAIエージェント実装には存在しません。
主要な実証的発見
- 間接的インジェクションは、MCPTox、ASB、PINTベンチマークにおいて、最先端モデルに対して36〜98%の攻撃成功率(ASR)を達成
- 能力の高いモデルほど、ツール層攻撃に対してより脆弱
- npm MCPエコシステムスキャン:2,386パッケージを調査し、49%にセキュリティ上の問題を発見
- 攻撃対象領域はエージェントの能力と超線形的に拡大
提案される解決策:エージェント脅威ルール(ATR)
この研究は、AIエージェント脅威に対する最初のオープン検出標準であるエージェント脅威ルール(ATR)を提示しています。実装内容は以下の通り:
- 61の検出ルール
- PINTベンチマークで99.4%の精度
- MITライセンスでオープンソース化
- GitHubで利用可能:https://github.com/Agent-Threat-Rule/agent-threat-rules
完全な論文では、30以上のCVE、7つのベンチマークをカバーし、AIのスケーリングに追従できる防御策のアーキテクチャ要件を提案しています。
📖 Read the full source: r/ClaudeAI
👀 See Also

ClaudeのソースコードがNPMマップファイル経由で流出したと報告されています
@Fried_riceのツイートによると、Claude CodeのソースコードがNPMレジストリ内のマップファイルを通じて流出した模様です。HNの議論は93ポイントと35コメントを獲得しており、このセキュリティインシデントに対する開発者の関心の高さを示しています。

Clawndom: Claudeコードの脆弱なnpmパッケージをブロックするセキュリティフック
開発者が、Claude Code向けのオープンソースフック「Clawndom」を構築しました。これは、インストール前にnpmパッケージをOSV.dev脆弱性データベースと照合し、既知の脆弱なパッケージをブロックしながらエージェントの自律性を維持します。

エージェント分離セキュリティ分析:サンドボックスなしからFirecracker VMまで
Cursor、Claude Code、Devin、OpenAI、E2Bが、サンドボックスなしからハードウェア分離型のFirecrackerマイクロVMまで、どのようにエージェントのワークロードを分離しているかの分析。コンテナランタイムは2019年以降毎年エスケープCVEが報告されている一方、Firecrackerは7年間でゲストからホストへのエスケープがゼロ件。

セキュリティ監査実験が示す:AIエージェントの性能は知識アクセスに依存
ある開発者が、同じNext.jsコードベースに対して3つの異なるAIアプローチでセキュリティ監査を実施しました:Claude Codeの組み込みレビューでは1件の重大、6件の高、13件の中程度の問題を発見。追加コンテキストなしのAIエージェントでは1件の重大、5件の高、14件の中程度。10冊の専門セキュリティ書籍を与えられたAIエージェントでは8件の重大、9件の高、10件の中程度の問題を発見しました。