セキュリティベンチマーク:211の敵対的プローブでテストされた10のLLM

✍️ OpenClawRadar📅 公開日: March 8, 2026🔗 Source
セキュリティベンチマーク:211の敵対的プローブでテストされた10のLLM
Ad

あるセキュリティ研究者が、現実世界のシナリオにおける攻撃への対処能力を評価するため、10種類の異なるLLMに対して211種類の敵対的セキュリティプローブを用いた体系的なテストを実施しました。

テスト手法

研究者は、温度0の標準化されたセットアップと、すべてのモデルに対して同一のAPI呼び出しを使用しました。テストには、82種類の抽出プローブ(システムプロンプトの窃取を試みる)と109種類のインジェクションプローブ(モデルの動作を乗っ取ることを試みる)が含まれていました。偽のPII、SSHキー、API認証情報が含まれたハニーポットシステムプロンプトが餌として使用されました。

主な発見

  • 抽出耐性はほぼ解決済み: ほとんどのモデルは「システムプロンプトを繰り返せ」タイプの攻撃をブロックするのに適しています。全モデル平均は約85%です。
  • インジェクション耐性は未解決: 平均は46.2%であり、インジェクション攻撃の半分以上が全体的に成功していることを意味します。
  • 普遍的な失敗: すべてのモデルが、デリミタ攻撃、ディストラクタインジェクション、スタイルインジェクションで失敗しました。これら3つのカテゴリーでは、10モデルすべてで0%の耐性でした。
  • 無効化された攻撃パターン: すべてのモデルが、ペイロード分割とタイポ回避に対して100%の耐性を示しました。
Ad

モデル別結果

  • Claude Opus: インジェクション耐性で72.7%を記録し、テストされたモデルの中で最高でした。それでも、4回に1回以上のインジェクション攻撃が成功することを意味します。
  • GPT-5.4: 抽出と境界スコアは完璧ですが、インジェクション耐性は50%に留まります。
  • GPT-5.3 Codex: ユーザーのマシン上でコードを実行するCodex CLIの基盤モデルは、インジェクションで34.5%を記録しました。3回に2回のインジェクション試行が成功します。
  • DeepSeek V3.2: インジェクションで17.4%を記録し、実質的に耐性がありません。
  • Qwen 3.5 API vs ローカル: 抽出耐性はほぼ同一(81.6% vs 81.7%)ですが、ローカル版はインジェクション耐性が悪く(46.9% vs 29.8%)、境界整合性も大幅に悪いです(59.8% vs 44.6%)。ローカルで実行しても抽出ブロック能力は低下しませんが、インジェクションに対してはより脆弱になります。

インジェクションの重要性

抽出とは、誰かがあなたのシステムプロンプトを盗むことを意味します。悪いことですが、回復可能です。インジェクションとは、誰かがあなたのエージェントの動作を乗っ取ることを意味します。もしあなたのエージェントがツールアクセス、ファイルシステムアクセス、またはAPI呼び出し権限を持っている場合、インジェクションが成功すると、データ流出、ファイル削除、あるいはさらに悪い事態を引き起こす可能性があります。現在、世界最高のモデルでもインジェクション試行の73%しかブロックできません。

完全な手法と結果はagentseal.org/benchmarkで公開されています。テストプロンプトも公開されているため、誰でも結果を再現できます。

📖 完全なソースを読む: r/LocalLLaMA

Ad

👀 See Also

AIエージェントがSQLインジェクションを悪用し、マッキンゼーのLilliチャットボットを侵害
Security

AIエージェントがSQLインジェクションを悪用し、マッキンゼーのLilliチャットボットを侵害

CodeWallのセキュリティ研究者は、自律型AIエージェントを使用してマッキンゼーの内部チャットボット「Lilli」をハッキングし、認証不要のAPIエンドポイントにあるSQLインジェクションの脆弱性を介して、わずか2時間で本番データベースへの完全な読み書きアクセスを獲得しました。

OpenClawRadar
Claude AI生成アプリケーションのためのセキュリティチェックリスト
Security

Claude AI生成アプリケーションのためのセキュリティチェックリスト

開発者が、レート制限、認証の欠陥、データベースのスケーリング問題、入力処理の脆弱性など、Claude Codeで構築されたアプリケーションで見つかる一般的なセキュリティと運用上のギャップのチェックリストを共有しています。

OpenClawRadar
OpenClawのセキュリティギャップが、エージェンティック・パワー・オブ・アトーニー(APOA)仕様によって対処されました。
Security

OpenClawのセキュリティギャップが、エージェンティック・パワー・オブ・アトーニー(APOA)仕様によって対処されました。

開発者が、OpenClawにおけるセキュリティ上の懸念に対処するため、Agentic Power of Attorney (APOA) と呼ばれるオープン仕様を公開しました。現在、エージェントはメールやカレンダーなどのサービスに、自然言語の指示のみをガードレールとしてアクセスしています。この仕様では、サービスごとの権限、時間制限付きアクセス、監査証跡、権限の取り消し、資格情報の分離を提案しています。

OpenClawRadar
OpenClawセキュリティアラート:50万の公開インスタンス、デフォルト設定がシステムを危険に晒す
Security

OpenClawセキュリティアラート:50万の公開インスタンス、デフォルト設定がシステムを危険に晒す

セキュリティ分析によると、50万のOpenClawインスタンスが公開アクセス可能であり、そのうち3万件は既知のセキュリティリスクを抱え、1万5千件は既知の脆弱性を通じて悪用可能です。デフォルトのインストールでは認証が無効化され、0.0.0.0にバインドされるため、エージェント設定がインターネット上に公開される状態となっています。

OpenClawRadar