LLMエージェントにおけるツール権限注入:ツール出力がシステム意図を上書きする場合

研究者がローカルLLMエージェントラボを構築し、「ツール権限インジェクション」を実証しました。これは、AIエージェントにおいてツールの出力がシステムの意図を上書きするシナリオです。
ソースからの主要な詳細
ラボシリーズの第3部で、研究者はAIエージェントが信頼されたツールの出力をポリシーレベルの権限に昇格させ、静かに動作を変更する、焦点を絞ったツール汚染の形態を探求しています。この失敗は、サンドボックスやファイルアクセスレベルではなく、推論レイヤーで発生します。両者はそのまま安全に保たれています。
この実証は、ツールの出力がLLMエージェントにおいてポリシーとなり、エージェントの動作が明らかな侵害の兆候なしに変化する脆弱性を生み出す方法を示しています。この種の攻撃は、従来のセキュリティ侵害ではなく、推論レイヤーで発生します。
技術的コンテキスト
AIエージェントを扱う開発者にとって、この実証は微妙だが重要なセキュリティ上の考慮事項を強調しています:サンドボックス化やファイルアクセス制御が適切に実装されている場合でも、ツールが統合される推論レイヤーは操作に対して脆弱なままである可能性があります。エージェントは制約内で動作を続けますが、汚染されたツールの出力に基づいて異なる決定を行います。
完全な技術的な記事では、ラボの設定、攻撃ベクトル、およびAIエージェントセキュリティへの影響に関する具体的な詳細が提供されています。
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also

Anthropicが、中国の研究所による産業規模のClaude AIデータ抽出を明らかにする。
Anthropicは、Claudeから16万件以上のやり取りをスクレイピングし、軍事・監視システム向けに安全性ガードレールと論理構造を抽出するために、中国のAI研究所が24,000以上の不正アカウントを使用したことを確認しました。

AISI評価により、Claude MythosプレビューのCTFおよび多段階攻撃におけるサイバー能力が示される
AIセキュリティ研究所はAnthropicのClaude Mythos Previewを評価し、専門家レベルのキャプチャー・ザ・フラッグ課題の73%を成功裏に完了し、32段階の企業ネットワーク攻撃シミュレーションを10回中3回で解決したことを確認しました。

ClaudeコードプラグインのバグがCPU使用率の急上昇とバッテリー消耗を引き起こす
ユーザーが発見したところによると、Claude CodeのTelegramプラグインは、ラップトップの蓋が閉じている状態でも100%CPUで動作する複数のbun.exeプロセスを生成し、急速なバッテリー消耗を引き起こすことが判明しました。これらのプロセスはスリープ/復帰サイクルを生き延び、削除には特定のクリーンアップ手順が必要です。

スキルアナライザーがClawHubで利用可能になり、ワンコマンドインストールで導入できます。
OpenClaw Skill Analyzerセキュリティスキャナーが、ClawHubでワンコマンドインストール可能になりました。このツールは、プロンプトインジェクションや資格情報窃取などの悪意のあるパターンをスキルフォルダからスキャンし、安全な実行のためのDockerサンドボックスサポートも含まれています。