グループチャットアシスタントに対するプロンプトインジェクション対策のセキュアな管理者承認フロー

r/ClaudeAIの投稿「グループチャットアシスタントにおけるプロンプトインジェクション対策:VMとOAuthツール実行を一時停止し管理者承認を求める」は、公開または共有チャンネル(例:Supergreen経由のWhatsAppやグループチャット)に接続されたLLMベースのアシスタント向けの実践的なセキュリティパターンを説明しています。主な問題は、複数のユーザーが同じセッション履歴を共有する場合、参加者がアシスタントにプロンプトインジェクションを仕掛け、危険なツール(クラウドリソースの起動、マッピングされたシークレットを使ったコード実行、OAuthトークンの取得など)を実行させる可能性があることです。
安全な管理者承認フロー
prompt2botで提案されている解決策は、リスクの高いツール実行をインターセプトする安全な管理者承認フローです。
- 管理者以外のユーザーが
create_vm、run_safescript(マッピングされたシークレットを使うカスタムコード実行)、またはOAuthフローをトリガーすると、ツールは実行を一時停止し、「管理者の許可をリクエスト中…」と返します。 - 10分間のTTLを持つ承認リンクが、設定された管理者にWhatsAppまたはメールで自動送信されます。
- 承認されると、バックグラウンドジョブが会話履歴にシステム通知を注入します:
[システム通知:管理者が<toolName>の実行リクエスト(リクエストID:<requestId>)を承認しました] - この思考注入によりエージェントループが起動し、承認された
request_idを使ってツールを再呼び出し、シームレスに続行します。 - ゲストユーザー(メールや電話が設定されていないボット所有者)の場合、承認はバイパスされ、開発者のテストが容易になります。
こんな方におすすめ
共有チャンネルで動作し、信頼できない参加者からのプロンプトインジェクション攻撃に対して強力なツールアクセスを保護する必要がある、高機能なアシスタントを開発する開発者向け。
📖 出典全文: r/ClaudeAI
👀 See Also

デリミタ防御により、Gemma 4のプロンプトインジェクション防御率が6100以上のテストベンチマークで21%から100%に向上
ランダムな区切り文字で信頼できないコンテンツを囲むことで、プロンプトインジェクション防御率が劇的に向上したベンチマーク。Gemma 4 E4B は 21.6% から 100% に。

あなたのOpenClawをカスタマイズ:経済的かつセキュリティを強化
r/openclawサブレディットで議論されているように、OpenClawをカスタマイズしてコストを削減し、セキュリティを強化する方法をご紹介します。

エージェントパスポート:AIエージェントの本人確認
Agent Passportは、AIエージェントのなりすまし問題に対処するため、Ed25519認証とJWTトークンを利用したオープンソースのアイデンティティ検証レイヤーです。

Claude Codeワーム「Hades」、AI設定とPython起動フックで認証情報を窃取
アクティブなClaude Code攻撃(UNC6780)は「Hades」に進化。Python経由で拡散し、AIスキャナーを通過、Claude、Cursor、Copilot、Geminiの設定フックを仕込み秘密情報を盗むワーム。