GitHubリポジトリには、公開AIチャット向けの16のプロンプトインジェクション手法と防御戦略が文書化されています。

開発者が実験として自社ウェブサイトにカスタムAIチャットを構築したところ、実際のユーザーがそれを破ろうとする試みにより、複数のセキュリティ課題に直面しました。この経験から、GitHubで公開されている包括的なセキュリティガイドの作成につながりました。
直面したセキュリティ課題
ユーザーは以下のような様々な攻撃を試みました:
- プロンプトインジェクション
- ロールプレイ攻撃
- 多言語トリック
- Base64エンコードされたペイロード
実装された防御戦略
開発者は多層防御アプローチを文書化し、以下をカバーしています:
- 入力のサニタイズ
- レート制限
- ゼロトラストシステムプロンプト設計
- 出力制御
- コスト上限
GitHubリポジトリの内容
リポジトリには以下が含まれています:
- 16種類のプロンプトインジェクション手法の詳細解説
- あなたのチャットボットに対して16種類の手法を自動的にテストするClaudeコードスキル
- 防御実装の詳細情報
開発者は、ユーザーが「自分ではテストしようとも思わなかったようなこと」を試みたと述べており、このガイドが同様の公開AIチャットシステムを実装するすべての人にとって役立つことを意図しているとしています。
📖 詳細情報を読む: r/ClaudeAI
👀 See Also

OpenClawのセキュリティリスク:自律的行動と権限に関する懸念
OpenClawはユーザーの確認を待たずに、メール、カレンダー、メッセージング、ファイルに対して自律的に動作し、データ流出、プロンプトインジェクション、停止コマンドの無視などの事例が記録されています。

セキュリティ監査により、AnthropicのMCP参照サーバーに脆弱性が発見され、幻覚ベースの脆弱性が導入される可能性が判明
100のMCPサーバーパッケージに対するセキュリティ監査では、71%がF評価を獲得し、Anthropicの公式GitHubおよびファイルシステムリファレンス実装も含まれていました。監査では、推論ループを通じてセキュリティホールを作り出し、トークンを浪費する「幻覚ベースの脆弱性」が特定されました。

VulnHunter:キャピタル・ワンのエージェンティックAIコードセキュリティツール、オープンソース化
Capital OneがVulnHunterをオープンソース化。攻撃者の視点からエントリポイントをシミュレーションし、発見結果を検証して誤検知を削減し、修正コードを生成するエージェント型AIツール。

OneCLI:AIエージェント向けオープンソース認証情報保管庫
OneCLIは、AIエージェントと外部サービスの間に位置するRustで書かれたオープンソースのゲートウェイで、リクエスト時に実際の認証情報を注入し、エージェントにはプレースホルダーキーのみを表示します。AES-256-GCM暗号化ストレージを提供し、組み込みのPGliteを備えた単一のDockerコンテナで動作し、HTTPS_PROXYを設定できるあらゆるエージェントフレームワークと連携します。