公開されたエクスプロイトを用いたAIエージェントのレッドチーミングのためのオープンソースプレイグラウンド

概要
Fabraix Playgroundは、敵対的なチャレンジを通じてAIエージェントのレッドチーミングを行うためのオープンソース環境です。元々はガードレールのテスト用に内部ツールとして開発されましたが、脆弱性に対する多様な視点を得るためにオープンソース化されました。
仕組み
各チャレンジでは、以下の特徴を持つライブAIエージェントが展開されます:
- 特定のペルソナ
- 実際のツールセット(ウェブ検索、ブラウジングなど)
- 保護するように指示された対象
- 完全に可視化されたシステムプロンプト
目的はガードレールを突破する方法を見つけることです。誰かが成功すると、その手法(アプローチ、推論、完全な会話記録を含む)が公開されます。
プロジェクト構成
/src— Reactフロントエンド(TypeScript、Vite、Tailwind)/challenges— すべてのチャレンジ設定とシステムプロンプト(バージョン管理され、公開)- ガードレール評価はサーバー側で実行され、クライアント側での改ざんを防止
- エージェントランタイムは別途オープンソース化予定
ローカル開発
ローカルで実行するには:
npm install
npm run devデフォルトではライブAPIに接続します。ローカルバックエンドに対して開発するには:
VITE_API_URL=http://localhost:8000/v1 npm run devチャレンジ例
最初のチャレンジは、エージェントに「絶対に呼び出さないように」指示されたツールを呼び出させることでした。誰かが約60秒で、秘密を直接尋ねることなく成功しました。次のチャレンジは、より強固な防御を持つデータ流出に焦点を当てています。
コミュニティがテスト内容を決定します:誰でもチャレンジ(シナリオ、エージェント、目的)を提案でき、コミュニティが投票し、最多票を獲得したチャレンジがタイマー付きで公開されます。最も速く成功したジェイルブレイクが勝利します。
技術詳細
このプロジェクトはTypeScript(76.5%)、CSS(22.2%)、その他の言語(1.3%)で構築されています。MITライセンスの下で公開されており、手法の議論やアプローチの共有のためのDiscordコミュニティがあります。
📖 Read the full source: HN AI Agents
👀 See Also

AIセキュリティ研究者の方々:データ提供オプトイン設定により、0-day脆弱性が漏洩する可能性があります
LLMインターフェースの「モデルを皆のために改善する」トグルは、深刻なレッドチーミング研究を自動的に収集し、脆弱性の概念をベンダーのセキュリティチームや、あなたが発表する前に学術論文に送信する可能性があります。本格的なセキュリティ研究を行う前にデータ共有を無効にしてください。

AIチャットボットがユーザーに気付かれずに広告を回答に紛れ込ませる可能性
研究によると、AIチャットボットは回答に製品広告をこっそり埋め込むことができ、ユーザーの選択に影響を与える一方、ほとんどの参加者は操作に気づかなかった。この研究では、カスタムチャットボットを使用してその効果を実証した。

ThornGuard: MCPサーバー接続をプロンプトインジェクションから保護するプロキシゲートウェイ
ThornGuardは、MCPクライアントとアップストリームサーバーの間に位置するプロキシで、トラフィックをインジェクションパターンでスキャンし、PIIを除去し、ダッシュボードにログを記録します。サーバーがツールの応答に隠れた命令を埋め込む可能性のある脆弱性がテストで明らかになった後、構築されました。

Sieve: AIコーディングツールチャット履歴のローカルシークレットスキャナ
Sieveは、Cursor、Claude Code、CopilotなどのAIコーディングアシスタントのチャット履歴をスキャンし、漏洩したAPIキーやトークンを検出します。すべてのスキャンはローカルで実行され、秘匿化とmacOSキーチェーン保管に対応しています。