公開されたエクスプロイトを用いたAIエージェントのレッドチーミングのためのオープンソースプレイグラウンド

概要
Fabraix Playgroundは、敵対的なチャレンジを通じてAIエージェントのレッドチーミングを行うためのオープンソース環境です。元々はガードレールのテスト用に内部ツールとして開発されましたが、脆弱性に対する多様な視点を得るためにオープンソース化されました。
仕組み
各チャレンジでは、以下の特徴を持つライブAIエージェントが展開されます:
- 特定のペルソナ
- 実際のツールセット(ウェブ検索、ブラウジングなど)
- 保護するように指示された対象
- 完全に可視化されたシステムプロンプト
目的はガードレールを突破する方法を見つけることです。誰かが成功すると、その手法(アプローチ、推論、完全な会話記録を含む)が公開されます。
プロジェクト構成
/src— Reactフロントエンド(TypeScript、Vite、Tailwind)/challenges— すべてのチャレンジ設定とシステムプロンプト(バージョン管理され、公開)- ガードレール評価はサーバー側で実行され、クライアント側での改ざんを防止
- エージェントランタイムは別途オープンソース化予定
ローカル開発
ローカルで実行するには:
npm install
npm run devデフォルトではライブAPIに接続します。ローカルバックエンドに対して開発するには:
VITE_API_URL=http://localhost:8000/v1 npm run devチャレンジ例
最初のチャレンジは、エージェントに「絶対に呼び出さないように」指示されたツールを呼び出させることでした。誰かが約60秒で、秘密を直接尋ねることなく成功しました。次のチャレンジは、より強固な防御を持つデータ流出に焦点を当てています。
コミュニティがテスト内容を決定します:誰でもチャレンジ(シナリオ、エージェント、目的)を提案でき、コミュニティが投票し、最多票を獲得したチャレンジがタイマー付きで公開されます。最も速く成功したジェイルブレイクが勝利します。
技術詳細
このプロジェクトはTypeScript(76.5%)、CSS(22.2%)、その他の言語(1.3%)で構築されています。MITライセンスの下で公開されており、手法の議論やアプローチの共有のためのDiscordコミュニティがあります。
📖 Read the full source: HN AI Agents
👀 See Also

サイバーセキュリティに関する質問に対する検閲なしのQwen 3.5 35Bモデルのテスト
サイバーセキュリティの専門家が、ハッキングやセキュリティバイパスに関する質問に対して、3つの検閲なしのQwen 3.5 35Bモデルをテストし、元の検閲済みモデルと比較して応答品質に大きな違いがあることを発見しました。検閲なしモデルは、元のモデルが拒否したり不完全な回答をしたりする場合でも、一貫して回答を提供しました。

潜在的なClaudeセキュリティインシデント:自己送信パスワードアラートと不審な.NETプロセス
ユーザーがClaudeにログイン後、自身のアカウントから送信されたように見える不審なパスワードリセット通知を受け取ったと報告。数分後にメールが消失し、異常な.NETプロセスがシステムシャットダウンを妨げた。

サンドボックス化されたOpenClaw:AIコーディングにおけるセキュリティ強化
OpenClawコミュニティによる、AIコーディングエージェントのセキュリティにおいて重要な技術であるサンドボックスに関する最新の議論をご紹介します。AIイノベーションを保護するためにこれが不可欠であるとユーザーが考える理由を探ります。

サンドボックス化されていないローカルOpenClawインスタンスのセキュリティ警告
Redditの投稿によると、適切な分離なしにバニラOpenClawインスタンスをローカルで実行すると、APIキーの露出、誤ったファイル削除、データ漏洩が発生する可能性があると警告しています。情報源では、bashツールのサンドボックス化または管理サービスの利用を推奨しています。