オープンソースのRAG攻撃と防御ラボ:ローカルのChromaDB + LM Studioスタック向け

概要
Aminrj Labsは、完全にローカルで消費者向けハードウェア上で動作するオープンソースのRAG攻撃・防御ラボをリリースしました。これは特に、標準的なLangChainスタイルのチャンキングを使用したChromaDB + LM Studioスタックを対象としています。クラウドサービスやAPIキーは不要で、MacBook Proなどのハードウェアで動作します。
ラボからの主な発見
このラボは、デフォルトのローカルRAGセットアップに対する知識ベース汚染の効果を測定します。防御されていないChromaDBシステムでは、汚染攻撃は95%の成功率を達成します。この攻撃は検索層で動作し、ジェイルブレイク、モデルアクセス、プロンプト操作は必要ありません。モデルは意図通りに動作しますが、汚染されたコンテキストを使用します。
デフォルトのチャンキングに関する注目すべき観察:512トークンのチャンクと200トークンのオーバーラップでは、チャンク境界にあるドキュメントは2つの独立したチャンクとして2回埋め込まれます。これにより、追加の複雑さなしに検索確率が2倍になり、これはほとんどのローカルセットアップが考慮せずに継承する設定の副作用です。
最も一般的な防御アプローチである出力フィルタリングは、侵害が生成前に発生するため、間違った層を対象としています。取り込み時の埋め込み異常検出は効果的です:既存のコレクションに対して受信ドキュメントをスコアリングしてから書き込むことで、汚染成功率を95%から20%に減少させます。
5つの防御すべてが有効な場合、残存する汚染成功率は10%です。これらのケースはベースラインに意味的に十分近く、どの層も明確に捕捉できないため、防御の実用的な上限を表しています。
技術的詳細
- スタック:ChromaDB + LM Studio with Qwen2.5-7B
- チャンキング:512トークンチャンクと200トークンオーバーラップの標準LangChainスタイル
- 防御されていないシステムでの攻撃成功率:95%
- 埋め込み異常検出による防御効果:汚染を20%に低下
- すべての防御を適用した場合の残存汚染:10%
リポジトリには、攻撃実装、強化バージョン、および各防御層の測定値が含まれています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

AI脆弱性発見がパッチ展開時間を上回るペースで進行
セキュリティ専門家は、MythosのようなAIツールが脆弱性を修正の展開よりも速く発見すると主張し、Log4jのデータから平均修復時間が17日、完全排除には10年かかるとの見通しを示している。

AIエージェント権限:人間は4万ゲームで3つに1つの脅威を見逃す
40,000回の実行を伴うブラウザゲームで、人間は悪意のあるAIエージェントのコマンドの3分の1を見逃し、資格情報の流出は35%の確率で見逃されました。最も見逃されたコマンドは`npm run analyze`で、64.7%でした。

Google検索で公開されているセキュリティ対策されていないペーパークリップインスタンスによるライブダッシュボードの露出
Redditユーザーがエラーを検索中に、完全な組織データがGoogleにインデックスされたライブのPaperclipダッシュボードを発見しました。このインスタンスは認証なしで公開されており、組織図、エージェントの会話、タスク割り当て、事業計画が明らかになりました。

ヴィタリック・ブテリンの安全なローカルLLM構築へのアプローチ
ヴィタリック・ブテリンは、ローカル推論、サンドボックス化、データ漏洩やジェイルブレイクなどのプライバシーリスクの軽減に焦点を当てた、自己主権型LLMセットアップについて概説しています。