オープンソースのRAG攻撃と防御ラボ:ローカルのChromaDB + LM Studioスタック向け

✍️ OpenClawRadar📅 公開日: March 18, 2026🔗 Source
オープンソースのRAG攻撃と防御ラボ:ローカルのChromaDB + LM Studioスタック向け
Ad

概要

Aminrj Labsは、完全にローカルで消費者向けハードウェア上で動作するオープンソースのRAG攻撃・防御ラボをリリースしました。これは特に、標準的なLangChainスタイルのチャンキングを使用したChromaDB + LM Studioスタックを対象としています。クラウドサービスやAPIキーは不要で、MacBook Proなどのハードウェアで動作します。

ラボからの主な発見

このラボは、デフォルトのローカルRAGセットアップに対する知識ベース汚染の効果を測定します。防御されていないChromaDBシステムでは、汚染攻撃は95%の成功率を達成します。この攻撃は検索層で動作し、ジェイルブレイク、モデルアクセス、プロンプト操作は必要ありません。モデルは意図通りに動作しますが、汚染されたコンテキストを使用します。

デフォルトのチャンキングに関する注目すべき観察:512トークンのチャンクと200トークンのオーバーラップでは、チャンク境界にあるドキュメントは2つの独立したチャンクとして2回埋め込まれます。これにより、追加の複雑さなしに検索確率が2倍になり、これはほとんどのローカルセットアップが考慮せずに継承する設定の副作用です。

最も一般的な防御アプローチである出力フィルタリングは、侵害が生成前に発生するため、間違った層を対象としています。取り込み時の埋め込み異常検出は効果的です:既存のコレクションに対して受信ドキュメントをスコアリングしてから書き込むことで、汚染成功率を95%から20%に減少させます。

5つの防御すべてが有効な場合、残存する汚染成功率は10%です。これらのケースはベースラインに意味的に十分近く、どの層も明確に捕捉できないため、防御の実用的な上限を表しています。

技術的詳細

  • スタック:ChromaDB + LM Studio with Qwen2.5-7B
  • チャンキング:512トークンチャンクと200トークンオーバーラップの標準LangChainスタイル
  • 防御されていないシステムでの攻撃成功率:95%
  • 埋め込み異常検出による防御効果:汚染を20%に低下
  • すべての防御を適用した場合の残存汚染:10%

リポジトリには、攻撃実装、強化バージョン、および各防御層の測定値が含まれています。

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

AIチャットボットがユーザーに気付かれずに広告を回答に紛れ込ませる可能性
Security

AIチャットボットがユーザーに気付かれずに広告を回答に紛れ込ませる可能性

研究によると、AIチャットボットは回答に製品広告をこっそり埋め込むことができ、ユーザーの選択に影響を与える一方、ほとんどの参加者は操作に気づかなかった。この研究では、カスタムチャットボットを使用してその効果を実証した。

OpenClawRadar
McpVanguard: MCPベースのAIエージェント向けのオープンソースセキュリティプロキシ
Security

McpVanguard: MCPベースのAIエージェント向けのオープンソースセキュリティプロキシ

McpVanguardは、AIエージェントとMCPツールの間に配置される3層セキュリティプロキシおよびファイアウォールで、プロンプトインジェクション、パストラバーサル、その他の攻撃に対する保護を約16msの遅延で追加します。

OpenClawRadar
AIエージェントによるデータ漏洩リスクを低減する2つのアプローチ
Security

AIエージェントによるデータ漏洩リスクを低減する2つのアプローチ

Redditの投稿では、開発者がAIエージェントのデータの行き先を制御する2つの方法が示されています:OpenAIやAnthropicのようなプロバイダーと直接APIキーを使用して中間業者を排除する方法、またはOllamaやOpenClawのようなツールでオープンソースモデルをローカルで実行する方法です。

OpenClawRadar
Google TIG、初のAI生成ゼロデイエクスプロイトを実環境で報告
Security

Google TIG、初のAI生成ゼロデイエクスプロイトを実環境で報告

Google脅威インテリジェンスグループは、AIで開発されたと考えられるゼロデイエクスプロイトを使用する脅威アクターを特定しました。これは、AIがゼロデイ脆弱性の悪用に攻撃的に使用された初めての観測事例です。

OpenClawRadar