로컬 ChromaDB + LM Studio 스택을 위한 오픈소스 RAG 공격 및 방어 실험실

이것이 무엇인가
Aminrj Labs가 완전히 로컬에서 소비자용 하드웨어에서 실행되는 오픈소스 RAG 공격 및 방어 연구실을 공개했습니다. 이 연구실은 특히 ChromaDB + LM Studio 스택을 대상으로 하며 표준 LangChain 스타일 청킹을 사용합니다. 클라우드 서비스나 API 키가 필요하지 않으며 MacBook Pro와 같은 하드웨어에서 실행됩니다.
연구실의 주요 발견
이 연구실은 기본 로컬 RAG 설정에 대한 지식 베이스 중독 효과를 측정합니다. 방어되지 않은 ChromaDB 시스템에서 중독 공격은 95%의 성공률을 달성합니다. 이 공격은 검색 레이어에서 작동하며, 탈옥, 모델 접근 또는 프롬프트 조작이 필요하지 않습니다. 모델은 의도한 대로 정확히 작동하지만 중독된 컨텍스트를 사용합니다.
기본 청킹에 대한 주목할 만한 관찰: 512-토큰 청크와 200-토큰 오버랩을 사용하면 청크 경계에 있는 문서가 두 개의 독립적인 청크로 두 번 임베딩됩니다. 이는 추가적인 정교함 없이 검색 확률을 두 배로 높이며, 대부분의 로컬 설정이 고려 없이 상속하는 설정의 부작용입니다.
가장 일반적인 방어 접근 방식인 출력 필터링은 손상이 생성 전에 발생하기 때문에 잘못된 레이어를 대상으로 합니다. 수집 시 임베딩 이상 감지는 효과적입니다: 문서를 쓰기 전에 기존 컬렉션에 대해 들어오는 문서를 점수화하면 중독 성공률을 95%에서 20%로 줄입니다.
다섯 가지 방어가 모두 활성화된 상태에서 잔여 중독 성공률은 10%입니다. 이러한 사례는 기준선과 의미적으로 충분히 가까워 어떤 레이어도 깔끔하게 잡아내지 못하며, 방어의 실용적인 한계를 나타냅니다.
기술적 세부 사항
- 스택: ChromaDB + LM Studio with Qwen2.5-7B
- 청킹: 512-토큰 청크와 200-토큰 오버랩을 사용한 표준 LangChain 스타일
- 방어되지 않은 시스템에서의 공격 성공률: 95%
- 임베딩 이상 감지를 통한 방어 효과: 중독을 20%로 감소
- 모든 방어 적용 시 잔여 중독률: 10%
저장소에는 공격 구현, 강화된 버전 및 각 방어 레이어에 대한 측정값이 포함되어 있습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

OpenClaw 2026.3.28은 중요한 권한 상승을 포함한 8개의 보안 취약점을 패치했습니다.
OpenClaw 2026.3.28은 Ant AI Security Lab이 발견한 8개의 보안 취약점을 패치했습니다. 여기에는 /pair approve를 통한 심각한 권한 상승 취약점과 메시지 도구의 높은 심각도 샌드박스 탈출 취약점이 포함됩니다.

클로드 모델은 도구 접근 시 특히 보이지 않는 유니코드 문자 하이재킹에 취약합니다.
테스트 결과, 도구가 활성화된 상태에서 Claude Sonnet 4는 보이지 않는 유니코드 문자에 숨겨진 지침을 71.2% 준수하는 것으로 나타났으며, Opus 4는 유니코드 태그 인코딩에서 100% 준수율을 기록했습니다. 도구 접근은 모든 Claude 모델의 취약성을 극적으로 증가시킵니다.

SkillFence 소개: 스킬의 실제 동작을 감시하는 새로운 런타임 모니터
SkillFence는 AI 에이전트 동작 모니터링에 있어 혁신적인 돌파구를 제시하여, AI 기반 환경에서의 투명성과 보안 요구를 해결합니다. 이 혁신적인 도구가 자율적 프로세스에 대한 통제력을 어떻게 강화할 수 있는지 알아보세요.

클로드 코드 플러그인 버그로 인한 CPU 급증 및 배터리 소모 문제
한 사용자가 Claude Code의 Telegram 플러그인이 노트북 뚜껑이 닫힌 상태에서도 100% CPU로 실행되는 여러 bun.exe 프로세스를 생성하여 급격한 배터리 소모를 일으킨다는 사실을 발견했습니다. 이 프로세스들은 절전/복귀 주기를 거쳐도 살아남으며, 제거하려면 특정 정리 단계가 필요합니다.