로컬 ChromaDB + LM Studio 스택을 위한 오픈소스 RAG 공격 및 방어 실험실

이것이 무엇인가
Aminrj Labs가 완전히 로컬에서 소비자용 하드웨어에서 실행되는 오픈소스 RAG 공격 및 방어 연구실을 공개했습니다. 이 연구실은 특히 ChromaDB + LM Studio 스택을 대상으로 하며 표준 LangChain 스타일 청킹을 사용합니다. 클라우드 서비스나 API 키가 필요하지 않으며 MacBook Pro와 같은 하드웨어에서 실행됩니다.
연구실의 주요 발견
이 연구실은 기본 로컬 RAG 설정에 대한 지식 베이스 중독 효과를 측정합니다. 방어되지 않은 ChromaDB 시스템에서 중독 공격은 95%의 성공률을 달성합니다. 이 공격은 검색 레이어에서 작동하며, 탈옥, 모델 접근 또는 프롬프트 조작이 필요하지 않습니다. 모델은 의도한 대로 정확히 작동하지만 중독된 컨텍스트를 사용합니다.
기본 청킹에 대한 주목할 만한 관찰: 512-토큰 청크와 200-토큰 오버랩을 사용하면 청크 경계에 있는 문서가 두 개의 독립적인 청크로 두 번 임베딩됩니다. 이는 추가적인 정교함 없이 검색 확률을 두 배로 높이며, 대부분의 로컬 설정이 고려 없이 상속하는 설정의 부작용입니다.
가장 일반적인 방어 접근 방식인 출력 필터링은 손상이 생성 전에 발생하기 때문에 잘못된 레이어를 대상으로 합니다. 수집 시 임베딩 이상 감지는 효과적입니다: 문서를 쓰기 전에 기존 컬렉션에 대해 들어오는 문서를 점수화하면 중독 성공률을 95%에서 20%로 줄입니다.
다섯 가지 방어가 모두 활성화된 상태에서 잔여 중독 성공률은 10%입니다. 이러한 사례는 기준선과 의미적으로 충분히 가까워 어떤 레이어도 깔끔하게 잡아내지 못하며, 방어의 실용적인 한계를 나타냅니다.
기술적 세부 사항
- 스택: ChromaDB + LM Studio with Qwen2.5-7B
- 청킹: 512-토큰 청크와 200-토큰 오버랩을 사용한 표준 LangChain 스타일
- 방어되지 않은 시스템에서의 공격 성공률: 95%
- 임베딩 이상 감지를 통한 방어 효과: 중독을 20%로 감소
- 모든 방어 적용 시 잔여 중독률: 10%
저장소에는 공격 구현, 강화된 버전 및 각 방어 레이어에 대한 측정값이 포함되어 있습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

ClawVault Security Enhancement Adds Sensitive Data Detection for OpenClaw
A new enhancement to ClawVault adds real-time sensitive data detection and automatic sanitization for OpenClaw API traffic, intercepting plaintext passwords, API keys, and tokens before they reach LLM providers.

Claude Code로 바이브 코딩하기 위한 보안 개념: 인증, 권한 부여 및 시행
10년 경력의 시니어 엔지니어가 호텔 비유를 통해 바이브 코딩 앱의 인증, 권한 부여, 시행 개념을 설명하고, AI 에이전트에 보안 확인을 요청하는 방법을 알려줍니다.

AI 에이전트 권한: 인간, 40k 게임에서 위협 3개 중 1개를 놓친다
40,000회 실행된 브라우저 게임에서 인간은 악성 AI 에이전트 명령의 3분의 1을 놓쳤으며, 자격 증명 유출은 35%의 확률로 놓쳤습니다. 가장 많이 놓친 명령은 64.7%의 확률로 `npm run analyze`였습니다.

클로드 코드 설치 피싱 사이트, 구글 검색 결과 최상위 노출
공식 Claude Code 다운로드 페이지를 사칭한 피싱 사이트가 "Claude code install mac" 검색 결과 첫 번째로 나타납니다. 사용자는 가짜 사이트에서 다운로드하지 않도록 주의해야 합니다.