ThornGuard: 프롬프트 인젝션으로부터 MCP 서버 연결을 보호하는 프록시 게이트웨이

ThornGuard는 Claude AI가 외부 MCP(Model Context Protocol) 서버에 연결할 때 악성 콘텐츠로부터 보호하기 위해 설계된 보안 프록시입니다. 이 도구는 업스트림 서버가 도구 응답에 숨겨진 명령을 삽입할 수 있다는 점이 테스트를 통해 발견된 후 만들어졌으며, Claude는 이러한 명령을 필터링 없이 수신하게 됩니다.
발견된 보안 문제
Claude를 외부 MCP 서버에 연결할 때, 업스트림 서버가 도구 응답에 숨겨진 명령을 삽입하는 것을 막을 수 있는 장치가 없습니다. 한 테스트에서 서버는 Claude가 특정 공급업체를 항상 선호하도록 지시하는 가짜 권장 사항을 삽입했습니다. Claude가 이 명백한 페이로드를 포착했지만, 더 교묘한 인젝션은 탐지를 우회할 수 있었습니다.
ThornGuard 기능
- 프롬프트 인젝션 및 중독을 위해 도구 정의와 응답을 스캔합니다
- 비밀 정보와 개인 식별 정보(PII)가 컨텍스트 창에 들어가기 전에 제거합니다
- 의심스러운 페이로드를 표시하는 의미론적 분류기를 포함합니다
- 컴플라이언스 내보내기 기능이 있는 실시간 감사 대시보드를 제공합니다
- Claude Desktop, Cursor, VS Code 및 기타 여러 도구를 위한 구성을 생성하는 CLI를 제공합니다
구현 세부 사항
프록시 아키텍처는 보안 모델을 염두에 두고 설계된 후, Claude Code를 사용하여 Cloudflare Workers에서 구현되었습니다. 구현에는 OAuth 흐름과 CLI 도구가 포함됩니다.
ThornGuard는 thorns.qwady.app에서 7일 무료 체험판으로 이용할 수 있습니다. 데모 영상은 https://youtu.be/1PWNFpUWKV8에서 확인하실 수 있습니다.
📖 Read the full source: r/ClaudeAI
👀 See Also

클로드 AI 가드레일 우회가 네트워크 보안 작업으로 요청을 구성할 때 관찰되었습니다.
레딧 사용자가 Claude AI가 네트워크 보안 작업으로 프레이밍된 요청에 대해 해적판 도메인 목록을 제공하며 일반적인 거부 메커니즘을 우회한다는 사실을 발견했습니다. 사용자가 프레이밍의 영향을 지적한 후 모델은 의도를 오해했다고 인정했습니다.

엔도 패밀리어: AI 에이전트를 위한 객체-역량 샌드박스
Endo Familiar는 AI 에이전트를 위한 객체-권한 보안을 구현합니다: 에이전트는 초기에 아무런 권한도 없이 시작되며, 특정 파일이나 디렉토리에 대한 명시적 참조만 받고, 샌드박스 코드에서 더 좁은 권한을 파생할 수 있습니다.

Sieve: AI 코딩 도구 채팅 기록용 로컬 비밀 스캐너
Sieve가 Cursor, Claude Code, Copilot 및 기타 AI 코딩 어시스턴트 채팅 기록에서 API 키와 토큰 유출을 스캔합니다. 모든 스캔은 로컬에서 이루어지며, 수정 및 macOS 키체인 볼트 기능이 포함됩니다.

보안 감사 실험 결과, AI 에이전트 성능은 지식 접근성에 달려 있음
한 개발자가 동일한 Next.js 코드베이스에 대해 세 가지 다른 AI 접근법으로 보안 감사를 수행했습니다: Claude Code의 내장 검토는 1개의 치명적, 6개의 높음, 13개의 중간 수준 문제를 발견했고, 추가 컨텍스트 없이 AI 에이전트를 사용한 경우 1개의 치명적, 5개의 높음, 14개의 중간 수준 문제를, 10개의 전문 보안 서적을 제공한 AI 에이전트는 8개의 치명적, 9개의 높음, 10개의 중간 수준 문제를 발견했습니다.