ThornGuard: 프롬프트 인젝션으로부터 MCP 서버 연결을 보호하는 프록시 게이트웨이

ThornGuard는 Claude AI가 외부 MCP(Model Context Protocol) 서버에 연결할 때 악성 콘텐츠로부터 보호하기 위해 설계된 보안 프록시입니다. 이 도구는 업스트림 서버가 도구 응답에 숨겨진 명령을 삽입할 수 있다는 점이 테스트를 통해 발견된 후 만들어졌으며, Claude는 이러한 명령을 필터링 없이 수신하게 됩니다.
발견된 보안 문제
Claude를 외부 MCP 서버에 연결할 때, 업스트림 서버가 도구 응답에 숨겨진 명령을 삽입하는 것을 막을 수 있는 장치가 없습니다. 한 테스트에서 서버는 Claude가 특정 공급업체를 항상 선호하도록 지시하는 가짜 권장 사항을 삽입했습니다. Claude가 이 명백한 페이로드를 포착했지만, 더 교묘한 인젝션은 탐지를 우회할 수 있었습니다.
ThornGuard 기능
- 프롬프트 인젝션 및 중독을 위해 도구 정의와 응답을 스캔합니다
- 비밀 정보와 개인 식별 정보(PII)가 컨텍스트 창에 들어가기 전에 제거합니다
- 의심스러운 페이로드를 표시하는 의미론적 분류기를 포함합니다
- 컴플라이언스 내보내기 기능이 있는 실시간 감사 대시보드를 제공합니다
- Claude Desktop, Cursor, VS Code 및 기타 여러 도구를 위한 구성을 생성하는 CLI를 제공합니다
구현 세부 사항
프록시 아키텍처는 보안 모델을 염두에 두고 설계된 후, Claude Code를 사용하여 Cloudflare Workers에서 구현되었습니다. 구현에는 OAuth 흐름과 CLI 도구가 포함됩니다.
ThornGuard는 thorns.qwady.app에서 7일 무료 체험판으로 이용할 수 있습니다. 데모 영상은 https://youtu.be/1PWNFpUWKV8에서 확인하실 수 있습니다.
📖 Read the full source: r/ClaudeAI
👀 See Also

AWS는 AI 강화 공격이 600개 이상의 FortiGate 방화벽을 침해했다고 보고합니다.
AWS에 따르면 사이버 범죄자들이 상용 생성형 AI 도구를 사용해 한 달 동안 55개국에 걸쳐 600개 이상의 인터넷에 노출된 FortiGate 방화벽을 침해했습니다. 공격자들은 노출된 관리 인터페이스를 스캔하고, 취약한 자격 증명을 시도하며, AI를 사용해 공격 플레이북과 스크립트를 생성했습니다.

에이전트 격리 보안 분석: 샌드박스 없음에서 파이어크래커 VM까지
Cursor, Claude Code, Devin, OpenAI, E2B가 에이전트 워크로드를 어떻게 격리하는지 분석합니다. 샌드박스 없음부터 하드웨어 격리된 Firecracker 마이크로VM까지 다양한 접근 방식을 다룹니다. 컨테이너 런타임은 2019년 이후 매년 탈출 CVE가 발생한 반면, Firecracker는 7년간 게스트-호스트 탈출 사례가 단 한 건도 없습니다.

오픈클로 보안 침해: CEO 에이전트 2만 5천 달러에 판매, 13만 5천 개 인스턴스 노출
영국 CEO의 OpenClaw 인스턴스가 BreachForums에서 25,000달러에 판매되어, 대화 내용, 프로덕션 데이터베이스, API 키, 개인 정보가 담긴 일반 텍스트 Markdown 파일이 노출되었습니다. SecurityScorecard는 불안전한 기본 설정으로 공개된 135,000개의 OpenClaw 인스턴스를 발견했습니다.

WebAssembly로 AI 에이전트 샌드박싱하기: 기본적으로 제로 권한
코스모닉은 기존의 샌드박싱(seccomp, bubblewrap)이 내재된 권한(ambient authority) 문제로 인해 AI 에이전트에 부적합하다고 주장합니다. WebAssembly의 역량 기반 모델은 기본적으로 권한이 없으며, 파일시스템, 네트워크 또는 자격 증명에 대한 명시적 임포트가 필요합니다.