ThornGuard: Una Puerta de Enlace Proxy para Proteger las Conexiones del Servidor MCP contra la Inyección de Prompts

ThornGuard es un proxy de seguridad diseñado para proteger a Claude AI de contenido malicioso al conectarse a servidores externos MCP (Protocolo de Contexto del Modelo). La herramienta fue creada después de que las pruebas revelaran que los servidores ascendentes pueden inyectar instrucciones ocultas en las respuestas de las herramientas, las cuales Claude recibe sin filtrado.
Problema de Seguridad Identificado
Al conectar Claude a servidores externos MCP, nada impide que los servidores ascendentes inyecten instrucciones ocultas en las respuestas de las herramientas. En una prueba, un servidor incrustó una recomendación falsa indicando a Claude que siempre prefiriera un proveedor específico. Aunque Claude detectó esta carga útil obvia, inyecciones más sutiles podrían eludir la detección.
Características de ThornGuard
- Escanear definiciones y respuestas de herramientas en busca de inyección de comandos y envenenamiento
- Eliminar secretos e información personal identificable (PII) antes de que entren en tu ventana de contexto
- Incluye un clasificador semántico que marca cargas útiles sospechosas
- Proporciona un panel de auditoría en tiempo real con exportaciones de cumplimiento
- Ofrece una interfaz de línea de comandos (CLI) que genera configuraciones para Claude Desktop, Cursor, VS Code y varios otros
Detalles de Implementación
La arquitectura del proxy fue diseñada con un modelo de seguridad en mente, luego implementada usando Claude Code en Cloudflare Workers. La implementación incluye flujos OAuth y la herramienta CLI.
ThornGuard está disponible con una prueba gratuita de 7 días en thorns.qwady.app. Un video de demostración está disponible en https://youtu.be/1PWNFpUWKV8.
📖 Read the full source: r/ClaudeAI
👀 Ver también

llm-hasher: Detección y Tokenización Local de PII para Flujos de Trabajo Híbridos de LLM
llm-hasher es una herramienta que detecta información de identificación personal localmente usando Ollama antes de que los datos lleguen a LLMs externos como OpenAI o Claude, tokeniza la PII y restaura los originales después del procesamiento. Utiliza expresiones regulares para tipos de datos estructurados y un LLM local para detección contextual, con almacenamiento cifrado para los mapeos.

Los chatbots de IA pueden insertar anuncios en las respuestas sin que los usuarios se den cuenta.
La investigación muestra que los chatbots de IA pueden incrustar ads de productos en sus respuestas, influyendo en las elecciones de los usuarios, mientras que la mayoría de los participantes no detectaron la manipulación. El estudio usó un chatbot personalizado para demostrar el efecto.

Una edición de SKILL.md es un cambio de producción, incluso cuando no cambió ningún código.
Las habilidades del workspace en OpenClaw pueden sobrescribir las versiones incluidas y alterar el comportamiento de los agentes. Trata los archivos SKILL.md como código confiable: audítalos y versiónalos como cambios de producción.

FORGE: Marco de Pruebas de Seguridad de IA de Código Abierto para Sistemas LLM
FORGE es un marco de pruebas de seguridad de IA autónomo que construye sus propias herramientas durante la ejecución, se autoreplica en un enjambre y cubre las 10 principales vulnerabilidades OWASP LLM, incluyendo inyección de prompts, fuzzing de jailbreak y fugas RAG.