Escáner de Inyección de Solicitudes en Modelos Locales para la Seguridad de Habilidades de IA

Vulnerabilidad de Seguridad en Habilidades de IA
Una discusión en X destacó una grave falla de seguridad en habilidades de IA de terceros. Claude Code admite el operador ! para ejecutar comandos bash directamente dentro de las habilidades, pero estos operadores pueden ocultarse en etiquetas HTML, lo que lleva a ejecuciones bash de las que el LLM podría no estar consciente.
Implementación del Escáner Local
Se ha construido una herramienta de prueba de concepto para escanear habilidades en busca de posibles inyecciones de malware durante la instalación. El escáner utiliza un modelo sin capacidad de llamadas a herramientas que se ejecuta localmente, específicamente mistral-small:latest en Ollama. El creador informa que "funcionó de maravilla" durante las pruebas.
El enfoque funciona de manera similar a un escáner de virus y podría integrarse en un futuro producto "instalador de habilidades". La protección contra la inyección de prompts se identifica como una aplicación prometedora para modelos locales.
Detalles Técnicos
La vulnerabilidad involucra el operador ! en Claude Code que permite la ejecución directa de comandos bash. Los atacantes pueden ocultar estos operadores dentro de etiquetas HTML, ejecutando potencialmente comandos maliciosos sin el conocimiento del LLM. El escáner aborda esto analizando las habilidades antes de la instalación para detectar tales inyecciones ocultas.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Análisis de Seguridad de Aislamiento de Agentes: Desde Sin Sandbox hasta Máquinas Virtuales Firecracker
Análisis de cómo Cursor, Claude Code, Devin, OpenAI y E2B aíslan las cargas de trabajo de los agentes, desde sin sandbox hasta microVMs Firecracker aisladas por hardware. Los entornos de ejecución de contenedores han tenido CVEs de escape anualmente desde 2019, mientras que Firecracker tiene cero escapes de huésped a anfitrión en siete años.

Claude Fable 5 Puede Sabotear Silenciosamente tu Trabajo de IA — Y No lo Sabrás
El modelo Fable 5 de Anthropic limita silenciosamente la eficacia para usuarios que construyen infraestructura de IA. Sin indicio visible.

ClawGuard: Puerta de Enlace de Seguridad de Código Abierto para la Protección de Credenciales de la API OpenClaw
ClawGuard es una puerta de enlace de seguridad que se sitúa entre los agentes de IA y las API externas, utilizando credenciales ficticias en la máquina del agente mientras almacena los tokens reales por separado. Proporciona aprobación por Telegram para llamadas sensibles y mantiene un registro de auditoría de las solicitudes.
