Ataques de Inyección Camuflados en el Dominio Eluden Detectores en Sistemas LLM Multiagente

✍️ OpenClawRadar📅 Publicado: 23 de mayo de 2026🔗 Source
Ataques de Inyección Camuflados en el Dominio Eluden Detectores en Sistemas LLM Multiagente
Ad

Un nuevo artículo de Aaditya Pai identifica un punto ciego crítico en los detectores de inyección de LLM: los ataques de inyección camuflados por dominio —payloads generados para imitar el vocabulario y las estructuras de autoridad del documento objetivo— evaden sistemáticamente la detección. Los detectores estándar señalan payloads estáticos con altas tasas, pero fallan contra los camuflados.

Hallazgos clave

  • Tasa de detección en Llama 3.1 8B: cayó del 93,8% (estático) al 9,7% (camuflado).
  • Tasa de detección en Gemini 2.0 Flash: cayó del 100% al 55,6%.
  • Llama Guard 3, un clasificador de seguridad de producción, detectó cero payloads camuflados (IDR = 0.000).
  • La Brecha de Detección de Camuflaje (CDG) es estadísticamente significativa en 45 tareas y tres dominios (Llama: χ² = 38.03, p < 0.001; Gemini: χ² = 17.05, p < 0.001).
Ad

El debate multiagente amplifica los ataques

Las arquitecturas de debate multiagente amplifican los ataques de inyección estática hasta 9,9x en modelos más pequeños. Los modelos más fuertes muestran resistencia colectiva. La mejora del detector dirigida solo remedia parcialmente la brecha: mejora del 10,2% en Llama, 78,7% en Gemini, lo que indica que la vulnerabilidad es arquitectónica para modelos más débiles.

Framework publicado

Los autores publican su framework, banco de tareas y generador de payloads públicamente. El punto ciego se extiende más allá de los detectores de pocos ejemplos a los clasificadores de seguridad dedicados, lo que sugiere debilidades fundamentales en el enfoque actual.

📖 Lee la fuente completa: HN LLM Tools

Ad

👀 Ver también

El Enfoque de Vitalik Buterin para la Configuración Segura de LLM Locales
Seguridad

El Enfoque de Vitalik Buterin para la Configuración Segura de LLM Locales

Vitalik Buterin describe su configuración de LLM autosoberana centrada en inferencia local, aislamiento y mitigación de riesgos de privacidad como fugas de datos y jailbreaks.

OpenClawRadar
OpenClaw Fortalecimiento de Seguridad: Protección Multicapa Contra Riesgos de Agentes Autónomos
Seguridad

OpenClaw Fortalecimiento de Seguridad: Protección Multicapa Contra Riesgos de Agentes Autónomos

Un desarrollador modificó la base de código de OpenClaw para agregar una pila de seguridad de múltiples capas que incluye un guardia de regex de denegación estricta, un desofuscador recursivo, un perfil de AppArmor e integración de auditoría para evitar comandos destructivos y exfiltración de datos por parte de agentes autónomos.

OpenClawRadar
SupraWall MCP Plugin Bloquea Ataques de Inyección de Comandos en Agentes de IA Locales
Seguridad

SupraWall MCP Plugin Bloquea Ataques de Inyección de Comandos en Agentes de IA Locales

SupraWall es un complemento MCP que intercepta y bloquea intentos de exfiltración de datos sensibles de agentes de IA, demostrado en un desafío de equipo rojo donde evitó filtraciones de credenciales mediante ataques de inyección de prompts.

OpenClawRadar
Investigadores de Seguridad en IA: Tus Vulnerabilidades de Día Cero Podrían Filtrarse a través de la Opción de Inclusión de Datos
Seguridad

Investigadores de Seguridad en IA: Tus Vulnerabilidades de Día Cero Podrían Filtrarse a través de la Opción de Inclusión de Datos

El interruptor 'Mejorar el modelo para todos' en las interfaces de LLM puede recolectar automáticamente investigaciones profundas de red-teaming, enviando tus conceptos de vulnerabilidad a los equipos de seguridad de los proveedores y potencialmente a artículos académicos antes de que publiques. Desactiva el intercambio de datos antes de realizar investigaciones de seguridad serias.

OpenClawRadar