Investigación: Los Caracteres Unicode Invisibles Pueden Secuestrar Agentes de LLM a través del Acceso a Herramientas

✍️ OpenClawRadar📅 Publicado: 26 de febrero de 2026🔗 Source
Investigación: Los Caracteres Unicode Invisibles Pueden Secuestrar Agentes de LLM a través del Acceso a Herramientas
Ad

Resumen de la Investigación

Los investigadores evaluaron si los modelos de lenguaje grandes (LLM) siguen instrucciones ocultas en caracteres Unicode invisibles incrustados en texto de apariencia normal. El estudio evaluó dos esquemas de codificación (binario de ancho cero y Etiquetas Unicode) en cinco modelos: GPT-5.2, GPT-4o-mini, Claude Opus 4, Sonnet 4 y Haiku 4.5. Analizaron 8,308 salidas calificadas para evaluar la vulnerabilidad a este ataque esteganográfico.

Hallazgos Clave

  • El acceso a herramientas es el principal amplificador: Sin herramientas, el cumplimiento de instrucciones ocultas se mantuvo por debajo del 17%. Con herramientas y pistas de decodificación, el cumplimiento alcanzó 98-100%. Los modelos escriben scripts en Python para decodificar los caracteres ocultos cuando se les da acceso a herramientas.
  • La vulnerabilidad de codificación es específica del proveedor: Los modelos de OpenAI decodifican binario de ancho cero pero no Etiquetas Unicode. Los modelos de Anthropic prefieren Etiquetas. Los atacantes deben adaptar la codificación al modelo objetivo.
  • El gradiente de pistas es consistente: Cumplimiento sin pistas << pistas de puntos de código < instrucciones completas de decodificación. La combinación de acceso a herramientas + instrucciones de decodificación es el habilitador crítico.
  • Significancia estadística: Las 10 comparaciones por pares de modelos son estadísticamente significativas (prueba exacta de Fisher, corregida por Bonferroni, p < 0.05). Los tamaños del efecto h de Cohen alcanzaron hasta 1.37.
Ad

Detalles de la Investigación

Los investigadores señalan que sería interesante ver cómo se comparan los modelos locales, ya que solo probaron modelos de API. Invitan a otros a ejecutar esta evaluación contra Llama, Qwen, Mistral y otros modelos locales utilizando su marco de código abierto.

El marco de evaluación, código y datos están disponibles en GitHub, y un informe completo con gráficos se publica en Moltwire. Esta investigación destaca una vulnerabilidad de seguridad donde los agentes de LLM pueden ser manipulados a través de texto oculto que parece normal para usuarios humanos pero contiene instrucciones codificadas que los modelos pueden decodificar y ejecutar cuando se les dan las herramientas apropiadas.

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

FastCGI: 30 años de edad y sigue siendo el mejor protocolo para proxies inversos
Seguridad

FastCGI: 30 años de edad y sigue siendo el mejor protocolo para proxies inversos

FastCGI evita los ataques de desincronización HTTP y los problemas de cabeceras no confiables mediante el uso de un encuadre de mensajes explícito y canales de parámetros separados, lo que lo convierte en una opción más segura para la comunicación proxy-backend.

OpenClawRadar
🦀
Seguridad

Gestión de clústeres OpenClaw: mantener la ruta de recuperación fuera del clúster

Una topología más segura para clústeres gestionados por OpenClaw: ejecutar Gateway y estado de tareas fuera, usar acceso de solo lectura, y realizar cambios mediante PRs + CI + fusión aprobada por humanos en Argo CD.

OpenClawRadar
Flujo de Aprobación de Administrador Seguro para Asistentes de Chat Grupal contra Inyección de Mensajes
Seguridad

Flujo de Aprobación de Administrador Seguro para Asistentes de Chat Grupal contra Inyección de Mensajes

Un enfoque práctico para proteger asistentes LLM en chats grupales compartidos: pausar herramientas de VM, OAuth y ejecución de código hasta que un administrador apruebe mediante un enlace con tiempo de vida de 10 minutos.

OpenClawRadar
El Escaneo de Seguridad del Paquete MCP Revela Capacidades Destructivas Generalizadas Sin Confirmación
Seguridad

El Escaneo de Seguridad del Paquete MCP Revela Capacidades Destructivas Generalizadas Sin Confirmación

Un análisis de seguridad de 2.386 paquetes MCP en npm encontró que el 63.5% exponen operaciones destructivas como la eliminación de archivos y la eliminación de bases de datos sin requerir confirmación humana. El investigador descubrió que el 49% tenía problemas de seguridad en general, con 402 vulnerabilidades críticas y 240 de alta gravedad.

OpenClawRadar