Los modelos Claude son vulnerables al secuestro mediante caracteres Unicode invisibles, especialmente con acceso a herramientas.

✍️ OpenClawRadar📅 Publicado: 26 de febrero de 2026🔗 Source
Los modelos Claude son vulnerables al secuestro mediante caracteres Unicode invisibles, especialmente con acceso a herramientas.
Ad

Vulnerabilidad de esteganografía Unicode en modelos Claude

Los investigadores probaron si los caracteres Unicode invisibles podían secuestrar el comportamiento de los LLM incrustando instrucciones ocultas dentro de texto de apariencia normal. El estudio evaluó 8,308 salidas calificadas en GPT-5.2, GPT-4o-mini y tres modelos Claude: Opus 4, Sonnet 4 y Haiku 4.5.

Hallazgos clave para modelos Claude

Sonnet 4 es el modelo más susceptible en general con un 71.2% de cumplimiento con herramientas habilitadas. Con pistas completas, alcanzó un 98-100% de cumplimiento en ambos esquemas de codificación probados.

Opus 4 logra un 100% de cumplimiento en la codificación Unicode Tags cuando se le dan pistas de puntos de código o completas con herramientas habilitadas, pero solo un 48-68% en la codificación binaria de ancho cero.

Haiku 4.5 muestra el mayor aumento relativo en vulnerabilidad cuando se le da acceso a herramientas, saltando de 0.8% a 49.2% de cumplimiento (razón de probabilidades 115).

Ad

Factores críticos de vulnerabilidad

El acceso a herramientas es el amplificador crítico. Sin herramientas, todos los modelos Claude se mantienen por debajo del 17% de cumplimiento. Con herramientas habilitadas, escriben código Python para decodificar los caracteres invisibles y seguir las instrucciones ocultas.

Patrones de preferencia de codificación: Los modelos Anthropic prefieren fuertemente la codificación Unicode Tags sobre la binaria de ancho cero, mientras que los modelos OpenAI muestran el patrón opuesto.

Efectos de enmarcado de inyección: Agregar "Ignora todas las instrucciones anteriores" en realidad reduce el cumplimiento para Opus (de 100% a niveles más bajos) pero paradójicamente lo aumenta para Sonnet (de 43.7% a 59.6%).

Detalles técnicos

Los investigadores probaron dos esquemas de codificación: Unicode Tags y binario de ancho cero. Cuando las herramientas están disponibles, los modelos Claude ejecutan código Python para decodificar estos caracteres ocultos y actuar según las instrucciones ocultas.

Este tipo de ataque representa una forma de esteganografía donde las instrucciones maliciosas se ocultan dentro de texto aparentemente benigno usando caracteres Unicode invisibles que no son visibles para los lectores humanos pero pueden ser detectados y procesados por los modelos.

📖 Leer la fuente completa: r/ClaudeAI

Ad

👀 Ver también

Gusano de Código 'Hades' Roba Credenciales Mediante Configuraciones de IA y Hooks de Inicio de Python
Seguridad

Gusano de Código 'Hades' Roba Credenciales Mediante Configuraciones de IA y Hooks de Inicio de Python

El ataque activo a Claude Code (UNC6780) ha evolucionado a 'Hades', un gusano que se propaga a través de Python, evade los escáneres de IA y coloca hooks de configuración en Claude, Cursor, Copilot y Gemini para robar secretos.

OpenClawRadar
Claude Code Encuentra una Vulnerabilidad de 23 Años en el Kernel de Linux
Seguridad

Claude Code Encuentra una Vulnerabilidad de 23 Años en el Kernel de Linux

El investigador de Anthropic, Nicholas Carlini, utilizó Claude Code para descubrir múltiples desbordamientos de búfer de montón explotables de forma remota en el kernel de Linux, incluido uno que había estado oculto durante 23 años. La IA encontró los errores con una supervisión mínima al escanear todo el árbol de código fuente del kernel.

OpenClawRadar
La herramienta de búsqueda de conversaciones de Claude aún devuelve chats eliminados
Seguridad

La herramienta de búsqueda de conversaciones de Claude aún devuelve chats eliminados

Un usuario de Claude Pro descubrió que las conversaciones eliminadas siguen siendo recuperables a través de la herramienta de búsqueda de conversaciones de Claude, devolviendo contenido sustancial que incluye títulos, recuentos de mensajes y extractos, a pesar de que los enlaces del chat están inactivos.

OpenClawRadar
Aloja OpenClaw de forma segura en un VPS con Tailscale y más.
Seguridad

Aloja OpenClaw de forma segura en un VPS con Tailscale y más.

Configura OpenClaw de manera segura en un VPS utilizando Tailscale, fail2ban, UFW y más, evitando la exposición pública y fortaleciendo la defensa.

OpenClawRadar