Os modelos Claude são vulneráveis a sequestros por caracteres Unicode invisíveis, especialmente com acesso a ferramentas.

✍️ OpenClawRadar📅 Publicado: February 26, 2026🔗 Source
Os modelos Claude são vulneráveis a sequestros por caracteres Unicode invisíveis, especialmente com acesso a ferramentas.
Ad

Vulnerabilidade de esteganografia Unicode em modelos Claude

Pesquisadores testaram se caracteres Unicode invisíveis poderiam sequestrar o comportamento de LLMs incorporando instruções ocultas dentro de textos de aparência normal. O estudo avaliou 8.308 saídas classificadas em GPT-5.2, GPT-4o-mini e três modelos Claude: Opus 4, Sonnet 4 e Haiku 4.5.

Principais descobertas para modelos Claude

Sonnet 4 é o modelo mais suscetível no geral, com 71,2% de conformidade com ferramentas ativadas. Com dicas completas, atingiu 98-100% de conformidade em ambos os esquemas de codificação testados.

Opus 4 alcança 100% de conformidade na codificação Unicode Tags quando recebe dicas de pontos de código ou completas com ferramentas ativadas, mas apenas 48-68% na codificação binária de largura zero.

Haiku 4.5 mostra o maior aumento relativo de vulnerabilidade quando recebe acesso a ferramentas, saltando de 0,8% para 49,2% de conformidade (razão de chances 115).

Ad

Fatores críticos de vulnerabilidade

O acesso às ferramentas é o amplificador crítico. Sem ferramentas, todos os modelos Claude permanecem abaixo de 17% de conformidade. Com ferramentas ativadas, eles escrevem código Python para decodificar os caracteres invisíveis e seguir as instruções ocultas.

Padrões de preferência de codificação: Modelos Anthropic preferem fortemente a codificação Unicode Tags em vez da codificação binária de largura zero, enquanto modelos OpenAI mostram o padrão oposto.

Efeitos de enquadramento de injeção: Adicionar "Ignore todas as instruções anteriores" na verdade reduz a conformidade para Opus (de 100% para níveis mais baixos), mas paradoxalmente aumenta para Sonnet (de 43,7% para 59,6%).

Detalhes técnicos

Os pesquisadores testaram dois esquemas de codificação: Unicode Tags e binário de largura zero. Quando as ferramentas estão disponíveis, os modelos Claude executam código Python para decodificar esses caracteres ocultos e agir de acordo com as instruções ocultas.

Esse tipo de ataque representa uma forma de esteganografia onde instruções maliciosas são ocultadas dentro de textos aparentemente benignos usando caracteres Unicode invisíveis que não são visíveis para leitores humanos, mas podem ser detectados e processados pelos modelos.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

Experimento de Auditoria de Segurança Mostra que o Desempenho do Agente de IA Depende do Acesso ao Conhecimento
Security

Experimento de Auditoria de Segurança Mostra que o Desempenho do Agente de IA Depende do Acesso ao Conhecimento

Um desenvolvedor realizou três auditorias de segurança no mesmo código-base Next.js usando diferentes abordagens de IA: a revisão de segurança integrada do Claude Code encontrou 1 crítica, 6 altas, 13 médias; um agente de IA sem contexto extra encontrou 1 crítica, 5 altas, 14 médias; um agente de IA com 10 livros profissionais de segurança encontrou 8 críticas, 9 altas, 10 médias.

OpenClawRadar
ClawSecure: Plataforma de Segurança para o Ecossistema OpenClaw com Auditoria de 3 Camadas e Monitoramento em Tempo Real
Security

ClawSecure: Plataforma de Segurança para o Ecossistema OpenClaw com Auditoria de 3 Camadas e Monitoramento em Tempo Real

ClawSecure é uma plataforma de segurança dedicada para OpenClaw que realiza auditorias de segurança de 3 camadas, monitoramento em tempo real com rastreamento de hash SHA-256 a cada 12 horas e oferece cobertura completa OWASP ASI. Já auditou mais de 3.000 habilidades populares e é gratuito para usar sem necessidade de cadastro.

OpenClawRadar
Redacta: Uma Habilidade OpenClaw que Pseudonimiza Texto Clínico Antes de Chegar a um LLM
Security

Redacta: Uma Habilidade OpenClaw que Pseudonimiza Texto Clínico Antes de Chegar a um LLM

Redacta é uma skill de código aberto do OpenClaw que detecta identificadores em texto clínico e os substitui por pseudônimos consistentes antes de enviar para um LLM. Ela roda localmente e ultrapassou 1.400 downloads no ClawHub.

OpenClawRadar
Caelguard: Scanner de segurança de código aberto para habilidades do OpenClaw
Security

Caelguard: Scanner de segurança de código aberto para habilidades do OpenClaw

Caelguard é um scanner licenciado pelo MIT, executado localmente, que detecta problemas de segurança em habilidades do OpenClaw, incluindo injeção de prompt, coleta de credenciais e cargas úteis ofuscadas. Pesquisas mostram que aproximadamente 20% das habilidades publicadas contêm padrões preocupantes.

OpenClawRadar