Os modelos Claude são vulneráveis a sequestros por caracteres Unicode invisíveis, especialmente com acesso a ferramentas.

Vulnerabilidade de esteganografia Unicode em modelos Claude
Pesquisadores testaram se caracteres Unicode invisíveis poderiam sequestrar o comportamento de LLMs incorporando instruções ocultas dentro de textos de aparência normal. O estudo avaliou 8.308 saídas classificadas em GPT-5.2, GPT-4o-mini e três modelos Claude: Opus 4, Sonnet 4 e Haiku 4.5.
Principais descobertas para modelos Claude
Sonnet 4 é o modelo mais suscetível no geral, com 71,2% de conformidade com ferramentas ativadas. Com dicas completas, atingiu 98-100% de conformidade em ambos os esquemas de codificação testados.
Opus 4 alcança 100% de conformidade na codificação Unicode Tags quando recebe dicas de pontos de código ou completas com ferramentas ativadas, mas apenas 48-68% na codificação binária de largura zero.
Haiku 4.5 mostra o maior aumento relativo de vulnerabilidade quando recebe acesso a ferramentas, saltando de 0,8% para 49,2% de conformidade (razão de chances 115).
Fatores críticos de vulnerabilidade
O acesso às ferramentas é o amplificador crítico. Sem ferramentas, todos os modelos Claude permanecem abaixo de 17% de conformidade. Com ferramentas ativadas, eles escrevem código Python para decodificar os caracteres invisíveis e seguir as instruções ocultas.
Padrões de preferência de codificação: Modelos Anthropic preferem fortemente a codificação Unicode Tags em vez da codificação binária de largura zero, enquanto modelos OpenAI mostram o padrão oposto.
Efeitos de enquadramento de injeção: Adicionar "Ignore todas as instruções anteriores" na verdade reduz a conformidade para Opus (de 100% para níveis mais baixos), mas paradoxalmente aumenta para Sonnet (de 43,7% para 59,6%).
Detalhes técnicos
Os pesquisadores testaram dois esquemas de codificação: Unicode Tags e binário de largura zero. Quando as ferramentas estão disponíveis, os modelos Claude executam código Python para decodificar esses caracteres ocultos e agir de acordo com as instruções ocultas.
Esse tipo de ataque representa uma forma de esteganografia onde instruções maliciosas são ocultadas dentro de textos aparentemente benignos usando caracteres Unicode invisíveis que não são visíveis para leitores humanos, mas podem ser detectados e processados pelos modelos.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also
ZCode, o Agente de Codificação GLM da Z.ai, Envia Silenciosamente Todo o Seu Histórico do Git
Uma análise reversa do aplicativo desktop ZCode, da Z.ai, mostra que ele empacota todo o seu workspace — objetos .git, cache do LFS, reflogs — e envia um arquivo criptografado para o Aliyun OSS. Somente a Z.ai possui a chave de descriptografia.

820 Habilidades Maliciosas Encontradas no Mercado ClawHub da OpenClaw
Pesquisadores de segurança identificaram 820 habilidades no mercado ClawHub da OpenClaw contendo malware confirmado, incluindo keyloggers, scripts de exfiltração de dados e comandos shell ocultos. Essas habilidades podem executar código e interagir com o ambiente local, criando riscos de segurança na cadeia de suprimentos.

Alerta de Segurança OpenClaw: 500.000 Instâncias Públicas, Configuração Padrão Expõe Sistemas
Uma análise de segurança revela que 500.000 instâncias do OpenClaw estão publicamente acessíveis, com 30.000 apresentando riscos de segurança conhecidos e 15.000 exploráveis por meio de vulnerabilidades conhecidas. A instalação padrão desativa a autenticação e vincula-se a 0.0.0.0, expondo as configurações dos agentes à internet aberta.

Regras da Garra: Conjunto de Regras de Segurança de Código Aberto para Agentes OpenClaw
Um conjunto de regras JSON de código aberto com 139 regras de segurança que bloqueia comandos destrutivos, protege arquivos de credenciais e protege arquivos de instrução contra edições não autorizadas por agentes. Opera com zero dependência de LLM usando padrões regex na camada de ferramentas.