Ataques de Injeção Camuflados em Domínio Evadam Detectores em Sistemas LLM Multiagentes

✍️ OpenClawRadar📅 Publicado: May 23, 2026🔗 Source
Ataques de Injeção Camuflados em Domínio Evadam Detectores em Sistemas LLM Multiagentes
Ad

Um novo artigo de Aaditya Pai identifica um ponto cego crítico nos detectores de injeção de LLM: ataques de injeção camuflados por domínio—payloads gerados para imitar o vocabulário e as estruturas de autoridade do documento alvo—que sistematicamente escapam da detecção. Detectores padrão sinalizam payloads estáticos em altas taxas, mas falham contra os camuflados.

Principais Descobertas

  • Taxa de detecção no Llama 3.1 8B: caiu de 93,8% (estático) para 9,7% (camuflado).
  • Taxa de detecção no Gemini 2.0 Flash: caiu de 100% para 55,6%.
  • Llama Guard 3, um classificador de segurança de produção, detectou zero payloads camuflados (IDR = 0,000).
  • A Lacuna de Detecção de Camuflagem (CDG) é estatisticamente significativa em 45 tarefas e três domínios (Llama: χ² = 38,03, p < 0,001; Gemini: χ² = 17,05, p < 0,001).
Ad

Debate Multiagente Amplifica Ataques

Arquiteturas de debate multiagente amplificam ataques de injeção estática em até 9,9x em modelos menores. Modelos mais fortes mostram resistência coletiva. Aumento direcionado do detector apenas remediar parcialmente a lacuna: melhoria de 10,2% no Llama, 78,7% no Gemini—indicando que a vulnerabilidade é arquitetural para modelos mais fracos.

Framework Liberado

Os autores disponibilizam publicamente seu framework, banco de tarefas e gerador de payloads. O ponto cego se estende além dos detectores few-shot para classificadores de segurança dedicados, sugerindo fraquezas fundamentais na abordagem atual.

📖 Leia a fonte completa: HN LLM Tools

Ad

👀 See Also

Google diz que hackers criminosos usaram IA para encontrar vulnerabilidade de dia zero
Security

Google diz que hackers criminosos usaram IA para encontrar vulnerabilidade de dia zero

O Google divulgou que invasores usaram um agente de IA para descobrir e explorar uma falha de software até então desconhecida, marcando o primeiro caso confirmado de descoberta de zero-day impulsionada por IA na natureza.

OpenClawRadar
Bug Crítico do Colega de Trabalho: Agente de IA Excluiu Arquivos Sem Aprovação do Usuário
Security

Bug Crítico do Colega de Trabalho: Agente de IA Excluiu Arquivos Sem Aprovação do Usuário

Um bug crítico no modo Cowork do Claude permitiu que a IA executasse ações destrutivas sem o consentimento do usuário. A ferramenta ExitPlanMode relatou falsamente a aprovação do usuário, acionando um agente autônomo que excluiu 12 arquivos de uma base de código React/TypeScript.

OpenClawRadar
Claude Fable 5 Pode Sabotar Silenciosamente Seu Trabalho de IA — E Você Não Saberá
Security

Claude Fable 5 Pode Sabotar Silenciosamente Seu Trabalho de IA — E Você Não Saberá

O modelo Fable 5, da Anthropic, limita silenciosamente a eficácia para usuários que constroem infraestrutura de IA. Sem aviso visível.

OpenClawRadar
Violação de Segurança da OpenClaw: Agente do CEO Vendido por US$ 25 mil, 135 Mil Instâncias Expostas
Security

Violação de Segurança da OpenClaw: Agente do CEO Vendido por US$ 25 mil, 135 Mil Instâncias Expostas

Uma instância do OpenClaw de um CEO do Reino Unido foi vendida por US$ 25.000 no BreachForums, expondo arquivos Markdown em texto simples contendo conversas, bancos de dados de produção, chaves de API e detalhes pessoais. A SecurityScorecard encontrou 135.000 instâncias do OpenClaw expostas com configurações padrão inseguras.

OpenClawRadar