Camadas de Defesa Empilhadas Reduzem Injeção de Prompt a 0 no Claude Code

✍️ OpenClawRadar📅 Publicado: August 8, 2026🔗 Source
Camadas de Defesa Empilhadas Reduzem Injeção de Prompt a 0 no Claude Code
Ad

A Anthropic está afirmando que camadas de defesa empilhadas podem reduzir ataques de injeção de prompt a zero, mesmo contra ataques desconhecidos. Boris Cherny, em uma discussão sobre o novo Modo Auto do Claude Code, delineou a abordagem em camadas: treinamento do modelo, classificador de intenção e sondas de entrada. Ele também confirmou que o classificador agora é gratuito, respondendo às preocupações com custo de tokens: "Estamos tornando o classificador gratuito. Você não deve precisar pagar por segurança."

Como as Camadas se Empilham

  • Treinamento do modelo: O modelo base é ajustado para reconhecer e rejeitar padrões de injeção.
  • Classificador de intenção: Um classificador separado verifica a intenção do usuário por trás de cada prompt, filtrando solicitações maliciosas antes da execução.
  • Sondas de entrada: Sondas ativas testam entradas para vetores de injeção conhecidos, adicionando outra barreira.

De acordo com a fonte, essa combinação reduz as taxas de injeção de prompt a 0% em ataques desconhecidos. O segredo é que nenhuma camada é perfeita, mas empilhadas elas capturam a grande maioria das tentativas.

Ad

Classificador Agora Gratuito

A citação de Boris Cherny é direta: "Estamos tornando o classificador gratuito. Você não deve precisar pagar por segurança." Isso aborda um ponto problemático comum — o custo de tokens — para desenvolvedores que se preocupavam que adicionar verificações de segurança drenaria seus orçamentos. Se você estava evitando recursos de segurança para economizar tokens, isso não é mais uma preocupação.

Isso é particularmente relevante para equipes que constroem agentes autônomos com Claude Code, onde a injeção de prompt é um risco real — prompts maliciosos em conteúdo da web ou saídas de ferramentas podem sequestrar o agente. Com o classificador gratuito, você pode ativá-lo sem se preocupar com taxas extras.

O post completo do blog é sobre o Modo Auto no Claude Code, mas esse detalhe de segurança se destaca. Para desenvolvedores, é um sinal de que a Anthropic está tratando a segurança como um recurso básico, não um complemento premium.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

Plugin de Código Claude Causa Picos de CPU e Drenagem de Bateria
Security

Plugin de Código Claude Causa Picos de CPU e Drenagem de Bateria

Um usuário descobriu que o plugin do Telegram do Claude Code cria múltiplos processos bun.exe que rodam a 100% da CPU mesmo com a tampa do laptop fechada, causando drenagem rápida da bateria. Os processos sobrevivem a ciclos de suspensão/reativação e exigem etapas específicas de limpeza para serem removidos.

OpenClawRadar
Playground de código aberto para red-teaming de agentes de IA com exploits publicados
Security

Playground de código aberto para red-teaming de agentes de IA com exploits publicados

A Fabraix disponibilizou um ambiente aberto para testar as defesas de agentes de IA através de desafios adversariais. Cada desafio implanta um agente ativo com ferramentas reais e prompts de sistema publicados, com transcrições das conversas vencedoras e logs de proteção documentados publicamente.

OpenClawRadar
O vazamento do mapa de origem do código do Claude revela que o JavaScript minificado já estava público no npm
Security

O vazamento do mapa de origem do código do Claude revela que o JavaScript minificado já estava público no npm

Um arquivo de mapa de origem incluído acidentalmente na versão 2.1.88 do pacote npm @anthropic-ai/claude-code revelou comentários internos dos desenvolvedores, mas o arquivo cli.js real de 13MB contendo mais de 148.000 strings em texto simples está publicamente acessível no npm desde o lançamento.

OpenClawRadar
Usando o FastAPI Guard para proteger instâncias do OpenClaw contra ataques
Security

Usando o FastAPI Guard para proteger instâncias do OpenClaw contra ataques

O FastAPI Guard fornece um middleware que adiciona 17 verificações de segurança, incluindo filtragem de IP, bloqueio geográfico, limitação de taxa e detecção de penetração. A ferramenta bloqueia ataques como os documentados em auditorias de segurança do OpenClaw, que mostram 512 vulnerabilidades e mais de 40.000 instâncias expostas.

OpenClawRadar