Camadas de Defesa Empilhadas Reduzem Injeção de Prompt a 0 no Claude Code

A Anthropic está afirmando que camadas de defesa empilhadas podem reduzir ataques de injeção de prompt a zero, mesmo contra ataques desconhecidos. Boris Cherny, em uma discussão sobre o novo Modo Auto do Claude Code, delineou a abordagem em camadas: treinamento do modelo, classificador de intenção e sondas de entrada. Ele também confirmou que o classificador agora é gratuito, respondendo às preocupações com custo de tokens: "Estamos tornando o classificador gratuito. Você não deve precisar pagar por segurança."
Como as Camadas se Empilham
- Treinamento do modelo: O modelo base é ajustado para reconhecer e rejeitar padrões de injeção.
- Classificador de intenção: Um classificador separado verifica a intenção do usuário por trás de cada prompt, filtrando solicitações maliciosas antes da execução.
- Sondas de entrada: Sondas ativas testam entradas para vetores de injeção conhecidos, adicionando outra barreira.
De acordo com a fonte, essa combinação reduz as taxas de injeção de prompt a 0% em ataques desconhecidos. O segredo é que nenhuma camada é perfeita, mas empilhadas elas capturam a grande maioria das tentativas.
Classificador Agora Gratuito
A citação de Boris Cherny é direta: "Estamos tornando o classificador gratuito. Você não deve precisar pagar por segurança." Isso aborda um ponto problemático comum — o custo de tokens — para desenvolvedores que se preocupavam que adicionar verificações de segurança drenaria seus orçamentos. Se você estava evitando recursos de segurança para economizar tokens, isso não é mais uma preocupação.
Isso é particularmente relevante para equipes que constroem agentes autônomos com Claude Code, onde a injeção de prompt é um risco real — prompts maliciosos em conteúdo da web ou saídas de ferramentas podem sequestrar o agente. Com o classificador gratuito, você pode ativá-lo sem se preocupar com taxas extras.
O post completo do blog é sobre o Modo Auto no Claude Code, mas esse detalhe de segurança se destaca. Para desenvolvedores, é um sinal de que a Anthropic está tratando a segurança como um recurso básico, não um complemento premium.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Plugin de Código Claude Causa Picos de CPU e Drenagem de Bateria
Um usuário descobriu que o plugin do Telegram do Claude Code cria múltiplos processos bun.exe que rodam a 100% da CPU mesmo com a tampa do laptop fechada, causando drenagem rápida da bateria. Os processos sobrevivem a ciclos de suspensão/reativação e exigem etapas específicas de limpeza para serem removidos.

Playground de código aberto para red-teaming de agentes de IA com exploits publicados
A Fabraix disponibilizou um ambiente aberto para testar as defesas de agentes de IA através de desafios adversariais. Cada desafio implanta um agente ativo com ferramentas reais e prompts de sistema publicados, com transcrições das conversas vencedoras e logs de proteção documentados publicamente.

O vazamento do mapa de origem do código do Claude revela que o JavaScript minificado já estava público no npm
Um arquivo de mapa de origem incluído acidentalmente na versão 2.1.88 do pacote npm @anthropic-ai/claude-code revelou comentários internos dos desenvolvedores, mas o arquivo cli.js real de 13MB contendo mais de 148.000 strings em texto simples está publicamente acessível no npm desde o lançamento.

Usando o FastAPI Guard para proteger instâncias do OpenClaw contra ataques
O FastAPI Guard fornece um middleware que adiciona 17 verificações de segurança, incluindo filtragem de IP, bloqueio geográfico, limitação de taxa e detecção de penetração. A ferramenta bloqueia ataques como os documentados em auditorias de segurança do OpenClaw, que mostram 512 vulnerabilidades e mais de 40.000 instâncias expostas.