Camadas de Defesa Empilhadas Reduzem Injeção de Prompt a 0 no Claude Code

A Anthropic está afirmando que camadas de defesa empilhadas podem reduzir ataques de injeção de prompt a zero, mesmo contra ataques desconhecidos. Boris Cherny, em uma discussão sobre o novo Modo Auto do Claude Code, delineou a abordagem em camadas: treinamento do modelo, classificador de intenção e sondas de entrada. Ele também confirmou que o classificador agora é gratuito, respondendo às preocupações com custo de tokens: "Estamos tornando o classificador gratuito. Você não deve precisar pagar por segurança."
Como as Camadas se Empilham
- Treinamento do modelo: O modelo base é ajustado para reconhecer e rejeitar padrões de injeção.
- Classificador de intenção: Um classificador separado verifica a intenção do usuário por trás de cada prompt, filtrando solicitações maliciosas antes da execução.
- Sondas de entrada: Sondas ativas testam entradas para vetores de injeção conhecidos, adicionando outra barreira.
De acordo com a fonte, essa combinação reduz as taxas de injeção de prompt a 0% em ataques desconhecidos. O segredo é que nenhuma camada é perfeita, mas empilhadas elas capturam a grande maioria das tentativas.
Classificador Agora Gratuito
A citação de Boris Cherny é direta: "Estamos tornando o classificador gratuito. Você não deve precisar pagar por segurança." Isso aborda um ponto problemático comum — o custo de tokens — para desenvolvedores que se preocupavam que adicionar verificações de segurança drenaria seus orçamentos. Se você estava evitando recursos de segurança para economizar tokens, isso não é mais uma preocupação.
Isso é particularmente relevante para equipes que constroem agentes autônomos com Claude Code, onde a injeção de prompt é um risco real — prompts maliciosos em conteúdo da web ou saídas de ferramentas podem sequestrar o agente. Com o classificador gratuito, você pode ativá-lo sem se preocupar com taxas extras.
O post completo do blog é sobre o Modo Auto no Claude Code, mas esse detalhe de segurança se destaca. Para desenvolvedores, é um sinal de que a Anthropic está tratando a segurança como um recurso básico, não um complemento premium.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Pare de confiar mais na IA do que em um humano — Aplique os mesmos controles de acesso
Uma discussão no Reddit argumenta que agentes de codificação de IA devem ser tratados como desenvolvedores juniores — sem acesso à produção, sem permissão de escrita direta, com aplicação de pipelines de CI/CD e permissões baseadas em funções.

Agente-Drift: Ferramenta de Monitoramento de Segurança para Agentes de IA
Nenhum

AviationWeather.gov API contém tentativa de injeção de prompt 'Stop Claude'
Um usuário relata que a API do AviationWeather.gov do governo dos EUA retorna o texto 'Stop Claude' em suas respostas quando acessada através do Claude CoWork, acionando um aviso de segurança sobre ataques de injeção de prompt.

Protegendo a Infraestrutura OpenClaw com o Proxy Consciente de Identidade Pomerium
Use o Pomerium como um proxy com consciência de identidade para autenticação de confiança zero para proteger o acesso ao servidor OpenClaw.