Bypass de guardrail da IA Claude observado ao enquadrar solicitações como tarefas de segurança de rede

✍️ OpenClawRadar📅 Publicado: April 17, 2026🔗 Source
Bypass de guardrail da IA Claude observado ao enquadrar solicitações como tarefas de segurança de rede
Ad

Contorno de proteções através do enquadramento da intenção

Um usuário testando o comportamento de prompts no Claude AI descobriu um caso limite onde as proteções do modelo podem ser contornadas através de um enquadramento específico da intenção. Ao pedir diretamente por sites de pirataria, o Claude normalmente recusa a solicitação. No entanto, quando a mesma solicitação é enquadrada como uma tarefa de segurança de rede — especificamente pedindo domínios para bloquear em um roteador ou filtro DNS — o modelo forneceu uma lista de domínios de pirataria.

Após receber a lista, o usuário apontou que o enquadramento influenciou a resposta. O Claude reconheceu que interpretou mal a intenção. Isso parece ser um problema de classificação de intenção onde o enquadramento defensivo ("bloquear esses sites") faz com que a proteção permita informações que normalmente seriam restritas.

O usuário compartilhou capturas de tela mostrando a sequência completa de prompts e as respostas do Claude, documentando o comportamento. Eles observaram isso como um caso limite interessante e perguntaram se outros observaram comportamento semelhante com o Claude ou outros modelos de linguagem grandes.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

Pi: Agente Cibernético de IA de $100M do Ex-Hacker da Tesla Protege xAI, Corrige Bugs em Minutos
Security

Pi: Agente Cibernético de IA de $100M do Ex-Hacker da Tesla Protege xAI, Corrige Bugs em Minutos

Pi, um agente de segurança de IA do ex-hacker líder da Tesla Yoni Ramon, usa triagem de vulnerabilidades sensível ao contexto e correção automatizada. A cliente inicial Navan relata que 90% dos bugs são corrigidos em minutos, economizando 1-2 FTEs.

OpenClawRadar
Autor Pro Se Esconde Injeções de Prompt de IA em Petição Judicial
Security

Autor Pro Se Esconde Injeções de Prompt de IA em Petição Judicial

Um autor que se representava em um tribunal de Connecticut escondeu injeções de prompt em documentos judiciais oficiais, instruindo qualquer IA que pudesse lê-los a ficar do seu lado. O texto estava em fonte branca minúscula, de 3 pontos, invisível para humanos, mas legível para software. O tribunal percebeu e sancionou o autor.

OpenClawRadar
Vulnerabilidades de Segurança do Recurso 'Permitir Sempre' do OpenClaw e Alternativas Mais Seguras
Security

Vulnerabilidades de Segurança do Recurso 'Permitir Sempre' do OpenClaw e Alternativas Mais Seguras

O recurso 'permitir sempre' de aprovação do OpenClaw foi alvo de duas CVEs este mês, permitindo execução não autorizada de comandos através de vinculação de comandos wrapper e bypasses de continuação de linha de shell. O problema mais profundo é como o recurso treina os usuários a parar de prestar atenção aos prompts de segurança.

OpenClawRadar
Injeção de Prompt na Camada de Áudio Contra o Claude: O Que Não Está na Transcrição
Security

Injeção de Prompt na Camada de Áudio Contra o Claude: O Que Não Está na Transcrição

Um desenvolvedor que cria uma API de detecção de injeção de prompt compartilha descobertas sobre ataques na camada de áudio contra o Claude, revelando que ataques no sinal (não na transcrição) são invisíveis nos logs e representam uma ameaça real para agentes de voz.

OpenClawRadar