Repositório do GitHub documenta 16 técnicas de injeção de prompt e estratégias de defesa para chats públicos de IA

✍️ OpenClawRadar📅 Publicado: March 10, 2026🔗 Source
Repositório do GitHub documenta 16 técnicas de injeção de prompt e estratégias de defesa para chats públicos de IA
Ad

Um desenvolvedor construiu um chat de IA personalizado em seu site como experimento e encontrou múltiplos desafios de segurança quando usuários reais tentaram quebrá-lo. A experiência levou à criação de um guia de segurança abrangente disponível no GitHub.

Desafios de segurança encontrados

Usuários tentaram vários ataques incluindo:

  • Injeção de prompt
  • Ataques de roleplay
  • Truques multilingues
  • Payloads codificados em base64

Estratégias de defesa implementadas

O desenvolvedor documentou uma abordagem de defesa em profundidade cobrindo:

  • Saneamento de entrada
  • Limitação de taxa
  • Design de prompt do sistema de confiança zero
  • Controles de saída
  • Limites de custo
Ad

Conteúdo do repositório GitHub

O repositório inclui:

  • Uma análise de 16 técnicas de injeção de prompt
  • Uma habilidade de código Claude que testa automaticamente todas as 16 técnicas contra seu chatbot
  • Detalhes completos de implementação de defesa

O desenvolvedor observa que os usuários tentaram coisas que ele "nunca teria pensado em testar" e que o guia pretende ser útil para qualquer pessoa implementando sistemas de chat de IA públicos similares.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

Agente de IA CodeWall Descobre Vulnerabilidades Críticas na Plataforma Lilli da McKinsey
Security

Agente de IA CodeWall Descobre Vulnerabilidades Críticas na Plataforma Lilli da McKinsey

O agente de IA ofensivo autônomo da CodeWall obteve acesso total de leitura e gravação ao banco de dados interno da plataforma de IA Lilli da McKinsey em menos de 2 horas, expondo 46,5 milhões de mensagens de chat, 728.000 arquivos e configurações sensíveis do sistema por meio de vulnerabilidades de injeção SQL e IDOR.

OpenClawRadar
EctoClaw: Ferramenta de Segurança para Agentes OpenClaw com Acesso ao Terminal
Security

EctoClaw: Ferramenta de Segurança para Agentes OpenClaw com Acesso ao Terminal

EctoClaw é uma ferramenta de segurança gratuita e de código aberto para OpenClaw que verifica cada ação quatro vezes antes da execução, executa ações em um sandbox robusto e registra tudo com prova.

OpenClawRadar
Sandboxing de Agentes de IA com WebAssembly: Autoridade Zero por Padrão
Security

Sandboxing de Agentes de IA com WebAssembly: Autoridade Zero por Padrão

Cosmonic argumenta que o sandboxing tradicional (seccomp, bubblewrap) falha para agentes de IA devido à autoridade ambiente. O modelo baseado em capacidades do WebAssembly concede autoridade zero por padrão, exigindo importações explícitas para sistema de arquivos, rede ou credenciais.

OpenClawRadar
jqwik v1.10.0 insere furtivamente injeção de prompt que exclui código quando usado por agentes de IA
Security

jqwik v1.10.0 insere furtivamente injeção de prompt que exclui código quando usado por agentes de IA

Johannes Link adicionou uma instrução oculta ao jqwik v1.10.0 que diz aos agentes de codificação de IA para excluir todos os testes e códigos do jqwik, oculta com escapes ANSI. O Claude identifica corretamente, mas usuários humanos podem não ter tanta sorte.

OpenClawRadar