Repositório do GitHub documenta 16 técnicas de injeção de prompt e estratégias de defesa para chats públicos de IA

Um desenvolvedor construiu um chat de IA personalizado em seu site como experimento e encontrou múltiplos desafios de segurança quando usuários reais tentaram quebrá-lo. A experiência levou à criação de um guia de segurança abrangente disponível no GitHub.
Desafios de segurança encontrados
Usuários tentaram vários ataques incluindo:
- Injeção de prompt
- Ataques de roleplay
- Truques multilingues
- Payloads codificados em base64
Estratégias de defesa implementadas
O desenvolvedor documentou uma abordagem de defesa em profundidade cobrindo:
- Saneamento de entrada
- Limitação de taxa
- Design de prompt do sistema de confiança zero
- Controles de saída
- Limites de custo
Conteúdo do repositório GitHub
O repositório inclui:
- Uma análise de 16 técnicas de injeção de prompt
- Uma habilidade de código Claude que testa automaticamente todas as 16 técnicas contra seu chatbot
- Detalhes completos de implementação de defesa
O desenvolvedor observa que os usuários tentaram coisas que ele "nunca teria pensado em testar" e que o guia pretende ser útil para qualquer pessoa implementando sistemas de chat de IA públicos similares.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Agente de IA CodeWall Descobre Vulnerabilidades Críticas na Plataforma Lilli da McKinsey
O agente de IA ofensivo autônomo da CodeWall obteve acesso total de leitura e gravação ao banco de dados interno da plataforma de IA Lilli da McKinsey em menos de 2 horas, expondo 46,5 milhões de mensagens de chat, 728.000 arquivos e configurações sensíveis do sistema por meio de vulnerabilidades de injeção SQL e IDOR.

EctoClaw: Ferramenta de Segurança para Agentes OpenClaw com Acesso ao Terminal
EctoClaw é uma ferramenta de segurança gratuita e de código aberto para OpenClaw que verifica cada ação quatro vezes antes da execução, executa ações em um sandbox robusto e registra tudo com prova.

Sandboxing de Agentes de IA com WebAssembly: Autoridade Zero por Padrão
Cosmonic argumenta que o sandboxing tradicional (seccomp, bubblewrap) falha para agentes de IA devido à autoridade ambiente. O modelo baseado em capacidades do WebAssembly concede autoridade zero por padrão, exigindo importações explícitas para sistema de arquivos, rede ou credenciais.

jqwik v1.10.0 insere furtivamente injeção de prompt que exclui código quando usado por agentes de IA
Johannes Link adicionou uma instrução oculta ao jqwik v1.10.0 que diz aos agentes de codificação de IA para excluir todos os testes e códigos do jqwik, oculta com escapes ANSI. O Claude identifica corretamente, mas usuários humanos podem não ter tanta sorte.