Repositório do GitHub documenta 16 técnicas de injeção de prompt e estratégias de defesa para chats públicos de IA

Um desenvolvedor construiu um chat de IA personalizado em seu site como experimento e encontrou múltiplos desafios de segurança quando usuários reais tentaram quebrá-lo. A experiência levou à criação de um guia de segurança abrangente disponível no GitHub.
Desafios de segurança encontrados
Usuários tentaram vários ataques incluindo:
- Injeção de prompt
- Ataques de roleplay
- Truques multilingues
- Payloads codificados em base64
Estratégias de defesa implementadas
O desenvolvedor documentou uma abordagem de defesa em profundidade cobrindo:
- Saneamento de entrada
- Limitação de taxa
- Design de prompt do sistema de confiança zero
- Controles de saída
- Limites de custo
Conteúdo do repositório GitHub
O repositório inclui:
- Uma análise de 16 técnicas de injeção de prompt
- Uma habilidade de código Claude que testa automaticamente todas as 16 técnicas contra seu chatbot
- Detalhes completos de implementação de defesa
O desenvolvedor observa que os usuários tentaram coisas que ele "nunca teria pensado em testar" e que o guia pretende ser útil para qualquer pessoa implementando sistemas de chat de IA públicos similares.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

OpenClaw Security: A Base Endurecida Com Que Você Deveria Começar
Auto-hospedar o OpenClaw não o torna automaticamente seguro. Um post no Reddit detalha a configuração de linha de base endurecida: Gateway local, isolamento DM por peer, negação de grupos runtime/fs/automation, exec bloqueado e grupos com menção obrigatória.

Incidentes de Exclusão de Produção de Agentes de IA: O Padrão e a Solução
Incidentes de exclusão em produção causados por PocketOS, Replit e Cursor compartilham um padrão de acesso comum. Solução: agentes não recebem credenciais de produção; todas as alterações passam por CI/CD com uma barreira de pontuação de políticas.

A Anthropic revela extração de dados em escala industrial da IA Claude por laboratórios chineses
A Anthropic confirmou que laboratórios chineses de IA usaram mais de 24.000 contas fraudulentas para extrair 16 milhões de trocas do Claude, obtendo proteções de segurança e estruturas lógicas para sistemas militares e de vigilância.

AppLovin Mediação Cipher Quebrada: Impressão Digital do Dispositivo Ignora ATT
A engenharia reversa revelou que a cifra personalizada da AppLovin usa um salt constante + chave SDK, um gerador pseudoaleatório SplitMix64 e nenhuma autenticação. Requisições descriptografadas carregam ~50 campos do dispositivo (modelo de hardware, tamanho da tela, localidade, tempo de inicialização, etc.) mesmo quando o ATT é negado, permitindo reidentificação determinística entre aplicativos.