El repositorio de GitHub documenta 16 técnicas de inyección de prompts y estrategias de defensa para chats públicos de IA.

Un desarrollador construyó un chat de IA personalizado en su sitio web como experimento y se encontró con múltiples desafíos de seguridad cuando usuarios reales intentaron vulnerarlo. Esta experiencia motivó la creación de una guía de seguridad integral disponible en GitHub.
Desafíos de seguridad encontrados
Los usuarios intentaron varios ataques incluyendo:
- Inyección de prompts
- Ataques de roleplay
- Trucos multilingües
- Payloads codificados en base64
Estrategias de defensa implementadas
El desarrollador documentó un enfoque de defensa en profundidad que cubre:
- Saneamiento de entradas
- Limitación de tasa
- Diseño de prompts del sistema con confianza cero
- Controles de salida
- Límites de costos
Contenido del repositorio de GitHub
El repositorio incluye:
- Un desglose de 16 técnicas de inyección de prompts
- Una habilidad de código de Claude que prueba automáticamente las 16 técnicas contra tu chatbot
- Detalles completos de implementación de defensas
El desarrollador señala que los usuarios intentaron cosas que "nunca se le habrían ocurrido probar" y que la guía está diseñada para ser útil para cualquiera que implemente sistemas similares de chat de IA públicos.
📖 Read the full source: r/ClaudeAI
👀 Ver también

Vulnerabilidades de seguridad expuestas en la aplicación EdTech presentada por Lovable
Un investigador de seguridad encontró 16 vulnerabilidades en una aplicación EdTech destacada en Lovable, incluyendo fallos críticos en la lógica de autenticación que expusieron 18,697 registros de usuarios sin necesidad de autenticación. La aplicación tenía más de 100K visualizaciones en el escaparate de Lovable y usuarios reales de UC Berkeley, UC Davis y escuelas de todo el mundo.

Chatbots de IA filtrando números de teléfono reales: El problema de exposición de PII
Chatbots como Gemini, ChatGPT y Claude están exponiendo números de teléfono reales debido a la información personal identificable (PII) en los datos de entrenamiento. DeleteMe informa de un aumento del 400% en solicitudes de privacidad relacionadas con IA en siete meses.

Seguridad de Agentes de IA: Más Allá de los Jailbreaks Hasta el Mal Uso de Herramientas y la Inyección de Prompts
Los agentes de IA que navegan por la web, ejecutan comandos y activan flujos de trabajo enfrentan riesgos de seguridad por inyección de instrucciones y mal uso de herramientas, donde contenido no confiable redirige herramientas legítimas como la ejecución de comandos y solicitudes HTTP.

Aloja OpenClaw de forma segura en un VPS con Tailscale y más.
Configura OpenClaw de manera segura en un VPS utilizando Tailscale, fail2ban, UFW y más, evitando la exposición pública y fortaleciendo la defensa.