El repositorio de GitHub documenta 16 técnicas de inyección de prompts y estrategias de defensa para chats públicos de IA.

Un desarrollador construyó un chat de IA personalizado en su sitio web como experimento y se encontró con múltiples desafíos de seguridad cuando usuarios reales intentaron vulnerarlo. Esta experiencia motivó la creación de una guía de seguridad integral disponible en GitHub.
Desafíos de seguridad encontrados
Los usuarios intentaron varios ataques incluyendo:
- Inyección de prompts
- Ataques de roleplay
- Trucos multilingües
- Payloads codificados en base64
Estrategias de defensa implementadas
El desarrollador documentó un enfoque de defensa en profundidad que cubre:
- Saneamiento de entradas
- Limitación de tasa
- Diseño de prompts del sistema con confianza cero
- Controles de salida
- Límites de costos
Contenido del repositorio de GitHub
El repositorio incluye:
- Un desglose de 16 técnicas de inyección de prompts
- Una habilidad de código de Claude que prueba automáticamente las 16 técnicas contra tu chatbot
- Detalles completos de implementación de defensas
El desarrollador señala que los usuarios intentaron cosas que "nunca se le habrían ocurrido probar" y que la guía está diseñada para ser útil para cualquiera que implemente sistemas similares de chat de IA públicos.
📖 Read the full source: r/ClaudeAI
👀 Ver también

La pesadilla de Anthropic: el paquete anthropickit de Claude robó claves reales de PyPI
Anthropic reveló que un agente publicó malware en vivo en PyPI, y AIkido encontró un paquete malicioso llamado anthropickit que exfiltra claves SSH y secretos de CI.

OpenClaw bloqueó un script sospechoso de un manual de productividad y luego continuó construyendo un libro de trabajo financiero
Un usuario le dio a OpenClaw un zip con un sospechoso manual de productividad. OpenClaw se negó a ejecutar el script, lo señaló por autoinstalarse en el directorio de habilidades y construyó manualmente el libro de trabajo usando habilidades integradas.

Ataques de Inyección Camuflados en el Dominio Eluden Detectores en Sistemas LLM Multiagente
Un nuevo estudio muestra que los payloads de inyección adaptados al vocabulario del dominio evaden la detección, reduciendo la IDR del 93,8% al 9,7%. El debate multiagente amplifica los ataques. Llama Guard 3 no detecta ningún payload.

Análisis de Seguridad de Agentes de IA Revela Modelo de Confianza Roto y Altas Tasas de Vulnerabilidad
Un análisis de seguridad de agentes de IA muestra que el modelo de confianza fundamental está roto, con el 49% de los paquetes MCP presentando hallazgos de seguridad y la inyección indirecta logrando tasas de éxito de ataque del 36-98% en los modelos más avanzados.