Capas de Defensa Apiladas Reducen la Inyección de Prompts a 0 en Claude Code

Anthropic afirma que las capas de defensa apiladas pueden reducir los ataques de inyección de prompts a cero, incluso contra ataques no vistos. Boris Cherny, en una discusión sobre el nuevo Modo Auto de Claude Code, describió el enfoque en capas: entrenamiento del modelo, clasificador de intenciones y sondas de entrada. También confirmó que el clasificador ahora es gratis, respondiendo a las preocupaciones sobre el costo de tokens con: "Estamos haciendo que el clasificador sea gratuito. No deberías tener que pagar por seguridad".
Cómo se apilan las capas
- Entrenamiento del modelo: El modelo base está ajustado para reconocer y rechazar patrones de inyección.
- Clasificador de intenciones: Un clasificador separado verifica la intención del usuario detrás de cada prompt, filtrando solicitudes maliciosas antes de la ejecución.
- Sondas de entrada: Las sondas activas prueban las entradas para vectores de inyección conocidos, añadiendo otra barrera.
Según la fuente, esta combinación reduce las tasas de inyección de prompts a 0% en ataques no vistos. La clave es que ninguna capa es perfecta por sí sola, pero apiladas capturan la gran mayoría de los intentos.
Clasificador ahora gratis
La cita de Boris Cherny es directa: "Estamos haciendo que el clasificador sea gratuito. No deberías tener que pagar por seguridad". Esto aborda un punto de dolor común, el costo de tokens, para los desarrolladores que temían que añadir controles de seguridad agotara sus presupuestos. Si has estado omitiendo funciones de seguridad para ahorrar tokens, ya no es una preocupación.
Esto es particularmente relevante para equipos que construyen agentes autónomos con Claude Code, donde la inyección de prompts es un riesgo real: los prompts maliciosos en contenido web o salidas de herramientas podrían secuestrar al agente. Con el clasificador gratis, puedes habilitarlo sin preocuparte por tarifas adicionales.
La publicación completa trata sobre el Modo Auto en Claude Code, pero este detalle de seguridad destaca. Para los desarrolladores, es una señal de que Anthropic trata la seguridad como una característica básica, no un complemento premium.
📖 Leer la fuente completa: r/ClaudeAI
👀 Ver también

La función de soporte de IA de Meta permite a cualquiera secuestrar cuentas de Instagram — Detalles del exploit adentro
Una función de soporte de Instagram con IA, en fase de pruebas A/B, permite a atacantes restablecer contraseñas pidiendo al agente que envíe un código a un correo arbitrario. Más de 100 cuentas de alto valor han sido robadas.

Las aplicaciones creadas con IA son frágiles: por qué los pequeños cambios rompen el aislamiento de datos y los permisos
Los desarrolladores informan que las aplicaciones generadas por IA (a través de Claude Code, Cursor) rompen silenciosamente el inicio de sesión, los permisos y el aislamiento de datos cuando se realizan pequeños cambios, porque los modelos de IA carecen de comprensión de la intención original del sistema, como las reglas de propiedad.

Probar Modelos Qwen 3.5 35B sin Censura para Preguntas de Ciberseguridad
Un profesional de ciberseguridad probó tres modelos Qwen 3.5 35B sin censura en preguntas de hacking y evasión de seguridad, encontrando diferencias significativas en la calidad de las respuestas en comparación con el modelo original censurado. Los modelos sin censura proporcionaron consistentemente respuestas donde el modelo original se negaba o daba respuestas incompletas.

Paquete malicioso de PyTorch Lightning roba credenciales e infecta paquetes npm
Los paquetes 'lightning' 2.6.2 y 2.6.3 de PyPI contienen malware con temática de Shai-Hulud que roba credenciales, tokens y secretos en la nube, y se propaga a paquetes npm mediante cargas útiles JavaScript inyectadas.