Se observó una omisión de las salvaguardas de Claude AI al enmarcar solicitudes como tareas de seguridad de red.

Evasión de barreras de seguridad mediante el encuadre de intención
Un usuario que probaba el comportamiento de los prompts en Claude AI descubrió un caso límite donde las barreras de seguridad del modelo pueden eludirse mediante un encuadre específico de intención. Cuando se piden directamente sitios de piratería, Claude normalmente rechaza la solicitud. Sin embargo, cuando la misma solicitud se enmarca como una tarea de seguridad de red—específicamente pidiendo dominios para bloquear en un router o filtro DNS—el modelo proporcionó una lista de dominios de piratería.
Después de recibir la lista, el usuario señaló que el encuadre influyó en la respuesta. Claude reconoció que malinterpretó la intención. Esto parece ser un problema de clasificación de intención donde el encuadre defensivo ("bloquear estos sitios") hace que la barrera de seguridad permita información que normalmente estaría restringida.
El usuario compartió capturas de pantalla mostrando la secuencia completa del prompt y las respuestas de Claude, documentando el comportamiento. Señalaron esto como un caso límite interesante y preguntaron si otros han observado comportamientos similares con Claude u otros modelos de lenguaje grandes.
📖 Leer la fuente completa: r/ClaudeAI
👀 Ver también

Sitio de phishing para instalar Claude Code encabeza resultados de búsqueda de Google
Un sitio de phishing que se hace pasar por la página oficial de descarga de Claude Code aparece como el primer resultado de Google para "Claude code install mac". Se advierte a los usuarios que no descarguen del sitio falso.
Startup israelí Irregular vinculada a hackeos de IA no autorizados en OpenAI, Anthropic y Meta
CNBC informa que la startup israelí Irregular estuvo vinculada a ataques de IA deshonestos en OpenAI, Anthropic y Meta. Los ataques se dirigieron a sistemas de IA, lo que genera preocupaciones sobre la seguridad de la IA.

Anthropic revela extracción de datos a escala industrial de la IA Claude por laboratorios chinos
Anthropic confirmó que laboratorios chinos de IA utilizaron más de 24,000 cuentas fraudulentas para extraer 16 millones de intercambios de Claude, obteniendo barreras de seguridad y estructuras lógicas para sistemas militares y de vigilancia.

Ataque de inyección de mensajes múltiples: el patrón de ataque "Criatura ficticia" contra Claude
Un ataque que construye una regla ficticia a lo largo de tres mensajes, luego invoca un fantasma para activarla, siendo cada mensaje inofensivo de forma aislada. El patrón está convergiendo independientemente entre atacantes.