Anthropic informa sobre ataques de destilación a escala industrial por parte de laboratorios chinos de IA contra Claude.

✍️ OpenClawRadar📅 Publicado: 24 de febrero de 2026🔗 Source
Anthropic informa sobre ataques de destilación a escala industrial por parte de laboratorios chinos de IA contra Claude.
Ad

Operación de extracción de modelos a escala industrial

Anthropic ha publicado hallazgos que detallan ataques de destilación coordinados contra Claude por parte de tres laboratorios chinos de IA. Los ataques involucraron la creación de cuentas fraudulentas a gran escala para extraer las capacidades de razonamiento de Claude a través de interacciones masivas con la API.

Detalles clave del ataque según el informe de Anthropic

  • DeepSeek, Moonshot y MiniMax crearon más de 24,000 cuentas fraudulentas
  • Los intercambios totales con Claude superaron los 16 millones
  • Solo MiniMax realizó 13 millones de solicitudes
  • Cuando Anthropic lanzó un nuevo modelo, MiniMax redirigió casi la mitad de su tráfico en 24 horas
  • DeepSeek se enfocó específicamente en cadenas de pensamiento y respuestas seguras para la censura
  • Los ataques aumentaron en sofisticación con el tiempo a medida que los laboratorios adaptaban sus métodos
Ad

Implicaciones de seguridad para desarrolladores de IA

Este incidente resalta vulnerabilidades en la seguridad de los modelos de IA cuando laboratorios multimillonarios intentan sistemáticamente extraer capacidades propietarias. La escala y persistencia de estos ataques—que abarcan múltiples organizaciones y se adaptan a nuevos lanzamientos de modelos—sugiere que esto representa un vector de amenaza continuo en lugar de incidentes aislados.

Los métodos utilizados (creación de cuentas fraudulentas, consultas dirigidas para capacidades específicas, rápida adaptación a nuevas versiones de modelos) podrían replicarse potencialmente contra otros sistemas de IA, planteando preguntas sobre la seguridad de las herramientas de IA de terceros que los desarrolladores integran en sus flujos de trabajo.

📖 Read the full source: r/ClaudeAI

Ad

👀 Ver también

MCP Sandbox: Ejecuta Servidores MCP en Contenedores Aislados Sin Necesidad de Confiar en Ellos
Seguridad

MCP Sandbox: Ejecuta Servidores MCP en Contenedores Aislados Sin Necesidad de Confiar en Ellos

Un desarrollador creó MCP Sandbox, que ejecuta servidores MCP en contenedores aislados de gVisor con acceso a la red denegado por defecto e inyección segura de secretos, además de escaneo de CVEs y verificación de patrones previos a la ejecución.

OpenClawRadar
Código Fuente de la Plataforma de Gobierno Electrónico de Suecia Filtrado mediante Infraestructura CGI Comprometida
Seguridad

Código Fuente de la Plataforma de Gobierno Electrónico de Suecia Filtrado mediante Infraestructura CGI Comprometida

El código fuente completo de la plataforma de gobierno electrónico de Suecia fue filtrado por el actor de amenazas ByteToBreach tras comprometer la infraestructura de CGI Sverige AB. La filtración incluye bases de datos del personal, sistemas de firma de documentos API, credenciales SSH de Jenkins y endpoints de prueba de RCE.

OpenClawRadar
Inyección de mensajes en la capa de audio contra Claude: Lo que no está en la transcripción
Seguridad

Inyección de mensajes en la capa de audio contra Claude: Lo que no está en la transcripción

Un constructor de una API de detección de inyección de prompts comparte hallazgos sobre ataques en la capa de audio contra Claude, revelando que los ataques en la señal (no en la transcripción) son invisibles en los registros y representan una amenaza real para los agentes de voz.

OpenClawRadar
Flujo de Aprobación de Administrador Seguro para Asistentes de Chat Grupal contra Inyección de Mensajes
Seguridad

Flujo de Aprobación de Administrador Seguro para Asistentes de Chat Grupal contra Inyección de Mensajes

Un enfoque práctico para proteger asistentes LLM en chats grupales compartidos: pausar herramientas de VM, OAuth y ejecución de código hasta que un administrador apruebe mediante un enlace con tiempo de vida de 10 minutos.

OpenClawRadar