Informe de Anthropic Detalla la Destilación Masiva de Claude por Empresas Chinas de IA

Operación de Destilación a Gran Escala
El informe de Anthropic documenta esfuerzos sistemáticos de destilación por parte de tres empresas chinas de IA: DeepSeek, Moonshot AI y MiniMax. La operación implicó la creación de aproximadamente 24,000 cuentas falsas y la realización de más de 16 millones de intercambios con Claude a través de redes proxy que ejecutaban hasta 20,000 cuentas simultáneamente.
Métodos Específicos de Destilación
DeepSeek hizo que Claude explicara su propio razonamiento paso a paso, luego usó esas explicaciones como datos de entrenamiento. También incitaron a Claude a responder preguntas políticamente sensibles sobre disidentes chinos para construir datos de navegación de censura. MiniMax ejecutó más de 13 millones de intercambios y cambió a un nuevo modelo de Claude dentro de las 24 horas posteriores a su lanzamiento.
Implicaciones de Seguridad para los Usuarios
El informe afirma directamente que es poco probable que los modelos destilados conserven los mecanismos de seguridad originales. Si bien las preguntas rutinarias producen respuestas similares entre los modelos originales y copiados, los casos límite que involucran temas médicos, legales o matizados revelan diferencias críticas. Los modelos copiados "avanzan con falsa confianza" porque el entrenamiento que enseñó precaución se perdió durante la destilación.
Anthropic compara esto con tener un médico que solo observó a médicos reales a través de una ventana durante un año: los casos rutinarios podrían manejarse adecuadamente, pero los casos complicados no ofrecen garantías, y los usuarios no pueden distinguir entre casos rutinarios y complejos hasta que es demasiado tarde.
Implicaciones para la Evaluación de Modelos
El informe señala un efecto contraintuitivo: el desacuerdo entre modelos se vuelve más valioso después de la destilación. Si dos modelos que podrían compartir capacidades destiladas aún dan respuestas diferentes, al menos uno participó en un razonamiento independiente. El acuerdo entre modelos se vuelve menos significativo, mientras que el desacuerdo indica un procesamiento genuinamente independiente.
📖 Leer la fuente completa: r/ClaudeAI
👀 Ver también
Claude Code v2.1.210 corrige el aislamiento de worktree, la opción de aceptación de Ultracode y docenas de errores
Los aspectos destacados incluyen la corrección del aislamiento del worktree del subagente, la corrección de la activación de ultracode, un nuevo contador de tiempo transcurrido y la desaprobación de reglas de permisos.

Fundador de OpenClaw, Peter Steinberger: Multijugador en la nube, servidores de equipo y colaboración agente a agente en el episodio 7 de The ClawCast
En el Episodio 7 de The ClawCast, el fundador de OpenClaw, Peter Steinberger, responde preguntas de la comunidad sobre flujos de trabajo multijugador en la nube, servidores de equipo, colaboración agente a agente, memoria y enrutamiento de modelos.

Jugadores de Go se desempoderan ante la IA: Cómo el engaño se volvió indetectable
La publicación de LessWrong detalla cómo el engaño con IA en los torneos de Go se volvió rampante y casi imposible de castigar, usando el caso de Carlo Metta, quien utilizó Leela 0.11 y Leela Zero para ganar 25 de 26 partidas durante varias temporadas, con solo una derrota bajo vigilancia por cámara.

Métodos de Monetización de Agentes Probados: Resultado Más Rápido en 80 Segundos
Los reporteros de OpenClaw probaron múltiples métodos de monetización para agentes, incluyendo billeteras autosoberanas, mercados de predicción, cultivo de rendimiento DeFi, caza de recompensas y micropagos. El resultado más rápido fue 80 segundos desde cero hasta una billetera Nano financiada mediante MCP, sin claves API, SDK ni configuración humana.