DiLoCo Desacoplado: Entrenamiento Distribuido Resiliente entre Centros de Datos con Bajo Ancho de Banda

Google DeepMind publicó un artículo sobre Decoupled DiLoCo (Distributed Low-Communication), una arquitectura de entrenamiento distribuido que separa la computación en "unidades de aprendizaje" independientes que se comunican de forma asíncrona. Esto permite entrenar modelos grandes a través de centros de datos geográficamente distribuidos con requisitos de ancho de banda mucho más bajos que los enfoques sincrónicos tradicionales.
Detalles clave
- Se basa en dos avances anteriores: Pathways (sistema de flujo de datos asíncrono) y DiLoCo (ancho de banda reducido entre centros de datos).
- El entrenamiento se divide en unidades de aprendizaje separadas: islas de computación independientes. Un fallo en un chip de una unidad no interrumpe a las demás. El sistema es autocurativo: tras perder una unidad entera por un fallo de hardware, el entrenamiento continúa y la unidad se reintegra sin problemas una vez que se recupera.
- Validado con ingeniería del caos: se inyectaron fallos de hardware artificiales durante las ejecuciones de entrenamiento. Decoupled DiLoCo mantuvo un alto "goodput" (tiempo de entrenamiento útil) mientras que los métodos convencionales se desplomaban ante los fallos.
- Entrenó un modelo de 12 mil millones de parámetros en cuatro regiones distintas de EE. UU. utilizando redes de área amplia de 2-5 Gbps, algo alcanzable con la conectividad a Internet existente entre centros de datos.
- Alcanzó el mismo rendimiento de ML en pruebas comparativas (probado con modelos Gemma 4) que los enfoques de entrenamiento convencionales.
- Reportó ser más de 20 veces más rápido que los métodos de sincronización convencionales porque la comunicación se superpone con la computación, evitando cuellos de botella de bloqueo.
Resumen de la arquitectura
El sistema incorpora la comunicación en periodos de computación más largos en lugar de requerir all-reduce síncrono en todos los chips. Esto evita el "bloqueo" en el que una parte del sistema debe esperar a otra. El resultado es un entrenamiento resistente que puede aprovechar la computación no utilizada en cualquier lugar, convirtiendo recursos dispersos en capacidad útil.
Para quién es
Equipos que entrenan modelos de lenguaje grandes u otros modelos de frontera en múltiples centros de datos que necesitan tolerancia a fallos sin sacrificar rendimiento ni requerir infraestructura de red personalizada.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Delve es acusado de bifurcar el SimStudio de código abierto de Sim.ai y venderlo como Pathways.
La startup de cumplimiento Delve supuestamente bifurcó la herramienta de código abierto para crear agentes SimStudio de Sim.ai, la rebautizó como Pathways y la vendió sin la atribución de licencia adecuada o un acuerdo monetario con Sim.ai, lo que potencialmente viola los términos de la licencia Apache.

Aclarando las capacidades de automatización de OpenClaw.
OpenClaw no realiza tareas completamente automatizadas de forma independiente; requiere la guía del usuario para su configuración, actuando más como un LLM tradicional.

Reescritura del código base de 18 meses de Autonoma: lecciones sobre pruebas, deuda técnica y Acciones de Servidor
Autonoma desechó 1.5 años de código después de escalar de 2 a 14 ingenieros, citando la falta de pruebas, TypeScript no estricto y las limitaciones de Server Actions como las razones clave para la reescritura.

Illinois aprueba SB 315: Auditorías de terceros requeridas para laboratorios de IA de frontera
Illinois aprueba SB 315 que exige que los laboratorios de IA fronteriza como OpenAI, Anthropic y Google DeepMind auditén sus prácticas de seguridad por terceros independientes. Si se firma, se convierte en la ley estatal de seguridad de IA más fuerte de EE.UU.