DiLoCo Desacoplado: Entrenamiento Distribuido Resiliente entre Centros de Datos con Bajo Ancho de Banda

Google DeepMind publicó un artículo sobre Decoupled DiLoCo (Distributed Low-Communication), una arquitectura de entrenamiento distribuido que separa la computación en "unidades de aprendizaje" independientes que se comunican de forma asíncrona. Esto permite entrenar modelos grandes a través de centros de datos geográficamente distribuidos con requisitos de ancho de banda mucho más bajos que los enfoques sincrónicos tradicionales.
Detalles clave
- Se basa en dos avances anteriores: Pathways (sistema de flujo de datos asíncrono) y DiLoCo (ancho de banda reducido entre centros de datos).
- El entrenamiento se divide en unidades de aprendizaje separadas: islas de computación independientes. Un fallo en un chip de una unidad no interrumpe a las demás. El sistema es autocurativo: tras perder una unidad entera por un fallo de hardware, el entrenamiento continúa y la unidad se reintegra sin problemas una vez que se recupera.
- Validado con ingeniería del caos: se inyectaron fallos de hardware artificiales durante las ejecuciones de entrenamiento. Decoupled DiLoCo mantuvo un alto "goodput" (tiempo de entrenamiento útil) mientras que los métodos convencionales se desplomaban ante los fallos.
- Entrenó un modelo de 12 mil millones de parámetros en cuatro regiones distintas de EE. UU. utilizando redes de área amplia de 2-5 Gbps, algo alcanzable con la conectividad a Internet existente entre centros de datos.
- Alcanzó el mismo rendimiento de ML en pruebas comparativas (probado con modelos Gemma 4) que los enfoques de entrenamiento convencionales.
- Reportó ser más de 20 veces más rápido que los métodos de sincronización convencionales porque la comunicación se superpone con la computación, evitando cuellos de botella de bloqueo.
Resumen de la arquitectura
El sistema incorpora la comunicación en periodos de computación más largos en lugar de requerir all-reduce síncrono en todos los chips. Esto evita el "bloqueo" en el que una parte del sistema debe esperar a otra. El resultado es un entrenamiento resistente que puede aprovechar la computación no utilizada en cualquier lugar, convirtiendo recursos dispersos en capacidad útil.
Para quién es
Equipos que entrenan modelos de lenguaje grandes u otros modelos de frontera en múltiples centros de datos que necesitan tolerancia a fallos sin sacrificar rendimiento ni requerir infraestructura de red personalizada.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Las NPU de IA de AMD Ryzen obtienen soporte para LLM en Linux mediante Lemonade 10.0 y FastFlowLM
Las NPU AMD Ryzen AI ahora admiten la ejecución de modelos de lenguaje grandes en Linux a través del servidor Lemonade 10.0 con el entorno de ejecución FastFlowLM, requiriendo el kernel Linux 7.0 o back-ports del controlador AMDXDNA.

La burbuja de la IA está estallando; simplemente aún no lo sabemos.
Los resultados del segundo trimestre de las grandes tecnológicas revelan fuertes oscilaciones en las acciones, una disminución del flujo de caja libre y una enorme inversión en IA. El podcast de The Register analiza qué significa para los equipos de TI.

La IA ya ha matado la academia tal como la conocemos — Dentro del juego de volumen
Un profesor titular explica cómo la IA hace infinito el volumen académico: ensayos estudiantiles indetectables, producción de un artículo por día y avalanchas de solicitudes de subvención que manipulan el sistema. El juego ya no tiene sentido.

El Ping-Pong de la IA: cuando cada respuesta es una captura de ChatGPT
Desarrolladores informan estar inundados de respuestas generadas por IA, de colegas, jefes e incluso comentaristas de GitHub, que ignoran el contexto y hacen perder tiempo. La discusión en HN captura una frustración creciente.