DiLoCo Découplé : Formation Distribuée Résiliente entre Centres de Données avec Faible Bande Passante

✍️ OpenClawRadar📅 Publié: April 27, 2026🔗 Source
DiLoCo Découplé : Formation Distribuée Résiliente entre Centres de Données avec Faible Bande Passante
Ad

Google DeepMind a publié un article sur Decoupled DiLoCo (Distributed Low-Communication), une architecture d'entraînement distribué qui dissocie le calcul en « unités d'apprentissage » séparées communiquant de manière asynchrone. Cela permet d'entraîner de grands modèles dans des centres de données géographiquement répartis avec des exigences de bande passante bien inférieures à celles des approches synchronisées traditionnelles.

Détails clés

  • S'appuie sur deux avancées antérieures : Pathways (système de flux de données asynchrone) et DiLoCo (bande passante réduite entre centres de données).
  • L'entraînement est réparti sur des unités d'apprentissage découplées — des îlots de calcul indépendants. Une panne de puce dans une unité n'interrompt pas les autres. Le système est auto-réparateur : après la perte d'une unité d'apprentissage entière due à une panne matérielle, l'entraînement continue et l'unité est réintégrée de manière transparente une fois rétablie.
  • Validé par l'ingénierie du chaos — pannes matérielles artificielles injectées lors des sessions d'entraînement. Decoupled DiLoCo a maintenu un « goodput » (temps d'entraînement utile) élevé tandis que les méthodes conventionnelles chutaient en cas de panne.
  • A entraîné un modèle de 12 milliards de paramètres dans quatre régions américaines distinctes en utilisant un réseau étendu (WAN) de 2 à 5 Gbps — réalisable avec la connectivité Internet existante entre centres de données.
  • A atteint les mêmes performances ML de référence (testées avec les modèles Gemma 4) que les approches d'entraînement conventionnelles.
  • A rapporté une vitesse plus de 20 fois supérieure à celle des méthodes de synchronisation conventionnelles car la communication est superposée au calcul, évitant les goulots d'étranglement bloquants.
Ad

Aperçu de l'architecture

Le système intègre la communication dans des périodes de calcul plus longues au lieu d'exiger une réduction globale (all-reduce) synchrone sur toutes les puces. Cela évite les « blocages » où une partie du système doit attendre une autre. Il en résulte un entraînement résilient qui peut exploiter le calcul inutilisé n'importe où, transformant les ressources éparpillées en capacité utile.

À qui cela s'adresse

Équipes entraînant de grands modèles de langage ou d'autres modèles de pointe dans plusieurs centres de données, qui ont besoin de tolérance aux pannes sans sacrifier les performances ni nécessiter d'infrastructure réseau personnalisée.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

🦀
News

Benchmark d'effort de raisonnement Opus 4.7 : Le niveau moyen bat les niveaux élevé et maximal sur des tâches réelles

Dans 29 tâches du dépôt GraphQL-go-tools, Opus 4.7 dans Claude Code atteint son pic à un effort de raisonnement moyen — des réglages plus élevés détériorent la correction et augmentent le coût sans améliorer la qualité des correctifs.

OpenClawRadar
Deux défaillances de l'IA dans une même démo : Claude Code corrige l'orthographe au lieu de l'erreur de schéma, OpenAI brouille le mappage de champs personnalisés
News

Deux défaillances de l'IA dans une même démo : Claude Code corrige l'orthographe au lieu de l'erreur de schéma, OpenAI brouille le mappage de champs personnalisés

Lors d'un atelier en direct, Claude Code a ignoré une erreur de validation de schéma JSON pour corriger des avertissements orthographiques, et OpenAI a renvoyé des données incohérentes lors de sa première tentative de mappage de champs Salesforce personnalisés étranges.

OpenClawRadar
🦀
News

Grok 4.5 vs Claude Code : Les changements acceptés par dollar, le vrai indicateur

Comparaison pratique de Grok 4.5 et Claude Code (Opus) pour le codage : modifications acceptées par dollar, pas les gros titres. Inclut un test tiers sur des tâches Rust qui révèle l'avantage d'Opus pour les fonctionnalités multi-fichiers.

OpenClawRadar
La méthode basée sur la grammaire égale ou surpasse l'IA dans l'analyse de paternité d'œuvres.
News

La méthode basée sur la grammaire égale ou surpasse l'IA dans l'analyse de paternité d'œuvres.

Une étude de l'Université de Manchester a révélé que LambdaG, une méthode d'analyse de paternité basée sur la grammaire, égalait ou surpassait les principaux systèmes d'IA dans la plupart des ensembles de données de test, tout en offrant une plus grande transparence et un coût de calcul inférieur.

OpenClawRadar