Entkoppeltes DiLoCo: Robuster verteilter Training über Rechenzentren mit geringer Bandbreite

✍️ OpenClawRadar📅 Veröffentlicht: 27. April 2026🔗 Source
Entkoppeltes DiLoCo: Robuster verteilter Training über Rechenzentren mit geringer Bandbreite
Ad

Google DeepMind hat ein Paper über Decoupled DiLoCo (Distributed Low-Communication) veröffentlicht, eine verteilte Trainingsarchitektur, die Berechnungen in separate „Learner Units“ entkoppelt, die asynchron kommunizieren. Dies ermöglicht das Training großer Modelle über geografisch verteilte Rechenzentren mit deutlich geringeren Bandbreitenanforderungen als bei traditionellen synchronisierten Ansätzen.

Wichtige Details

  • Baut auf zwei früheren Fortschritten auf: Pathways (asynchrones Datenflusssystem) und DiLoCo (reduzierte Bandbreite zwischen Rechenzentren).
  • Das Training wird auf entkoppelte Learner Units aufgeteilt – unabhängige Recheninseln. Ein Chipausfall in einer Einheit unterbricht die anderen nicht. Das System ist selbstheilend: Nach dem Verlust einer gesamten Learner Unit durch Hardwareausfall wird das Training fortgesetzt und die Einheit nach ihrer Wiederherstellung nahtlos wieder integriert.
  • Validiert durch Chaos Engineering – künstliche Hardwareausfälle wurden während Trainingsläufen injiziert. Decoupled DiLoCo behielt hohen „Goodput“ (nutzbare Trainingszeit) bei, während konventionelle Methoden bei Ausfällen einbrachen.
  • Trainierte ein 12 Milliarden Parameter Modell über vier separate US-Regionen mit 2-5 Gbps Wide-Area-Networking – erreichbar mit bestehender Internetverbindung zwischen Rechenzentren.
  • Erreichte die gleiche benchmarkte ML-Leistung (getestet mit Gemma 4-Modellen) wie konventionelle Trainingsansätze.
  • Berichtete mehr als 20× schneller als konventionelle Synchronisationsmethoden, da Kommunikation mit Berechnung überlappt wird und blockierende Engpässe vermieden werden.
Ad

Architekturüberblick

Das System integriert Kommunikation in längere Berechnungszeiträume, anstatt synchrone All-Reduce-Vorgänge über alle Chips zu erfordern. Dadurch wird „Blockieren“ vermieden, bei dem ein Teil des Systems auf einen anderen warten muss. Das Ergebnis ist ein widerstandsfähiges Training, das ungenutzte Rechenleistung überall nutzen und brachliegende Ressourcen in nutzbare Kapazität verwandeln kann.

Für wen es gedacht ist

Teams, die große Sprachmodelle oder andere Spitzenmodelle über mehrere Rechenzentren trainieren und Fehlertoleranz benötigen, ohne Leistungseinbußen oder spezielle Netzwerkinfrastruktur.

📖 Read the full source: HN AI Agents

Ad

👀 Siehe auch

🦀
Nachrichten

The Atlantic berichtet über zunehmende Anti-KI-Gewalt und politische Gegenreaktionen

Bernie Sanders und Steve Bannon bezeichnen KI gleichermaßen als Bedrohung für Arbeiter. Ein Molotowcocktail-Angriff auf Sam Altmans Haus und die Schießerei auf einen Stadtrat in Indianapolis zeigen, dass die Gewalt gegen Rechenzentren zunimmt.

OpenClawRadar
Stanford CS 25 Transformers-Kurs öffnet für die Öffentlichkeit mit Live-Streaming
Nachrichten

Stanford CS 25 Transformers-Kurs öffnet für die Öffentlichkeit mit Live-Streaming

Der CS 25 Transformers-Seminar von Stanford ist jetzt für die Öffentlichkeit zugänglich. Die Vorlesungen beginnen am 23. Januar 2025 um 16:30-17:50 Uhr PDT und sind persönlich im Skilling Auditorium oder über Zoom verfügbar, wobei Aufzeichnungen online veröffentlicht werden.

OpenClawRadar
GPT 5.5 vs Claude: Ein Entwickler-Refactoring-Battle-Report
Nachrichten

GPT 5.5 vs Claude: Ein Entwickler-Refactoring-Battle-Report

Ein Entwickler nutzte GPT 5.5 für die Planung und Claude zum Coding einer massiven C-Refaktorisierung mit 36.000 Zeilen. GPT 5.5 beeindruckte mit klaren Plänen, verbrauchte aber 85 % des Kontingents in 2 Stunden beim 30-Dollar-Tarif.

OpenClawRadar
Claude-API-Kostenübersicht: Bedenken für Indie-Entwickler
Nachrichten

Claude-API-Kostenübersicht: Bedenken für Indie-Entwickler

Eine Reddit-Diskussion hebt hervor, dass die mangelnde detaillierte Kostenverfolgung der Claude Sonnet API unabhängige Entwickler dazu veranlassen könnte, sie trotz ihrer Qualität aufzugeben, da Rechnungen von 400–900 US-Dollar sie aufgrund unzureichender Transparenz im Vergleich zu AWS-ähnlicher Überwachung überraschen.

OpenClawRadar