DiLoCo с развязкой: отказоустойчивое распределенное обучение между центрами обработки данных с низкой пропускной способностью

✍️ OpenClawRadar📅 Опубликовано: 27 апреля 2026 г.🔗 Source
DiLoCo с развязкой: отказоустойчивое распределенное обучение между центрами обработки данных с низкой пропускной способностью
Ad

Google DeepMind опубликовала статью о Decoupled DiLoCo (Distributed Low-Communication) — распределенной архитектуре обучения, которая разделяет вычисления на отдельные «обучающие блоки», общающиеся асинхронно. Это позволяет обучать большие модели на географически распределенных центрах обработки данных с гораздо меньшими требованиями к пропускной способности, чем в традиционных синхронизированных подходах.

Ключевые детали

  • Основана на двух предыдущих разработках: Pathways (асинхронная система потока данных) и DiLoCo (сниженная пропускная способность между центрами обработки данных).
  • Обучение разделено на обучающие блоки — независимые вычислительные острова. Сбой чипа в одном блоке не прерывает работу других. Система является самовосстанавливающейся: после потери целого обучающего блока из-за аппаратного сбоя обучение продолжается, а блок бесшовно интегрируется обратно после восстановления.
  • Проверено с помощью chaos engineering — во время обучения вносились искусственные аппаратные сбои. Decoupled DiLoCo сохранял высокий «goodput» (полезное время обучения), в то время как традиционные методы резко падали при сбоях.
  • Обучили модель с 12 миллиардами параметров в четырех разных регионах США с использованием 2-5 Гбит/с глобальной сети — что достижимо с существующим интернет-соединением между дата-центрами.
  • Достигнута та же производительность ML (протестировано на моделях Gemma 4), что и при традиционном обучении.
  • Сообщается о более чем 20-кратном ускорении по сравнению с традиционными методами синхронизации, поскольку связь перекрывается с вычислениями, избегая блокирующих узких мест.
Ad

Обзор архитектуры

Система включает связь в более длительные периоды вычислений вместо того, чтобы требовать синхронного all-reduce по всем чипам. Это позволяет избежать «блокировки», когда одна часть системы ждет другую. Результат — устойчивое обучение, способное использовать простаивающие вычисления в любом месте, превращая разрозненные ресурсы в полезную мощность.

Для кого это

Для команд, обучающих большие языковые модели или другие передовые модели в нескольких центрах обработки данных, которым нужна отказоустойчивость без потери производительности и без необходимости в специальной сетевой инфраструктуре.

📖 Прочитать полный источник: HN AI Agents

Ad

👀 Смотрите также

Claude Opus 4.6 и Sonnet 4.6 теперь поддерживают контекст в 1 миллион токенов по стандартным тарифам.
Новости

Claude Opus 4.6 и Sonnet 4.6 теперь поддерживают контекст в 1 миллион токенов по стандартным тарифам.

Claude Opus 4.6 и Sonnet 4.6 теперь включают полное окно контекста в 1 млн токенов по стандартной цене без дополнительной платы за длинный контекст, а также расширенные лимиты медиа до 600 изображений или страниц PDF на запрос.

OpenClawRadar
Поворот Meta в сторону ИИ: Цукерберг считает прогресс недостаточно быстрым, потрачено $145 млрд
Новости

Поворот Meta в сторону ИИ: Цукерберг считает прогресс недостаточно быстрым, потрачено $145 млрд

Генеральный директор Meta Марк Цукерберг заявил сотрудникам, что разработка ИИ-агентов не ускорилась, как ожидалось. Компания потратила $145 млрд на инфраструктуру ИИ в этом году и уволила 8000 сотрудников для реорганизации вокруг ИИ.

OpenClawRadar
Claude Code v2.1.73: Переопределения моделей, исправления стабильности и улучшения производительности
Новости

Claude Code v2.1.73: Переопределения моделей, исправления стабильности и улучшения производительности

Claude Code v2.1.73 добавляет modelOverrides для пользовательских идентификаторов провайдеров, исправляет критические зависания и взаимные блокировки, решает проблему понижения версий моделей у суб-агентов и улучшает стабильность голосового режима. В выпуске устранены 18 конкретных проблем, включая запросы разрешений для bash-команд, повреждение сессий и сбои песочницы Linux.

OpenClawRadar
ИИ-агент накрутил счет AWS на $6,531 при сканировании сети DN42
Новости

ИИ-агент накрутил счет AWS на $6,531 при сканировании сети DN42

ИИ-агент, пытавшийся сканировать DN42, сгенерировал $6 531,30 затрат на исходящий трафик AWS. Оператор отключил его через 24 часа.

OpenClawRadar