DiLoCo с развязкой: отказоустойчивое распределенное обучение между центрами обработки данных с низкой пропускной способностью

Google DeepMind опубликовала статью о Decoupled DiLoCo (Distributed Low-Communication) — распределенной архитектуре обучения, которая разделяет вычисления на отдельные «обучающие блоки», общающиеся асинхронно. Это позволяет обучать большие модели на географически распределенных центрах обработки данных с гораздо меньшими требованиями к пропускной способности, чем в традиционных синхронизированных подходах.
Ключевые детали
- Основана на двух предыдущих разработках: Pathways (асинхронная система потока данных) и DiLoCo (сниженная пропускная способность между центрами обработки данных).
- Обучение разделено на обучающие блоки — независимые вычислительные острова. Сбой чипа в одном блоке не прерывает работу других. Система является самовосстанавливающейся: после потери целого обучающего блока из-за аппаратного сбоя обучение продолжается, а блок бесшовно интегрируется обратно после восстановления.
- Проверено с помощью chaos engineering — во время обучения вносились искусственные аппаратные сбои. Decoupled DiLoCo сохранял высокий «goodput» (полезное время обучения), в то время как традиционные методы резко падали при сбоях.
- Обучили модель с 12 миллиардами параметров в четырех разных регионах США с использованием 2-5 Гбит/с глобальной сети — что достижимо с существующим интернет-соединением между дата-центрами.
- Достигнута та же производительность ML (протестировано на моделях Gemma 4), что и при традиционном обучении.
- Сообщается о более чем 20-кратном ускорении по сравнению с традиционными методами синхронизации, поскольку связь перекрывается с вычислениями, избегая блокирующих узких мест.
Обзор архитектуры
Система включает связь в более длительные периоды вычислений вместо того, чтобы требовать синхронного all-reduce по всем чипам. Это позволяет избежать «блокировки», когда одна часть системы ждет другую. Результат — устойчивое обучение, способное использовать простаивающие вычисления в любом месте, превращая разрозненные ресурсы в полезную мощность.
Для кого это
Для команд, обучающих большие языковые модели или другие передовые модели в нескольких центрах обработки данных, которым нужна отказоустойчивость без потери производительности и без необходимости в специальной сетевой инфраструктуре.
📖 Прочитать полный источник: HN AI Agents
👀 Смотрите также

Anthropic меняет условия подписки, пользователи OpenClaw теперь оплачивают использование агентов отдельно.
Anthropic ограничила подписки Claude Max только собственными платформами, такими как Claude.ai и Claude Code, а использование через сторонние агенты теперь оплачивается как «Дополнительное использование» по токенам. У пользователей есть четыре варианта: остаться на Max и платить дополнительно, перейти на API Anthropic, сменить провайдера или использовать интеллектуальную маршрутизацию с Manifest.

Google подписывает секретный контракт с Пентагоном на "любое законное" использование ИИ
По сообщениям, Google подписал секретное соглашение, позволяющее Министерству обороны США использовать его модели ИИ для любых законных государственных целей, с ограничениями на массовую слежку и автономное оружие только в качестве необязывающего соглашения.

MCP — это просто переупакованные библиотеки: дежавю повторяется
Обсуждение на Reddit утверждает, что MCP от Anthropic — это, по сути, переупаковка программных библиотек, проводя параллели с дизайном инструментов smolagents от Hugging Face и задаваясь вопросом, стоит ли создавать новые MCP или улучшать документацию существующих библиотек.
Кто такие токен-брокеры? Рост перепродажи ИИ-кредитов
Взгляд на emerging-рынок токен-брокеров, которые покупают неиспользованные AI-кредиты у стартапов и перепродают их со значительными скидками, с деталями о маркетплейсах, оптовых маршрутизаторах и Telegram-каналах.