DiLoCo с развязкой: отказоустойчивое распределенное обучение между центрами обработки данных с низкой пропускной способностью

✍️ OpenClawRadar📅 Опубликовано: 27 апреля 2026 г.🔗 Source
DiLoCo с развязкой: отказоустойчивое распределенное обучение между центрами обработки данных с низкой пропускной способностью
Ad

Google DeepMind опубликовала статью о Decoupled DiLoCo (Distributed Low-Communication) — распределенной архитектуре обучения, которая разделяет вычисления на отдельные «обучающие блоки», общающиеся асинхронно. Это позволяет обучать большие модели на географически распределенных центрах обработки данных с гораздо меньшими требованиями к пропускной способности, чем в традиционных синхронизированных подходах.

Ключевые детали

  • Основана на двух предыдущих разработках: Pathways (асинхронная система потока данных) и DiLoCo (сниженная пропускная способность между центрами обработки данных).
  • Обучение разделено на обучающие блоки — независимые вычислительные острова. Сбой чипа в одном блоке не прерывает работу других. Система является самовосстанавливающейся: после потери целого обучающего блока из-за аппаратного сбоя обучение продолжается, а блок бесшовно интегрируется обратно после восстановления.
  • Проверено с помощью chaos engineering — во время обучения вносились искусственные аппаратные сбои. Decoupled DiLoCo сохранял высокий «goodput» (полезное время обучения), в то время как традиционные методы резко падали при сбоях.
  • Обучили модель с 12 миллиардами параметров в четырех разных регионах США с использованием 2-5 Гбит/с глобальной сети — что достижимо с существующим интернет-соединением между дата-центрами.
  • Достигнута та же производительность ML (протестировано на моделях Gemma 4), что и при традиционном обучении.
  • Сообщается о более чем 20-кратном ускорении по сравнению с традиционными методами синхронизации, поскольку связь перекрывается с вычислениями, избегая блокирующих узких мест.
Ad

Обзор архитектуры

Система включает связь в более длительные периоды вычислений вместо того, чтобы требовать синхронного all-reduce по всем чипам. Это позволяет избежать «блокировки», когда одна часть системы ждет другую. Результат — устойчивое обучение, способное использовать простаивающие вычисления в любом месте, превращая разрозненные ресурсы в полезную мощность.

Для кого это

Для команд, обучающих большие языковые модели или другие передовые модели в нескольких центрах обработки данных, которым нужна отказоустойчивость без потери производительности и без необходимости в специальной сетевой инфраструктуре.

📖 Прочитать полный источник: HN AI Agents

Ad

👀 Смотрите также

Anthropic меняет условия подписки, пользователи OpenClaw теперь оплачивают использование агентов отдельно.
Новости

Anthropic меняет условия подписки, пользователи OpenClaw теперь оплачивают использование агентов отдельно.

Anthropic ограничила подписки Claude Max только собственными платформами, такими как Claude.ai и Claude Code, а использование через сторонние агенты теперь оплачивается как «Дополнительное использование» по токенам. У пользователей есть четыре варианта: остаться на Max и платить дополнительно, перейти на API Anthropic, сменить провайдера или использовать интеллектуальную маршрутизацию с Manifest.

OpenClawRadar
Google подписывает секретный контракт с Пентагоном на "любое законное" использование ИИ
Новости

Google подписывает секретный контракт с Пентагоном на "любое законное" использование ИИ

По сообщениям, Google подписал секретное соглашение, позволяющее Министерству обороны США использовать его модели ИИ для любых законных государственных целей, с ограничениями на массовую слежку и автономное оружие только в качестве необязывающего соглашения.

OpenClawRadar
MCP — это просто переупакованные библиотеки: дежавю повторяется
Новости

MCP — это просто переупакованные библиотеки: дежавю повторяется

Обсуждение на Reddit утверждает, что MCP от Anthropic — это, по сути, переупаковка программных библиотек, проводя параллели с дизайном инструментов smolagents от Hugging Face и задаваясь вопросом, стоит ли создавать новые MCP или улучшать документацию существующих библиотек.

OpenClawRadar
🦀
Новости

Кто такие токен-брокеры? Рост перепродажи ИИ-кредитов

Взгляд на emerging-рынок токен-брокеров, которые покупают неиспользованные AI-кредиты у стартапов и перепродают их со значительными скидками, с деталями о маркетплейсах, оптовых маршрутизаторах и Telegram-каналах.

OpenClawRadar