디커플드 디로코(Decoupled DiLoCo): 저대역폭 환경에서 데이터 센터 간의 탄력적인 분산 학습

Google DeepMind는 Decoupled DiLoCo(분산 저통신)에 관한 논문을 발표했습니다. 이는 컴퓨팅을 비동기적으로 통신하는 별도의 "학습 단위"로 분리하는 분산 훈련 아키텍처입니다. 이를 통해 기존 동기화 방식보다 훨씬 낮은 대역폭 요구사항으로 지리적으로 분산된 데이터 센터 간에 대규모 모델을 훈련할 수 있습니다.
핵심 세부 사항
- 두 가지 선행 기술을 기반으로 함: Pathways(비동기 데이터 흐름 시스템) 및 DiLoCo(데이터 센터 간 대역폭 감소).
- 훈련은 분리된 학습 단위—독립적인 컴퓨팅 섬으로 분할됩니다. 한 단위의 칩 오류가 다른 단위를 중단시키지 않습니다. 시스템은 자가 복구됩니다. 전체 학습 단위가 하드웨어 오류로 손실된 후에도 훈련이 계속되고 단위가 복구되면 원활하게 재통합됩니다.
- 카오스 엔지니어링을 통해 검증됨—훈련 실행 중 인위적인 하드웨어 오류를 주입했습니다. Decoupled DiLoCo는 높은 "굿풋"(유용한 훈련 시간)을 유지한 반면, 기존 방법은 오류 발생 시 급락했습니다.
- 네 개의 별도 미국 지역에서 2-5Gbps 광역 네트워킹을 사용하여 120억 매개변수 모델을 훈련했습니다. 이는 데이터 센터 간 기존 인터넷 연결로 달성 가능합니다.
- 기존 훈련 방식과 동일한 벤치마크 ML 성능(Gemma 4 모델로 테스트)을 달성했습니다.
- 통신이 계산과 중첩되어 차단 병목 현상을 피하기 때문에 기존 동기화 방식보다 20배 이상 빠른 것으로 보고되었습니다.
아키텍처 개요
시스템은 모든 칩에서 동기적 올리듀스를 요구하는 대신 더 긴 계산 기간에 통신을 통합합니다. 이는 시스템의 한 부분이 다른 부분을 기다려야 하는 "차단"을 방지합니다. 결과적으로 어디서든 사용되지 않는 컴퓨팅을 활용할 수 있는 탄력적인 훈련이 가능해져, 유휴 자원을 유용한 용량으로 전환합니다.
대상
여러 데이터 센터에 걸쳐 대규모 언어 모델 또는 기타 최첨단 모델을 훈련하는 팀으로, 성능 저하나 맞춤형 네트워크 인프라 없이 내결함성이 필요합니다.
📖 전체 원문 읽기: HN AI Agents
👀 See Also

아틀라시안, AI 훈련을 위한 기본 데이터 수집 기능 활성화
Atlassian이 AI 모델 훈련을 위해 제품 전반에 기본 데이터 수집을 활성화했다고 Hacker News에 312점과 75개의 댓글로 공유된 소스에서 밝혔습니다.

클로드 소넷 4.5, 오류 급증 중 — 상태 업데이트
Claude Sonnet 4.5가 2026-04-28T13:29:56.000Z 기준으로 현재 오류 증가를 겪고 있습니다. 업데이트를 위해 상태 페이지와 Reddit megathread를 확인하세요.
AI的环境成本:到2030年将消耗945太瓦时电力,影响13亿人的用水
UNU 보고서는 2030년 AI의 환경 발자국을 정량화합니다: 945 TWh 전력, 사하라 이남 아프리카의 필요량과 같은 물, 자카르타 면적의 두 배에 달하는 토지.
뉴올리언스, 911 통화 분류에 카바인 AI 테스트 — 비상 기술에 시사하는 바
뉴올리언스가 동일한 사건에 대한 반복 신고를 처리하기 위해 Carbyne의 AI 긴급 통화 분류 시스템을 테스트하고 있어, 교환원의 업무 부담을 줄이고 있습니다. 이 AI는 발신자에게 알려진 사건에 대한 신고인지 묻고, 그렇다면 AI가 정보를 제공하고, 그렇지 않으면 상담원에게 연결합니다.