Homa: замена TCP для сетевого взаимодействия в кластерах ИИ

✍️ OpenClawRadar📅 Опубликовано: 5 октября 2026 г.🔗 Source
Ad

Homa — это транспортный протокол, разработанный для замены TCP в сетях дата-центров и AI-кластеров, где хвостовая задержка на уровне микросекунд важнее семантики байтового потока. В этом видео разбирается дизайн и его мотивация.

Что Homa меняет по сравнению с TCP

TCP создавался для глобального интернета: он оптимизирован под пропускную способность и справедливость между долгоживущими потоками. Homa управляется получателем. Вместо того чтобы отправители зондировали доступную пропускную способность, получатель выдаёт кредиты отправителям и планирует входящие сообщения с помощью SRPT (shortest-remaining-processing-time first — первым обрабатывается сообщение с наименьшим оставшимся временем обработки). Короткие сообщения — типичный случай для RPC и коллективных операций в AI-обучении — получают приоритет над крупными массовыми передачами.

Ad

Почему это важно для AI-кластеров

Трафик AI-обучения и инференса носит импульсный и сообщение-ориентированный характер. AllReduce, обновления parameter server и передачи KV-кэша выглядят как множество мелких сообщений, а не как несколько длинных байтовых потоков. Управление перегрузкой на уровне отдельных потоков и доставка байтов в порядке следования в TCP добавляют блокировку из-за головного элемента и задержку в очередях, что ухудшает время выполнения задач при масштабировании.

Оригинальная статья USENIX ATC '21 авторства Ousterhout и др. — это основной источник. В ней сообщается о снижении задержки сообщений на 99-м процентиле на порядки по сравнению со стеками на основе TCP в дата-центровых нагрузках, а также о более высокой пропускной способности, когда множество коротких сообщений делят сеть.

Текущее состояние

Связанная статья LWN освещает текущие усилия по внедрению планирования в духе Homa в сетевой стек Linux — давнюю дискуссию о том, расширять ли TCP, добавлять новый транспорт или реализовать его как модуль ядра. Материал The Register рассматривает проектную сторону Stanford.

Если вы создаёте или эксплуатируете GPU-кластеры и время выполнения ваших задач определяется в основном хвостовой задержкой сети, а не вычислениями, за этим стоит следить. Статья — самый быстрый способ понять дизайн; ветка LWN показывает, как на самом деле могла бы выглядеть интеграция в ядро.

📖 Читать полный источник: HN LLM Tools

Ad

👀 Смотрите также

🦀
Новости

Когнитивная капитуляция: когда ИИ-агенты пишут код, который вы не понимаете

ИИ-агенты кодирования могут создавать код, который авторы не понимают, что приводит к непроверенным PR. Статья исследует «когнитивную капитуляцию» и способы её избежать в вашем рабочем процессе.

OpenClawRadar
Исследователи Университета Вашингтона планируют использовать камеры, закрепленные на учителях, для обучения ИИ; родители могут отказаться
Новости

Исследователи Университета Вашингтона планируют использовать камеры, закрепленные на учителях, для обучения ИИ; родители могут отказаться

Исследователи из Вашингтонского университета планировали, что воспитатели детских садов будут носить камеры от первого лица для записи детей с целью обучения моделей ИИ, используя модель согласия opt-out.

OpenClawRadar
Повышенное количество ошибок в Claude Opus 4.7: статус обновления и чего ожидать
Новости

Повышенное количество ошибок в Claude Opus 4.7: статус обновления и чего ожидать

По состоянию на 2026-05-19T15:21Z в Claude Opus 4.7 наблюдается повышенное количество ошибок. Следите за статусом на status.claude.com.

OpenClawRadar
Google Chrome устанавливает 4 ГБ ИИ-модель Gemini Nano молча – без согласия пользователя
Новости

Google Chrome устанавливает 4 ГБ ИИ-модель Gemini Nano молча – без согласия пользователя

Обнаружено, что Google Chrome незаметно загружает и устанавливает на устройства пользователей ИИ-модель Gemini Nano размером 4 ГБ без явного согласия, что вызывает опасения по поводу конфиденциальности и использования дискового пространства.

OpenClawRadar