Homa: замена TCP для сетевого взаимодействия в кластерах ИИ
Homa — это транспортный протокол, разработанный для замены TCP в сетях дата-центров и AI-кластеров, где хвостовая задержка на уровне микросекунд важнее семантики байтового потока. В этом видео разбирается дизайн и его мотивация.
Что Homa меняет по сравнению с TCP
TCP создавался для глобального интернета: он оптимизирован под пропускную способность и справедливость между долгоживущими потоками. Homa управляется получателем. Вместо того чтобы отправители зондировали доступную пропускную способность, получатель выдаёт кредиты отправителям и планирует входящие сообщения с помощью SRPT (shortest-remaining-processing-time first — первым обрабатывается сообщение с наименьшим оставшимся временем обработки). Короткие сообщения — типичный случай для RPC и коллективных операций в AI-обучении — получают приоритет над крупными массовыми передачами.
Почему это важно для AI-кластеров
Трафик AI-обучения и инференса носит импульсный и сообщение-ориентированный характер. AllReduce, обновления parameter server и передачи KV-кэша выглядят как множество мелких сообщений, а не как несколько длинных байтовых потоков. Управление перегрузкой на уровне отдельных потоков и доставка байтов в порядке следования в TCP добавляют блокировку из-за головного элемента и задержку в очередях, что ухудшает время выполнения задач при масштабировании.
Оригинальная статья USENIX ATC '21 авторства Ousterhout и др. — это основной источник. В ней сообщается о снижении задержки сообщений на 99-м процентиле на порядки по сравнению со стеками на основе TCP в дата-центровых нагрузках, а также о более высокой пропускной способности, когда множество коротких сообщений делят сеть.
Текущее состояние
Связанная статья LWN освещает текущие усилия по внедрению планирования в духе Homa в сетевой стек Linux — давнюю дискуссию о том, расширять ли TCP, добавлять новый транспорт или реализовать его как модуль ядра. Материал The Register рассматривает проектную сторону Stanford.
Если вы создаёте или эксплуатируете GPU-кластеры и время выполнения ваших задач определяется в основном хвостовой задержкой сети, а не вычислениями, за этим стоит следить. Статья — самый быстрый способ понять дизайн; ветка LWN показывает, как на самом деле могла бы выглядеть интеграция в ядро.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также
Когнитивная капитуляция: когда ИИ-агенты пишут код, который вы не понимаете
ИИ-агенты кодирования могут создавать код, который авторы не понимают, что приводит к непроверенным PR. Статья исследует «когнитивную капитуляцию» и способы её избежать в вашем рабочем процессе.

Исследователи Университета Вашингтона планируют использовать камеры, закрепленные на учителях, для обучения ИИ; родители могут отказаться
Исследователи из Вашингтонского университета планировали, что воспитатели детских садов будут носить камеры от первого лица для записи детей с целью обучения моделей ИИ, используя модель согласия opt-out.

Повышенное количество ошибок в Claude Opus 4.7: статус обновления и чего ожидать
По состоянию на 2026-05-19T15:21Z в Claude Opus 4.7 наблюдается повышенное количество ошибок. Следите за статусом на status.claude.com.

Google Chrome устанавливает 4 ГБ ИИ-модель Gemini Nano молча – без согласия пользователя
Обнаружено, что Google Chrome незаметно загружает и устанавливает на устройства пользователей ИИ-модель Gemini Nano размером 4 ГБ без явного согласия, что вызывает опасения по поводу конфиденциальности и использования дискового пространства.