Homa: Substituindo o TCP para redes de clusters de IA

✍️ OpenClawRadar📅 Publicado: October 5, 2026🔗 Source
Ad

Homa é um protocolo de transporte projetado para substituir o TCP em redes de datacenter e clusters de IA, onde a latência de cauda em escala de microssegundos importa mais do que a semântica de fluxo de bytes. Este vídeo percorre o design e sua motivação.

O que o Homa muda em relação ao TCP

O TCP foi criado para a internet de longa distância: ele otimiza largura de banda e justiça entre fluxos de longa duração. O Homa é orientado pelo receptor. Em vez de os emissores sondarem a capacidade, o receptor concede crédito de volta aos emissores e agenda as mensagens recebidas usando SRPT (shortest-remaining-processing-time first). Mensagens curtas — o caso comum para RPC e operações coletivas no treinamento de IA — têm prioridade sobre grandes transferências em massa.

Por que isso importa para clusters de IA

O tráfego de treinamento e inferência de IA é explosivo e orientado a mensagens. AllReduce, atualizações de parameter server e transferências de KV-cache se parecem com muitas mensagens pequenas, e não com alguns fluxos longos de bytes. O controle de congestão por fluxo e a entrega em ordem do TCP adicionam bloqueio de cabeça de fila e atraso de enfileiramento que prejudicam o tempo de conclusão de jobs em escala.

O artigo original da USENIX ATC '21 de Ousterhout et al. é a referência central. Ele relata reduções de ordem de magnitude na latência de mensagens no percentil 99 em comparação com pilhas baseadas em TCP sob cargas de datacenter, além de maior throughput quando muitas mensagens curtas compartilham a malha.

Ad

Onde está agora

O artigo da LWN linkado cobre o esforço em andamento para trazer o agendamento estilo Homa para a pilha de rede do Linux — a longa discussão sobre se deve estender o TCP, adicionar um novo transporte ou construí-lo como um módulo de kernel. A peça do The Register cobre o ângulo do projeto de Stanford.

Se você está construindo ou operando clusters de GPU e seus tempos de conclusão de jobs são dominados pela latência de cauda da rede em vez de computação, vale a pena acompanhar. O artigo é a maneira mais rápida de entender o design; a thread da LWN mostra como a integração com o kernel realmente seria.

📖 Read the full source: HN LLM Tools

Ad

👀 See Also

Anthropic Esclarece Política de Uso do CLI Claude para Integração OpenClaw
News

Anthropic Esclarece Política de Uso do CLI Claude para Integração OpenClaw

A Anthropic confirmou que o uso do Claude CLI no estilo OpenClaw está permitido novamente, permitindo que os desenvolvedores reutilizem logins existentes do Claude CLI diretamente. A documentação detalha tanto os métodos de autenticação por chave de API quanto por CLI, juntamente com opções de configuração para os modelos Claude 4.6, modo rápido e cache de prompt.

OpenClawRadar
Encíclica do Papa Leão XIV sobre IA: Principais Pontos para Desenvolvedores
News

Encíclica do Papa Leão XIV sobre IA: Principais Pontos para Desenvolvedores

O Vaticano publicou uma encíclica sobre ética em IA. O documento destaca problemas de interpretabilidade de LLMs, vieses culturais nos dados de treinamento e o custo ambiental da IA.

OpenClawRadar
Mistral Medium 3.5 128B Lançado: Modelo Denso com Raciocínio e Visão Configuráveis
News

Mistral Medium 3.5 128B Lançado: Modelo Denso com Raciocínio e Visão Configuráveis

A Mistral AI lançou o Mistral Medium 3.5, um modelo denso de 128B com contexto de 256k, esforço de raciocínio configurável e capacidades de visão, sob uma licença MIT modificada.

OpenClawRadar
Coinbase x402 vs Google A2A: Duas Ordens de Pagamento Opostas para Pagamentos entre Agentes
News

Coinbase x402 vs Google A2A: Duas Ordens de Pagamento Opostas para Pagamentos entre Agentes

Construindo pagamentos entre agentes revela uma divisão fundamental: o middleware x402 da Coinbase liquida após o trabalho (verificar→executar→liquidar), enquanto a extensão A2A do Google liquida antes (verificar→liquidar→executar) para chamadas lentas de agentes.

OpenClawRadar