Homa : remplacer TCP pour les réseaux de clusters d'IA
Homa est un protocole de transport conçu pour remplacer TCP dans les réseaux de datacenters et de clusters d'IA, où la latence de queue à l'échelle de la microseconde compte plus que la sémantique de flux d'octets. Cette vidéo présente la conception et sa motivation.
Ce que Homa change par rapport à TCP
TCP a été conçu pour l'internet étendu : il optimise la bande passante et l'équité entre des flux de longue durée. Homa est piloté par le récepteur. Au lieu que les émetteurs sondent la capacité, le récepteur accorde un crédit aux émetteurs et planifie les messages entrants selon SRPT (plus court temps de traitement restant en premier). Les messages courts — le cas courant pour les RPC et les opérations collectives en entraînement d'IA — sont prioritaires sur les transferts massifs.
Pourquoi c'est important pour les clusters d'IA
Le trafic d'entraînement et d'inférence d'IA est irrégulier et orienté messages. AllReduce, les mises à jour de serveurs de paramètres et les transferts de cache KV ressemblent tous à de nombreux petits messages plutôt qu'à quelques longs flux d'octets. Le contrôle de congestion par flux et la livraison en ordre des octets de TCP ajoutent un blocage en tête de file et un délai de mise en file qui nuisent au temps d'achèvement des tâches à grande échelle.
L'article original USENIX ATC '21 d'Ousterhout et al. est la référence principale. Il rapporte des réductions d'un ordre de grandeur de la latence au 99e percentile par rapport aux piles basées sur TCP sous des charges de travail de datacenter, ainsi qu'un débit plus élevé lorsque de nombreux messages courts partagent la fabrique.
Où en est-on aujourd'hui
L'article LWN lié couvre l'effort en cours pour intégrer une planification de type Homa dans la pile réseau de Linux — la longue discussion sur l'opportunité d'étendre TCP, d'ajouter un nouveau transport ou de le construire comme module noyau. L'article de The Register couvre l'angle du projet Stanford.
Si vous construisez ou exploitez des clusters GPU et que vos temps d'achèvement de tâches sont dominés par la latence de queue du réseau plutôt que par le calcul, cela vaut la peine de suivre. L'article est le moyen le plus rapide de comprendre la conception ; le fil LWN montre à quoi ressemblerait réellement l'intégration au noyau.
📖 Lire la source complète : HN LLM Tools
👀 See Also

OpenAI et ses rivaux publient des plugins d'agents : un format de package unique pour les agents IA
OpenAI, Amazon, Microsoft, Cursor et Vercel ont publié Agent Plugins 1.0, un standard ouvert pour empaqueter les extensions d'agents IA. Créez une fois, exécutez sur ChatGPT, Codex, Copilot, Cursor, et plus.

Sept façons d'éviter de perdre votre emploi face à l'IA – Le guide pratique de Tyler Cowen
Tyler Cowen énonce sept principes, notamment rechercher des emplois désordonnés et se méfier du télétravail, pour protéger sa carrière face à la concurrence de l'IA.
Claude Code v2.1.271 : mode rapide dans les sessions distantes, allowed_domains par commande et une série de correctifs pour les autorisations Bash
Claude Code v2.1.271 ajoute le mode rapide aux sessions distantes, des allowed_domains par commande pour le Bash/PowerShell en bac à sable, et --accept-command <sha256> pour l'installation de plugins, plus une longue liste de correctifs sur les permissions Bash et les stratégies d'organisation.

Cerebras lance les modèles Step-3.5-Flash-REAP avec une réduction de 40 % de la mémoire.
Cerebras a publié les modèles Step-3.5-Flash-REAP qui utilisent REAP (Router-weighted Expert Activation Pruning) pour compresser des modèles de 196B paramètres à 121B tout en maintenant des performances quasi identiques. Les modèles fonctionnent avec vLLM standard et sont optimisés pour les environnements aux ressources limitées.