Mesh LLM : Calcul IA distribué sur Iroh – Exécutez des LLMs sur vos propres GPU

✍️ OpenClawRadar📅 Publié: July 12, 2026🔗 Source
Ad

Mesh LLM est une plateforme de calcul IA distribuée qui mutualise les GPU et la mémoire de plusieurs machines et expose le tout comme une API compatible OpenAI à l'adresse http://localhost:9337/v1. Vous pouvez démarrer un nœud, en ajouter d'autres plus tard, et laisser le maillage décider si un modèle s'exécute localement, est routé vers un pair qui l'a déjà chargé, ou se répartit sur plusieurs machines.

Comment ça marche

Sous le capot, Mesh LLM utilise les points de terminaison iroh pour l'identité (clé publique) et le réseau. Il n'y a pas de serveur central. iroh gère la traversée NAT, le hole-punching et le relais de secours via des connexions QUIC. Le protocole définit trois ALPN :

  • mesh-llm/1 – maillage principal (gossip, routage, tunnels HTTP, canaux de plugins)
  • mesh-llm-control/1 – plan de contrôle propriétaire (synchronisation de configuration, attestation de propriété)
  • skippy-stage/2 – transport d'activation sensible à la latence pour les modèles divisés

Dans la connexion principale, toute communication est multiplexée sur des flux QUIC bidirectionnels étiquetés par un seul octet de tête :

  • 0x01 GOSSIP – annonces de pairs (modèles, GPU, RTT, capacités)
  • 0x04 TUNNEL_HTTP – requêtes d'inférence proxyées vers un pair
  • 0x05 ROUTE_REQUEST – interroger les modèles hébergés par un pair
  • 0x06 PEER_DOWN – notification de pair mort
  • 0x07 PEER_LEAVING – arrêt gracieux
  • 0x08 PLUGIN_CHANNEL – RPC de plugin
  • 0x0e DIRECT_PATH_REQUEST – partage d'adresses directes pour la traversée NAT
Ad

Mode fractionné (« Skippy »)

Pour les modèles trop volumineux pour un seul GPU (par exemple, 235B mixture-of-experts), Mesh LLM dispose d'un mode fractionné qui partitionne un modèle par plages de couches en étapes. Les couches 0 à 15 s'exécutent sur un nœud, 16 à 31 sur le suivant, etc. Les activations circulent d'une étape à la suivante via des flux QUIC. Plusieurs machines modestes peuvent ensemble exécuter un modèle qu'aucune ne pourrait contenir seule.

Architecture enfichable

Les plugins déclarent leurs capacités dans un manifeste. L'exécution les démarre, achemine les appels et expose leurs capacités via MCP, HTTP, inférence et événements du maillage. Le catalogue propose plus de 40 modèles — des modèles d'un demi-milliard de paramètres qui tiennent sur un ordinateur portable aux géants de 235B.

À qui cela s'adresse

Équipes qui veulent contrôler leur propre infrastructure IA : partager des GPU en privé ou en public, exécuter des modèles plus grands sans acheter de matériel plus puissant, et éviter la dépendance vis-à-vis d'un fournisseur. N'importe quel client OpenAI peut pointer vers localhost:9337 et ne plus se soucier de l'endroit où le travail s'effectue réellement.

📖 Lire la source complète : HN LLM Tools

Ad

👀 See Also

Parlez avec Claw : Interface Vocale iOS Open Source pour les Bots OpenClaw Telegram
Tools

Parlez avec Claw : Interface Vocale iOS Open Source pour les Bots OpenClaw Telegram

Une application iOS open source qui permet une interaction vocale avec les bots Telegram alimentés par OpenClaw. L'application envoie l'audio à un serveur Mac local pour traitement, avec des réponses retournées sous forme de texte et d'audio.

OpenClawRadar
Homebutler : Serveur MCP pour la gestion de multi-serveurs en homelab via Claude
Tools

Homebutler : Serveur MCP pour la gestion de multi-serveurs en homelab via Claude

Homebutler est un binaire Go avec un serveur MCP intégré qui permet à Claude de gérer plusieurs serveurs via SSH sans installer d'agents sur les machines distantes. Il fournit 9 outils incluant la surveillance de l'état du système, la gestion des conteneurs Docker, le scan de ports et des règles d'alerte.

OpenClawRadar
Script et Processus de Fusion de Modèles GGUF pour les Variantes Qwen3.5-35B
Tools

Script et Processus de Fusion de Modèles GGUF pour les Variantes Qwen3.5-35B

Un utilisateur de Reddit a partagé un script Python pour fusionner des fichiers de modèles GGUF avec une perte minimale, combinant spécifiquement le modèle Qwen3.5-35B-A3B-Uncensored de HauhauCS avec la version Claude-4.6-Opus-Reasoning-Distilled de samuelcardillo. Le script fonctionne sur Google Colab Free Tier et inclut le support de la quantification via llama-quantize.

OpenClawRadar
BuddyBoard : Un classement compétitif pour la fonctionnalité /buddy de Claude Code
Tools

BuddyBoard : Un classement compétitif pour la fonctionnalité /buddy de Claude Code

BuddyBoard est un outil créé par la communauté qui établit un classement compétitif pour la fonctionnalité /buddy de Claude Code, générant des cartes à collectionner avec des statistiques, des niveaux de rareté et un BuddyDex suivant 1 728 combinaisons possibles. Exécutez avec npx buddy-board pour soumettre votre buddy au classement mondial.

OpenClawRadar