Mesh LLM: Verteiltes KI-Computing auf Iroh – LLMs über eigene GPUs ausführen

✍️ OpenClawRadar📅 Veröffentlicht: 12. Juli 2026🔗 Source
Ad

Mesh LLM ist eine verteilte KI-Compute-Plattform, die GPUs und Arbeitsspeicher über mehrere Rechner hinweg bündelt und das Ganze als eine OpenAI-kompatible API unter http://localhost:9337/v1 bereitstellt. Sie können einen Knoten starten, später weitere hinzufügen und das Mesh entscheiden lassen, ob ein Modell lokal läuft, zu einem Peer weitergeleitet wird, der es bereits geladen hat, oder auf mehrere Rechner aufgeteilt wird.

Wie es funktioniert

Unter der Haube verwendet Mesh LLM iroh-Endpunkte für Identität (öffentlicher Schlüssel) und Netzwerk. Es gibt keinen zentralen Server. iroh übernimmt NAT-Traversal, Hole-Punching und Relay-Fallback über QUIC-Verbindungen. Das Protokoll definiert drei ALPNs:

  • mesh-llm/1 – Haupt-Mesh (Gossip, Routing, HTTP-Tunnel, Plugin-Kanäle)
  • mesh-llm-control/1 – Besitzer-Steuerebene (Konfigurationssynchronisation, Eigentumsnachweis)
  • skippy-stage/2 – latenzempfindlicher Aktivierungs-Transport für aufgeteilte Modelle

Innerhalb der Hauptverbindung wird die gesamte Kommunikation über bidirektionale QUIC-Streams gemultiplext, die durch ein einzelnes führendes Byte gekennzeichnet sind:

  • 0x01 GOSSIP – Peer-Ankündigungen (Modelle, GPU, RTT, Fähigkeiten)
  • 0x04 TUNNEL_HTTP – an einen Peer weitergeleitete Inferenzanfragen
  • 0x05 ROUTE_REQUEST – Abfrage, welche Modelle ein Peer hostet
  • 0x06 PEER_DOWN – Benachrichtigung über ausgefallenen Peer
  • 0x07 PEER_LEAVING – Graceful Shutdown
  • 0x08 PLUGIN_CHANNEL – Plugin-RPC
  • 0x0e DIRECT_PATH_REQUEST – direkte Adressen für NAT-Traversal teilen
Ad

Split-Modus („Skippy“)

Für Modelle, die zu groß für eine einzelne GPU sind (z. B. 235B Mixture-of-Experts), bietet Mesh LLM einen Split-Modus, der ein Modell nach Layer-Bereichen in Stufen unterteilt. Layer 0–15 laufen auf einem Knoten, 16–31 auf dem nächsten und so weiter. Aktivierungen fließen über QUIC-Streams von einer Stufe zur nächsten. Mehrere bescheidene Rechner können gemeinsam ein Modell ausführen, das keiner alleine halten könnte.

Plug-in-Architektur

Plugins deklarieren ihre Fähigkeiten in einem Manifest. Die Laufzeit startet sie, leitet Aufrufe weiter und macht ihre Fähigkeiten über MCP, HTTP, Inferenz und Mesh-Ereignisse verfügbar. Der Katalog umfasst über 40 Modelle – von Modellen mit einer halben Milliarde Parametern, die auf ein Laptop passen, bis hin zu den 235B Giganten.

Für wen es gedacht ist

Teams, die ihre eigene KI-Infrastruktur kontrollieren möchten: GPU-Compute privat oder öffentlich teilen, größere Modelle ausführen ohne teurere Hardware zu kaufen, und Anbieterbindung vermeiden. Jeder OpenAI-Client kann auf localhost:9337 zeigen und sich nicht mehr darum kümmern, wo die Arbeit tatsächlich stattfindet.

📖 Vollständige Quelle lesen: HN LLM Tools

Ad

👀 Siehe auch

Kubeez MCP Server verbindet Claude mit über 70 KI-Medienmodellen
Werkzeuge

Kubeez MCP Server verbindet Claude mit über 70 KI-Medienmodellen

Kubeez hat einen MCP-Server veröffentlicht, der Claude mit über 70 KI-Modellen für Bild-, Video-, Musik- und Sprachgenerierung verbindet. Der Server unterstützt OAuth-Authentifizierung und bietet asynchrone Generierung, wobei Claude den Status abfragt und CDN-URLs zurückgibt.

OpenClawRadar
Open-Source Web-UI für parallele Claude-Code-Sitzungen mit Git Worktree
Werkzeuge

Open-Source Web-UI für parallele Claude-Code-Sitzungen mit Git Worktree

Ein Entwickler hat eine Open-Source-Web-Oberfläche namens CCUI erstellt, die es ermöglicht, mehrere Claude Code-Sitzungen parallel mit git worktree auszuführen. Sie läuft als lokaler Webserver, der über einen Browser zugänglich ist, und unterstützt SSH-Portweiterleitung für die Remote-Entwicklung.

OpenClawRadar
Warum KI-Kopfgeldjäger Geld verlieren: Daten aus 60 Ausgaben
Werkzeuge

Warum KI-Kopfgeldjäger Geld verlieren: Daten aus 60 Ausgaben

Ein Entwickler versuchte, Claude mit einem Token-Budget von 20 $ dazu zu bringen, Geld mit Open-Source-Bounties zu verdienen. Nachdem er über 80 Algora-Bounties gescannt hatte, stellte er fest, dass die meisten mit 10+ offenen PRs, 1 $-Spam oder für Interviews reserviert sind. Erwarteter Wert: 0 $.

OpenClawRadar
Lokales Dashboard verfolgt Claude Code-Nutzung mit Token-Kosten, Tool-Aufrufen und Sitzungsanalysen
Werkzeuge

Lokales Dashboard verfolgt Claude Code-Nutzung mit Token-Kosten, Tool-Aufrufen und Sitzungsanalysen

Ein Entwickler hat ein lokales Dashboard erstellt, das JSONL-Sitzungsdateien von Claude Code liest, um die Token-Nutzung, geschätzte Kosten, Tool-Aufrufaufschlüsselungen und Sitzungsverlauf zu visualisieren. Das Tool läuft vollständig auf Ihrem Rechner mit einer Express-API und einem React-Dashboard.

OpenClawRadar