Mesh LLM: Verteiltes KI-Computing auf Iroh – LLMs über eigene GPUs ausführen

✍️ OpenClawRadar📅 Veröffentlicht: 12. Juli 2026🔗 Source
Ad

Mesh LLM ist eine verteilte KI-Compute-Plattform, die GPUs und Arbeitsspeicher über mehrere Rechner hinweg bündelt und das Ganze als eine OpenAI-kompatible API unter http://localhost:9337/v1 bereitstellt. Sie können einen Knoten starten, später weitere hinzufügen und das Mesh entscheiden lassen, ob ein Modell lokal läuft, zu einem Peer weitergeleitet wird, der es bereits geladen hat, oder auf mehrere Rechner aufgeteilt wird.

Wie es funktioniert

Unter der Haube verwendet Mesh LLM iroh-Endpunkte für Identität (öffentlicher Schlüssel) und Netzwerk. Es gibt keinen zentralen Server. iroh übernimmt NAT-Traversal, Hole-Punching und Relay-Fallback über QUIC-Verbindungen. Das Protokoll definiert drei ALPNs:

  • mesh-llm/1 – Haupt-Mesh (Gossip, Routing, HTTP-Tunnel, Plugin-Kanäle)
  • mesh-llm-control/1 – Besitzer-Steuerebene (Konfigurationssynchronisation, Eigentumsnachweis)
  • skippy-stage/2 – latenzempfindlicher Aktivierungs-Transport für aufgeteilte Modelle

Innerhalb der Hauptverbindung wird die gesamte Kommunikation über bidirektionale QUIC-Streams gemultiplext, die durch ein einzelnes führendes Byte gekennzeichnet sind:

  • 0x01 GOSSIP – Peer-Ankündigungen (Modelle, GPU, RTT, Fähigkeiten)
  • 0x04 TUNNEL_HTTP – an einen Peer weitergeleitete Inferenzanfragen
  • 0x05 ROUTE_REQUEST – Abfrage, welche Modelle ein Peer hostet
  • 0x06 PEER_DOWN – Benachrichtigung über ausgefallenen Peer
  • 0x07 PEER_LEAVING – Graceful Shutdown
  • 0x08 PLUGIN_CHANNEL – Plugin-RPC
  • 0x0e DIRECT_PATH_REQUEST – direkte Adressen für NAT-Traversal teilen
Ad

Split-Modus („Skippy“)

Für Modelle, die zu groß für eine einzelne GPU sind (z. B. 235B Mixture-of-Experts), bietet Mesh LLM einen Split-Modus, der ein Modell nach Layer-Bereichen in Stufen unterteilt. Layer 0–15 laufen auf einem Knoten, 16–31 auf dem nächsten und so weiter. Aktivierungen fließen über QUIC-Streams von einer Stufe zur nächsten. Mehrere bescheidene Rechner können gemeinsam ein Modell ausführen, das keiner alleine halten könnte.

Plug-in-Architektur

Plugins deklarieren ihre Fähigkeiten in einem Manifest. Die Laufzeit startet sie, leitet Aufrufe weiter und macht ihre Fähigkeiten über MCP, HTTP, Inferenz und Mesh-Ereignisse verfügbar. Der Katalog umfasst über 40 Modelle – von Modellen mit einer halben Milliarde Parametern, die auf ein Laptop passen, bis hin zu den 235B Giganten.

Für wen es gedacht ist

Teams, die ihre eigene KI-Infrastruktur kontrollieren möchten: GPU-Compute privat oder öffentlich teilen, größere Modelle ausführen ohne teurere Hardware zu kaufen, und Anbieterbindung vermeiden. Jeder OpenAI-Client kann auf localhost:9337 zeigen und sich nicht mehr darum kümmern, wo die Arbeit tatsächlich stattfindet.

📖 Vollständige Quelle lesen: HN LLM Tools

Ad

👀 Siehe auch

🦀
Werkzeuge

Claudy: Ein nativer macOS-Wrapper für Claude Code mit Multi-Sitzung, automatischem Account-Wechsel und Entwurfs-Commit

Claudy ist eine native macOS-App, erstellt mit SwiftUI + SwiftData, die Claude Code umhüllt und Multi-Session-Management, automatische Kontoumstellung bei Ratengrenzen, Entwurfs-Commits für Zwischen-Checkpoints sowie einen Marktplatz für Skills, MCPs und Befehle hinzufügt.

OpenClawRadar
HolyCode: Docker-Container für persistente Claude AI-Codierungsumgebungen
Werkzeuge

HolyCode: Docker-Container für persistente Claude AI-Codierungsumgebungen

HolyCode ist ein Docker-Container, der den Zustand der KI-Codierungsumgebung bei Maschinenwechseln und Neuerstellungen beibehält. Er enthält über 30 vorinstallierte Tools, Browser-Automatisierung mit Chromium + xvfb + Playwright und bewahrt den Kontext in ./data/opencode.

OpenClawRadar
Browser-natives Echtzeit-Kohärenzkontrollsystem für Claude mit SDE-Bändern und Kalman-Filterung
Werkzeuge

Browser-natives Echtzeit-Kohärenzkontrollsystem für Claude mit SDE-Bändern und Kalman-Filterung

Ein Entwickler hat ein Echtzeit-Kohärenzsteuerungssystem erstellt, das vollständig als Claude-Artefakt im Browser läuft. Dabei wird Konversation als stochastischer Prozess behandelt, der Live-Monte-Carlo-SDE-Pfade, duale Kalman-Filterung und Verhaltenssignalerfassung nutzt.

OpenClawRadar
RelayCode VS Code Extension leitet Claude-Code über souveräne RDUs weiter
Werkzeuge

RelayCode VS Code Extension leitet Claude-Code über souveräne RDUs weiter

OpenGPU hat RelayCode veröffentlicht, eine VS Code-Erweiterung, die als lokaler Proxy fungiert, um Claude Code- oder Copilot-Anfragen über ihr dezentrales Netzwerk zu Open-Weight-Modellen wie DeepSeek-R1 und MiniMax M2.5 weiterzuleiten, die auf souveränen rekonfigurierbaren Dataflow-Einheiten laufen.

OpenClawRadar