Lokales Multi-Agenten-Setup mit vLLM, Claude Code und gpt-oss-120b unter Linux

✍️ OpenClawRadar📅 Veröffentlicht: 26. März 2026🔗 Source
Lokales Multi-Agenten-Setup mit vLLM, Claude Code und gpt-oss-120b unter Linux
Ad

Ein Entwickler teilte seine Erfahrungen mit der Einrichtung eines vollständig lokalen, parallelen Multi-Agenten-Codierungssetups unter Linux, nachdem er von Windows gewechselt hatte. Die Konfiguration nutzt vLLM für parallele Inferenz, Claude Code für die Agenten-Orchestrierung und ein großes Sprachmodell für Codierungsaufgaben.

Setup-Komponenten

  • vLLM Docker-Container: Wird für einfache Bereitstellung und parallele Inferenz verwendet
  • Claude Code: Handhabt Vibecoding und die Orchestrierung von Agententeams, konfiguriert, um auf den vLLM localhost-Endpunkt statt auf Cloud-Anbieter zu zeigen
  • gpt-oss:120b: Dient als Codierungs-Agent
  • RTX Pro 6000 Blackwell MaxQ: Primäre GPU für die Arbeitslast
  • Dual-Boot Ubuntu: Betriebssystem-Setup
Ad

Leistung und Workflow-Verbesserungen

Der Entwickler nutzte zuvor Ollama und LM Studio, stellte jedoch fest, dass diese Anfragen sequenziell verarbeiteten und nach mehreren Nachrichtenwechseln und Tool-Aufrufen Verlangsamungen auftraten. Mit vLLM erreichte er parallele Verarbeitung, die sein Erlebnis "turboaufgeladen" hat.

In Tests bewältigte das Setup 4 gleichzeitig zusammenarbeitende Agenten, wie in einer Video-Demonstration gezeigt, wobei die GPU in der Lage war, kontinuierlich 8 Agenten parallel zu unterstützen. Das einzige festgestellte Problem war ein Durchsatzrückgang, der je nach Agent variiert.

Agententeam-Aufgaben, die zuvor sequenziell Stunden dauerten, können nun je nach Projektumfang in etwa 30 Minuten erledigt werden. Der Entwickler schätzt, dass das Hinzufügen einer zweiten MaxQ GPU das System potenziell auf Dutzende gleichzeitiger Agenten skalieren könnte.

Dieser parallele Ansatz ermöglicht Vibecoding mehrerer Projekte lokal und gleichzeitig, obwohl er in bestimmten Szenarien etwas erhöhte Latenz verursachen kann. Der Entwickler fand diesen Kompromiss vorzuziehen gegenüber der Abarbeitung von Projekten mit jeweils nur einem Agenten.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Verwendung von Claude zur Erstellung von PainSignal: Eine Datenbank mit 1.000 echten Geschäftsproblemen
Anwendungsfälle

Verwendung von Claude zur Erstellung von PainSignal: Eine Datenbank mit 1.000 echten Geschäftsproblemen

Ein Entwickler nutzte Claude Code, um PainSignal zu erstellen – eine Plattform, die 1.000 echte Geschäftsprobleme aus Branchen wie Transportwesen und Reinigung organisiert. Claude übernahm die Datenklassifizierung, die Clustering von Chancen und die Generierung von App-Konzepten.

OpenClawRadar
SkiTomorrow.ai: Eine Skireise-Entscheidungsmaschine, erstellt mit Claude Code
Anwendungsfälle

SkiTomorrow.ai: Eine Skireise-Entscheidungsmaschine, erstellt mit Claude Code

SkiTomorrow.ai ist ein kostenloses Webtool, das 234 Skigebiete weltweit basierend auf Live-Schneevorhersagen, Reiseentfernung und Kosten bewertet und dann personalisierte Ranglisten liefert. Der Entwickler hat es vollständig mit Claude Code erstellt und spezifische Workflow-Einblicke geteilt.

OpenClawRadar
Echte Anwendungsfälle und Entwicklungsmuster für MCP-Server
Anwendungsfälle

Echte Anwendungsfälle und Entwicklungsmuster für MCP-Server

Ein Entwickler teilt seine Erfahrungen beim Aufbau eines MCP-Servers, der sich mit Live-Sportdatenscannern verbindet, um Quoten von Sportwettenanbietern abzurufen und Preisineffizienzen in Echtzeit zu erkennen. Er diskutiert praktische Erkenntnisse über Tool-Design und Installationsformate.

OpenClawRadar
Claude MCP-Workflow automatisiert die LinkedIn Lead-Reaktivierung mit adaptiven Einschränkungen
Anwendungsfälle

Claude MCP-Workflow automatisiert die LinkedIn Lead-Reaktivierung mit adaptiven Einschränkungen

Ein Entwickler erstellte einen Workflow mit Claude und MCP, um automatisch alte LinkedIn-Kontakte wieder anzusteuern, Leads zu identifizieren, kontextbezogene Nachrichten zu generieren und Plattformbeschränkungen adaptiv zu handhaben. Von 7 gezielten Leads wurden 5 Nachrichten erfolgreich versendet, während 2 aufgrund von LinkedIn-Beschränkungen übersprungen wurden.

OpenClawRadar