Lokales Multi-Agenten-Setup mit vLLM, Claude Code und gpt-oss-120b unter Linux

Ein Entwickler teilte seine Erfahrungen mit der Einrichtung eines vollständig lokalen, parallelen Multi-Agenten-Codierungssetups unter Linux, nachdem er von Windows gewechselt hatte. Die Konfiguration nutzt vLLM für parallele Inferenz, Claude Code für die Agenten-Orchestrierung und ein großes Sprachmodell für Codierungsaufgaben.
Setup-Komponenten
- vLLM Docker-Container: Wird für einfache Bereitstellung und parallele Inferenz verwendet
- Claude Code: Handhabt Vibecoding und die Orchestrierung von Agententeams, konfiguriert, um auf den vLLM localhost-Endpunkt statt auf Cloud-Anbieter zu zeigen
- gpt-oss:120b: Dient als Codierungs-Agent
- RTX Pro 6000 Blackwell MaxQ: Primäre GPU für die Arbeitslast
- Dual-Boot Ubuntu: Betriebssystem-Setup
Leistung und Workflow-Verbesserungen
Der Entwickler nutzte zuvor Ollama und LM Studio, stellte jedoch fest, dass diese Anfragen sequenziell verarbeiteten und nach mehreren Nachrichtenwechseln und Tool-Aufrufen Verlangsamungen auftraten. Mit vLLM erreichte er parallele Verarbeitung, die sein Erlebnis "turboaufgeladen" hat.
In Tests bewältigte das Setup 4 gleichzeitig zusammenarbeitende Agenten, wie in einer Video-Demonstration gezeigt, wobei die GPU in der Lage war, kontinuierlich 8 Agenten parallel zu unterstützen. Das einzige festgestellte Problem war ein Durchsatzrückgang, der je nach Agent variiert.
Agententeam-Aufgaben, die zuvor sequenziell Stunden dauerten, können nun je nach Projektumfang in etwa 30 Minuten erledigt werden. Der Entwickler schätzt, dass das Hinzufügen einer zweiten MaxQ GPU das System potenziell auf Dutzende gleichzeitiger Agenten skalieren könnte.
Dieser parallele Ansatz ermöglicht Vibecoding mehrerer Projekte lokal und gleichzeitig, obwohl er in bestimmten Szenarien etwas erhöhte Latenz verursachen kann. Der Entwickler fand diesen Kompromiss vorzuziehen gegenüber der Abarbeitung von Projekten mit jeweils nur einem Agenten.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Patient nutzt Claude AI, um medizinische Daten zu interpretieren und die Behandlung von Gehirntumor zu steuern.
Ein 27-jähriger Patient mit primärem mediastinalem B-Zell-Lymphom mit ZNS-Beteiligung nutzt Claude AI täglich, um Immunhistochemie-Panels zu interpretieren, PET-CT-Scan-Ergebnisse zu analysieren, CAR-T-Studiendaten auszuwerten, Medikamentenmechanismen zu verstehen und Fragen für das medizinische Team vorzubereiten.

Praktische Anwendungsfälle für Coworking: Von der Massenbearbeitung von Bild-Metadaten bis zu API-Workarounds
Ein Nutzer beschreibt konkrete Cowork-Anwendungen, darunter das Automatisieren von Banner-Uploads mit CSV-Generierung, das Reverse-Engineering von UI-APIs für Datenübertragungen und das Erstellen von selbstverbessernden Skills für repetitive Aufgaben.

Lokale Feinabstimmung von Llama 3.2-1B zur Geheimniserkennung übertrifft Wizs Modell
Ein Entwickler hat das Geheimniserkennungsmodell von Wiz mit rein lokaler KI repliziert und verbessert und dabei eine Präzision von 88 % und einen Recall von 84,4 % mit Llama 3.2-1B erreicht. Der Prozess umfasste Datensatzerweiterung durch prozedurale Generierung und lokale Kennzeichnung mit Qwen3-Coder-Next.

Täglicher 3,5-Stunden-Sprach- + Claude-Workflow: Spezifikationen beim Gehen diktieren, mit Claude Code erstellen
Ein Entwickler geht mit 3 Hunden 12+ Mal am Tag spazieren (3,5 Stunden) und nutzt dabei Spracheingabe + Claude, um zu brainstormen, zu recherchieren und spec.md-Dateien zu erstellen. Anschließend baut Claude Code basierend auf diesen Spezifikationen.