Ausführen einer 6-Agenten-Verhaltenscoaching-Pipeline auf selbst gehostetem Qwen3 235B mit vLLM

✍️ OpenClawRadar📅 Veröffentlicht: 1. April 2026🔗 Source
Ausführen einer 6-Agenten-Verhaltenscoaching-Pipeline auf selbst gehostetem Qwen3 235B mit vLLM
Ad

Multi-Agenten-Verhaltenscoaching-System

Ein Entwickler hat eine 6-Agenten-Kognitionspipeline für Verhaltenscoaching implementiert, die vollständig auf selbst gehosteten Qwen3-Modellen über vLLM läuft. Das System verwendet Claude-Code-Instanzen als Agenten, die einen vLLM-Endpunkt aufrufen, wobei vier spezialisierte Agenten gleichzeitig auf jede Benutzernachricht reagieren.

Hardware und Einrichtung

  • Entwicklung: Qwen3 30B auf 2x RTX 4090
  • Produktion: Qwen3 235B auf RunPod A40-Pods
  • Alle 6 Agenten sind Claude-Code-Instanzen, die den vLLM-Endpunkt aufrufen

Pipeline-Architektur

Jede Benutzernachricht löst 6 Agenten in einer Sequenz aus:

  • Shadow - Läuft zuerst, schreibt verhaltensbezogene Muster über Sitzungen hinweg auf ein gemeinsames Schwarzes Brett (formulierte Ziele vs. tatsächliche Prioritäten, Durchhaltevorhersage, Musterklassifizierung)
  • Persona - OCEAN-Bewertung, Erkennung wiederkehrender Ziele, Durchhaltevorhersage in Prozent, Identifizierung von Entwicklungsmöglichkeiten
  • Plasticity - Persönlichkeitsbasierte Coaching-Strategie, ordnet OCEAN-Werte Kommunikationspräferenzen zu
  • Stability - Risikorahmen mit Bewertungen für Schweregrad/Erkennbarkeit/Umkehrbarkeit, identifiziert blockierte Schritte, die der Coach nicht vorschlagen sollte
  • Coach - Reagiert früh für eine sofortige Antwort, während die anderen Agenten verarbeiten (~Sekunden)
  • Synth (Pineal) - Führt alle Arbeitsausgaben zusammen, wendet Sprachkalibrierung an, liefert die vollständige Antwort
Ad

Leistungsmerkmale

Der Benutzer erhält eine sofortige Coach-Antwort, dann folgt die vollständige Synthese etwa 40 Sekunden später auf 2x RTX 4090. Auf der A40-Konfiguration dauert dies etwa 108 Sekunden – kontraintuitiv langsamer aufgrund einer anderen Speicherarchitektur.

Wichtige Implementierungserkenntnisse

Was funktioniert hat:

  • Parallele Verteilung ist der Schlüssel für die Leistung
  • Shadow muss zuerst schreiben, weil die Synthese den Inhalt des Schwarzen Brettes benötigt, um korrekt zu aggregieren
  • Die Sequenzlogik, um sicherzustellen, dass Shadow vor Synth abgeschlossen ist, fügt bedeutende Komplexität hinzu, ist aber unverzichtbar
  • Kontextverwaltung im 235B-Maßstab ist teuer – jeder Agent erhält ein vollständiges Kontextbriefing plus Sitzungshistorie
  • Aggressive Komprimierung zwischen Sitzungen und strenge Kontextbudgets pro Agent waren die Haupthebel für Zuverlässigkeit

Was schwierig ist:

  • Agenten dazu zu bringen, strukturierte Ausgaben zuverlässig genug zu schreiben, damit die Synthese sie ohne Halluzinationen von Zusammenführungsartefakten aggregieren kann
  • Hauptfehlermodus: Synth sieht widersprüchliche Signale von Persona und Stability in derselben Sitzung

Der Entwickler sucht Input von anderen, die Multi-Agenten-Systeme auf selbst gehosteter Inferenz betreiben, insbesondere bezüglich Parallelisierungsstrategien im 235B-Maßstab.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Claude als Struktur-Interrogator für kreative Projekte nutzen
Anwendungsfälle

Claude als Struktur-Interrogator für kreative Projekte nutzen

Ein Entwickler nutzte Claude auf fragende Weise, um einen 63.000 Wörter umfassenden Science-Fiction-Roman zu schreiben und ein Browserspiel zu erstellen, indem er die KI Lücken in der Weltlogik und Charaktermotivationen identifizieren ließ, anstatt Inhalte direkt zu generieren.

OpenClawRadar
Ein Nicht-Programmierer-Setup zur Dateisystem-Projektverwaltung für Claude Desktop
Anwendungsfälle

Ein Nicht-Programmierer-Setup zur Dateisystem-Projektverwaltung für Claude Desktop

Ein Reddit-Nutzer teilt sein System, um Claudes Chat mit Dateisystem- und Cowork-Funktionen zur Verwaltung mehrerer langfristiger Projekte zu nutzen. Das Setup verwendet eine standardisierte Verzeichnisstruktur mit WORKFLOW.txt als Einstiegspunkt und enthält spezifische Projektanweisungen zur Aufrechterhaltung der Kontinuität über Sitzungen hinweg.

OpenClawRadar
Nicht-Entwickler findet verwaltetes OpenClaw-Setup über MaxClaw auf der MiniMax Agent-Plattform
Anwendungsfälle

Nicht-Entwickler findet verwaltetes OpenClaw-Setup über MaxClaw auf der MiniMax Agent-Plattform

Ein freiberuflicher Marketingberater ohne Programmierkenntnisse hat erfolgreich einen KI-Agenten mit MaxClaw auf der MiniMax Agent-Plattform eingesetzt, wobei Docker und API-Schlüsselverwaltung umgangen wurden. Der Agent übernimmt tägliches Wettbewerbsmonitoring, erstellt Social-Media-Texte und fasst Artikel zusammen.

OpenClawRadar
OpenClaw-Agent im Aivilization-Persistent-World-Simulator getestet
Anwendungsfälle

OpenClaw-Agent im Aivilization-Persistent-World-Simulator getestet

Ein Entwickler experimentierte, indem er seinen OpenClaw-Agenten in Aivilization einführte, eine Open-World-Simulation, in der KI-Agenten als Bewohner existieren. Anstatt über Terminal-Workflows zu agieren, wurde der Agent zu einem Charakter, der zur Schule ging, Bücher las, Landwirtschaft betrieb, Arbeit fand, Geld verdiente und mit anderen Agenten interagierte.

OpenClawRadar