Lokales LLM-Pipeline-Kontextdriftproblem bei mehrstufigen Agenten-Workflows

✍️ OpenClawRadar📅 Veröffentlicht: 21. März 2026🔗 Source
Lokales LLM-Pipeline-Kontextdriftproblem bei mehrstufigen Agenten-Workflows
Ad

Praktische Erkenntnisse aus zwei Monaten LLM-Pipeline-Tests

Ein Entwickler hat kürzlich Ergebnisse aus dem Betrieb einer mehrstufigen Pipeline zur Automatisierung der Jobsuche über zwei Monate geteilt. Die Pipeline umfasste Recherche, Lebenslauf-Erstellung und Anschreiben-Generierung. Die Tests wurden mit Llama-3.3-70b-versatile sowohl auf der kostenlosen Stufe von Groq als auch lokal mit Ollama während abendlicher Läufe über mehrere Wochen durchgeführt.

Wo lokale Modelle an Boden verloren

Während lokale Modelle bei Datenschutz, Kosten und der Sorglosigkeit bezüglich Kontingenten pro Sitzung punkten, hatten sie erhebliche Probleme in agentenbasierten Workflows:

  • Kontextdrift in mehrstufigen Pipelines: Lokale Modelle konnten Schritt 2 erfolgreich abschließen, vergaßen aber bis Schritt 4, was in Schritt 1 etabliert wurde. Der Entwickler beobachtete dies über 5 bis 6 Knoten-Pipelines, bei denen die Aufrechterhaltung eines kohärenten Kontexts entscheidend war.
  • Vergleich mit Cloud-Modellen: Claude auf der kostenlosen Stufe von Groq zeigte dieses Kontextdrift-Problem bei weitem nicht so stark, was auf eine bessere Leistung bei der Kontexterhaltung über sequenzielle Aufgaben hindeutet.
Ad

Versteckte Falle der kostenlosen Stufe

Der Entwickler wies auf ein weiteres praktisches Problem hin: Kostenlose Modelle werden leise und ohne Vorwarnung eingestellt. Man kann eine Pipeline mit einem bestimmten Modell einrichten, sich für ein paar Wochen entfernen und zurückkehren, um die Hälfte der Konfiguration kaputt und mit falschen Ausgaben vorzufinden.

Der Entwickler merkte an, dass dies kein Benchmark-Post war, sondern tatsächliche Erfahrung, und dass er bezüglich des Kontextdrift-Teils durchaus offen dafür ist, falsch zu liegen, während er fragt, was derzeit tatsächlich für mehrstufige agentenbasierte Arbeit funktioniert.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Verwendung von Claude als Kreativdirektor in einem Sticker-Erstellungsprozess
Anwendungsfälle

Verwendung von Claude als Kreativdirektor in einem Sticker-Erstellungsprozess

Ein Entwickler baute eine Sticker-App, bei der Claude hochgeladene Benutzerfotos analysiert, neun Sticker-Konzepte generiert und detaillierte Prompts für Bildmodelle schreibt, was zu personalisierten statt generischen Stickern führt.

OpenClawRadar
BinktermPHP: Eine vollständige BBS/FidoNet-Plattform, die hauptsächlich mit Claude erstellt wurde
Anwendungsfälle

BinktermPHP: Eine vollständige BBS/FidoNet-Plattform, die hauptsächlich mit Claude erstellt wurde

BinktermPHP ist ein quelloffenes, webbasiertes BBS, das in PHP 8 mit PostgreSQL geschrieben ist. Es verfügt über einen integrierten binkp FidoNet-Mailer, Echomail/Netmail, Dateibereiche, Door-Games, Echtzeit-Server-Push und einen MCP-Server, der Echomail für KI-Assistenten zugänglich macht. Der Entwickler berichtet, dass er es fast vollständig mit Claude für die Implementierung erstellt hat, während er Architektur und Tests übernahm.

OpenClawRadar
V100 Cluster vs. MoE: 12x SXM2 32GB Build mit Claude Code Orchestrierung
Anwendungsfälle

V100 Cluster vs. MoE: 12x SXM2 32GB Build mit Claude Code Orchestrierung

Ein Anwalt, der einen 12x V100 32 GB SXM2-Cluster auf einem Threadripper Pro betreibt, berichtet, dass MoE-Modelle der einzige gangbare Weg auf Volta sind, wobei Qwen3.5-122B-A10B mit ~50 tok/s auf vier Karten decodiert. Der gesamte Stack nutzt Claude Code, um 5 lokale Modelle auf 16 GPUs zu orchestrieren.

OpenClawRadar
Mit Claude verfasste Masterarbeit: Wirtschaftsstudent besteht mit Bestnote
Anwendungsfälle

Mit Claude verfasste Masterarbeit: Wirtschaftsstudent besteht mit Bestnote

Ein Wirtschaftsstudent nutzte Claude für die Literaturrecherche, Datenanalyse mit Python-Skripten und Excel sowie die Präsentation – bestand mit einer Spitzennote nahe dem PhD-Niveau. Im Anhang wurde die KI-Nutzung offengelegt, es wurden keine Fragen gestellt.

OpenClawRadar