Lokales LLM-Pipeline-Kontextdriftproblem bei mehrstufigen Agenten-Workflows

Praktische Erkenntnisse aus zwei Monaten LLM-Pipeline-Tests
Ein Entwickler hat kürzlich Ergebnisse aus dem Betrieb einer mehrstufigen Pipeline zur Automatisierung der Jobsuche über zwei Monate geteilt. Die Pipeline umfasste Recherche, Lebenslauf-Erstellung und Anschreiben-Generierung. Die Tests wurden mit Llama-3.3-70b-versatile sowohl auf der kostenlosen Stufe von Groq als auch lokal mit Ollama während abendlicher Läufe über mehrere Wochen durchgeführt.
Wo lokale Modelle an Boden verloren
Während lokale Modelle bei Datenschutz, Kosten und der Sorglosigkeit bezüglich Kontingenten pro Sitzung punkten, hatten sie erhebliche Probleme in agentenbasierten Workflows:
- Kontextdrift in mehrstufigen Pipelines: Lokale Modelle konnten Schritt 2 erfolgreich abschließen, vergaßen aber bis Schritt 4, was in Schritt 1 etabliert wurde. Der Entwickler beobachtete dies über 5 bis 6 Knoten-Pipelines, bei denen die Aufrechterhaltung eines kohärenten Kontexts entscheidend war.
- Vergleich mit Cloud-Modellen: Claude auf der kostenlosen Stufe von Groq zeigte dieses Kontextdrift-Problem bei weitem nicht so stark, was auf eine bessere Leistung bei der Kontexterhaltung über sequenzielle Aufgaben hindeutet.
Versteckte Falle der kostenlosen Stufe
Der Entwickler wies auf ein weiteres praktisches Problem hin: Kostenlose Modelle werden leise und ohne Vorwarnung eingestellt. Man kann eine Pipeline mit einem bestimmten Modell einrichten, sich für ein paar Wochen entfernen und zurückkehren, um die Hälfte der Konfiguration kaputt und mit falschen Ausgaben vorzufinden.
Der Entwickler merkte an, dass dies kein Benchmark-Post war, sondern tatsächliche Erfahrung, und dass er bezüglich des Kontextdrift-Teils durchaus offen dafür ist, falsch zu liegen, während er fragt, was derzeit tatsächlich für mehrstufige agentenbasierte Arbeit funktioniert.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Verwendung von Claude als Kreativdirektor in einem Sticker-Erstellungsprozess
Ein Entwickler baute eine Sticker-App, bei der Claude hochgeladene Benutzerfotos analysiert, neun Sticker-Konzepte generiert und detaillierte Prompts für Bildmodelle schreibt, was zu personalisierten statt generischen Stickern führt.

BinktermPHP: Eine vollständige BBS/FidoNet-Plattform, die hauptsächlich mit Claude erstellt wurde
BinktermPHP ist ein quelloffenes, webbasiertes BBS, das in PHP 8 mit PostgreSQL geschrieben ist. Es verfügt über einen integrierten binkp FidoNet-Mailer, Echomail/Netmail, Dateibereiche, Door-Games, Echtzeit-Server-Push und einen MCP-Server, der Echomail für KI-Assistenten zugänglich macht. Der Entwickler berichtet, dass er es fast vollständig mit Claude für die Implementierung erstellt hat, während er Architektur und Tests übernahm.

V100 Cluster vs. MoE: 12x SXM2 32GB Build mit Claude Code Orchestrierung
Ein Anwalt, der einen 12x V100 32 GB SXM2-Cluster auf einem Threadripper Pro betreibt, berichtet, dass MoE-Modelle der einzige gangbare Weg auf Volta sind, wobei Qwen3.5-122B-A10B mit ~50 tok/s auf vier Karten decodiert. Der gesamte Stack nutzt Claude Code, um 5 lokale Modelle auf 16 GPUs zu orchestrieren.

Mit Claude verfasste Masterarbeit: Wirtschaftsstudent besteht mit Bestnote
Ein Wirtschaftsstudent nutzte Claude für die Literaturrecherche, Datenanalyse mit Python-Skripten und Excel sowie die Präsentation – bestand mit einer Spitzennote nahe dem PhD-Niveau. Im Anhang wurde die KI-Nutzung offengelegt, es wurden keine Fragen gestellt.