Agentischer Kontext-Motor: Automatisierte Agenten-Verbesserungsschleife mit 34,2 % Genauigkeitssteigerung

Automatisierung des Agentenverbesserungsprozesses
Ein Entwickler hat ein System quelloffen gemacht, das den gesamten Prozess der Verbesserung von KI-Agenten automatisiert, indem es ihnen ermöglicht, sich selbst zu analysieren und zu korrigieren. Das Tool adressiert das häufige Problem des manuellen Durchlesens von Protokollen, Anpassens von Prompts und Hoffens auf Verbesserungen.
Der Fünf-Schritte-Prozess
Der automatisierte Kreislauf folgt fünf klar definierten Schritten:
- Spurenanalyse: Analysiert Spuren, um nicht nur festzustellen, was fehlgeschlagen ist, sondern auch warum, ob es sich um ein einmaliges oder systemisches Problem handelt und um welche Art von Fehler es sich handelt. Erstellt eine strukturierte Aufschlüsselung der Fehlermodi anstelle von bloßen Fehlerlisten.
- Erstellung von Evaluierungen: Erstellt spezifische Bewertungen, um die Analyse zu validieren und Korrekturen zu messen. Generische Bewertungen erfassen spezifische Fehler nicht. LLM-as-a-judge dient als Ausweichlösung, wenn Spurendaten nicht strukturiert genug für deterministische Bewertungen sind.
- Basismessung: Führt Bewertungen gegen den aktuellen Agenten durch, bevor Korrekturen vorgenommen werden, um Baselines zu etablieren und die Bewertungen selbst zu validieren.
- Umsetzung von Korrekturen: Ein Entwickler prüft die Analyse und die Codebasis, um zu entscheiden, was geändert werden soll. Die Schlüsselentscheidung ist, ob die Korrektur im Prompt oder im umgebenden Code erfolgen soll (z. B. wenn das Harness Tool-Ausgaben schlecht verarbeitet oder nicht den richtigen Kontext weitergibt).
- Verifizierung und Kumulierung: Nach den Korrekturen werden die Bewertungen erneut durchgeführt, um die Verbesserung zu überprüfen, wobei Änderungen beibehalten, zurückgesetzt oder überarbeitet werden.
Implementierungsdetails
Die Lösung automatisiert diesen gesamten Kreislauf von Anfang bis Ende mit einem Befehl, der ein sich selbst analysierendes agentisches System aufruft. Die Spurenanalyse findet in einer REPL-Umgebung mit Agenten statt, die für diesen spezifischen Anwendungsfall optimiert sind. Das System stellt die Analyse über CLI-Zugriff auf Claude Code bereit, um den Rest mit einem Satz von Fähigkeiten zu erledigen.
Da Claude innerhalb der Codebasis arbeiten kann, validiert es die Analyse und entscheidet im Korrekturschritt über den besten Vorgehensweg (Prompt vs. Code).
Ergebnisse und Betrieb
Beim Benchmark auf dem Tau-2 Bench mit nur einer Iteration erzielte der erste Durchlauf einen Genauigkeitsgewinn von 34,2 % ohne manuelles Eingreifen. Das System ist darauf ausgelegt, Verbesserungen zu kumulieren: Neue Spuren decken neue Probleme auf, die in jedem Zyklus zu neuen Korrekturen führen.
Sie können es so einstellen, dass es vollständig autonom läuft. Eine Option mit menschlicher Kontrolle existiert, wenn Sie Korrekturen vor Schritt 4 genehmigen möchten, aber in Tests ließ der Entwickler es "einfach laufen".
Das Tool ist quelloffen auf GitHub verfügbar: https://github.com/kayba-ai/agentic-context-engine
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Claude-Skill-MCP-Checker: Deterministische Prüfung bahnbrechender Änderungen vom 28.07.2026
Ein kostenloses Claude-Skill und eine Web-Demo führen 7 deterministische Regeln aus, um MCP-Server zu erkennen, die durch die zustandslosen Transport- und OAuth-2.1-Änderungen vom 2026-07-28 defekt sind. Der Autor teilt mit, wie eine Regel falsch war und wie er den Fehler eingegrenzt hat.

OmniRecall Beta: FAISS-gestützte Speicherinjektion für Cloud-LLM-Chats
OmniRecall ist eine lokale mitmproxy-Umgehung, die den Datenverkehr zu Cloud-Chat-Schnittstellen wie DeepSeek abfängt und eine permanente Speicherschicht mittels FAISS-Indexierung und sentence-transformers MiniLM-L6 hinzufügt. Es befindet sich derzeit in der Beta-Phase, erfordert CPU-only-Betrieb und verwendet eine aggressiv restriktive quelloffene Lizenz.

Das Nia-docs-Tool erstellt ein lokales Dateisystem aus Dokumentations-URLs für Claude AI.
Das nia-docs-Tool ermöglicht es Ihnen, npx nia-docs mit einer Dokumentations-URL auszuführen, um ein lokales Dateisystem der Dokumentation zu erstellen, auf das Claude AI dann direkt ohne zusätzliche Konfiguration zugreifen kann.

Token Reducer: Ein Claude-Code-Plugin für intelligente Kontextkomprimierung
Token Reducer ist ein Claude Code-Plugin, das Repository-Kontexte lokal verarbeitet, um die Token-Nutzung durch AST-basiertes Chunking, hybride Abrufmethoden und TextRank-Kompression um 90-98 % zu reduzieren. Es ist unter der MIT-Lizenz verfügbar und über den Plugin-Marktplatz erhältlich.