Die Dual-Modell-Architektur reduziert den Token-Verbrauch für lange Gespräche um die Hälfte.

Kontextkomprimierungssystem für KI-Agenten
Ein Entwickler auf r/ClaudeAI hat eine Lösung für das Problem geteilt, dass KI-Agenten nach der Gesprächskompaktierung den Kontext verlieren. Das System verwendet eine Dual-Modell-Architektur, bei der ein kostengünstiges kleines Modell (das sogenannte "Unterbewusstsein") kontinuierlich im Hintergrund den Gesprächsverlauf komprimiert.
Architekturdetails
Das System besteht aus vier Ebenen:
- Narrative Zusammenfassung (~1K Token)
- Komprimierte Fakten
- Semantisch abgerufene wörtliche Zitate
- Rohdaten der letzten Gesprächsrunden
Das Hauptmodell ("Bewusstsein") erhält einen kuratierten Kontext von etwa 35K Token mit derselben Informationsdichte, die normalerweise 120K Token des rohen Verlaufs erfordern würde. Das Hauptmodell liest einen zusammenhängenden Zeitstrahl und weiß nicht, dass das Gedächtnissystem existiert.
Leistungsergebnisse
Der Entwickler simulierte 260 Gesprächsrunden über verschiedene Konversationstypen hinweg. Bei längerfristigen Projektarbeiten (beginnend mit intensiver Recherche und allmählichem Übergang zu schnellen Austauschen, während das Modell die Domäne lernt) reduziert das System den Token-Verbrauch ungefähr um die Hälfte.
Entwicklungswerkzeuge
Das System wurde mit Claude Code für die Simulation und Claude.ai in der Beratungs- und Forschungsphase erstellt. Der Entwickler sucht nach anderen, die versucht haben, ein kleineres Modell zur Verwaltung des Kontexts für ein größeres Modell zu nutzen oder andere Lösungen für das Kompaktierungsproblem gefunden haben.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Mneme: Ein PreToolUse-Hook, der Claude-Code-Bearbeitungen blockiert, die Architekturentscheidungen verletzen
Mneme ist ein PreToolUse-Hook für Claude Code, der jede Edit/Write/MultiEdit vor dem Schreiben auf die Festplatte mit einer lokalen Entscheidungsdatei abgleicht und Verstöße ohne manuelles Eingreifen blockiert.

tmux-claude: Überwachen Sie Claude-Code-Instanzen über Tmux-Fenster hinweg
tmux-claude ist ein Tool, das eine Live-Überwachung für Claude Code-Instanzen innerhalb von tmux-Sitzungen hinzufügt. Es bietet eine Statusleiste, ein interaktives Dashboard, einen erweiterten Fensterauswähler und Desktop-Benachrichtigungen, indem es lokale Sitzungsdateien ohne API-Aufrufe liest.

Erinnerung: Ein Persistent Memory MCP-Server für Claude Code
Recall ist ein Open-Source-MCP-Server, der Claude Code über Sitzungen hinweg persistenten Speicher durch semantische Suche mit Embeddings ermöglicht. Es umfasst vier Lebenszyklus-Hooks: session-start, observe, pre-compact und session-end.

Begrenzung der Governance-Ebene für die Entwicklung Multi-Agenten-KI
Delimit ist eine Open-Source-Governance-Schicht, die mehrere KI-Codierungsagenten koordiniert, um Konflikte zu verhindern. Sie bietet gemeinsamen Speicher, Kollisionserkennung und Audit-Tracking für Agenten wie Claude Code, Codex und Gemini.