Persistenter Speicher für Claude: Lokaler Stack mit MCP, 39ms Abruf, 82% Tokenreduktion

Ein Reddit-Nutzer hat eine lokale persistente Gedächtnisschicht für Claude entwickelt, die das Null-Kontext-Problem zwischen Sitzungen löst. Der Stack läuft vollständig lokal (keine Cloud, keine API-Schlüssel) und wird über MCP integriert. Wichtige Architektur: vier Schichten (L0 Append-Only-Ereignisprotokoll in SQLite, L1 strukturierte Fakten zurückgestellt, L2/L3 Wiki-Prosa, L4 kristallisierte Sitzungsknoten mit Zusammenfassung + Entscheidungen + offenen Threads), Qdrant Docker für Vektorsuche, llama.cpp mit Qwen3-Embedding-4B auf GPU und Qwen3.5-2B-Q4_K_M auf CPU für Embedding und Chat, und ein FastMCP-Server, der 7 Werkzeuge bereitstellt (retrieve, crystallize_session, list_sessions, get_l4_node, index_status, reindex, shutdown_models).
Zahlen
- Token-Reduktion vs. grep+Read-Baseline: 82,7 % Mittelwert, 86,2 % Median.
- Abruf-F1: 0,50 vs. 0,20 Baseline.
- Embed-Kaltstart ~4s; Hot-Path p95 39ms (vor Bugfix 2241ms).
- L4-Sitzungsabruf-Bewertung: 0,920 Mittelwert (Schwelle 0,6).
- 738 Chunks indiziert über 104 Markdown-Dateien.
Wichtige Erkenntnis: Verbindungswiederverwendung unter Windows
Der Hot-Path-Abruf blieb selbst mit GPU-residentem Embedding auf einer 4070 Ti Super bei 2241ms p95 stecken. Die Ursache: Jedes httpx.post() öffnete eine neue TCP-Verbindung, und Windows-Localhost-Handshakes dauerten etwa 2 Sekunden. Der Wechsel zu einem persistenten httpx.Client mit Keep-Alive senkte den p95 auf 39 ms – eine 57-fache Beschleunigung.
Weitere Überraschungen
- Qwen3-Denkmodus: Wenn
enable_thinkingnicht überchat_template_kwargs: {enable_thinking: false}mit--jinjaauf dem llama-Server deaktiviert wird, verbraucht das Modell das gesamte Token-Budget für Denkblöcke und gibt leere Inhalte aus. - MCP-Registrierung: Claude Desktop's agentischer Modus (Cowork) liest eine Plugin-Konfigurationsdatei, nicht
~/.claude.json. Der LKS-Dienst muss als ordentliches Cowork-.plugin-Bundle verpackt werden.
Für wen es gedacht ist
Entwickler, die Claude intensiv nutzen und eine kosteneffiziente, private, lokale Gedächtnisschicht wünschen, die den Kontext über Sitzungen hinweg beibehält, ohne Cloud-Abhängigkeiten.
📖 Vollständige Quelle lesen: r/ClaudeAI
👀 Siehe auch

Agent Smith: Ein Befehl zum Erstellen von MCP-Servern, Fähigkeiten und einer Ticket-zu-PR-Pipeline für Claude Code
Agent Smith scannt Ihr Repository, erkennt exakt den verwendeten Stack (Go/Echo, React/Zustand, golang-jwt, pgx usw.), richtet MCP-Server, Hooks und Skills ein, die auf Ihre Umgebung zugeschnitten sind, und bietet eine autonome Ticket-to-PR-Pipeline.

KI-basierte Codierungssitzungskosten mit grafischer Code-Indizierung um 90 % senken
Ein Entwickler hat eine lokale Graphdatenbank erstellt, die eine Codebasis mithilfe von LLM-generierten Zusammenfassungen indiziert. Dadurch sinken die Kosten für Claude Code-Sitzungen von 6–10 Dollar auf Centbeträge, da redundante Datei-Neuladevorgänge vermieden werden.

Cortex v1.2 fügt LLM-Anreicherung, Q&A mit Quellenangaben und Konfliktlösung hinzu.
Cortex, eine lokale Speicherschicht für OpenClaw-Agenten, hat Version 1.2 veröffentlicht, die standardmäßig LLM-unterstützte Anreicherung, einen Frage-Antwort-Befehl mit Quellenangaben sowie verbesserte Deduplizierung und Konfliktlösung bietet. Das Tool umfasst nun einheitliche Konfigurationsverwaltung und intent-basierte Suchvorfilterung.

HomeButler: Null-Token-Verwaltung für Homelabs mit OpenClaw-Agenten
HomeButler ist eine einzelne Go-Binärdatei, die es OpenClaw-Agenten ermöglicht, Homelab-Infrastruktur ohne API-Schlüssel oder Tokens zu verwalten. Sie läuft lokal und hält alle Vorgänge in Ihrem Netzwerk.