Mémoire persistante pour Claude : Stack local avec MCP, récupération en 39 ms, réduction de tokens de 82 %

✍️ OpenClawRadar📅 Publié: May 8, 2026🔗 Source
Mémoire persistante pour Claude : Stack local avec MCP, récupération en 39 ms, réduction de tokens de 82 %
Ad

Un utilisateur de Reddit a construit une couche mémoire persistante locale pour Claude qui résout le problème de contexte zéro entre les sessions. La pile fonctionne entièrement en local (pas de cloud, pas de clés API) et s'intègre via MCP. Architecture clé : quatre couches (L0 journal d'événements en ajout seul dans SQLite, L1 faits structurés différés, L2/L3 prose wiki, L4 nœuds de session cristallisés avec résumé + décisions + fils ouverts), Qdrant Docker pour la recherche vectorielle, llama.cpp avec Qwen3-Embedding-4B sur GPU et Qwen3.5-2B-Q4_K_M sur CPU pour l'embedding et le chat, et un serveur FastMCP exposant 7 outils (retrieve, crystallize_session, list_sessions, get_l4_node, index_status, reindex, shutdown_models).

Chiffres

  • Réduction de tokens par rapport à la référence grep+Read : 82,7 % en moyenne, 86,2 % en médiane.
  • F1 de récupération : 0,50 contre 0,20 pour la référence.
  • Démarrage à froid de l'embedding ~4 s ; hot-path p95 39 ms (était 2241 ms avant correction de bug).
  • Évaluation de récupération de session L4 : score moyen 0,920 (seuil 0,6).
  • 738 morceaux indexés dans 104 fichiers markdown.
Ad

Leçon clé : Réutilisation des connexions sous Windows

Le hot-path retrieve restait bloqué à 2241 ms p95 même avec un embedding résidant sur GPU sur une 4070 Ti Super. La cause : chaque httpx.post() ouvrait une nouvelle connexion TCP, et les poignées de main localhost sous Windows prenaient environ 2 secondes. Le passage à un httpx.Client persistant avec keep-alive a fait chuter le p95 à 39 ms — un gain de vitesse de 57×.

Autres surprises

  • Mode réflexion Qwen3 : Si enable_thinking n'est pas désactivé via chat_template_kwargs: {enable_thinking: false} avec --jinja sur llama-server, le modèle dépense tout son budget de tokens en blocs de réflexion et produit un contenu vide.
  • Enregistrement MCP : Le mode agentique de Claude Desktop (Cowork) lit un fichier de configuration de plugin, pas ~/.claude.json. Le service LKS doit être empaqueté comme un véritable bundle .plugin Cowork.

À qui cela s'adresse

Développeurs qui utilisent Claude intensivement et souhaitent une couche mémoire locale, privée et économique, qui maintienne le contexte entre les sessions sans dépendances cloud.

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

Claude Code HUD : Tableau de bord terminal pour la surveillance des sessions de codage IA
Tools

Claude Code HUD : Tableau de bord terminal pour la surveillance des sessions de codage IA

claude-code-hud est un tableau de bord en terminal qui fournit une surveillance en temps réel des sessions Claude Code, affichant l'utilisation de la fenêtre contextuelle, les limites de débit de l'API et les modifications de fichiers sans nécessiter un IDE. Exécutez-le avec npx claude-code-hud.

OpenClawRadar
Android CLI et Compétences pour les Flux de Travail de Développement d'Agents IA
Tools

Android CLI et Compétences pour les Flux de Travail de Développement d'Agents IA

Google a lancé Android CLI avec des commandes comme android create et android sdk install, ainsi que le dépôt GitHub Android Skills avec des ensembles d'instructions modulaires. Les benchmarks internes montrent une réduction de 70 % de l'utilisation de tokens LLM et une exécution des tâches 3 fois plus rapide.

OpenClawRadar
Doc Harness : Une Compétence Claude Code pour Maintenir l'État du Projet Entre les Sessions
Tools

Doc Harness : Une Compétence Claude Code pour Maintenir l'État du Projet Entre les Sessions

Doc Harness est une compétence Claude Code qui crée un système de documentation léger avec cinq fichiers structurés pour aider les agents IA à maintenir le contexte du projet entre les sessions. Il résout les problèmes comme les réinitialisations de contexte, les règles oubliées et la nécessité de réexpliquer les projets aux nouveaux agents.

OpenClawRadar
Claude Code contre OpenCode : Principales différences techniques relevées par un développeur
Tools

Claude Code contre OpenCode : Principales différences techniques relevées par un développeur

Un développeur compare Claude Code et OpenCode sur le contexte, la mémoire, l'utilisation des outils, les sous-agents, les autorisations, la sécurité et la flexibilité des modèles, concluant que Claude Code reste le meilleur pour les dépôts de production.

OpenClawRadar