Système de mémoire MCP local avec consolidation pour les conversations d'IA

✍️ OpenClawRadar📅 Publié: February 26, 2026🔗 Source
Système de mémoire MCP local avec consolidation pour les conversations d'IA
Ad

Ce que c'est

Un développeur a créé un système de mémoire locale pour les conversations d'IA qui consolide et synthétise les informations plutôt que de simplement les stocker. Construit comme un serveur MCP, il fonctionne avec des clients compatibles comme Claude Desktop et Claude Code, fonctionnant à 100 % localement sans que les données ne quittent votre matériel.

Comment ça fonctionne

Le principal différentiateur par rapport aux systèmes RAG standard est le processus de consolidation. Toutes les 6 heures, un LLM local (Qwen 2.5-7B fonctionnant dans LM Studio) regroupe les souvenirs récents par sujet et les consolide en documents de connaissances structurés. Il extrait des faits, des solutions et des préférences, les fusionne avec les connaissances existantes et versionne le tout.

Stack technique

  • Embeddings : nomic-embed-text-v1.5 via LM Studio
  • Recherche vectorielle : FAISS (hybride sémantique + mots-clés)
  • LLM de consolidation : Qwen 2.5-7B (Q4) via LM Studio
  • Stockage : SQLite pour les épisodes, FAISS pour les vecteurs
  • Protocole : MCP — fonctionne avec tout ce qui le supporte
  • Configuration : TOML

Fonctionnalités

  • Déduplication sémantique avec un seuil de similarité cosinus de 0,95
  • Score de surprise adaptatif — les souvenirs fréquemment consultés sont boostés, les obsolètes s'estompent
  • Écritures atomiques avec tempfile + os.replace pour la protection contre les plantages
  • Suppression FAISS basée sur des tombstones — O(1) au lieu de reconstruire tout l'index
  • Dégradation gracieuse — si LM Studio tombe, le stockage fonctionne toujours, la consolidation est mise en pause
  • 88 tests réussis
Ad

Outils MCP

  • memory_store — enregistrer un épisode avec type, étiquettes, score de surprise
  • memory_recall — recherche sémantique à travers les épisodes + connaissances consolidées
  • memory_forget — marquer un épisode pour suppression
  • memory_correct — mettre à jour un document de connaissance
  • memory_export — sauvegarde JSON complète
  • memory_status — vérification de l'état

Pourquoi MCP a été choisi

Les modèles sont fréquemment remplacés, mais les connaissances accumulées ne devraient pas disparaître avec eux. MCP rend la mémoire portable — un seul stockage, de nombreuses interfaces. La couche mémoire devient plus précieuse que n'importe quel modèle individuel.

Résultats pratiques

Après environ une semaine d'utilisation, le système a construit des documents de connaissances sur le matériel PC, la configuration VR, les préférences de codage et les architectures de projet — tous synthétisés à partir de conversations normales. Lors du démarrage de nouvelles discussions, l'IA connaît déjà le contexte de l'utilisateur sans qu'il ait besoin de se réexpliquer.

Exigences

  • Python 3.11+
  • LM Studio avec Qwen 2.5-7B et nomic-embed-text-v1.5 chargés
  • N'importe quel client MCP

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

🦀
Tools

Cue AI utilise Gemma 4 pour une dictée vocale plus rapide : baisse de 44 % de la latence, augmentation de 30 % de l'utilisation

Cue AI a remplacé une étape de polissage de texte basée sur le cloud par Gemma 4 E4B de Google DeepMind, exécuté localement via Ollama, réduisant la latence médiane de 876 ms à 488 ms et augmentant l'utilisation de la dictée de 30 %.

OpenClawRadar
Tendr Skill Ajoute une Mémoire à Long Terme Basée sur CLI avec Hiérarchie pour Réduire l'Utilisation de Tokens
Tools

Tendr Skill Ajoute une Mémoire à Long Terme Basée sur CLI avec Hiérarchie pour Réduire l'Utilisation de Tokens

Une nouvelle compétence OpenClaw sépare le raisonnement de l'exécution pour les opérations de mémoire à long terme, utilisant un outil CLI pour gérer les changements structurels de manière déterministe. Elle prend en charge les wikilinks et une hiérarchie sémantique explicite entre les fichiers pour réduire la consommation de tokens et éviter l'accumulation d'erreurs.

OpenClawRadar
OpenAlly : Assistant IA local pour Android avec contrôle téléphonique
Tools

OpenAlly : Assistant IA local pour Android avec contrôle téléphonique

OpenAlly est une application Android qui exécute un assistant IA localement sur votre téléphone via un processus Node.js intégré, avec 51 compétences intégrées et des capacités de contrôle téléphonique via le compagnon Aster. Elle se connecte à plus de 19 plateformes de messagerie et prend en charge 18 fournisseurs de modèles avec vos propres clés API.

OpenClawRadar
Centre de Commande Claude : Tableau de Bord Open-Source pour l'Analyse de Code Claude
Tools

Centre de Commande Claude : Tableau de Bord Open-Source pour l'Analyse de Code Claude

Claude Command Center est un tableau de bord local qui lit votre répertoire ~/.claude/ pour afficher les données de session Claude Code, les coûts et les configurations des serveurs MCP. Entièrement construit avec Claude Code, utilisant un backend Express et un frontend React, il ne nécessite aucune configuration et s'exécute localement sans cloud ni télémétrie.

OpenClawRadar