Sistema de Memoria MCP Local con Consolidación para Conversaciones de IA

Qué es esto
Un desarrollador creó un sistema de memoria local para conversaciones de IA que consolida y sintetiza información en lugar de solo almacenarla. Construido como un servidor MCP, funciona con clientes compatibles como Claude Desktop y Claude Code, ejecutándose 100% localmente sin que los datos salgan de tu hardware.
Cómo funciona
El diferenciador clave respecto a los sistemas RAG estándar es el proceso de consolidación. Cada 6 horas, un LLM local (Qwen 2.5-7B ejecutándose en LM Studio) agrupa recuerdos recientes por tema y los consolida en documentos de conocimiento estructurado. Extrae hechos, soluciones y preferencias, fusionándolos con el conocimiento existente y versionando todo.
Stack técnico
- Embeddings: nomic-embed-text-v1.5 vía LM Studio
- Búsqueda vectorial: FAISS (híbrido semántico + palabras clave)
- LLM de consolidación: Qwen 2.5-7B (Q4) vía LM Studio
- Almacenamiento: SQLite para episodios, FAISS para vectores
- Protocolo: MCP — funciona con cualquier cosa que lo soporte
- Configuración: TOML
Características
- Deduplicación semántica con umbral de similitud coseno 0.95
- Puntuación de sorpresa adaptativa — los recuerdos accedidos frecuentemente se potencian, los obsoletos decaen
- Escrituras atómicas con tempfile + os.replace para protección contra fallos
- Eliminación FAISS basada en tumbas — O(1) en lugar de reconstruir todo el índice
- Degradación elegante — si LM Studio falla, el almacenamiento sigue funcionando, la consolidación se pausa
- 88 pruebas aprobadas
Herramientas MCP
memory_store— guardar un episodio con tipo, etiquetas, puntuación de sorpresamemory_recall— búsqueda semántica entre episodios + conocimiento consolidadomemory_forget— marcar un episodio para eliminaciónmemory_correct— actualizar un documento de conocimientomemory_export— copia de seguridad JSON completamemory_status— verificación de estado
Por qué se eligió MCP
Los modelos se reemplazan frecuentemente, pero el conocimiento acumulado no debería desaparecer con ellos. MCP hace que la memoria sea portátil — un almacén, muchas interfaces. La capa de memoria se vuelve más valiosa que cualquier modelo individual.
Resultados prácticos
Después de aproximadamente una semana de uso, el sistema construyó documentos de conocimiento sobre hardware de PC, configuración de VR, preferencias de codificación y arquitecturas de proyectos — todo sintetizado a partir de conversaciones normales. Al iniciar nuevos chats, la IA ya conoce el contexto del usuario sin necesidad de reexplicar.
Requisitos
- Python 3.11+
- LM Studio con Qwen 2.5-7B y nomic-embed-text-v1.5 cargados
- Cualquier cliente MCP
📖 Read the full source: r/LocalLLaMA
👀 Ver también

OpenBridge: Control Remoto Gratuito y de Código Abierto para Claude Code a través de Slack/Discord
OpenBridge es una herramienta gratuita y de código abierto que te permite controlar Claude Code desde Slack o Discord, organizando proyectos como canales y conversaciones como hilos. Se ejecuta localmente o en un VPS y funciona con suscripciones existentes de Claude Code/Codex sin tarifas adicionales de API.

CodeLedger: Complemento de código de código abierto de Claude que rastrea el uso de tokens y agentes en segundo plano.
CodeLedger es un complemento de servidor MCP de código abierto para Claude Code que rastrea automáticamente el uso de tokens en proyectos, identifica agentes en segundo plano y proporciona recomendaciones de optimización de costos basadas en el análisis de archivos de sesión JSONL locales.

Sistema de Cerebro Secundario de Código Abierto Construido en Claude Code para la Gestión de Tareas
Un sistema de código abierto llamado Kipi System utiliza Claude Code para hacer seguimiento de conversaciones abiertas, redactar seguimientos y gestionar tareas extrayendo datos del calendario, correo electrónico, CRM y fuentes sociales. Genera un archivo HTML diario con acciones preescritas ordenadas por dificultad.

Configuración de OpenClaw en Máquina Virtual Ubuntu UTM con Acceso a API LLM y Ollama
Un usuario configuró exitosamente OpenClaw en una máquina virtual Ubuntu aislada en un Mac M3, con acceso tanto a Ollama local en macOS como a APIs externas de LLM como Gemini, Claude y DeepSeek. Los archivos de configuración de ejemplo y las notas de solución de problemas están disponibles en GitHub.