Memoria Persistente para Claude: Stack Local con MCP, Recuperación de 39ms, Reducción del 82% de Tokens

Un usuario de Reddit construyó una capa de memoria persistente local para Claude que resuelve el problema de contexto cero entre sesiones. La pila se ejecuta completamente en local (sin nube, sin claves API) y se integra mediante MCP. Arquitectura clave: cuatro capas (L0 registro de eventos de solo añadido en SQLite, L1 hechos estructurados diferidos, L2/L3 prosa wiki, L4 nodos de sesión cristalizados con resumen + decisiones + hilos abiertos), Qdrant Docker para búsqueda vectorial, llama.cpp con Qwen3-Embedding-4B en GPU y Qwen3.5-2B-Q4_K_M en CPU para incrustación y chat, y un servidor FastMCP que expone 7 herramientas (retrieve, crystallize_session, list_sessions, get_l4_node, index_status, reindex, shutdown_models).
Números
- Reducción de tokens frente a línea base grep+Read: 82.7% media, 86.2% mediana.
- F1 de recuperación: 0.50 frente a 0.20 línea base.
- Arranque en frío de incrustación ~4s; p95 en ruta caliente 39ms (era 2241ms antes de la corrección de error).
- Evaluación de recuperación de sesión L4: puntuación media 0.920 (umbral 0.6).
- 738 fragmentos indexados en 104 archivos markdown.
Lección Clave: Reutilización de Conexión en Windows
La recuperación en ruta caliente estaba atascada en 2241ms p95 incluso con incrustación residente en GPU en una 4070 Ti Super. La causa: cada httpx.post() abría una nueva conexión TCP, y los handshakes de localhost en Windows tomaban ~2 segundos. Cambiar a un httpx.Client persistente con keep-alive redujo el p95 a 39ms, una aceleración de 57×.
Otras Sorpresas
- Modo de pensamiento de Qwen3: Si
enable_thinkingno está deshabilitado mediantechat_template_kwargs: {enable_thinking: false}con--jinjaen llama-server, el modelo gasta todo el presupuesto de tokens en bloques de pensamiento y genera contenido vacío. - Registro MCP: El modo agente de Claude Desktop (Cowork) lee un archivo de configuración de plugin, no
~/.claude.json. El servicio LKS debe empaquetarse como un paquete .plugin de Cowork adecuado.
Para Quién Es
Desarrolladores que usan Claude intensivamente y desean una capa de memoria local, privada y rentable que mantenga el contexto entre sesiones sin dependencias en la nube.
📖 Lee la fuente completa: r/ClaudeAI
👀 Ver también

RelayCode Extensión de VS Code Enruta el Código de Claude a Través de RDUs Soberanos
OpenGPU ha lanzado RelayCode, una extensión de VS Code que actúa como un proxy local para redirigir solicitudes de Claude Code o Copilot a través de su red descentralizada hacia modelos de código abierto como DeepSeek-R1 y MiniMax M2.5, ejecutándose en unidades de flujo de datos reconfigurables soberanas.

Habilidad de Claude Code Convierte Diseños de Stitch a Next.js con Cero Desviación de Píxeles
Una habilidad de Claude Code convierte diseños de Google Stitch AI en componentes Next.js con puntos de verificación obligatorios para prevenir la desviación de píxeles, preservando valores exactos y manejando recursos.

BotCost.dev: Analizador gratuito para ver cuánto cuestan los bots de IA en tu sitio
BotCost.dev es una herramienta gratuita que analiza los registros de tu servidor contra 18 huellas digitales conocidas de bots de IA (GPTBot, ClaudeBot, Perplexity, etc.) y estima el costo mensual de ancho de banda — sin necesidad de subir archivos, funciona en el navegador.

Fallos silenciosos de herramientas en agentes de codificación: un drenaje oculto de eficiencia
Los agentes de codificación a menudo enfrentan fallos de herramientas que pasan desapercibidos porque recurren a estrategias alternativas, desperdiciando tokens y reduciendo la calidad. La herramienta de código abierto Vibeyard detecta estos fallos y sugiere correcciones.