Memoria Persistente para Claude: Stack Local con MCP, Recuperación de 39ms, Reducción del 82% de Tokens

✍️ OpenClawRadar📅 Publicado: 8 de mayo de 2026🔗 Source
Memoria Persistente para Claude: Stack Local con MCP, Recuperación de 39ms, Reducción del 82% de Tokens
Ad

Un usuario de Reddit construyó una capa de memoria persistente local para Claude que resuelve el problema de contexto cero entre sesiones. La pila se ejecuta completamente en local (sin nube, sin claves API) y se integra mediante MCP. Arquitectura clave: cuatro capas (L0 registro de eventos de solo añadido en SQLite, L1 hechos estructurados diferidos, L2/L3 prosa wiki, L4 nodos de sesión cristalizados con resumen + decisiones + hilos abiertos), Qdrant Docker para búsqueda vectorial, llama.cpp con Qwen3-Embedding-4B en GPU y Qwen3.5-2B-Q4_K_M en CPU para incrustación y chat, y un servidor FastMCP que expone 7 herramientas (retrieve, crystallize_session, list_sessions, get_l4_node, index_status, reindex, shutdown_models).

Números

  • Reducción de tokens frente a línea base grep+Read: 82.7% media, 86.2% mediana.
  • F1 de recuperación: 0.50 frente a 0.20 línea base.
  • Arranque en frío de incrustación ~4s; p95 en ruta caliente 39ms (era 2241ms antes de la corrección de error).
  • Evaluación de recuperación de sesión L4: puntuación media 0.920 (umbral 0.6).
  • 738 fragmentos indexados en 104 archivos markdown.
Ad

Lección Clave: Reutilización de Conexión en Windows

La recuperación en ruta caliente estaba atascada en 2241ms p95 incluso con incrustación residente en GPU en una 4070 Ti Super. La causa: cada httpx.post() abría una nueva conexión TCP, y los handshakes de localhost en Windows tomaban ~2 segundos. Cambiar a un httpx.Client persistente con keep-alive redujo el p95 a 39ms, una aceleración de 57×.

Otras Sorpresas

  • Modo de pensamiento de Qwen3: Si enable_thinking no está deshabilitado mediante chat_template_kwargs: {enable_thinking: false} con --jinja en llama-server, el modelo gasta todo el presupuesto de tokens en bloques de pensamiento y genera contenido vacío.
  • Registro MCP: El modo agente de Claude Desktop (Cowork) lee un archivo de configuración de plugin, no ~/.claude.json. El servicio LKS debe empaquetarse como un paquete .plugin de Cowork adecuado.

Para Quién Es

Desarrolladores que usan Claude intensivamente y desean una capa de memoria local, privada y rentable que mantenga el contexto entre sesiones sin dependencias en la nube.

📖 Lee la fuente completa: r/ClaudeAI

Ad

👀 Ver también

RelayCode Extensión de VS Code Enruta el Código de Claude a Través de RDUs Soberanos
Herramientas

RelayCode Extensión de VS Code Enruta el Código de Claude a Través de RDUs Soberanos

OpenGPU ha lanzado RelayCode, una extensión de VS Code que actúa como un proxy local para redirigir solicitudes de Claude Code o Copilot a través de su red descentralizada hacia modelos de código abierto como DeepSeek-R1 y MiniMax M2.5, ejecutándose en unidades de flujo de datos reconfigurables soberanas.

OpenClawRadar
Habilidad de Claude Code Convierte Diseños de Stitch a Next.js con Cero Desviación de Píxeles
Herramientas

Habilidad de Claude Code Convierte Diseños de Stitch a Next.js con Cero Desviación de Píxeles

Una habilidad de Claude Code convierte diseños de Google Stitch AI en componentes Next.js con puntos de verificación obligatorios para prevenir la desviación de píxeles, preservando valores exactos y manejando recursos.

OpenClawRadar
BotCost.dev: Analizador gratuito para ver cuánto cuestan los bots de IA en tu sitio
Herramientas

BotCost.dev: Analizador gratuito para ver cuánto cuestan los bots de IA en tu sitio

BotCost.dev es una herramienta gratuita que analiza los registros de tu servidor contra 18 huellas digitales conocidas de bots de IA (GPTBot, ClaudeBot, Perplexity, etc.) y estima el costo mensual de ancho de banda — sin necesidad de subir archivos, funciona en el navegador.

OpenClawRadar
Fallos silenciosos de herramientas en agentes de codificación: un drenaje oculto de eficiencia
Herramientas

Fallos silenciosos de herramientas en agentes de codificación: un drenaje oculto de eficiencia

Los agentes de codificación a menudo enfrentan fallos de herramientas que pasan desapercibidos porque recurren a estrategias alternativas, desperdiciando tokens y reduciendo la calidad. La herramienta de código abierto Vibeyard detecta estos fallos y sugiere correcciones.

OpenClawRadar