Capa de memoria autoalojada para Claude se ejecuta gratis en Cloudflare

Un usuario de Reddit creó second-brain-cloudflare, un servidor MCP de código abierto que añade memoria persistente a Claude. Funciona completamente en el nivel gratuito de Cloudflare utilizando Workers, D1 (SQLite), Vectorize y Workers AI.
Características principales
- Cuatro herramientas MCP:
remember,recall,list_recent,forget. - Búsqueda semántica mediante
recall: las notas se incrustan en vectores usando el modelobge-small-en-v1.5a través de Workers AI y se almacenan en Cloudflare Vectorize. Las búsquedas coinciden por significado, no por palabras clave. - Funciona con Claude Desktop, Claude Code y
claude.ai(a través de conectores personalizados).
Cómo funciona
Agregas instrucciones al prompt del sistema de Claude. El servidor se despliega con un botón de despliegue de un clic en el repositorio. Contexto: remember almacena una nota, recall busca en las incrustaciones semánticas, list_recent muestra notas recientes y forget elimina una nota. La pila: TypeScript, Cloudflare Workers + D1 + Vectorize + Workers AI.
Compromisos y detalles de implementación
El autor señala que la búsqueda semántica tiene compromisos: la calidad de las incrustaciones, la latencia y el costo se discuten en el hilo de Reddit. El nivel gratuito maneja el uso personal sin problemas.
📖 Leer la fuente completa: r/ClaudeAI
👀 Ver también

De Replit a Local: Cómo un desarrollador usó Claude para construir StillHere, una app de chat de acompañante IA con API
Un desarrollador construyó StillHere.ink, una app de chat con IA para conversaciones de compañía usando claves API personales, después de migrar de Replit al desarrollo local con Claude. La app cuenta con memoria, resúmenes de diario, RAG, cambio de modelo y herramientas de control de costos.

X-MCP 2.0: Servidor MCP para Acceso a la API de X/Twitter desde Claude
X-MCP 2.0 es un servidor MCP que conecta Claude Desktop y Claude Code con la API v2 de X/Twitter mediante autenticación OAuth 2.0 PKCE, proporcionando 10 herramientas para publicar tweets, buscar, obtener cronologías, dar me gusta, retwittear, responder y ver perfiles.

Evaluación comparativa de Nemotron 3 Super 120B con contexto de 1 millón de tokens en M1 Ultra
Un usuario probó Nemotron 3 Super 120B con un modelo cuantizado Q4_K_M usando llama.cpp en un M1 Ultra, logrando una ventana de contexto de 1 millón de tokens que consumió aproximadamente 90 GB de VRAM. Los puntos de referencia de rendimiento muestran velocidades de generación de tokens que van desde 255 t/s en el procesamiento de 512 tokens iniciales hasta 22,37 t/s en un contexto de 100.000 tokens.

AutoDream: sistema de memoria de 11 ganchos para Claude Code con funciones de seguridad
AutoDream es una herramienta de código abierto que añade persistencia de memoria de proyecto y seguridad de comandos a Claude Code. Utiliza 11 hooks en 6 eventos para inyectar contexto, bloquear comandos peligrosos y sobrevivir a la operación /compact.