Couche mémoire auto-hébergée pour Claude fonctionne gratuitement sur Cloudflare

Un utilisateur de Reddit a créé second-brain-cloudflare, un serveur MCP open source qui ajoute une mémoire persistante à Claude. Il fonctionne entièrement sur le niveau gratuit de Cloudflare en utilisant Workers, D1 (SQLite), Vectorize et Workers AI.
Fonctionnalités clés
- Quatre outils MCP :
remember,recall,list_recent,forget. - Recherche sémantique via
recall: les notes sont converties en vecteurs à l'aide du modèlebge-small-en-v1.5via Workers AI et stockées dans Cloudflare Vectorize. Les recherches correspondent par sens, pas par mots-clés. - Fonctionne avec Claude Desktop, Claude Code et
claude.ai(via des connecteurs personnalisés).
Comment ça marche
Vous ajoutez des instructions au prompt système de Claude. Le serveur est déployé via un bouton de déploiement en un clic sur le dépôt. Contexte : remember stocke une note, recall recherche des embeddings sémantiques, list_recent affiche les notes récentes, forget supprime une note. La stack : TypeScript, Cloudflare Workers + D1 + Vectorize + Workers AI.
Compromis et détails d'implémentation
L'auteur note que la recherche sémantique a des compromis — la qualité des embeddings, la latence et le coût sont discutés dans le fil Reddit. Le niveau gratuit gère un usage personnel sans problème.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Passeport de Décision : Une Couche d'Audit pour la Gouvernance de l'Exécution des Agents IA
La fuite du code Claude met en lumière une lacune dans la gouvernance des agents d'IA. Decision Passport répond à cela avec des enregistrements d'exécution en ajout uniquement, des paquets de preuve portables et une vérification hors ligne pour des pistes d'audit résistantes à la falsification.

Prism MCP v5.1 ajoute une compression mémoire 10x et un apprentissage de l'agent à partir des corrections.
Prism MCP v5.1 introduit une compression mémoire 10x grâce à TurboQuant porté en TypeScript, permettant des millions de mémoires sur un ordinateur portable sans bases de données vectorielles. La mise à jour ajoute l'apprentissage de l'agent à partir des corrections utilisateur et une interface de graphe de connaissances visuel.

GLM 5 sur Mac M3 : Observations de performance pour le codage agentique
Un utilisateur rapporte avoir exécuté GLM 5 via la quantification 4 bits de MLX sur un Mac M3 avec 512 Go de RAM, le trouvant utilisable pour le codage agentique avec un contexte inférieur à 50 000 tokens, mais notant des ralentissements significatifs au-delà de ce seuil.

Les tests de référence MemAware évaluent la mémoire de l'IA au-delà de la simple recherche par mots-clés.
MemAware est un benchmark avec 900 questions réparties sur 3 niveaux de difficulté qui teste si les assistants IA dotés de mémoire peuvent faire remonter un contexte pertinent lorsque les requêtes ne le suggèrent pas. Les résultats montrent que la recherche BM25 a obtenu 2,8 % contre 0,8 % sans mémoire, tandis que la recherche vectorielle chute à 0,7 % sur les connexions inter-domaines.