Galadriel : Harnais de cache chaud open-source pour agents Claude persistants

Un utilisateur de Reddit a open-sourcé Galadriel, un harnais pour les agents Claude persistants qui réalise 87 % d'économies de coûts et une latence inférieure à 3 secondes sur des contextes de 100 000 tokens en optimisant la mise en cache des invites. Le projet, publié sous licence MIT, cible les problèmes de mémoire et de coût souvent appelés le « problème du poisson rouge » dans les agents de codage IA.
Fonctionnalités clés
- Mise en cache empilée à 3 niveaux : Points de rupture de cache séparés pour les définitions d'outils, les invites système (
CLAUDE.md) et l'historique de conversation en fin de file. Cela évite l'invalidation du cache entre différents segments de contexte. - MemPalace intégré : Un système de mémoire persistante basé sur des vecteurs qui ne casse pas le cache d'invite, permettant un rappel permanent.
- Priorité à la confidentialité : Conçu pour les sous-réseaux privés — pas d'intermédiaire, pas de limites de messages, seulement votre clé API et vos règles.
- Directives CLAUDE.md (style Karpathy) : Règles intégrées pour empêcher le gonflement des agents (expansion inutile du contexte).
Benchmarks
Selon l'auteur, testé par rapport aux workflows OpenClaw/Cursor :
- Coût : 10 $ pour chaque 100 $ normalement dépensés (réduction de 87 %).
- Latence : Le contexte de 100 000 tokens passe de 11 s à <3 s (amélioration de 85 %).
À qui cela s'adresse
Développeurs exécutant des agents Claude persistants pour des tâches comme la gestion d'infrastructure ou la maintenance de codebase qui paient des coûts API élevés en raison d'un contexte non mis en cache.
Configuration
Le harnais est actuellement personnalisé pour Discord (la configuration personnelle de l'auteur), mais la logique de mise en cache est générique. Clonez le dépôt et adaptez la couche de transport selon vos besoins.
GitHub
github.com/avasol/galadriel-public (Licence MIT)
📖 Lire la source complète : r/openclaw
👀 See Also

Merlin : Déduplication contextuelle LLM d'abord locale – mesure jusqu'à 71 % de chevauchement de morceaux, gratuit et open-core
Merlin est un outil de déduplication contextuelle priorisant le local qui a mesuré un chevauchement de blocs de 22 à 71 % sur 22 millions de passages issus de sessions réelles d'agents et de RAG. Il se déploie sous forme de proxy HTTP (Ollama/vLLM/SGLang/llama.cpp), de serveur MCP (Claude/Cursor/OpenClaw) ou de CLI autonome. Licence MIT open-core avec plafonds d'utilisation quotidiens.

Plan directeur : Un système de tâches terminal minimal conçu pour les utilisateurs de code Claude
Un développeur a créé master-plan, un plugin Claude Code avec quatre commandes slash qui gère les tâches directement dans le terminal en utilisant un fichier markdown et git. Le système capture les idées en plein milieu d'une session sans changer de contexte et détecte automatiquement les exécuteurs de tests.

Code Altimate : Harnais de Génie de Données Agentiel Open-Source
Altimate Code est un harnais open-source qui fournit des outils déterministes d'ingénierie des données pour les agents d'IA, abordant des problèmes comme le SQL halluciné et le manque de contexte de schéma. Il inclut la traçabilité au niveau des colonnes, la détection d'anti-modèles SQL et l'intégration dbt, avec des benchmarks montrant 74,4 % de performance sur ADE-bench.

Brainstorm MCP Server Permet à Claude de Consulter D'autres LLM pour de Meilleures Réponses
Un développeur a créé un serveur MCP qui permet à Claude Code de consulter d'autres modèles d'IA comme GPT-5.2 et DeepSeek avant de fournir des réponses. Les modèles s'engagent dans des débats en plusieurs tours où ils lisent les réponses des autres, expriment leurs désaccords et affinent leurs positions pour converger vers de meilleures solutions.