Prefex : Un proxy local pour Claude Code qui automatise la mise en cache des invites et la mémoire de session

Prefex est un outil proxy local conçu pour réduire les coûts d'API lors de l'utilisation de Claude Code. Il traite deux inefficacités spécifiques en matière de coûts : la fonctionnalité bêta de mise en cache des prompts d'Anthropic nécessite une injection manuelle d'en-tête, et Claude Code envoie l'historique complet des conversations avec chaque requête.
Fonctionnement
Prefex s'exécute entièrement sur votre machine locale en tant que proxy entre Claude Code et l'API d'Anthropic. Il injecte automatiquement l'en-tête spécifique nécessaire pour activer la fonctionnalité de mise en cache des prompts d'Anthropic, ce qui réduit les coûts des jetons d'entrée répétés de 90 %. Sans cet en-tête, toutes les requêtes, y compris votre CLAUDE.md et le contexte du projet, sont facturées au prix plein.
L'outil implémente également une mémoire de session, empêchant Claude Code de renvoyer l'intégralité de l'historique des conversations à chaque tour. De plus, il inclut un routeur de modèles qui peut acheminer les requêtes plus simples vers des modèles moins chers, bien que cette fonctionnalité n'était pas active pendant la période de test initiale.
Performance et Installation
Lors d'un test de 4 jours avec une utilisation normale :
- 1 338 requêtes traitées
- 49,60 $ de coût réel avec Prefex
- 348 $ de coût estimé sans Prefex
- 86 % d'économies réalisées (avec mise en cache uniquement, sans routage de modèles)
Le développeur fournit un benchmark qui exécute 5 questions sur karpathy/nanoGPT avec des démarrages à froid et à chaud, coûtant environ 0,03 $. Les calculs de coût utilisent les champs de facturation réels d'Anthropic.
L'installation nécessite une commande curl et l'ajout d'une ligne dans settings.json. Le package inclut un script de désinstallation. L'outil fonctionne localement sans serveurs externes, sans télémétrie, et les clés API vont directement à Anthropic.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Opendesk : Algorithme MCP + SOM pour le contrôle de bureau par IA via Claude Code
Opendesk donne aux agents IA des yeux et des mains sur votre bureau via un serveur MCP avec un algorithme SOM personnalisé. S'intègre à Claude Code ou à tout harnais agentique pour le contrôle souris/clavier, l'apprentissage, le rejeu et la planification.

Réduction de la latence des agents multi-modaux en omettant l'historique des captures d'écran
Un développeur a constaté que l'omission des captures d'écran précédentes des requêtes d'agents multimodaux et le remplacement des données d'image en base64 par des chaînes "[image omise]" réduisent considérablement la latence tout en maintenant les performances. L'expérience a été menée avec Claude et documentée sur GitHub.

Hippocampe : Un système de mémoire persistante pour agents IA utilisant des arbres de compaction
Hipocampus résout le problème de l'oubli du contexte entre les sessions par les agents IA en mettant en œuvre un arbre de compactage qui comprime l'historique des conversations à travers cinq niveaux : brut → quotidien → hebdomadaire → mensuel → racine, avec un index thématique appelé ROOT.md.

Équipe Criminelle : Orchestrateur Multi-Agent pour OpenClaw — Revue de Code Parallèle avec Agent Codeur
Crime Team v0.1 exécute plusieurs agents spécialistes OpenClaw en parallèle pour la révision de code, puis intègre les résultats. Inclut des modèles par agent, un agent codeur qui applique les modifications et une boucle de re-vérification. CLI + GUI.