L'architecture à double modèle réduit de moitié la consommation de jetons pour les conversations longues.

Système de compression de contexte pour agents IA
Un développeur sur r/ClaudeAI a partagé une solution au problème des agents IA qui perdent le contexte après la compaction des conversations. Le système utilise une architecture à double modèle où un petit modèle peu coûteux (appelé le "subconscient") compresse continuellement l'historique des conversations en arrière-plan.
Détails de l'architecture
Le système comporte quatre couches :
- Résumé narratif (~1K tokens)
- Faits compressés
- Citations textuelles récupérées sémantiquement
- Tours récents bruts
Le modèle principal ("conscient") reçoit un contexte soigneusement sélectionné d'environ 35K tokens avec la même densité d'information qui nécessiterait normalement 120K tokens d'historique brut. Le modèle principal lit une chronologie cohérente et ne sait pas que le système de mémoire existe.
Résultats de performance
Le développeur a simulé 260 tours à travers différents types de conversations. Pour un travail de projet soutenu (commençant par des recherches approfondies et passant progressivement à des échanges rapides au fur et à mesure que le modèle apprend le domaine), le système réduit la consommation de tokens d'environ la moitié.
Outils de développement
Le système a été construit avec Claude Code pour la simulation et Claude.ai pour l'étape de consultation et de recherche. Le développeur recherche d'autres personnes qui ont essayé de router un modèle plus petit pour gérer le contexte d'un modèle plus grand ou qui ont trouvé d'autres solutions de contournement au problème de compaction.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Benchmarks de Performance des LLM Locaux sur Mac Mini avec OpenClaw et LM Studio
Un utilisateur de Reddit a publié des chiffres de performance pour l'exécution locale du modèle Unsloth gpt-oss-20b-Q4_K_S.gguf sur un Mac Mini avec 32 Go de RAM, atteignant 34 tokens/seconde avec un temps de 0,7 seconde pour le premier token en utilisant OpenClaw 2026.3.8 et LM Studio 0.4.6+1.

Savecraft MCP Server Fournit à Claude des Données Précises sur Magic: The Gathering
Savecraft est un serveur MCP open-source qui analyse localement le Player.log de MTG Arena, synchronise l'état de jeu et donne à Claude accès à 12 modules de référence experts construits sur des données réelles de Magic : The Gathering. L'outil empêche Claude d'halluciner les noms de cartes et les règles en lui fournissant un accès aux données réelles d'Arena, aux recommandations de draft de 17Lands et à la base de données complète de Scryfall.

AutoBe : Comment des LLM locaux faibles ont corrigé l'architecture d'un générateur de backend IA
AutoBe est un agent IA open-source qui génère des applications backend complètes en utilisant TypeScript, NestJS et Prisma. L'équipe a découvert que leur succès initial de compilation à 100 % produisait du code non maintenable, puis a reconstruit avec une génération modulaire - faisant chuter le succès à 40 % - et a utilisé des LLM locaux faibles comme qwen3-30b-a3b-thinking pour déboguer les ambiguïtés de schéma.

SkyClaw : Runtime d'agent IA autonome basé sur Rust
SkyClaw est un runtime d'agent IA autonome construit en Rust avec un binaire de 7,1 Mo qui consomme 14 Mo de RAM au repos et démarre en moins d'une seconde. Il fonctionne selon cinq principes d'ingénierie incluant l'autonomie, la robustesse et une efficacité brutale.