L'architecture à double modèle réduit de moitié la consommation de jetons pour les conversations longues.

✍️ OpenClawRadar📅 Publié: March 9, 2026🔗 Source
L'architecture à double modèle réduit de moitié la consommation de jetons pour les conversations longues.
Ad

Système de compression de contexte pour agents IA

Un développeur sur r/ClaudeAI a partagé une solution au problème des agents IA qui perdent le contexte après la compaction des conversations. Le système utilise une architecture à double modèle où un petit modèle peu coûteux (appelé le "subconscient") compresse continuellement l'historique des conversations en arrière-plan.

Détails de l'architecture

Le système comporte quatre couches :

  • Résumé narratif (~1K tokens)
  • Faits compressés
  • Citations textuelles récupérées sémantiquement
  • Tours récents bruts

Le modèle principal ("conscient") reçoit un contexte soigneusement sélectionné d'environ 35K tokens avec la même densité d'information qui nécessiterait normalement 120K tokens d'historique brut. Le modèle principal lit une chronologie cohérente et ne sait pas que le système de mémoire existe.

Ad

Résultats de performance

Le développeur a simulé 260 tours à travers différents types de conversations. Pour un travail de projet soutenu (commençant par des recherches approfondies et passant progressivement à des échanges rapides au fur et à mesure que le modèle apprend le domaine), le système réduit la consommation de tokens d'environ la moitié.

Outils de développement

Le système a été construit avec Claude Code pour la simulation et Claude.ai pour l'étape de consultation et de recherche. Le développeur recherche d'autres personnes qui ont essayé de router un modèle plus petit pour gérer le contexte d'un modèle plus grand ou qui ont trouvé d'autres solutions de contournement au problème de compaction.

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

Benchmarks de Performance des LLM Locaux sur Mac Mini avec OpenClaw et LM Studio
Tools

Benchmarks de Performance des LLM Locaux sur Mac Mini avec OpenClaw et LM Studio

Un utilisateur de Reddit a publié des chiffres de performance pour l'exécution locale du modèle Unsloth gpt-oss-20b-Q4_K_S.gguf sur un Mac Mini avec 32 Go de RAM, atteignant 34 tokens/seconde avec un temps de 0,7 seconde pour le premier token en utilisant OpenClaw 2026.3.8 et LM Studio 0.4.6+1.

OpenClawRadar
Savecraft MCP Server Fournit à Claude des Données Précises sur Magic: The Gathering
Tools

Savecraft MCP Server Fournit à Claude des Données Précises sur Magic: The Gathering

Savecraft est un serveur MCP open-source qui analyse localement le Player.log de MTG Arena, synchronise l'état de jeu et donne à Claude accès à 12 modules de référence experts construits sur des données réelles de Magic : The Gathering. L'outil empêche Claude d'halluciner les noms de cartes et les règles en lui fournissant un accès aux données réelles d'Arena, aux recommandations de draft de 17Lands et à la base de données complète de Scryfall.

OpenClawRadar
AutoBe : Comment des LLM locaux faibles ont corrigé l'architecture d'un générateur de backend IA
Tools

AutoBe : Comment des LLM locaux faibles ont corrigé l'architecture d'un générateur de backend IA

AutoBe est un agent IA open-source qui génère des applications backend complètes en utilisant TypeScript, NestJS et Prisma. L'équipe a découvert que leur succès initial de compilation à 100 % produisait du code non maintenable, puis a reconstruit avec une génération modulaire - faisant chuter le succès à 40 % - et a utilisé des LLM locaux faibles comme qwen3-30b-a3b-thinking pour déboguer les ambiguïtés de schéma.

OpenClawRadar
SkyClaw : Runtime d'agent IA autonome basé sur Rust
Tools

SkyClaw : Runtime d'agent IA autonome basé sur Rust

SkyClaw est un runtime d'agent IA autonome construit en Rust avec un binaire de 7,1 Mo qui consomme 14 Mo de RAM au repos et démarre en moins d'une seconde. Il fonctionne selon cinq principes d'ingénierie incluant l'autonomie, la robustesse et une efficacité brutale.

OpenClawRadar