L'architecture à double modèle réduit de moitié la consommation de jetons pour les conversations longues.

Système de compression de contexte pour agents IA
Un développeur sur r/ClaudeAI a partagé une solution au problème des agents IA qui perdent le contexte après la compaction des conversations. Le système utilise une architecture à double modèle où un petit modèle peu coûteux (appelé le "subconscient") compresse continuellement l'historique des conversations en arrière-plan.
Détails de l'architecture
Le système comporte quatre couches :
- Résumé narratif (~1K tokens)
- Faits compressés
- Citations textuelles récupérées sémantiquement
- Tours récents bruts
Le modèle principal ("conscient") reçoit un contexte soigneusement sélectionné d'environ 35K tokens avec la même densité d'information qui nécessiterait normalement 120K tokens d'historique brut. Le modèle principal lit une chronologie cohérente et ne sait pas que le système de mémoire existe.
Résultats de performance
Le développeur a simulé 260 tours à travers différents types de conversations. Pour un travail de projet soutenu (commençant par des recherches approfondies et passant progressivement à des échanges rapides au fur et à mesure que le modèle apprend le domaine), le système réduit la consommation de tokens d'environ la moitié.
Outils de développement
Le système a été construit avec Claude Code pour la simulation et Claude.ai pour l'étape de consultation et de recherche. Le développeur recherche d'autres personnes qui ont essayé de router un modèle plus petit pour gérer le contexte d'un modèle plus grand ou qui ont trouvé d'autres solutions de contournement au problème de compaction.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Serveur de Compétence OpenClaw pour l'Analyse et le Trading du Marché Indien
Un terminal de trading open-source pour les marchés indiens a été intégré en tant que serveur de compétences OpenClaw, permettant aux agents de récupérer des données de marché et d'exécuter des analyses multi-agents via HTTP. Le système fournit des plans de trading structurés avec des prix d'entrée, des stop-loss et des objectifs pour trois profils de risque.

SubQ : Un LLM sous-quadratique avec une fenêtre de contexte de 12 millions de tokens
SubQ est un LLM à attention creuse entièrement sous-quadratique offrant une fenêtre de contexte de 12 millions de tokens à 150 tokens/s, avec SWE-Bench Verified 81,8% et RULER @ 128K 95,0%. Il réduit le calcul de l'attention d'environ 1000× par rapport aux transformeurs.

Quanta-SDK v0.9.2 ajoute un serveur MCP pour l'exécution de circuits quantiques via des agents IA.
Quanta-SDK v0.9.2 inclut désormais un serveur MCP (Model Context Protocol) qui fournit aux agents IA comme Claude ou GPT des outils pour exécuter et interpréter des circuits quantiques. Le serveur propose plus de 20 outils incluant l'exécution de circuits sur du matériel IBM, l'interprétation des résultats, l'analyse du bruit et le tarif financier quantique.

Optio : Orchestration d'Agents d'IA de Codage dans Kubernetes du Ticket à la PR
Optio est un système d'orchestration open source qui transforme les tickets en demandes de fusion (pull requests) en utilisant des agents de codage IA comme Claude Code ou Codex. Il gère l'intégralité du cycle de vie dans des pods Kubernetes isolés avec une boucle de rétroaction qui redémarre automatiquement les agents en cas d'échec d'intégration continue ou de retours de revue.