Calmkeep : Une couche de continuité externe pour contrer la dérive des LLM dans les sessions prolongées

✍️ OpenClawRadar📅 Publié: March 17, 2026🔗 Source
Calmkeep : Une couche de continuité externe pour contrer la dérive des LLM dans les sessions prolongées
Ad

Résoudre la dérive des LLM dans les flux de travail professionnels

Calmkeep est une couche de continuité externe construite spécifiquement pour contrer ce que son créateur appelle la "dérive structurelle" des LLM lors de sessions prolongées. Cette dérive se produit lorsque des LLM comme Claude abandonnent progressivement des décisions, des modèles ou des cadres établis précédemment, même lorsque la fenêtre de contexte complète les contient encore — non pas par hallucination, mais par un abandon systématique des modèles établis.

Résultats des tests et méthodologie

Le créateur a mené des audits adversariaux en utilisant Claude lui-même comme système d'évaluation, avec une méthodologie en aveugle et une notation basée sur des critères établis dans les cinq premiers tours. Claude a systématiquement attribué des notes plus élevées aux transcriptions de Calmkeep qu'à ses propres sorties.

Test de construction backend de 25 tours

  • Claude standard : 60 % d'intégrité finale, 8 violations architecturales, coefficient de dérive de 40 %
  • Calmkeep : 85 % d'intégrité, 3 violations architecturales, aucune régression après le tour 14

L'exemple le plus révélateur : Claude a introduit un middleware Zod au tour 14, puis est immédiatement revenu à parseInt brut pour les trois modules suivants, comme si la mise à niveau n'avait jamais eu lieu.

Ad

Session juridique/stratégique de 25 tours

  • Claude standard : 50 % d'intégrité stratégique, 5 violations incluant un changement de juridiction qui a invalidé le cadre juridique précédent, ~35 % d'exposition à la faute professionnelle
  • Calmkeep : 100 % d'intégrité, zéro violation, <5 % de risque

Implémentation technique

Calmkeep inclut :

  • Connecteur MCP
  • Plugin Claude Code
  • SDK Python

Le système fonctionne uniquement comme runtime externe, nécessite l'utilisation de votre propre clé Anthropic, n'a pas de mémoire cachée et ne modifie pas les poids du modèle sous-jacent.

Disponibilité et tests

Un essai gratuit de 14 jours est disponible via Stripe à l'adresse https://calmkeep.ai. Les rapports de test complets, la méthodologie, les classifications AVE, la grille de notation et les analyses tour par tour sont disponibles à :

  • https://calmkeep.ai/codetestreport
  • https://calmkeep.ai/legaltestreport

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Tacit : un langage de programmation pensé pour les LLM, construit avec Claude Code et Opus 4.7
Tools

Tacit : un langage de programmation pensé pour les LLM, construit avec Claude Code et Opus 4.7

Tacit est un langage de programmation expérimental conçu pour les LLM, créé et implémenté à l'aide de Claude Code et Opus 4.7. Il élimine les commodités humaines pour minimiser l'utilisation de tokens et est livré avec un primer qui apprend aux LLM de milieu de gamme et supérieurs (Sonnet et au-dessus) à écrire du code Tacit.

OpenClawRadar
OpenTrace : Serveur d'observabilité auto-hébergé avec plus de 75 outils MCP
Tools

OpenTrace : Serveur d'observabilité auto-hébergé avec plus de 75 outils MCP

OpenTrace est un serveur d'observabilité auto-hébergé qui fournit des journaux, des analyses utilisateur et une introspection de base de données via plus de 75 outils MCP, fonctionnant sur un VPS à 4 $ avec stockage SQLite et connexions PostgreSQL en lecture seule.

OpenClawRadar
Exploiter le Signal d'Agence Cachée des LLM (Â) pour un Meilleur Appel d'Outils
Tools

Exploiter le Signal d'Agence Cachée des LLM (Â) pour un Meilleur Appel d'Outils

Un développeur a découvert que les LLM possèdent une direction d'état caché linéairement séparable appelée  qui prédit les appels d'outils avec une AUC > 0,94. En utilisant ce signal pour forcer les appels d'outils, les performances de Qwen3-1.7B sont passées de 26,7 % à 85 % (+58 % d'amélioration) et les échecs sans outil ont été réduits de 43 % à 2,6 %.

OpenClawRadar
🦀
Tools

Bonsai 2 (Qwen 3.8 27B) comme solution de repli pour OpenClaw : 8 Go, 85 tok/s sur une 5070

Un utilisateur de r/openclaw a intégré Ternary Bonsai 2 de PrismML (Qwen 3.8 27B) comme modèle de secours pour OpenClaw — environ 8 Go sur disque, 85 tok/s en sortie sur une 5070, texte et vision, et des tâches agentiques navigateur/VM qui tiennent la route.

OpenClawRadar