Le code de Claude divulgué révèle le système KAIROS et le déficit de vérification des agents d'IA

Ce que la fuite a révélé
Anthropic a accidentellement inclus une source map dans son package npm, exposant l'intégralité du code source de Claude Code. La fuite contient 512 000 lignes de TypeScript, 44 drapeaux de fonctionnalité, et un système caché appelé KAIROS.
KAIROS est décrit comme un agent en arrière-plan toujours actif qui effectue plusieurs fonctions pendant que l'utilisateur est inactif :
- Consolide la mémoire
- Fusionne les observations
- Supprime les contradictions
- Prépare le contexte pour qu'il soit propre au retour de l'utilisateur
L'expérience de développement indépendant
Un développeur solo construisant une plateforme TypeScript de 668 000 lignes avec Claude Code a rencontré les mêmes limites que KAIROS adresse. Il exécute des campagnes autonomes s'étalant sur plusieurs sessions avec des fichiers d'état persistants qui transportent le contexte au-delà des limites de la fenêtre de contexte.
Le problème : les campagnes s'arrêtent entre les sessions. Lorsqu'on termine une phase et qu'on revient plus tard, les développeurs doivent redémarrer manuellement, relire les fichiers de campagne, et déterminer où les choses se sont arrêtées parce que la mémoire de l'agent disparaît avec la session.
La solution qu'ils ont construite : un démon qui enchaîne les sessions via des déclencheurs programmés. Une session se termine, écrit l'état, se termine avec le code 0 (« aucune erreur »), et le démon détecte la fin pour lancer la session suivante avec le contexte complet. Cela a réduit des campagnes qui prenaient une semaine de redémarrages manuels pour s'exécuter en une seule fois.
Le problème de vérification
Le développeur a découvert que le code de sortie 0 signifie « aucune erreur » mais ne signifie pas « cela fonctionne ». Lors de leur première nuit d'exécution du démon, un agent a livré une fonctionnalité invisible — une campagne complète terminée avec une vérification de type propre, zéro avertissement, et une fin confiante, mais 37 des 38 entités étaient manquantes dans l'application réelle.
Dans un autre cas, une session de flotte a remplacé 6 composants fonctionnels en parallèle, résultant en des composants affichant « Running NaN » sans chronologie ni signes vitaux. Les agents n'ont jamais rendu ce qu'ils ont construit — ils ont seulement vérifié que cela compilait et sont passés à autre chose.
La solution de couche de vérification
Le développeur a réalisé que « le démon seul est un moyen plus rapide de livrer du code cassé ». Ils ont construit une couche de vérification qui force les agents à prouver leur travail visuellement :
- Naviguer sur des routes réelles dans un vrai navigateur
- Compter les éléments DOM
- Capturer des captures d'écran
- Si une vue qui devrait avoir 38 cartes d'entité en a zéro, le système le détecte
- Si un agent a modifié des fichiers d'interface utilisateur, il ne peut pas terminer sans artefacts de capture d'écran
Cela est implémenté comme une barrière stricte, pas une suggestion.
L'écart fondamental
KAIROS résout le problème de mémoire mais ne résout pas le problème de vérification. Bien qu'il fusionne les observations, supprime les contradictions, et convertit des aperçus vagues en faits concrets, ni la consolidation de la mémoire ni le mode démon n'adressent l'écart fondamental : les agents ne peuvent pas vérifier leur propre travail visuellement. Ils peuvent prouver la structure mais ne peuvent pas prouver l'apparence.
Le développeur note que la convergence entre le KAIROS d'Anthropic et leur solution indépendante indique un plafond réel : une fois que les sessions sont suffisamment longues et que les campagnes s'étalent sur des jours, l'exécution en arrière-plan persistante devient inévitable. Cependant, « le démon est la partie facile. N'importe qui peut enchaîner les sessions. La partie difficile est de construire l'infrastructure qui détecte les échecs que le démon livrera avec confiance. »
Leçon clé
Si vous construisez une forme quelconque d'exécution autonome d'agents, posez une question avant de livrer : mon agent peut-il prouver que ce qu'il a construit fonctionne réellement ? Si la réponse est « cela a compilé », vous risquez de rencontrer les mêmes problèmes. Les 27 post-mortem documentés du développeur leur ont appris que « le démon est un multiplicateur de force. Sans une couche de qualité, il multiplie vos échecs. »
Le démon, la couche de vérification, et le système de persistance de campagne sont open-source sur github.com/SethGammon/Citadel.
📖 Read the full source: r/ClaudeAI
👀 See Also

Perspectives du Projet Rust sur l'IA : Aperçus Pratiques des Contributeurs
Un document de synthèse recueille les perspectives des contributeurs Rust sur l'utilisation des outils d'IA, soulignant qu'une intégration efficace de l'IA nécessite une ingénierie minutieuse et présentant des cas d'usage spécifiques comme la navigation dans la base de code, l'assistance à la revue de code et le traitement de données semi-structurées.

Les utilisateurs de Claude Code atteignent les limites d'utilisation plus vite que prévu, des bogues sont soupçonnés.
Anthropic reconnaît que les utilisateurs de Claude Code épuisent leurs quotas 'bien plus rapidement que prévu', avec des utilisateurs signalant des limites atteintes en quelques heures. Des bogues présumés dans la mise en cache des invites pourraient gonfler les coûts de 10 à 20 fois, et le rétrogradage vers la version 2.1.34 semblerait aider.

La pandémie du « Je ne sais pas, c’est Claude qui l’a écrit » : quand l’abandon cognitif remplace la propriété du code
Les ingénieurs délèguent les décisions architecturales à Claude, puis ne peuvent pas expliquer la PR. Addy Osmani appelle cela la « reddition cognitive » — la sortie d'IA devient la vôtre sans révision.

ICML 2026 rejette 2 % des articles sur le bureau pour violation de la politique de révision par LLM.
ICML 2026 a rejeté 497 articles (environ 2 % des soumissions) après avoir détecté 795 évaluations (environ 1 % de toutes les évaluations) où les évaluateurs ont violé des accords explicites de ne pas utiliser de LLM. La méthode de détection impliquait le tatouage numérique des PDF avec des instructions LLM cachées.