L'illusion du travail terminé de Claude Code : pourquoi examiner le cheminement de l'agent importe plus que le diff

Un post sur r/ClaudeAI soutient qu'à mesure que Claude Code (et les outils de codage agentiques similaires) deviennent plus autonomes, la revue de code traditionnelle d'un diff final n'est plus suffisante. L'auteur, Ill_Particular_3385, met en garde contre un « écart de confiance » : un agent peut produire un diff propre, un bon résumé et des tests passants, mais quand même passer à côté du comportement réel, des problèmes de sécurité, des contraintes d'architecture ou des cas limites. « L'agent s'est arrêté » et « c'est sûr à fusionner » ne sont pas la même chose.
Ce qui change avec les workflows agentiques
Claude Code peut désormais :
- Explorer une base de code
- Planifier des modifications
- Modifier des fichiers
- Exécuter des commandes
- Créer des PR
- Travailler en sessions parallèles
- Résumer ce qu'il a fait
Ce qu'une meilleure surface de revue devrait inclure
L'auteur suggère que les outils de codage agentiques doivent exposer plus de données de revue structurées, notamment :
- Tâche d'origine
- Plan
- Fichiers lus
- Fichiers modifiés
- Commandes exécutées
- Résultats de tests
- Modifications de dépendances
- Approbations et contrôles de sécurité
- Surtout ce qui n'a pas été vérifié
Implications pratiques pour les développeurs
Si vous utilisez Claude Code ou des outils similaires, demandez-vous : faites-vous surtout confiance au diff final, ou essayez-vous aussi de revoir le chemin emprunté par l'agent ? Le post suggère qu'adopter un modèle de revue de toute la chaîne de l'agent — pas seulement le résultat — devient nécessaire pour la sécurité et l'exactitude.
L'auteur renvoie également à un essai plus long (https://cate.cero-ai.com/blog/illusion-of-finished-work) et à une proposition pour gérer ce processus de revue (https://github.com/0-AI-UG/cate).
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Backend personnalisé llama.cpp décharge la multiplication matricielle des LLM vers le NPU AMD XDNA2 sur Ryzen AI MAX 385
Un développeur a créé un backend personnalisé pour llama.cpp qui envoie directement les opérations GEMM vers le NPU AMD XDNA2 sur le Ryzen AI MAX 385 (Strix Halo), atteignant 43,7 t/s en décodage avec 0,947 J/tok pour Meta-Llama-3.1-8B-Instruct Q4_K_M. Le chemin de décodage via le NPU économise environ 10W par rapport au Vulkan seul tout en maintenant le débit de décodage.

Cortex : Une couche de mémoire locale pour les agents OpenClaw avec décroissance d'Ebbinghaus
Cortex est un outil de mémoire open-source conçu pour résoudre les problèmes de compactage de contexte chez les agents OpenClaw. Il implémente les courbes d'oubli d'Ebbinghaus pour la dégradation des faits, importe d'abord à partir de fichiers et s'exécute sous la forme d'un unique binaire Go de 19 Mo avec SQLite.

Le développeur partage une solution pour que Claude AI ne contourne plus les règles au-delà du seuil de 50 occurrences.
Un développeur rapporte que Claude Code a commencé à ignorer silencieusement des règles une fois que son ensemble de règles partagées a dépassé environ 50 éléments, en particulier lors de tâches intensives en frontend. Il a créé un hook qui analyse les prompts et charge seulement 2-3 règles pertinentes basées sur la correspondance de mots-clés.

Utilisateur de Reddit teste la fonction d'auto-apprentissage de l'agent IA Hermes, découvre des failles critiques
Un utilisateur de Reddit a testé la fonction d'auto-apprentissage de l'agent IA Hermes, qui crée automatiquement des compétences à partir de fichiers markdown. L'utilisateur a constaté qu'il évalue toujours ses propres résultats comme réussis, même lorsque la sortie est incorrecte, et qu'il écrase les modifications manuelles.