Pipeline TDD IA : Comment de mauvaises instructions ont créé 3 400 tests et ce qui a permis de les corriger

✍️ OpenClawRadar📅 Publié: April 2, 2026🔗 Source
Pipeline TDD IA : Comment de mauvaises instructions ont créé 3 400 tests et ce qui a permis de les corriger
Ad

Le Problème : Interprétation Littérale à Grande Échelle

Un développeur a créé un pipeline TDD multi-agents en utilisant Claude Code, avec différents agents gérant des tâches spécifiques : un écrit les tests, un écrit le code pour les réussir, un révise tout, et un recherche les cas limites. L'instruction initiale était simple : "écrire des tests pour tout".

Le système semblait fonctionner - le nombre de tests augmentait et l'intégration continue était verte. Cependant, un audit a révélé des problèmes avec les 3 400 tests générés :

  • 44 % valides
  • 30 % nécessitaient des retouches
  • 26 % étaient complètement inutiles

Les tests inutiles incluaient :

  • Des tests qui construisaient un objet de configuration JSON puis affirmaient qu'il était égal à lui-même
  • Des tests qui vérifiaient si une interface TypeScript avait la bonne forme en construisant l'objet et en affirmant qu'il correspondait à ce qu'ils venaient de construire
  • Des tests pour des fichiers statiques qui ne changeront jamais

Le développeur a supprimé près de 20 000 lignes de code de test et a identifié le problème central : "Claude n'a pas fait d'erreur. C'est moi. J'ai dit 'écrire des tests pour tout' et il m'a parfaitement compris. Chaque fichier. Chaque configuration. Chaque définition de type. Mes instructions étaient le problème, et l'agent les a suivies parfaitement."

Ad

La Solution : Classification et Revue

La correction a impliqué deux changements clés :

1. Classifier les éléments de travail avant les tests :

  • Les fonctionnalités obtiennent 3-5 tests comportementaux (est-ce que cette chose fonctionne réellement ?)
  • Les tâches obtiennent 1-2 tests de fumée (est-ce que cela a cassé quelque chose d'évident ?)
  • Les bugs obtiennent 2-3 tests de régression (est-ce que ce bug spécifique reviendra ?)
  • Les améliorations ne testent que le comportement nouveau ou modifié

2. Ajouter un agent de revue : Un agent séparé examine à la fois les tests et l'implémentation avec un contexte frais, détectant les problèmes que les agents d'écriture ont manqués car ils étaient trop proches de leur propre production.

Résultats Après la Correction

  • 3 400 tests réduits à 2 525
  • Temps d'exécution réduit de 117 secondes à environ 50 secondes
  • Chaque test restant valide un comportement réel

Insight Clé

"Construire avec des agents IA rend votre pensée approximative visible à grande échelle. Un humain écrit de mauvais tests, vous obtenez quelques mauvais tests. Donnez une mauvaise instruction à un pipeline d'agents traitant des centaines d'éléments de travail ? Vous obtenez des centaines de mauvais tests. La même mauvaise pensée, simplement amplifiée à travers tout ce qu'elle touche. Corrigez la pensée, corrigez la production."

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Utilisateur rapporte que Claude surpasse GPT-4o dans l'analyse approfondie de documents : détecte les contradictions logiques, réécrit le ton avec précision
Use Cases

Utilisateur rapporte que Claude surpasse GPT-4o dans l'analyse approfondie de documents : détecte les contradictions logiques, réécrit le ton avec précision

Un développeur fidèle à ChatGPT partage son expérience concrète : Claude 3.5 Sonnet a détecté trois contradictions logiques dans un document technique de 15 000 mots que GPT-4o a manquées, et a réécrit des sections tout en reproduisant exactement la voix de l'auteur.

OpenClawRadar
Opus 4.8 vs Sonnet 4.6 pour l'analyse : Données réelles d'un tableau de bord SaaS
Use Cases

Opus 4.8 vs Sonnet 4.6 pour l'analyse : Données réelles d'un tableau de bord SaaS

Un SaaS avec 310 clients artisans a testé Claude Opus 4.8 vs Sonnet 4.6 pour l'analyse des tendances, les résumés mensuels et la détection d'anomalies. Opus a repéré des anomalies subtiles que Sonnet a manquées, mais coûte 2,1x par appel.

OpenClawRadar
Développeur crée une application de comptabilité IA avec Claude Code
Use Cases

Développeur crée une application de comptabilité IA avec Claude Code

Un développeur a créé AICountant, une application de comptabilité IA pour les freelances et les petites entreprises, en utilisant Claude Code sur toute la pile technique, incluant Next.js App Router, Prisma avec PostgreSQL et le stockage Vercel Blob. L'application extrait les données des reçus, convertit les devises étrangères en utilisant les taux de change historiques et organise le tout dans un registre consultable.

OpenClawRadar
Développeur Homelab Évalue 19 LLM Locaux avec 45 Tests Pratiques sur AMD Strix Halo
Use Cases

Développeur Homelab Évalue 19 LLM Locaux avec 45 Tests Pratiques sur AMD Strix Halo

Un développeur a créé une suite de 45 tests de référence pour les LLM locaux basée sur des cas d'utilisation réels de laboratoire domestique, comme la classification d'e-mails, l'automatisation Home Assistant et la planification de repas. En testant 19 modèles sur un AMD Strix Halo avec 128 Go de RAM et 96 Go de VRAM, Gemma 4 26B-A4B a obtenu les meilleurs résultats après correction de bugs.

OpenClawRadar