KI-TDD-Pipeline: Wie schlechte Anweisungen 3.400 Tests erzeugten und was das Problem löste

Das Problem: Wörtliche Interpretation im großen Maßstab
Ein Entwickler erstellte eine Multi-Agent-TDD-Pipeline mit Claude Code, bei der verschiedene Agenten spezifische Aufgaben übernehmen: einer schreibt Tests, einer schreibt Code, um sie zu bestehen, einer überprüft alles, und einer sucht nach Randfällen. Die ursprüngliche Anweisung war einfach: "Schreibe Tests für alles."
Das System schien zu funktionieren – die Testanzahl stieg stetig und die CI war grün. Eine Überprüfung zeigte jedoch Probleme mit den 3.400 generierten Tests:
- 44 % gültig
- 30 % benötigten Überarbeitung
- 26 % völliger Unsinn
Die unsinnigen Tests umfassten:
- Tests, die ein JSON-Konfigurationsobjekt erstellten und dann behaupteten, es sei gleich sich selbst
- Tests, die prüften, ob eine TypeScript-Schnittstelle die richtige Form hatte, indem sie das Objekt bauten und behaupteten, es passe zu dem, was sie gerade gebaut hatten
- Tests für statische Dateien, die sich nie ändern werden
Der Entwickler löschte fast 20.000 Zeilen Testcode und identifizierte das Kernproblem: "Claude hat nicht versagt. Ich habe es getan. Ich sagte 'Schreibe Tests für alles' und es hat mich deutlich verstanden. Jede Datei. Jede Konfiguration. Jede Typdefinition. Meine Anweisungen waren das Problem, und der Agent befolgte sie perfekt."
Die Lösung: Klassifizierung und Überprüfung
Die Lösung umfasste zwei wichtige Änderungen:
1. Klassifizierung von Arbeitselementen vor dem Testen:
- Features erhalten 3–5 Verhaltenstests (funktioniert dieses Ding tatsächlich?)
- Aufgaben erhalten 1–2 Rauchtests (hat es etwas Offensichtliches kaputtgemacht?)
- Fehler erhalten 2–3 Regressionstests (wird dieser spezifische Fehler zurückkehren?)
- Verbesserungen testen nur neues oder geändertes Verhalten
2. Hinzufügen eines Review-Agenten: Ein separater Agent betrachtet sowohl Tests als auch Implementierung mit frischem Kontext und erkennt Probleme, die die schreibenden Agenten übersahen, weil sie zu nah an ihrer eigenen Ausgabe waren.
Ergebnisse nach der Lösung
- 3.400 Tests reduziert auf 2.525
- Ausführungszeit sank von 117 Sekunden auf ~50 Sekunden
- Jeder verbleibende Test validiert tatsächliches Verhalten
Wesentliche Erkenntnis
"Das Bauen mit KI-Agenten macht Ihr schlampiges Denken im großen Maßstab sichtbar. Ein Mensch schreibt schlechte Tests, Sie bekommen ein paar schlechte Tests. Geben Sie eine schlechte Anweisung an eine Agenten-Pipeline, die Hunderte von Arbeitselementen verarbeitet? Sie bekommen Hunderte von schlechten Tests. Dasselbe schlechte Denken, nur verstärkt über alles, was es berührt. Korrigieren Sie das Denken, korrigieren Sie die Ausgabe."
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Entwickler baut Chrome-Erweiterung in 7 Tagen mit Claude neu, nachdem Google MV3-Migration das Original zerstört hat
Ein Entwickler hat eine Chrome-Erweiterung, ihre API, eine Website und einen QA-Agenten in 7 Tagen mit Claude neu aufgebaut, nachdem die Migration von Googles Manifest V2 zu V3 die ursprüngliche Version zerstört hatte. Die Erweiterung findet echte Amazon-Rabatte über 21 Domains hinweg und gewann in der ersten Woche 4.000 Installationen.

Modifiziertes vLLM 0.17.0 läuft auf Tesla P40 für Echtzeit-Transkription mit Qwen3 ASR 1.7B
Ein Entwickler hat vLLM 0.17.0 für die Pascal-Architektur von Tesla P40 GPUs angepasst und damit nahezu vollständige Hardwarebeschleunigung für die Echtzeit-Transkription von Vorlesungen mit dem Qwen3 ASR 1.7B Modell erreicht. Der Fork ist auf GitHub verfügbar.

OpenClaw als Rechtsanwaltsfachangestellte: Einrichtung eines Scheidungsfalls mit Discord, Obsidian und GPT-Zugriff
Ein Ausländer in Japan nutzt OpenClaw auf einem Mac mini, um Scheidungsbeweise, Übersetzungen, Fristen und ein Eltern-Tagebuch mit GPS-Abgleich zu verwalten.

Automatisierter Morgenbegleiter mit Zitat-Hintergrundbild-Generierung unter Verwendung von Remotion
Ein Entwickler hat einen automatisierten Morgenbegleiter erstellt, der Zitate aus 107 Büchern in einem Obsidian-Tresor abruft, personalisierte Kurzberichte mit Reddit-Threads und Tagebuchaufforderungen generiert und dann mithilfe von Remotion mit KI-gesteuerter Designauswahl individuelle Hintergrundbilder erstellt.