Canalización TDD de IA: Cómo las instrucciones deficientes generaron 3,400 pruebas y qué lo solucionó

El Problema: Interpretación Literal a Escala
Un desarrollador creó una canalización TDD multiagente usando Claude Code, con diferentes agentes manejando trabajos específicos: uno escribe pruebas, otro escribe código para pasarlas, otro revisa todo y otro busca casos límite. La instrucción inicial fue simple: "escribe pruebas para todo".
El sistema parecía funcionar: el conteo de pruebas seguía aumentando y el CI estaba en verde. Sin embargo, una auditoría reveló problemas con las 3,400 pruebas generadas:
- 44% válidas
- 30% necesitaban rehacerse
- 26% basura completa
Las pruebas basura incluían:
- Pruebas que construían un objeto JSON de configuración y luego afirmaban que era igual a sí mismo
- Pruebas que verificaban si una interfaz TypeScript tenía la forma correcta construyendo el objeto y afirmando que coincidía con lo que acababan de construir
- Pruebas para archivos estáticos que nunca cambiarán
El desarrollador eliminó casi 20,000 líneas de código de prueba e identificó el problema central: "Claude no falló. Yo lo hice. Dije 'escribe pruebas para todo' y me escuchó alto y claro. Cada archivo. Cada configuración. Cada definición de tipo. Mis instrucciones fueron el problema, y el agente las siguió perfectamente".
La Solución: Clasificación y Revisión
La solución involucró dos cambios clave:
1. Clasificar elementos de trabajo antes de probar:
- Las características obtienen 3-5 pruebas de comportamiento (¿esta cosa realmente funciona?)
- Las tareas obtienen 1-2 pruebas de humo (¿rompió algo obvio?)
- Los errores obtienen 2-3 pruebas de regresión (¿volverá este error específico?)
- Las mejoras solo prueban comportamiento nuevo o cambiado
2. Agregar un agente de revisión: Un agente separado examina tanto las pruebas como la implementación con contexto fresco, detectando problemas que los agentes escritores pasaron por alto porque estaban demasiado cerca de su propia salida.
Resultados Después de la Solución
- 3,400 pruebas reducidas a 2,525
- Tiempo de ejecución bajó de 117 segundos a ~50 segundos
- Cada prueba restante valida comportamiento real
Perspectiva Clave
"Construir con agentes de IA hace que tu pensamiento descuidado sea visible a escala. Un humano escribe malas pruebas, obtienes algunas malas pruebas. ¿Das una mala instrucción a una canalización de agentes procesando cientos de elementos de trabajo? Obtienes cientos de malas pruebas. El mismo mal pensamiento, solo amplificado a través de todo lo que toca. Arregla el pensamiento, arregla la salida."
📖 Read the full source: r/ClaudeAI
👀 Ver también

Usuario reporta que Claude supera a GPT-4o en análisis profundo de documentos: detecta contradicciones lógicas, reescribe el tono con precisión
Un desarrollador que era un leal usuario de ChatGPT comparte su experiencia concreta: Claude 3.5 Sonnet detectó tres contradicciones lógicas en un documento técnico de 15 000 palabras que GPT-4o pasó por alto, y reescribió secciones manteniendo exactamente la voz del autor.

Alojamiento local de vLLM en 2x 2080 Ti modificadas para OpenClaw: Experiencia del mundo real
Un usuario comparte su experiencia comprando por impulso dos 2080 Ti modificadas de 22GB en Alibaba con NVLink para alojar un modelo de 20-30B para OpenClaw mediante vLLM, pidiendo consejos sobre modelos adecuados para coding, homelab y RAG.

SkiTomorrow.ai: Un motor de decisiones para viajes de esquí construido con Claude Code
SkiTomorrow.ai es una herramienta web gratuita que puntúa 234 estaciones de esquí en todo el mundo según pronósticos de nieve en vivo, distancia de viaje y costo, luego proporciona clasificaciones personalizadas. El desarrollador la construyó completamente usando Claude Code y compartió ideas específicas sobre el flujo de trabajo.

Desarrollador Diseña Icono de Aplicación Usando Claude AI Sin Herramientas de Diseño
Un desarrollador creó un administrador de procesos para macOS llamado PIDKill y diseñó su icono de aplicación utilizando únicamente Claude AI, específicamente Claude Code y Claude web. El diseño final utiliza la fuente SF Mono con un efecto de glitch y un tachado rojo para representar la terminación de procesos.