Pipeline de TDD com IA: Como Instruções Ruins Criaram 3.400 Testes e o Que os Corrigiu

O Problema: Interpretação Literal em Escala
Um desenvolvedor criou um pipeline TDD multiagente usando Claude Code, com diferentes agentes lidando com tarefas específicas: um escreve testes, um escreve código para passá-los, um revisa tudo e um procura por casos extremos. A instrução inicial era simples: "escreva testes para tudo".
O sistema parecia funcionar - a contagem de testes continuava subindo e o CI estava verde. No entanto, uma auditoria revelou problemas com os 3.400 testes gerados:
- 44% válidos
- 30% precisavam de retrabalho
- 26% lixo completo
Os testes de lixo incluíam:
- Testes que construíam um objeto de configuração JSON e então afirmavam que ele era igual a si mesmo
- Testes que verificavam se uma interface TypeScript tinha o formato correto construindo o objeto e afirmando que correspondia ao que acabaram de construir
- Testes para arquivos estáticos que nunca mudarão
O desenvolvedor excluiu quase 20.000 linhas de código de teste e identificou o problema central: "Claude não errou. Eu errei. Eu disse 'escreva testes para tudo' e ele me ouviu alto e claro. Cada arquivo. Cada configuração. Cada definição de tipo. Minhas instruções eram o problema, e o agente as seguiu perfeitamente."
A Solução: Classificação e Revisão
A correção envolveu duas mudanças principais:
1. Classificar itens de trabalho antes dos testes:
- Funcionalidades recebem 3-5 testes comportamentais (essa coisa realmente funciona?)
- Tarefas recebem 1-2 testes de fumaça (quebrou algo óbvio?)
- Bugs recebem 2-3 testes de regressão (esse bug específico voltará?)
- Melhorias testam apenas comportamento novo ou alterado
2. Adicionar um agente de revisão: Um agente separado examina tanto os testes quanto a implementação com contexto novo, capturando problemas que os agentes de escrita perderam porque estavam muito próximos de sua própria saída.
Resultados Após a Correção
- 3.400 testes reduzidos para 2.525
- Tempo de execução caiu de 117 segundos para ~50 segundos
- Cada teste restante valida comportamento real
Insight Principal
"Construir com agentes de IA torna seu pensamento descuidado visível em escala. Um humano escreve testes ruins, você obtém alguns testes ruins. Dê uma instrução ruim para um pipeline de agentes processando centenas de itens de trabalho? Você obtém centenas de testes ruins. O mesmo pensamento ruim, apenas amplificado por tudo o que toca. Corrija o pensamento, corrija a saída."
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Claude AI Orienta Usuário no Reparo de Teto Solar de Carro com Adesivo de Vidro de Uretano
Um usuário reparou o teto solar de um Ford Fusion 2012 que se abriu na estrada seguindo a orientação passo a passo de Claude para limpar a ferrugem e aplicar adesivo de vidro de uretano, evitando uma substituição de US$ 1500 em um carro de US$ 5000.

Construindo Camadas de Dados Verticais para Agentes OpenClaw
A verdadeira oportunidade com o OpenClaw não é apenas usá-lo — é construir camadas de dados específicas da indústria que conectem fontes de dados confusas, normalizem-nas em esquemas utilizáveis e as exponham como endpoints de ferramentas limpas que retornam JSON estruturado.

Construindo um Córtex de IA com Claude Code: Arquitetura e Insights da Biblioteca de Contexto
Um desenvolvedor criou uma plataforma onde o Claude escreve, revisa e mescla código automaticamente, com o principal insight sendo uma biblioteca de contexto estruturada que se acumula ao longo do tempo. Após seis semanas, a IA supostamente conhece a empresa melhor do que um novo contratado após um ano.

Monitor de Conflitos em Tempo Real Desenvolvido com a API Claude Analisa Impacto de Notícias
Um desenvolvedor usou a API do Claude para criar um pipeline automatizado que lê notícias sobre conflitos de mais de 100 fontes, classifica por tópico/país/gravidade, gera pontuações de impacto (1-100) e produz resumos inteligentes de 3 linhas.