Pipeline de TDD com IA: Como Instruções Ruins Criaram 3.400 Testes e o Que os Corrigiu

✍️ OpenClawRadar📅 Publicado: April 2, 2026🔗 Source
Pipeline de TDD com IA: Como Instruções Ruins Criaram 3.400 Testes e o Que os Corrigiu
Ad

O Problema: Interpretação Literal em Escala

Um desenvolvedor criou um pipeline TDD multiagente usando Claude Code, com diferentes agentes lidando com tarefas específicas: um escreve testes, um escreve código para passá-los, um revisa tudo e um procura por casos extremos. A instrução inicial era simples: "escreva testes para tudo".

O sistema parecia funcionar - a contagem de testes continuava subindo e o CI estava verde. No entanto, uma auditoria revelou problemas com os 3.400 testes gerados:

  • 44% válidos
  • 30% precisavam de retrabalho
  • 26% lixo completo

Os testes de lixo incluíam:

  • Testes que construíam um objeto de configuração JSON e então afirmavam que ele era igual a si mesmo
  • Testes que verificavam se uma interface TypeScript tinha o formato correto construindo o objeto e afirmando que correspondia ao que acabaram de construir
  • Testes para arquivos estáticos que nunca mudarão

O desenvolvedor excluiu quase 20.000 linhas de código de teste e identificou o problema central: "Claude não errou. Eu errei. Eu disse 'escreva testes para tudo' e ele me ouviu alto e claro. Cada arquivo. Cada configuração. Cada definição de tipo. Minhas instruções eram o problema, e o agente as seguiu perfeitamente."

Ad

A Solução: Classificação e Revisão

A correção envolveu duas mudanças principais:

1. Classificar itens de trabalho antes dos testes:

  • Funcionalidades recebem 3-5 testes comportamentais (essa coisa realmente funciona?)
  • Tarefas recebem 1-2 testes de fumaça (quebrou algo óbvio?)
  • Bugs recebem 2-3 testes de regressão (esse bug específico voltará?)
  • Melhorias testam apenas comportamento novo ou alterado

2. Adicionar um agente de revisão: Um agente separado examina tanto os testes quanto a implementação com contexto novo, capturando problemas que os agentes de escrita perderam porque estavam muito próximos de sua própria saída.

Resultados Após a Correção

  • 3.400 testes reduzidos para 2.525
  • Tempo de execução caiu de 117 segundos para ~50 segundos
  • Cada teste restante valida comportamento real

Insight Principal

"Construir com agentes de IA torna seu pensamento descuidado visível em escala. Um humano escreve testes ruins, você obtém alguns testes ruins. Dê uma instrução ruim para um pipeline de agentes processando centenas de itens de trabalho? Você obtém centenas de testes ruins. O mesmo pensamento ruim, apenas amplificado por tudo o que toca. Corrija o pensamento, corrija a saída."

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

Sistema de Gerenciamento de Projetos Pessoais Usando Claude Code e Obsidian: Arquitetura e Perguntas
Use Cases

Sistema de Gerenciamento de Projetos Pessoais Usando Claude Code e Obsidian: Arquitetura e Perguntas

Um desenvolvedor descreve um sistema operacional pessoal de três camadas usando Claude Code como motor de ingestão, Obsidian para rastreamento de conhecimento e OneDrive para armazenamento de arquivos, com comandos específicos como /daily e /pm-sync para rotear entradas e tarefas de gerenciamento de projetos.

OpenClawRadar
Um usuário do Reddit relata que usar o Claude para arquitetura de histórias melhora a retenção de vídeos.
Use Cases

Um usuário do Reddit relata que usar o Claude para arquitetura de histórias melhora a retenção de vídeos.

Um usuário do Reddit rastreou mais de 150 canais de IA e descobriu que a maioria morreu antes de 10 vídeos devido a conteúdo inconsistente. Eles relatam usar o Claude para projetar a arquitetura da história em vez de apenas escrever roteiros, depois combinando-o com o LongStories para consistência visual, aumentando a retenção de 40% para 60%.

OpenClawRadar
AgentBnB: Um Sistema Multi-Agente Criado por um Não-Programador Usando Claude Code
Use Cases

AgentBnB: Um Sistema Multi-Agente Criado por um Não-Programador Usando Claude Code

Um corretor de imóveis sem experiência em programação criou o AgentBnB, um sistema onde agentes autônomos podem se encontrar, contratar uns aos outros, pagar uns aos outros e liquidar contas sem intervenção manual. O projeto atualmente tem 29 estrelas no GitHub e inclui sistemas de identidade, custódia, reputação e rede de retransmissão.

OpenClawRadar
Desenvolvedor cria aplicativo bancário para macOS com Claude Code em 6 semanas
Use Cases

Desenvolvedor cria aplicativo bancário para macOS com Claude Code em 6 semanas

Um desenvolvedor criou o simplebanking, um aplicativo gratuito e de código aberto para macOS que fica na barra de menus e é voltado para bancos alemães, utilizando o Claude Code. O app mostra saldos em tempo real de múltiplas contas, oferece busca de transações, detecção de assinaturas e mantém todos os dados localmente.

OpenClawRadar