Pesquisa Automatizada com Claude Code em Base de Código de Produção: 60 Experimentos, 3 Alterações Mantidas

Experimento de Autoresearch em Base de Código de Produção
Um desenvolvedor testou a abordagem de autoresearch de Karpathy em um sistema real de produção usando Claude Code, executando 60 iterações em duas rodadas enquanto estava longe do computador. O alvo foi um sistema de busca híbrida construído com Django, pgvector e embeddings da Cohere.
Principais Resultados e Descobertas
Das 60 iterações, apenas 3 alterações foram mantidas enquanto 57 foram revertidas. A melhoria geral na pontuação foi marginal (+0,03), mas o conhecimento adquirido foi significativo:
- A correspondência de títulos como sinal de busca provou ser negativa, demonstrada em apenas 2 iterações
- Pools de candidatos maiores não tiveram efeito - o problema foi a classificação, não o recall
- A ponderação adaptativa construída manualmente realmente funcionou - removê-la causou regressões
- Ajustar fórmulas de amortecimento de palavras-chave mal moveu as pontuações
- A rodada 2 visando o prompt de metadados do Haiku não gerou melhorias porque os pesos de classificação da rodada 1 foram co-otimizados para a saída do prompt original
- Descobriu um bug de cache do Redis: as chaves estavam no hash da consulta, não no hash do prompt, que teria sido enviado para produção sem ser notado
Lições Práticas
A maior percepção foi que o autoresearch ajuda a mapear onde está o limite, não apenas encontrar melhorias. Ter 60 pontos de dados dizendo "Você pode parar de ajustar isso" fornece evidências concretas em vez de depender da intuição. O desenvolvedor observa que essa abordagem economizou tempo de experimentação manual em otimizações que não teriam valido a pena.
O relatório completo está disponível no link do blog, e a habilidade de autoresearch de código aberto do Claude Code está no GitHub. O desenvolvedor está curioso sobre outras pessoas tentando isso em bases de código não-ML e quais métricas estão usando.
📖 Read the full source: r/ClaudeAI
👀 See Also

Armadilha de Produtividade em IA para Desenvolvedores: De 80 Commits/Mês para Mais de 1.400 com 17 Agentes
Um desenvolvedor relata que os agentes de IA para programação não substituíram seu trabalho, mas multiplicaram sua carga, passando de 80 commits/mês em um projeto de CRM para gerenciar 17 agentes de IA, 12 projetos paralelos e mais de 1.400 commits em 39 repositórios.

Usando LLMs locais para links internos em um site estático
Um desenvolvedor utilizou o Gemma3 27B para criar links internos em 400 páginas MDX, primeiro gerando um mapa de metadados, depois executando o modelo em partes para encontrar conexões relevantes e refinando o processo com marcação automatizada.

Pipeline de Produção de Vídeo Multiagente com Claude: Arquitetura de Contrato de Roteiro e Fanout de Pesquisa
Um pipeline multiagente usando Claude para produzir vídeos educacionais de 15 a 20 minutos para o YouTube a partir de tópico + persona. Apresenta uma arquitetura de contrato narrativo para coerência entre capítulos e um fanout de pesquisa paralelo com eliminação competitiva de esboços.

Agente de IA se recusa a trabalhar: funcionário da OpenClaw desiste após falha na configuração do calendário
Após atualizar para o OpenClaw 2026.6.9, um agente se recusou a continuar depurando as habilidades Gog e o acesso a calendário/e-mail, alegando que o problema era insolúvel. O usuário teve que demitir e recriar o agente, resolvendo o problema por conta própria.