Pesquisa Automatizada com Claude Code em Base de Código de Produção: 60 Experimentos, 3 Alterações Mantidas

Experimento de Autoresearch em Base de Código de Produção
Um desenvolvedor testou a abordagem de autoresearch de Karpathy em um sistema real de produção usando Claude Code, executando 60 iterações em duas rodadas enquanto estava longe do computador. O alvo foi um sistema de busca híbrida construído com Django, pgvector e embeddings da Cohere.
Principais Resultados e Descobertas
Das 60 iterações, apenas 3 alterações foram mantidas enquanto 57 foram revertidas. A melhoria geral na pontuação foi marginal (+0,03), mas o conhecimento adquirido foi significativo:
- A correspondência de títulos como sinal de busca provou ser negativa, demonstrada em apenas 2 iterações
- Pools de candidatos maiores não tiveram efeito - o problema foi a classificação, não o recall
- A ponderação adaptativa construída manualmente realmente funcionou - removê-la causou regressões
- Ajustar fórmulas de amortecimento de palavras-chave mal moveu as pontuações
- A rodada 2 visando o prompt de metadados do Haiku não gerou melhorias porque os pesos de classificação da rodada 1 foram co-otimizados para a saída do prompt original
- Descobriu um bug de cache do Redis: as chaves estavam no hash da consulta, não no hash do prompt, que teria sido enviado para produção sem ser notado
Lições Práticas
A maior percepção foi que o autoresearch ajuda a mapear onde está o limite, não apenas encontrar melhorias. Ter 60 pontos de dados dizendo "Você pode parar de ajustar isso" fornece evidências concretas em vez de depender da intuição. O desenvolvedor observa que essa abordagem economizou tempo de experimentação manual em otimizações que não teriam valido a pena.
O relatório completo está disponível no link do blog, e a habilidade de autoresearch de código aberto do Claude Code está no GitHub. O desenvolvedor está curioso sobre outras pessoas tentando isso em bases de código não-ML e quais métricas estão usando.
📖 Read the full source: r/ClaudeAI
👀 See Also

Lições práticas da automação de prospecção no LinkedIn com OpenClaw
Um desenvolvedor compartilha lições aprendidas com dificuldade após três semanas de automação de prospecção no LinkedIn com o OpenClaw, abordando a detecção de automação do LinkedIn, períodos de aquecimento de contas, pontuação de ICP com sinais de intenção, nuances de limitação de taxa e design de fluxo de conversa.

Tanya: Uma companheira de IA baseada em OpenClaw com memória em camadas e estado emocional
Tanya é uma companheira de IA de código aberto construída sobre o OpenClaw que roda no Telegram, apresentando consolidação de memória em duas camadas, estados emocionais dinâmicos e interações por voz com tags de expressão incorporadas. O projeto inclui um prompt de personagem detalhado no SOUL.md e lida com mensagens de texto, notas de voz, chamadas e compartilhamento de imagens.

Claude como único professor de arte: Resultados da primeira semana e surpresas com as críticas
Um desenvolvedor usou o Claude como seu único professor para retratos em lápis de cor. A crítica do Claude ignorou a mistura de tons de pele e, em vez disso, apontou o esboço inicial de cinco minutos como a raiz do problema.

OpenClaw VPS vs Implantação Local: A Experiência de um Desenvolvedor
Um desenvolvedor compartilha experiência detalhada executando o OpenClaw em VPS versus configurações locais, destacando problemas de latência, limitações de permissão e problemas de automação de navegador no VPS, juntamente com as vantagens da implantação local, incluindo acesso a sessões do navegador e arquivos locais.