O projeto de autoresearch de Karpathy: agentes de IA executam experimentos de treinamento de LLM durante a noite.

O que o projeto de autoresearch de Karpathy faz
Andrej Karpathy lançou um pequeno repositório chamado "autoresearch" que demonstra o conceito de "pesquisador de IA em loop". O sistema usa um agente de IA para executar autonomamente experimentos de treinamento de LLM durante a noite em uma única GPU.
Como funciona
O agente segue este fluxo de trabalho:
- Edita continuamente o arquivo
train.py - Executa experimentos de treinamento nanochat de 5 minutos
- Verifica se a métrica de bits por byte de validação (
val_bpb) melhorou - Repete este ciclo enquanto você dorme
Configuração e instalação
O projeto tem uma configuração super minimalista:
- Hardware: Uma GPU
- Arquivos: Um arquivo principal
- Métricas: Uma métrica principal (
val_bpb)
O humano escreve o prompt de organização da pesquisa em program.md, e o agente cuida da iteração do código.
Taxa de experimentos
Com um orçamento fixo de 5 minutos por experimento, o sistema pode executar aproximadamente 12 experimentos por hora.
Esta abordagem demonstra uma implementação prática de pesquisa automatizada onde agentes de IA podem explorar espaços de parâmetros e configurações de treinamento de forma autônoma, potencialmente acelerando ciclos de experimentação para desenvolvedores que trabalham com modelos de linguagem.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Torrix: Observabilidade de LLM Auto-Hospedada Sem Postgres ou Redis
Torrix é uma ferramenta de observabilidade para LLMs auto-hospedada que roda como um único contêiner Docker com SQLite. Instale com docker compose up; registra chamadas de LLM via proxy HTTP ou SDK — tokens, custo, latência, rastreamento completo, mascaramento de PII, previsão de custos.

120 Padrões de Prompt Testados: 8 Que Realmente Funcionam para o Código Claude
Um teste empírico de 3 meses com 120 padrões de prompt para Claude Code resulta em 8 comandos acionáveis e 5 prompts de validação. Padrões-chave: L99 (elimina hesitações), /ghost (remove voz de IA), OODA (raciocínio estruturado), ULTRATHINK (raciocínio profundo), HARDMODE (depuração com restrições).

Roteamento do tráfego da API Claude para controlar custos após mudança na assinatura Max
A assinatura Max da Anthropic não cobre mais o uso de ferramentas de terceiros, forçando os usuários do OpenClaw a usar cobrança por API. Um proxy de roteamento direciona tarefas simples para o Claude Sonnet (US$ 3/M entrada, US$ 15/M saída) e as complexas para o Opus (US$ 5/M entrada, US$ 25/M saída), reduzindo custos sem perda de qualidade.

Referência de Revisão de Código por IA: Claude, Gemini, Codex, Qwen e MiniMax Comparados
Um benchmark testou cinco modelos de IA em 15 pull requests do Milvus com bugs conhecidos. O Claude detectou 53% dos bugs no modo bruto, enquanto o debate adversário entre os modelos aumentou a detecção para 80%.