O projeto de autoresearch de Karpathy: agentes de IA executam experimentos de treinamento de LLM durante a noite.

✍️ OpenClawRadar📅 Publicado: March 9, 2026🔗 Source
O projeto de autoresearch de Karpathy: agentes de IA executam experimentos de treinamento de LLM durante a noite.
Ad

O que o projeto de autoresearch de Karpathy faz

Andrej Karpathy lançou um pequeno repositório chamado "autoresearch" que demonstra o conceito de "pesquisador de IA em loop". O sistema usa um agente de IA para executar autonomamente experimentos de treinamento de LLM durante a noite em uma única GPU.

Como funciona

O agente segue este fluxo de trabalho:

  • Edita continuamente o arquivo train.py
  • Executa experimentos de treinamento nanochat de 5 minutos
  • Verifica se a métrica de bits por byte de validação (val_bpb) melhorou
  • Repete este ciclo enquanto você dorme

Configuração e instalação

O projeto tem uma configuração super minimalista:

  • Hardware: Uma GPU
  • Arquivos: Um arquivo principal
  • Métricas: Uma métrica principal (val_bpb)

O humano escreve o prompt de organização da pesquisa em program.md, e o agente cuida da iteração do código.

Ad

Taxa de experimentos

Com um orçamento fixo de 5 minutos por experimento, o sistema pode executar aproximadamente 12 experimentos por hora.

Esta abordagem demonstra uma implementação prática de pesquisa automatizada onde agentes de IA podem explorar espaços de parâmetros e configurações de treinamento de forma autônoma, potencialmente acelerando ciclos de experimentação para desenvolvedores que trabalham com modelos de linguagem.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Torrix: Observabilidade de LLM Auto-Hospedada Sem Postgres ou Redis
Tools

Torrix: Observabilidade de LLM Auto-Hospedada Sem Postgres ou Redis

Torrix é uma ferramenta de observabilidade para LLMs auto-hospedada que roda como um único contêiner Docker com SQLite. Instale com docker compose up; registra chamadas de LLM via proxy HTTP ou SDK — tokens, custo, latência, rastreamento completo, mascaramento de PII, previsão de custos.

OpenClawRadar
120 Padrões de Prompt Testados: 8 Que Realmente Funcionam para o Código Claude
Tools

120 Padrões de Prompt Testados: 8 Que Realmente Funcionam para o Código Claude

Um teste empírico de 3 meses com 120 padrões de prompt para Claude Code resulta em 8 comandos acionáveis e 5 prompts de validação. Padrões-chave: L99 (elimina hesitações), /ghost (remove voz de IA), OODA (raciocínio estruturado), ULTRATHINK (raciocínio profundo), HARDMODE (depuração com restrições).

OpenClawRadar
Roteamento do tráfego da API Claude para controlar custos após mudança na assinatura Max
Tools

Roteamento do tráfego da API Claude para controlar custos após mudança na assinatura Max

A assinatura Max da Anthropic não cobre mais o uso de ferramentas de terceiros, forçando os usuários do OpenClaw a usar cobrança por API. Um proxy de roteamento direciona tarefas simples para o Claude Sonnet (US$ 3/M entrada, US$ 15/M saída) e as complexas para o Opus (US$ 5/M entrada, US$ 25/M saída), reduzindo custos sem perda de qualidade.

OpenClawRadar
Referência de Revisão de Código por IA: Claude, Gemini, Codex, Qwen e MiniMax Comparados
Tools

Referência de Revisão de Código por IA: Claude, Gemini, Codex, Qwen e MiniMax Comparados

Um benchmark testou cinco modelos de IA em 15 pull requests do Milvus com bugs conhecidos. O Claude detectou 53% dos bugs no modo bruto, enquanto o debate adversário entre os modelos aumentou a detecção para 80%.

OpenClawRadar