Autoajuste Supervisionado Próprio em Erros Próprios Impulsiona Modelos Pequenos a 80% no HumanEval

Um desenvolvedor no r/LocalLLaMA implementou um loop de treinamento auto-supervisionado onde um pequeno modelo de linguagem gera seus próprios problemas de codificação, tenta soluções e refina nos pares em que o interpretador confirma a correção. A principal ideia do artigo DeepSeek-R1 — de que modelos podem melhorar por meio de recompensas verificáveis — foi aplicada sem dados rotulados por humanos.
Método
O modelo base (começando com Qwen 2.5 7B) foi instruído a inventar um problema de codificação e alguns pequenos testes. Em seguida, ele resolveu o mesmo problema várias vezes. O interpretador Python atuou como único juiz: pares de (tentativa falha, tentativa bem-sucedida) foram salvos. O refinamento foi realizado nesses pares auto-extraídos. Nenhum código escrito por humanos foi usado no treinamento.
Resultados
- Qwen 2.5 7B base: 25 → 112 no HumanEval (+87 problemas) após corrigir um bug no avaliador que truncava as saídas das funções.
- Qwen 2.5 14B: Extraiu 100 pares, treinou em 95 minutos em uma H100 ($3,50 em créditos). Pontuação dentro de 4 pontos da versão RLHF da mesma empresa.
- Llama 3.2 3B: 32 pares → 39 → 43 no HumanEval. Confirma a transferência entre arquiteturas.
- Qwen 2.5 Coder 7B: Já especializado em código, mas ainda melhorou: HumanEval 83 → 87, MBPP 122 → 124.
- Qwen 3 4B: HumanEval 79 → 106 (+27), MBPP 135 → 148.
Experimento de Controle
Para verificar se o sinal não vinha de treinamento genérico, o autor construiu pares falsos com código lixo aleatório que não passava em nenhum teste. O treinamento nesses pares não produziu melhora (25/164, igual ao base). A melhoria é especificamente proveniente do aprendizado com erros e correções auto-gerados.
Detalhes Práticos
A tentativa inicial falhou porque o avaliador parava cedo, cortando as saídas do modelo pela metade. Corrigir o avaliador foi crucial. Toda a configuração rodou em um MacBook de 24 GB e uma conta RunPod. O código e os scripts de treinamento foram presumivelmente compartilhados no post do Reddit.
Para Quem É
Desenvolvedores e pesquisadores que trabalham com pequenos modelos de linguagem e desejam iniciar o raciocínio de código sem anotações humanas.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Kimi K2.7-Code: Modelo de Codificação Open-Source com Melhor Eficiência de Tokens
Moonshot AI lançou o Kimi K2.7-Code, um modelo open-source de imagem-texto para texto com eficiência de tokens aprimorada para tarefas de codificação. Disponível no Hugging Face com 334 curtidas e suporte de inferência da Novita.

Estado do Open Source AI da Mozilla: 3% de diferença de desempenho, redução de 50x nos custos, adoção por 79% dos desenvolvedores
O primeiro relatório State of Open Source AI da Mozilla revela que os modelos abertos agora ficam apenas 3% atrás dos sistemas fechados em desempenho, custam até 50x menos e são usados por 79% dos desenvolvedores — mas capturam apenas 4% da receita.

Extensão do Claude Code para IDE falha ao carregar no Windows – Atualização de Status
Uma atualização oficial de status informa que a extensão Claude Code IDE não consegue carregar no Windows a partir de 2026-05-08T22:32:19Z. Acompanhe o progresso e a resolução através da página de status.

Gemini 3.1 Flash Live: o mais recente modelo de áudio do Google com benchmarks aprimorados e marca d'água
O Google lançou o Gemini 3.1 Flash Live, um modelo de áudio que obteve 90,8% no ComplexFuncBench Audio e 36,1% no Audio MultiChallenge da Scale AI. Ele está disponível via Gemini Live API no Google AI Studio e inclui marca d'água SynthID.