Autoajuste Supervisionado Próprio em Erros Próprios Impulsiona Modelos Pequenos a 80% no HumanEval

✍️ OpenClawRadar📅 Publicado: May 15, 2026🔗 Source
Autoajuste Supervisionado Próprio em Erros Próprios Impulsiona Modelos Pequenos a 80% no HumanEval
Ad

Um desenvolvedor no r/LocalLLaMA implementou um loop de treinamento auto-supervisionado onde um pequeno modelo de linguagem gera seus próprios problemas de codificação, tenta soluções e refina nos pares em que o interpretador confirma a correção. A principal ideia do artigo DeepSeek-R1 — de que modelos podem melhorar por meio de recompensas verificáveis — foi aplicada sem dados rotulados por humanos.

Método

O modelo base (começando com Qwen 2.5 7B) foi instruído a inventar um problema de codificação e alguns pequenos testes. Em seguida, ele resolveu o mesmo problema várias vezes. O interpretador Python atuou como único juiz: pares de (tentativa falha, tentativa bem-sucedida) foram salvos. O refinamento foi realizado nesses pares auto-extraídos. Nenhum código escrito por humanos foi usado no treinamento.

Resultados

  • Qwen 2.5 7B base: 25 → 112 no HumanEval (+87 problemas) após corrigir um bug no avaliador que truncava as saídas das funções.
  • Qwen 2.5 14B: Extraiu 100 pares, treinou em 95 minutos em uma H100 ($3,50 em créditos). Pontuação dentro de 4 pontos da versão RLHF da mesma empresa.
  • Llama 3.2 3B: 32 pares → 39 → 43 no HumanEval. Confirma a transferência entre arquiteturas.
  • Qwen 2.5 Coder 7B: Já especializado em código, mas ainda melhorou: HumanEval 83 → 87, MBPP 122 → 124.
  • Qwen 3 4B: HumanEval 79 → 106 (+27), MBPP 135 → 148.
Ad

Experimento de Controle

Para verificar se o sinal não vinha de treinamento genérico, o autor construiu pares falsos com código lixo aleatório que não passava em nenhum teste. O treinamento nesses pares não produziu melhora (25/164, igual ao base). A melhoria é especificamente proveniente do aprendizado com erros e correções auto-gerados.

Detalhes Práticos

A tentativa inicial falhou porque o avaliador parava cedo, cortando as saídas do modelo pela metade. Corrigir o avaliador foi crucial. Toda a configuração rodou em um MacBook de 24 GB e uma conta RunPod. O código e os scripts de treinamento foram presumivelmente compartilhados no post do Reddit.

Para Quem É

Desenvolvedores e pesquisadores que trabalham com pequenos modelos de linguagem e desejam iniciar o raciocínio de código sem anotações humanas.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Kimi K2.7-Code: Modelo de Codificação Open-Source com Melhor Eficiência de Tokens
News

Kimi K2.7-Code: Modelo de Codificação Open-Source com Melhor Eficiência de Tokens

Moonshot AI lançou o Kimi K2.7-Code, um modelo open-source de imagem-texto para texto com eficiência de tokens aprimorada para tarefas de codificação. Disponível no Hugging Face com 334 curtidas e suporte de inferência da Novita.

OpenClawRadar
Estado do Open Source AI da Mozilla: 3% de diferença de desempenho, redução de 50x nos custos, adoção por 79% dos desenvolvedores
News

Estado do Open Source AI da Mozilla: 3% de diferença de desempenho, redução de 50x nos custos, adoção por 79% dos desenvolvedores

O primeiro relatório State of Open Source AI da Mozilla revela que os modelos abertos agora ficam apenas 3% atrás dos sistemas fechados em desempenho, custam até 50x menos e são usados por 79% dos desenvolvedores — mas capturam apenas 4% da receita.

OpenClawRadar
Extensão do Claude Code para IDE falha ao carregar no Windows – Atualização de Status
News

Extensão do Claude Code para IDE falha ao carregar no Windows – Atualização de Status

Uma atualização oficial de status informa que a extensão Claude Code IDE não consegue carregar no Windows a partir de 2026-05-08T22:32:19Z. Acompanhe o progresso e a resolução através da página de status.

OpenClawRadar
Gemini 3.1 Flash Live: o mais recente modelo de áudio do Google com benchmarks aprimorados e marca d'água
News

Gemini 3.1 Flash Live: o mais recente modelo de áudio do Google com benchmarks aprimorados e marca d'água

O Google lançou o Gemini 3.1 Flash Live, um modelo de áudio que obteve 90,8% no ComplexFuncBench Audio e 36,1% no Audio MultiChallenge da Scale AI. Ele está disponível via Gemini Live API no Google AI Studio e inclui marca d'água SynthID.

OpenClawRadar