Autoajuste Supervisionado Próprio em Erros Próprios Impulsiona Modelos Pequenos a 80% no HumanEval

✍️ OpenClawRadar📅 Publicado: May 15, 2026🔗 Source
Autoajuste Supervisionado Próprio em Erros Próprios Impulsiona Modelos Pequenos a 80% no HumanEval
Ad

Um desenvolvedor no r/LocalLLaMA implementou um loop de treinamento auto-supervisionado onde um pequeno modelo de linguagem gera seus próprios problemas de codificação, tenta soluções e refina nos pares em que o interpretador confirma a correção. A principal ideia do artigo DeepSeek-R1 — de que modelos podem melhorar por meio de recompensas verificáveis — foi aplicada sem dados rotulados por humanos.

Método

O modelo base (começando com Qwen 2.5 7B) foi instruído a inventar um problema de codificação e alguns pequenos testes. Em seguida, ele resolveu o mesmo problema várias vezes. O interpretador Python atuou como único juiz: pares de (tentativa falha, tentativa bem-sucedida) foram salvos. O refinamento foi realizado nesses pares auto-extraídos. Nenhum código escrito por humanos foi usado no treinamento.

Resultados

  • Qwen 2.5 7B base: 25 → 112 no HumanEval (+87 problemas) após corrigir um bug no avaliador que truncava as saídas das funções.
  • Qwen 2.5 14B: Extraiu 100 pares, treinou em 95 minutos em uma H100 ($3,50 em créditos). Pontuação dentro de 4 pontos da versão RLHF da mesma empresa.
  • Llama 3.2 3B: 32 pares → 39 → 43 no HumanEval. Confirma a transferência entre arquiteturas.
  • Qwen 2.5 Coder 7B: Já especializado em código, mas ainda melhorou: HumanEval 83 → 87, MBPP 122 → 124.
  • Qwen 3 4B: HumanEval 79 → 106 (+27), MBPP 135 → 148.
Ad

Experimento de Controle

Para verificar se o sinal não vinha de treinamento genérico, o autor construiu pares falsos com código lixo aleatório que não passava em nenhum teste. O treinamento nesses pares não produziu melhora (25/164, igual ao base). A melhoria é especificamente proveniente do aprendizado com erros e correções auto-gerados.

Detalhes Práticos

A tentativa inicial falhou porque o avaliador parava cedo, cortando as saídas do modelo pela metade. Corrigir o avaliador foi crucial. Toda a configuração rodou em um MacBook de 24 GB e uma conta RunPod. O código e os scripts de treinamento foram presumivelmente compartilhados no post do Reddit.

Para Quem É

Desenvolvedores e pesquisadores que trabalham com pequenos modelos de linguagem e desejam iniciar o raciocínio de código sem anotações humanas.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Perspectivas dos Desenvolvedores sobre a Ansiedade em IA e a 'Psicose da IA'
News

Perspectivas dos Desenvolvedores sobre a Ansiedade em IA e a 'Psicose da IA'

Uma discussão no Reddit revela ansiedade generalizada entre desenvolvedores que usam ferramentas de IA, com diferentes faixas etárias enfrentando pressões distintas: pessoas de 35 a 45 anos sentem pressão constante por reinvenção, as de 25 a 35 anos se preocupam com suas habilidades se tornando obsoletas, e desenvolvedores com menos de 25 anos enfrentam riscos de burnout apesar da fluência em IA.

OpenClawRadar
O Uso de Água pela IA Não é um Problema: Análise nos Níveis Nacional, Local e Pessoal
News

O Uso de Água pela IA Não é um Problema: Análise nos Níveis Nacional, Local e Pessoal

Andy Masley analisa os números do consumo de água em data centers de IA em comparação com outras indústrias e conclui que é um 'falso problema' — a receita fiscal por galão é alta, e o uso por pessoa é insignificante.

OpenClawRadar
🦀
News

YouTube encerra 20 canais de 'criadores fantasmas' por spam de IA

O YouTube removeu 20 canais ligados a uma rede que usava roteiros gerados por IA e atores humanos para se passar por comentaristas políticos, violando as políticas de spam.

OpenClawRadar
🦀
News

Marca d'água textual da Anthropic no Claude: Esteganografia semântica explicada

A nova marca d'água de texto da Anthropic manipula escolhas de tokens para incorporar impressões digitais, contradizendo sua alegação de 'imperceptível'. Gruber detalha a técnica de lista verde/vermelha.

OpenClawRadar