Autoajuste Supervisionado Próprio em Erros Próprios Impulsiona Modelos Pequenos a 80% no HumanEval

Um desenvolvedor no r/LocalLLaMA implementou um loop de treinamento auto-supervisionado onde um pequeno modelo de linguagem gera seus próprios problemas de codificação, tenta soluções e refina nos pares em que o interpretador confirma a correção. A principal ideia do artigo DeepSeek-R1 — de que modelos podem melhorar por meio de recompensas verificáveis — foi aplicada sem dados rotulados por humanos.
Método
O modelo base (começando com Qwen 2.5 7B) foi instruído a inventar um problema de codificação e alguns pequenos testes. Em seguida, ele resolveu o mesmo problema várias vezes. O interpretador Python atuou como único juiz: pares de (tentativa falha, tentativa bem-sucedida) foram salvos. O refinamento foi realizado nesses pares auto-extraídos. Nenhum código escrito por humanos foi usado no treinamento.
Resultados
- Qwen 2.5 7B base: 25 → 112 no HumanEval (+87 problemas) após corrigir um bug no avaliador que truncava as saídas das funções.
- Qwen 2.5 14B: Extraiu 100 pares, treinou em 95 minutos em uma H100 ($3,50 em créditos). Pontuação dentro de 4 pontos da versão RLHF da mesma empresa.
- Llama 3.2 3B: 32 pares → 39 → 43 no HumanEval. Confirma a transferência entre arquiteturas.
- Qwen 2.5 Coder 7B: Já especializado em código, mas ainda melhorou: HumanEval 83 → 87, MBPP 122 → 124.
- Qwen 3 4B: HumanEval 79 → 106 (+27), MBPP 135 → 148.
Experimento de Controle
Para verificar se o sinal não vinha de treinamento genérico, o autor construiu pares falsos com código lixo aleatório que não passava em nenhum teste. O treinamento nesses pares não produziu melhora (25/164, igual ao base). A melhoria é especificamente proveniente do aprendizado com erros e correções auto-gerados.
Detalhes Práticos
A tentativa inicial falhou porque o avaliador parava cedo, cortando as saídas do modelo pela metade. Corrigir o avaliador foi crucial. Toda a configuração rodou em um MacBook de 24 GB e uma conta RunPod. O código e os scripts de treinamento foram presumivelmente compartilhados no post do Reddit.
Para Quem É
Desenvolvedores e pesquisadores que trabalham com pequenos modelos de linguagem e desejam iniciar o raciocínio de código sem anotações humanas.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Perspectivas dos Desenvolvedores sobre a Ansiedade em IA e a 'Psicose da IA'
Uma discussão no Reddit revela ansiedade generalizada entre desenvolvedores que usam ferramentas de IA, com diferentes faixas etárias enfrentando pressões distintas: pessoas de 35 a 45 anos sentem pressão constante por reinvenção, as de 25 a 35 anos se preocupam com suas habilidades se tornando obsoletas, e desenvolvedores com menos de 25 anos enfrentam riscos de burnout apesar da fluência em IA.

O Uso de Água pela IA Não é um Problema: Análise nos Níveis Nacional, Local e Pessoal
Andy Masley analisa os números do consumo de água em data centers de IA em comparação com outras indústrias e conclui que é um 'falso problema' — a receita fiscal por galão é alta, e o uso por pessoa é insignificante.
YouTube encerra 20 canais de 'criadores fantasmas' por spam de IA
O YouTube removeu 20 canais ligados a uma rede que usava roteiros gerados por IA e atores humanos para se passar por comentaristas políticos, violando as políticas de spam.
Marca d'água textual da Anthropic no Claude: Esteganografia semântica explicada
A nova marca d'água de texto da Anthropic manipula escolhas de tokens para incorporar impressões digitais, contradizendo sua alegação de 'imperceptível'. Gruber detalha a técnica de lista verde/vermelha.