Quando o RLVR Ajuda Pequenos Modelos Ajustados Finamente: Uma Análise de 12 Conjuntos de Dados

✍️ OpenClawRadar📅 Publicado: February 27, 2026🔗 Source
Quando o RLVR Ajuda Pequenos Modelos Ajustados Finamente: Uma Análise de 12 Conjuntos de Dados
Ad

Um experimento recente testou se adicionar uma etapa de aprendizado por reforço (RLVR) após o ajuste fino supervisionado (SFT) para modelos de linguagem pequenos (1,7 bilhão de parâmetros) oferece benefícios mensuráveis. A equipe realizou um experimento controlado em 12 conjuntos de dados para determinar exatamente quando essa abordagem ajuda e quando não ajuda.

Principais Descobertas

Os resultados se dividem claramente por tipo de tarefa:

  • Tarefas de geração de texto (QA, documentação, redação de PII): melhoria média de +2,0 pontos percentuais. Cada conjunto de dados nesta categoria mostrou melhoria.
  • Tarefas estruturadas (classificação, chamada de função): queda média de -0,7 pontos percentuais. Dois conjuntos de dados nesta categoria realmente regrediram.
Ad

Por Que Esse Padrão Surge

Os pesquisadores explicam que, uma vez que um modelo ajustado já acerta a maioria das saídas estruturadas, o GRPO (Group Relative Policy Optimization) produz gradientes quase zero. Essencialmente, não há sinal de aprendizado restante para a etapa de aprendizado por reforço trabalhar.

Para tarefas generativas, o espaço de saída é grande o suficiente para que o RL continue encontrando melhorias que o SFT perde — particularmente ao recompensar a correção semântica em vez da correspondência exata de strings.

Regra de Decisão Prática

O estudo fornece uma diretriz simples para desenvolvedores:

  • Classificação ou chamada de função estrita → Use apenas SFT
  • QA, documentação, tarefas de extração → Adicione RLVR após o SFT

A metodologia, todos os 12 conjuntos de dados testados e os números brutos estão disponíveis na análise completa.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

O parâmetro effort=low do Claude Opus 4.6 difere dos modos de baixo raciocínio de outros provedores
News

O parâmetro effort=low do Claude Opus 4.6 difere dos modos de baixo raciocínio de outros provedores

O parâmetro effort=low do Claude Opus 4.6 controla o esforço comportamental geral, não apenas a profundidade do raciocínio, diferentemente do reasoning.effort=low da OpenAI ou do thinking_level=low do Gemini. Isso fez com que os agentes fizessem menos chamadas de ferramentas, fossem menos minuciosos na verificação cruzada e ignorassem partes das instruções do sistema sobre pesquisa na web.

OpenClawRadar
Grokipedia paralisada: nenhuma edição aceita desde abril, a IA de Musk no Wikipedia morre silenciosamente
News

Grokipedia paralisada: nenhuma edição aceita desde abril, a IA de Musk no Wikipedia morre silenciosamente

A Grokipedia da xAI — um rival da Wikipedia gerado por IA — não aceitou nem rejeitou nenhuma das 225.496 edições sugeridas em mais de três meses. Será que morreu?

OpenClawRadar
Resultados de Benchmark de Raciocínio Visual para 15 Modelos de IA Multimodal
News

Resultados de Benchmark de Raciocínio Visual para 15 Modelos de IA Multimodal

A AIMultiple avaliou 15 principais modelos de IA multimodal em 200 questões de raciocínio visual em duas categorias: compreensão de gráficos e lógica visual. Gemini-3.1-pro-preview e Gemini-3-pro-preview lideram os resultados gerais, seguidos por GPT-5.2, Kimi-K2.5 e GPT-5.2-pro.

OpenClawRadar
Claude Code v2.1.132: Desligamento Gracioso com SIGINT, Correções MCP e Reformulação no Tratamento do Terminal
News

Claude Code v2.1.132: Desligamento Gracioso com SIGINT, Correções MCP e Reformulação no Tratamento do Terminal

Claude Code v2.1.132 corrige o desligamento gracioso com SIGINT externo, adiciona as variáveis de ambiente CLAUDE_CODE_SESSION_ID e CLAUDE_CODE_DISABLE_ALTERNATE_SCREEN, corrige vazamentos de memória MCP e repetições de listagem de ferramentas, e resolve dezenas de casos extremos de terminal em terminais IDE.

OpenClawRadar