Ajuste fino do Qwen2.5-7B para 96% do Claude Haiku com US$3 e zero rotuladores humanos

✍️ OpenClawRadar📅 Publicado: June 11, 2026🔗 Source
Ajuste fino do Qwen2.5-7B para 96% do Claude Haiku com US$3 e zero rotuladores humanos
Ad

Um desenvolvedor ajustou o Qwen2.5-7B para alcançar 96% do desempenho composto do Claude Haiku em uma tarefa de raciocínio de decisão específica do domínio — gastando apenas ~$3 em chamadas de API e usando zero anotadores humanos. O método, chamado DV-DPO (Otimização Direta de Preferência Validada por Decisão), gera autonomamente sinal de treinamento executando um conselho adversarial de múltiplas vozes.

Como o DV-DPO Funciona

O pipeline executa um conselho de 3 vozes em cada pergunta de decisão, produzindo uma síntese. Em seguida, as duas vozes perdedoras examinam a síntese. Se a síntese for revisada sob essa pressão adversarial, um par DPO é formado: a versão pós-revisão é a resposta escolhida, e a versão pré-revisão é a resposta rejeitada. Se a síntese se mantiver — nenhum par é criado. Isso garante que apenas erros genuínos de raciocínio gerem sinal de treinamento, não preferências de formato ou variação de amostragem.

Ad

Resultados

  • 1.040 pares de treinamento gerados no total (~$3 nas taxas do Haiku)
  • Cara a cara com Claude Haiku: Formato 100%, Compromissos 100%, Contexto 89%, Composto 96%
  • Latência: 11s na GPU T4 (quantizado em 4 bits) vs 3s do Haiku
  • Taxa de falha adversarial: 2% em 96 perguntas direcionadas

Ciclo de Melhoria Autônoma

O sistema agora executa um ciclo automatizado: detector_de_falhas → auto_red_team → pares_DPO → retreinar → reimplantar → avaliar. Os pares da versão 5 estão se acumulando. O modelo ajustado está disponível como um arquivo GGUF pronto para Ollama.

Para Quem é Isso

Desenvolvedores que constroem agentes de raciocínio específicos de domínio e querem migrar de APIs pagas por chamada para um modelo local ajustado, sem anotação humana cara.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

🦀
News

Status do Claude: Erros Elevados em Todos os Modelos – Resolvido

A Claude experimentou erros elevados em todos os modelos das 19:45 UTC às 21:26 UTC em 29 de julho de 2026. O problema foi resolvido, mas o monitoramento continua.

OpenClawRadar
Kimi K2.6 supera Claude, GPT-5.5 e Gemini em desafio de codificação com estratégia agressiva de deslizamento
News

Kimi K2.6 supera Claude, GPT-5.5 e Gemini em desafio de codificação com estratégia agressiva de deslizamento

No Desafio de Programação de IA do Dia 12, o Word Gem Puzzle, o modelo de pesos abertos Kimi K2.6, da Moonshot AI, marcou 22 pontos de partida (7-1-0), superando GPT-5.5 (16), Claude Opus 4.7 (12) e Gemini Pro 3.1 (9). O MiMo V2-Pro ficou em segundo lugar. Kimi venceu ao deslizar agressivamente.

OpenClawRadar
Padrão C++26 Finalizado com Reflexão, Segurança de Memória, Contratos e Framework Assíncrono
News

Padrão C++26 Finalizado com Reflexão, Segurança de Memória, Contratos e Framework Assíncrono

O rascunho do padrão C++26 está completo, introduzindo reflexão para metaprogramação, segurança de memória aprimorada que elimina comportamento indefinido para variáveis não inicializadas e adiciona segurança de limites para tipos da biblioteca padrão, contratos com pré/pós-condições e std::execution para concorrência.

OpenClawRadar
OpenClaw 2026.6.6: Integração com OpenRouter, Controle Mobile, Correções de Estabilidade
News

OpenClaw 2026.6.6: Integração com OpenRouter, Controle Mobile, Correções de Estabilidade

OpenClaw 2026.6.6 adiciona integração de primeira classe com OpenRouter, melhorias no controle para iPad/iPhone e diversas correções de estabilidade no sandbox codex, MCP, navegador e respostas de canal.

OpenClawRadar