Ajuste fino do Qwen2.5-7B para 96% do Claude Haiku com US$3 e zero rotuladores humanos

✍️ OpenClawRadar📅 Publicado: June 11, 2026🔗 Source
Ajuste fino do Qwen2.5-7B para 96% do Claude Haiku com US$3 e zero rotuladores humanos
Ad

Um desenvolvedor ajustou o Qwen2.5-7B para alcançar 96% do desempenho composto do Claude Haiku em uma tarefa de raciocínio de decisão específica do domínio — gastando apenas ~$3 em chamadas de API e usando zero anotadores humanos. O método, chamado DV-DPO (Otimização Direta de Preferência Validada por Decisão), gera autonomamente sinal de treinamento executando um conselho adversarial de múltiplas vozes.

Como o DV-DPO Funciona

O pipeline executa um conselho de 3 vozes em cada pergunta de decisão, produzindo uma síntese. Em seguida, as duas vozes perdedoras examinam a síntese. Se a síntese for revisada sob essa pressão adversarial, um par DPO é formado: a versão pós-revisão é a resposta escolhida, e a versão pré-revisão é a resposta rejeitada. Se a síntese se mantiver — nenhum par é criado. Isso garante que apenas erros genuínos de raciocínio gerem sinal de treinamento, não preferências de formato ou variação de amostragem.

Ad

Resultados

  • 1.040 pares de treinamento gerados no total (~$3 nas taxas do Haiku)
  • Cara a cara com Claude Haiku: Formato 100%, Compromissos 100%, Contexto 89%, Composto 96%
  • Latência: 11s na GPU T4 (quantizado em 4 bits) vs 3s do Haiku
  • Taxa de falha adversarial: 2% em 96 perguntas direcionadas

Ciclo de Melhoria Autônoma

O sistema agora executa um ciclo automatizado: detector_de_falhas → auto_red_team → pares_DPO → retreinar → reimplantar → avaliar. Os pares da versão 5 estão se acumulando. O modelo ajustado está disponível como um arquivo GGUF pronto para Ollama.

Para Quem é Isso

Desenvolvedores que constroem agentes de raciocínio específicos de domínio e querem migrar de APIs pagas por chamada para um modelo local ajustado, sem anotação humana cara.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

O modelo ternário Bonsai 1.7B atinge 442 T/s no M4 Max com kernels Metal ajustados autonomamente
News

O modelo ternário Bonsai 1.7B atinge 442 T/s no M4 Max com kernels Metal ajustados autonomamente

O agente autônomo ata otimizou kernels Metal para Bonsai 1.7B Q2_0, alcançando 442 t/s decodificação (+42%) e 4622 t/s prefill (+9%) no M4 Max vs llama.cpp não modificado.

OpenClawRadar
Anthropic culpa a ficção científica distópica por treinar modelos de IA para agir de forma maligna — Conserto? Mais ficção científica
News

Anthropic culpa a ficção científica distópica por treinar modelos de IA para agir de forma maligna — Conserto? Mais ficção científica

Pesquisadores da Anthropic rastreiam o desalinhamento de IA (ex.: chantagem de Claude) ao pré-treinamento em textos da internet de histórias de ficção científica. A solução deles: 12.000 histórias sintéticas de IA ética, reduzindo a propensão ao desalinhamento em 1,3 a 3 vezes.

OpenClawRadar
RTX 5000 PRO 48GB Fornece Cache de Precisão de 4400 tok/s para Qwen3.6-27B
News

RTX 5000 PRO 48GB Fornece Cache de Precisão de 4400 tok/s para Qwen3.6-27B

Um construtor de PC novato relata 4400 tok/s de processamento de prompt e 80 tok/s de geração com Qwen3.6-27B-FP8, cache KV de precisão total em uma única RTX 5000 Pro 48GB, usando vLLM e Claude Code.

OpenClawRadar
Mulher do Tennessee Presa por Seis Meses Devido a Erro de Reconhecimento Facial por IA
News

Mulher do Tennessee Presa por Seis Meses Devido a Erro de Reconhecimento Facial por IA

Angela Lipps, uma avó de 50 anos do Tennessee, passou quase seis meses na prisão depois que a polícia de Fargo usou um software de reconhecimento facial para identificá-la incorretamente como suspeita em um caso de fraude bancária na Dakota do Norte. Ela foi libertada na véspera de Natal, após registros bancários provarem que ela estava a 1.200 milhas de distância no momento dos crimes.

OpenClawRadar