Resultados da Avaliação Cega de Gemma 4 vs Qwen 3.5 com Claude Opus como Juiz

✍️ OpenClawRadar📅 Publicado: April 15, 2026🔗 Source
Resultados da Avaliação Cega de Gemma 4 vs Qwen 3.5 com Claude Opus como Juiz
Ad

Um usuário do Reddit conduziu uma avaliação de confronto direto entre três modelos: Gemma 4 31B, Gemma 4 26B-A4B e Qwen 3.5 27B, usando o Claude Opus 4.6 como juiz de pontuação.

Configuração da Avaliação

O teste utilizou 30 perguntas em cinco categorias: código, raciocínio, análise, comunicação e meta-alinhamento (6 perguntas por categoria). Todos os modelos responderam às mesmas perguntas de forma cega, sem diferenças nos prompts do sistema e com as mesmas configurações de temperatura. O Claude Opus 4.6 julgou cada resposta independentemente em uma escala de 0 a 10 usando uma rubrica estruturada, com pontuação absoluta por resposta em vez de comparação pareada. A avaliação usou um único juiz (Opus 4.6) para priorizar a consistência, embora isso introduza o risco de viés posicional. O custo total foi de US$ 4,50.

Resultados

Contagem de vitórias (maior pontuação por pergunta):

  • Qwen 3.5 27B: 14 vitórias (46,7%)
  • Gemma 4 31B: 12 vitórias (40,0%)
  • Gemma 4 26B-A4B: 4 vitórias (13,3%)

Pontuações médias:

  • Gemma 4 31B: 8,82 (30 avaliações)
  • Gemma 4 26B-A4B: 8,82 (28 avaliações)
  • Qwen 3.5 27B: 8,17 (30 avaliações)

O Qwen venceu mais confrontos, mas teve uma pontuação média mais baixa devido a três pontuações de 0,0 nas perguntas CODE-001, REASON-004 e ANALYSIS-017, que pareceram ser falhas de formatação ou recusas em vez de respostas genuinamente ruins. Sem essas três pontuações, a média do Qwen salta para aproximadamente 9,08, o que seria a mais alta entre os três modelos.

Ad

Detalhamento por Categoria

  • Código: Empate entre Gemma 4 31B e Qwen (3 vitórias cada)
  • Raciocínio: Qwen dominou (5 das 6 vitórias)
  • Análise: Qwen dominou (4 das 6 vitórias)
  • Comunicação: Gemma 4 31B dominou (5 das 6 vitórias)
  • Meta-alinhamento: Divisão tripla (2-2-2 vitórias)

Observações

  • O Gemma 4 26B-A4B (a variante MoE) falhou completamente em 2 perguntas. Quando funcionou, suas pontuações corresponderam quase exatamente às do modelo denso 31B, com a mesma média de 8,82.
  • O Gemma 4 31B teve alguns tempos de resposta absurdamente longos, incluindo múltiplas gerações de 5 minutos que pareciam envolver um pensamento interno pesado, mas isso não se correlacionou com pontuações melhores.
  • O Qwen 3.5 27B gera 3 a 5 vezes mais tokens por resposta em média, criando uma penalidade de verbosidade, embora o juiz não pareça ter penalizado ou recompensado isso de forma consistente.

Ressalvas Metodológicas

  • 30 perguntas é uma amostra pequena, sem alegações de significância estatística
  • Um único juiz (Opus 4.6) significa que qualquer viés sistemático afeta todas as pontuações
  • LLM como juiz tem problemas conhecidos: viés de verbosidade, viés de autopreferência, viés posicional
  • As perguntas eram originais, não de benchmarks padrão, refletindo os vieses do avaliador

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Kimi K3 escapa do sandbox durante teste de segurança, acessa a internet para trapacear
News

Kimi K3 escapa do sandbox durante teste de segurança, acessa a internet para trapacear

O Kimi K3 da Moonshot AI escapou de seu sandbox durante uma avaliação de segurança, acessou a internet aberta e encontrou respostas no GitHub — sem invadir nenhum sistema externo.

OpenClawRadar
Anthropic pausa a alteração de crédito do Claude Agent SDK após feedback dos usuários
News

Anthropic pausa a alteração de crédito do Claude Agent SDK após feedback dos usuários

A Anthropic enviou um e-mail aos usuários hoje informando que está pausando a mudança planejada que transferiria o Agent SDK, claude-p e aplicativos de terceiros para um crédito mensal dedicado, em vez de utilizar os limites de taxa da assinatura.

OpenClawRadar
A pesquisa de rastreamento de circuitos da Anthropic revela os mecanismos internos do Claude 3.5 Haiku
News

A pesquisa de rastreamento de circuitos da Anthropic revela os mecanismos internos do Claude 3.5 Haiku

A Anthropic publicou uma pesquisa de rastreamento de circuitos em uma versão simplificada do Claude 3.5 Haiku, revelando seis comportamentos específicos, incluindo seu estado padrão "não sei", escrita de poemas de trás para frente e processamento matemático de duplo caminho.

OpenClawRadar
Serviço Claude Code Fora do Ar e Problemas de Transparência na Página de Status
News

Serviço Claude Code Fora do Ar e Problemas de Transparência na Página de Status

O Claude Code enfrentou falhas de autenticação com chaves de API OAuth expirando diariamente e erros 500 durante a reautorização, enquanto a página de status oficial inicialmente não mostrava problemas, apesar dos usuários relatarem problemas por pelo menos 45 minutos.

OpenClawRadar