Benchmark de Quantização Qwen 3.6 27B: Q4_K_M Supera Q8_0 em Compensações Práticas

✍️ OpenClawRadar📅 Publicado: April 28, 2026🔗 Source
Benchmark de Quantização Qwen 3.6 27B: Q4_K_M Supera Q8_0 em Compensações Práticas
Ad

Um usuário do Reddit fez benchmark do Qwen 3.6 27B em três variantes de quantização GGUF (BF16, Q4_K_M, Q8_0) usando llama-cpp-python através do framework Neo AI Engineer. A avaliação cobriu 664 amostras no total em três tarefas: HumanEval (geração de código, 164 amostras), HellaSwag (raciocínio de senso comum, 100 amostras) e BFCL (chamada de funções, 400 amostras).

Resultados do Benchmark

  • BF16 (tamanho do modelo 53,8 GB, pico de RAM 54 GB, taxa de transferência 15,5 tok/s): HumanEval 56,10% (92/164), HellaSwag 90,00% (90/100), BFCL 63,25% (253/400). Precisão média: 69,78%.
  • Q4_K_M (16,8 GB, 28 GB de RAM, 22,5 tok/s): HumanEval 50,61% (83/164), HellaSwag 86,00% (86/100), BFCL 63,00% (252/400). Média: 66,54%.
  • Q8_0 (28,6 GB, 42 GB de RAM, 18,0 tok/s): HumanEval 52,44% (86/164), HellaSwag 83,00% (83/100), BFCL 63,00% (252/400). Média: 66,15%.
Ad

Principais Conclusões

O Q4_K_M é a variante prática de destaque. Ele preserva a precisão do BFCL (63,00% vs 63,25%), cai apenas ~5,5 pontos no HumanEval e fica ~4 pontos atrás do BF16 no HellaSwag. As compensações: 1,45x mais rápido que o BF16, 48% menos pico de RAM, arquivo 68,8% menor e desempenho quase idêntico em chamada de funções. O Q8_0 foi decepcionante: melhorou o HumanEval em apenas ~1,8 pontos em relação ao Q4_K_M, mas usou 42 GB de RAM contra 28 GB, foi mais lento e obteve pontuação menor no HellaSwag.

Para implantação local/CPU, o Q4_K_M é recomendado, a menos que a carga de trabalho seja fortemente focada em geração de código. Para máxima qualidade, o BF16 ainda vence.

Configuração da Avaliação

Variantes GGUF via llama-cpp-python com n_ctx: 32768, avaliação com checkpoint. O framework Neo AI Engineer construiu o pipeline de avaliação GGUF, gerenciou execuções com checkpoint e consolidou resultados. O estudo de caso completo com trechos de código está linkado nos comentários originais do Reddit.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Plano Mestre: Um Sistema de Tarefas em Terminal Mínimo Criado para Usuários de Código Claude
Tools

Plano Mestre: Um Sistema de Tarefas em Terminal Mínimo Criado para Usuários de Código Claude

Um desenvolvedor criou o master-plan, um plugin do Claude Code com quatro comandos de barra que gerencia tarefas diretamente no terminal usando um arquivo markdown e git. O sistema captura ideias durante a sessão sem alternar de contexto e detecta automaticamente os executores de teste.

OpenClawRadar
TideSurf: Ferramenta de compressão DOM reduz uso de tokens de agentes web em 30 vezes, acelera TTFT em 12 vezes
Tools

TideSurf: Ferramenta de compressão DOM reduz uso de tokens de agentes web em 30 vezes, acelera TTFT em 12 vezes

O TideSurf v0.3 converte o DOM renderizado para um formato compactado semelhante a markdown, reduzindo o consumo de tokens em 32x em páginas do GitHub em comparação com o DOM bruto, enquanto adiciona 18 ferramentas interativas para agentes de LLM.

OpenClawRadar
Servidor de Demonstração do NarrateAI MCP Mostra o Claude Adicionando Narração a Vídeos
Tools

Servidor de Demonstração do NarrateAI MCP Mostra o Claude Adicionando Narração a Vídeos

Uma demonstração ao vivo mostra o Claude usando o servidor MCP do NarrateAI para narrar automaticamente vídeos a partir de uma URL, lidando com polling assíncrono e gerando narração analisando gravações de tela silenciosas.

OpenClawRadar
TradesMCP: Servidor MCP de Código Aberto para Verificação de Licença de Contratante e Dados de Construção
Tools

TradesMCP: Servidor MCP de Código Aberto para Verificação de Licença de Contratante e Dados de Construção

TradesMCP é um servidor Model Context Protocol de código aberto que fornece ao Claude acesso a dados reais de licenças de contratantes, autorizações de construção, preços de materiais e taxas de mão de obra. A ferramenta verificou corretamente uma licença ativa de contratante na Califórnia, enquanto o ChatGPT retornou informações incorretas.

OpenClawRadar