Benchmark de Cache KV do Qwen 3.6-35B-A3B: f16 vs q8_0 vs Turbo3 vs Turbo4 no M5 Max com Contexto de até 1M

✍️ OpenClawRadar📅 Publicado: April 28, 2026🔗 Source
Benchmark de Cache KV do Qwen 3.6-35B-A3B: f16 vs q8_0 vs Turbo3 vs Turbo4 no M5 Max com Contexto de até 1M
Ad

Um usuário do Reddit realizou uma varredura de profundidade no Qwen 3.6-35B-A3B Q8 usando o fork TurboQuant Metal do TheTom do llama.cpp (GitHub: TheTom/llama-cpp-turboquant, branch feature/turboquant-kv-cache) em um MacBook Pro M5 Max com 128 GB de memória unificada. Eles testaram quatro tipos de cache KV: f16, q8_0, turbo3 (3 bits) e turbo4 (4 bits), K e V simétricos, com flash-attn ativado e mlock ativado, de 0 a 1M tokens de contexto.

Hardware e Build

M5 Max, 128 GB de memória unificada. Compilado com cmake -B build -DGGML_METAL=ON. Usou llama-bench, 3 repetições por célula, flash-attn ativado, mlock ativado. 8 horas de relógio durante a noite.

Throughput de Geração (tok/s)

Profundidadef16q8_0turbo3turbo4
089,487,479,579,7
8K84,279,272,271,2
32K72,667,861,561,8
128K44,440,736,037,7
256KOOM26,622,925,5
512KOOMOOM13,316,0
1MOOMOOM6,5OOM

Throughput de Processamento de Prompt (tok/s)

Profundidadef16q8_0turbo3turbo4
02962294829042854
8K2098162316531439
32K1063802784678
128K321245253206
256KOOM124128101
512KOOMOOM6656
1MOOMOOM30OOM
Ad

Principais Conclusões

  • Na profundidade 0, f16 lidera por pouco no prefill; turbo3 é ~10% mais lento no decode.
  • Em 128K, prefill do turbo3 (253 tok/s) iguala q8_0 (245 tok/s) — cache menor reduz pressão de largura de banda.
  • Em 256K, turbo3 vence prefill +27% sobre turbo4 (128 vs 101), mas turbo4 vence decode +11% (25,5 vs 22,9). Em 512K, diferença no decode aumenta para +20% (turbo4 16,0 vs turbo3 13,3).
  • turbo3 é o único tipo de cache que cabe em 1M de contexto (6,5 tok/s decode). Memória em 1M: ~89 GB (37 GB pesos, ~52 GB cache KV).

Recomendações de Carga de Trabalho

  • Agentes de codificação (contexto profundo, muitos tokens gerados): turbo4
  • RAG / QA em lote (prefill pesado, respostas curtas): turbo3
  • Contexto de 1M: apenas turbo3
  • Interativo curto (<32K): f16 se couber, senão q8_0

Ressalvas

Este é um único M5 Max. Os pontos de cruzamento provavelmente mudam com largura de banda de memória e núcleos de GPU. Apenas K/V simétrico testado. Combinações assimétricas (ex.: -ctk q8_0 -ctv turbo4) não foram testadas. O fork do TheTom é de nível de pesquisa, não está no upstream do llama.cpp main.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Usuário do OpenClaw relata 143 milhões de tokens processados por US$ 94 via OpenRouter.
News

Usuário do OpenClaw relata 143 milhões de tokens processados por US$ 94 via OpenRouter.

Um usuário do Reddit executando pipelines de multiagentes OpenClaw processou 143 milhões de tokens por US$ 94,16, alcançando um custo de aproximadamente US$ 0,66 por milhão de tokens ao rotear através do OpenRouter e implementar otimizações de configuração específicas.

OpenClawRadar
Microsoft encerra compartilhamento de receita com OpenAI, impacto em agentes de IA é incerto
News

Microsoft encerra compartilhamento de receita com OpenAI, impacto em agentes de IA é incerto

A Microsoft deixará de compartilhar receita com a OpenAI, sua principal parceira de IA, segundo relatório da Bloomberg. A medida pode afetar como desenvolvedores integram agentes de IA por meio dos serviços Azure OpenAI.

OpenClawRadar
Claude oferece crédito de uso extra para os planos Pro, Max e Team
News

Claude oferece crédito de uso extra para os planos Pro, Max e Team

O Claude está oferecendo um crédito de uso extra único para assinantes dos planos Pro, Max e Team, igual ao valor da sua assinatura. O crédito pode ser usado no Claude, Claude Code, Claude Cowork e produtos de terceiros.

OpenClawRadar
Auditoria de Ontário: 60% dos sistemas de IA para transcrição confundem medicamentos, 85% perdem detalhes de saúde mental
News

Auditoria de Ontário: 60% dos sistemas de IA para transcrição confundem medicamentos, 85% perdem detalhes de saúde mental

Auditores de Ontário descobriram que 12 de 20 sistemas de IA para anotações médicas inseriram informações incorretas sobre medicamentos, 9 fabricaram sugestões de tratamento e 17 perderam detalhes importantes de saúde mental de gravações de consultas médico-paciente. A avaliação ponderou a precisão em apenas 4% da pontuação total.

OpenClawRadar