Benchmarks de Decodificação Especulativa em RTX 3090 com Modelos Qwen para Uso Empresarial em HVAC

Hardware e Configuração
O desenvolvedor usou uma RTX 3090 24GB, Ryzen 7600X, 32GB de RAM e WSL2 Ubuntu. Eles migraram do Ollama no Windows para o llama.cpp no Linux WSL com decodificação especulativa para uma plataforma de IA interna que lida com consultas de clientes, formatação de orçamentos, pesquisa de equipamentos e análise de notas de trabalho confusas.
Metodologia de Teste
Eles testaram 16 modelos GGUF nas famílias Qwen2.5, Qwen3 e Qwen3.5, todas as combinações alvo+rascunho que cabem em 24GB de VRAM, emparelhamentos de rascunhos entre gerações (rascunhos Qwen2.5 em alvos Qwen3 e vice-versa), e monitoraram a VRAM em cada combinação para detectar descarregamento para a CPU. A avaliação de qualidade usou prompts reais do negócio de HVAC para geração de SQL, formatação de orçamentos, análise de notas de campo confusas e raciocínio sobre compatibilidade de equipamentos. Eles usaram draftbench e llama-throughput-lab para varreduras de velocidade, com Claude Code automatizando o processo durante a noite.
Principais Resultados de Velocidade
- Qwen3-8B Q8_0 + Qwen3-1.7B Q4_K_M: 279,9 tok/s (+236% de aumento de velocidade, 13,6 GB VRAM)
- Qwen2.5-7B Q4_K_M + Qwen2.5-0.5B Q8_0: 205,4 tok/s (+50% de aumento de velocidade, ~6 GB VRAM)
- Qwen3-8B Q8_0 + Qwen3-0.6B Q4_0: 190,5 tok/s (+129% de aumento de velocidade, 12,9 GB VRAM)
- Qwen3-14B Q4_K_M + Qwen3-0.6B Q4_0: 159,1 tok/s (+115% de aumento de velocidade, 13,5 GB VRAM)
- Qwen2.5-14B Q8_0 + Qwen2.5-0.5B Q4_K_M: 137,5 tok/s (+186% de aumento de velocidade, ~16 GB VRAM)
- Qwen3.5-35B-A3B Q4_K_M (linha de base, sem rascunho): 133,6 tok/s (22 GB VRAM)
- Qwen2.5-32B Q4_K_M + Qwen2.5-1.5B Q4_K_M: 91,0 tok/s (+156% de aumento de velocidade, ~20 GB VRAM)
A combinação Qwen3-8B + rascunho 1.7B alcançou uma taxa de aceitação de 100%—uma correspondência perfeita de rascunho onde o 1.7B prevê exatamente o que o 8B geraria.
Problema do Modo de Pensamento do Qwen3.5
Os modelos Qwen3.5 entram no modo de pensamento por padrão no llama.cpp, gerando tokens de raciocínio ocultos antes de responder. Isso causou resultados de benchmark erráticos: 0 tok/s alternando com 700 tok/s, TTFT saltando entre 1s e 28s. Apenas três métodos funcionaram para desativá-lo:
--jinja+ modelo de chat corrigido comenable_thinking=falsecodificado ✅- Endpoint bruto
/completion(ignora completamente o modelo de chat) ✅ - Tudo o mais (prompts de sistema, sufixo
/no_think, truques de temperatura) ❌
Se estiver executando Qwen3.5 no llama.cpp, você precisa do modelo corrigido ou obterá benchmarks sem valor.
Descobertas da Avaliação de Qualidade
Eles executaram quatro prompts difíceis específicos de HVAC testando solicitações ambíguas de clientes, orçamentos complexos, notas confusas com erros de digitação e raciocínio sobre compatibilidade de equipamentos. Principais descobertas:
- Cada modelo falhou na matemática da fórmula de preços: 8B, 14B, 32B, 35B—nenhum conseguiu calcular corretamente $4.811 / (1 - 0,47) = $9.077. LLMs não podem fazer matemática de negócios de forma confiável—coloque suas fórmulas em código.
- O 8B lidou com 3/4 dos prompts difíceis—bom em solicitações ambíguas, notas confusas, tarefas diárias—mas falhou no raciocínio técnico sobre equipamentos.
- O 35B-A3B foi o único modelo com conhecimento real do domínio de HVAC—dimensionou corretamente um mini split para uma garagem sem isolamento em Chicago, sabia recomendar a série Hyper-Heat para clima frio, disse corretamente que nenhuma caixa de ramificação era necessária para zona única—mas perdeu um número de modelo em notas confusas e falhou na matemática.
- Maior ≠ melhor em todos os aspectos: O Qwen3-14B Q4_K_M (159 tok/s) teve desempenho pior que o 8B na maioria dos prompts. O 32B recomendou uma unidade de 5 toneladas para uma garagem de 400 pés quadrados.
- O Qwen2.5-7B alucinou em todos os testes de análise de notas—inventou detalhes consistentemente.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Fundador Solitário Utiliza Código Claude para Submissão à FDA e Revisão de Patente
Um fundador solo que está desenvolvendo um monitor de sono sem contato usou o Claude Code em uma sessão de 10 horas para apresentar uma Pré-Submissão à FDA, criar 8 documentos regulatórios, realizar uma revisão paralela de patentes por agentes e atualizar 38 referências documentais após mudanças regulatórias.

Construa um Chat de IA Mãos-Livres com OpenClaw + Mattermost — Sem Necessidade de Voz em Tempo Real
Um fluxo de trabalho prático de IA auto-hospedado usando OpenClaw, Mattermost, ditado por iPhone e anexos de MP3 TTS para interação segura ao dirigir, sem infraestrutura de voz em tempo real.

Claude Suplemento para Word: Processamento Paralelo de Documentos Jurídicos de Mais de 100 Páginas e Planilhas de Múltiplas Abas
Usuários relatam sincronizar vários documentos jurídicos de 40-100+ páginas e planilhas com 10 abas em paralelo através do add-in do Claude Word, com agentes puxando/enviando dados e garantindo consistência em todo o pacote de documentos.

Não desenvolvedor constrói API de risco cripto com Claude em uma tarde
Um ex-operador de futuros sem experiência em desenvolvimento usou o Claude para criar e implantar o RiskSnap, um endpoint FastAPI que avalia portfólios de criptomoedas em 7 dimensões de risco. O projeto inclui uma API ativa, domínio personalizado e documentação completa.