10.33 t/s no Qwen 3.5 35B com um Laptop de $300: Análise Completa de Otimização

Um usuário do Reddit acelerou a inferência do Qwen 3.5 35B para 10,33 t/s em um Lenovo Ideapad Slim 3i de $300 (12ª Geração i3-1215U, 8GB soldados + 32GB DDR4 de expansão). A configuração usa um modelo MoE quantizado Q4_K_S com apenas ~3B de parâmetros ativos e o ik_llama.cpp build 4509.
Hardware & Modelo
- Notebook: Lenovo Ideapad Slim 3i 2023 (~$300)
- CPU: Intel i3-1215U (6 núcleos, 2 núcleos de desempenho usados)
- RAM: 8GB soldados + 32GB DDR4 SO-DIMM (modo Flex)
- SO: Linux Mint
- Modelo:
Qwen3.5-35B-A3B-uncensored-heretic-v2-Native-MTP-Preserved-Q4_K_S.gguf(35B MoE, 3B parâmetros ativos por token) - Backend: ik_llama.cpp commit 40aae0b6, compilado com GCC 13.3.0
Otimizações Aplicadas
- BIOS: Bateria → Modo de desempenho extremo; ventoinha configurada para silencioso (desligada)
- Perfil de energia do SO: desempenho
- Core pinning: threads fixadas nos núcleos de desempenho 0 e 2 via
taskset -c 0,2 - Quantização: Q4_K_S
- Tamanho do lote: 64 (
-ub 64) - Decodificação especulativa: tipo MTP, draft máx. 3
- Flash attention, fmoe, rtr — todos ativados por padrão
- Reinicialização recente antes do benchmark
Comando Utilizado
taskset -c 0,2 ./build/bin/llama-cli \
-m "/home/default/LLM Models/Qwen3.5-35B-A3B-uncensored-heretic-v2-Native-MTP-Preserved-Q4_K_S.gguf" \
-p "User: Please explain the history of france \nAI:" \
-n 1028 \
--spec-type mtp \
--draft-max 3 \
-t 2 \
-ub 64 \
--temp 1.0 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.0 \
--presence-penalty 1.5 \
--repeat-penalty 1.0
Resultados
- Avaliação do prompt: 22,49 t/s
- Inferência: 10,33 t/s (em 1028 tokens)
- Térmicas: ~90°C, sem necessidade de limite de potência com ik_llama (anteriormente exigia limite de 17,5W no llama.cpp)
Por que o Qwen 3.5 MoE é Rápido
A arquitetura MoE do Qwen 3.5 35B ativa apenas ~3B de parâmetros por token, ao contrário de modelos densos. Para comparação, o Gemma 4 26b (4B ativos) rendeu apenas ~3 t/s em configurações semelhantes — sugerindo que o roteamento MoE e o cálculo esparso no Qwen 3.5 são particularmente amigáveis à CPU.
Possíveis Ganhos Adicionais
- BIOS personalizada para timings de memória XMP → +10% t/s
- Reaplicação de pasta térmica de alto desempenho
- Upgrade de RAM DDR4 para DDR5 no notebook (combinado com reaplicação de pasta → +20% t/s)
Para quem é: Desenvolvedores rodando LLMs locais em hardware de baixo custo que desejam extrair o máximo desempenho de modelos MoE Qwen usando apenas inferência em CPU.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

CC-Canary: Detecte Regressões no Claude Code com Análise Local de JSONL
CC-Canary lê os logs de sessão do Claude Code e produz um relatório forense sobre deriva de modelo, incluindo razão leitura:edição, loops de raciocínio, tendências de custo e datas de inflexão detectadas automaticamente.

Madar: Compilador de Contexto Local para Claude Code / Cursor — 78% Menos Tokens no Repositório NestJS
Madar é um compilador de contexto local de código aberto para agentes de codificação. Em um repositório NestJS + BullMQ (~800 arquivos), ele reduziu os tokens de entrada do Claude Code em 78% e o custo em 63% para uma tarefa de explicação. Apenas grafos com escopo definido.

SDK de Código Aberto para Trabalho de Conhecimento em IA
O kw-sdk da ClioAI oferece uma estrutura estruturada para agentes de IA que realizam trabalho de conhecimento, implementando um loop de autoverificação com briefing de tarefas, criação de rubricas e verificação.

Título: Spec27: Validação Orientada por Spec para Agentes de IA – Testes em Nível de API Sem Acesso Interno
Spec27 é uma nova ferramenta da Safe Intelligence para validação orientada por especificações de agentes de IA. Ela testa o comportamento do agente de fora para dentro, executando verificações adversariais e de robustez contra interfaces primárias, sem necessidade de SDKs, gateways ou rastreamentos internos.