Qwen 3.5 122B MoE a 35 t/s em uma única 3090 com ik_llama.cpp MTP

Um desenvolvedor rodando uma stack de inferência totalmente local em um único desktop relata atingir 35 tokens/s no Qwen 3.5 122B MoE usando apenas uma 3090, com o principal facilitador sendo um fork do llama.cpp que corrige MTP (Multi-Token Prediction) para especialistas descarregados.
Configuração de Hardware
- CPU AMD 9900X
- 192GB DDR5-5200 RAM (chamada de “a arma secreta”)
- Duas 3090s (Ti + padrão), sem NVLink
A placa 1 roda o worker: Qwen3.5-122B-A10B usando Unsloth IQ3_S MTP GGUF com contexto de 204K. 75% das camadas de especialistas são descarregadas para a CPU via flags cirúrgicas -ot. A placa 2 roda o reasoner: Qwen3.6-35B-A3B Q4_K_XL com MTP a 135 t/s, contexto de 262K.
Instâncias adicionais apenas em CPU lidam com processamento em segundo plano: Dialectic (35B heretic Q8), Scribe-Logos (Gemma4 19B), Moonshot (Gemma4 2B) — totalizando ~19GB RAM.
A Descoberta do ik_llama.cpp
O MTP do llama.cpp padrão avalia os especialistas de cada token especulado sequencialmente através da DDR5, o que em conteúdo de raciocínio na verdade regride o desempenho — a sobrecarga do draft supera o ganho de aceitação. O fork ik implementa operações MoE fundidas que agrupam leituras de especialistas para tokens especulados, transformando o MTP de um ganho de +4% para um ganho de +20%. O desenvolvedor relata 35 t/s de decode em um modelo de 122B a partir de uma única 3090 usando este fork.
Se você está descarregando especialistas para a RAM em qualquer modelo MoE, experimente ik_llama.cpp antes de desistir do MTP.
Custo Total da Montagem
- ~$1600 pela RAM
- ~$1600 por duas 3090s
- ~$400 pelo resto
- Custo operacional: apenas eletricidade
📖 Leia a fonte completa: r/openclaw
👀 See Also

Arquivos CLAUDE.md são frequentemente organizados para desenvolvedores, não para modelos de IA – eis por que isso importa
Arquivos CLAUDE.md geralmente colocam as Regras Rígidas na linha 47, após o contexto e a pilha tecnológica. Quando o modelo lê as restrições, já construiu suposições conflitantes. Uma estrutura melhor coloca as regras rígidas primeiro.

Guia de Exame de Fundamentos do Agente Certificado Claude Discrepâncias Identificadas
Um candidato recente do exame CCA-F relata discrepâncias significativas entre o guia oficial do exame, o exame prático e o conteúdo real do teste. O exame real pode incluir até 13 cenários, enquanto o guia lista apenas 6, e o exame prático cobre apenas 4 deles.

Automatizando a Atualização de Tokens OAuth para Bots Usando Claude Code
Um usuário do Reddit compartilha um método para evitar a expiração de tokens OAuth configurando o Claude Code para renovar automaticamente os tokens a cada 8 horas, mantendo bots em execução contínua sem intervenção manual.

Usando IA para Escrever Código Melhor e Mais Devagar: Um Fluxo de Trabalho para Encontrar Bugs
Nolan Lawson descreve um workflow usando múltiplos agentes de IA (Claude, Codex, Cursor Bugbot) para encontrar e priorizar bugs em PRs, melhorando a qualidade do código em vez da velocidade bruta.