Executando MiniMax M2.7 Q8_0 128K em 2x3090 com Offloading de CPU – Benchmarks e Configurações do Mundo Real

Em uma postagem recente no r/LocalLLaMA, um usuário compartilha sua experiência ao levar o modelo MiniMax M2.7 (na quantização Q8_0) a 128K de contexto em uma configuração com 2x3090, 256GB DDR4 e uma CPU 10900X de segunda mão. O principal desafio: executar um modelo MoE grande com cache KV não quantizado em hardware relativamente modesto para sua classe.
Números de Desempenho
O usuário relata:
- Processamento de prompt: ~50 tokens por segundo
- Geração de tokens: ~10 tokens por segundo
- Descrito como "muito lento, mas utilizável para fluxos de trabalho de agente de codificação"
Configuração
Eles usam ik-llama-cuda (um fork do llama.cpp) com as seguintes flags (do config NixOS):
${ik-llama-cuda}/bin/llama-server \
-m ${modelPath} \
--host 0.0.0.0 \
--port ${toString cfg.port} \
-c ${toString cfg.contextLength} \
-ngl 999 \
--cpu-moe \
-sm graph \
-fa on \
-t 16 \
-tb 16 \
-b 4096 \
-ub 4096 \
-np 1 \
-muge \
-ger \
--jinja \
--metrics \
--temp 1.0 \
--top-p 0.95 \
--top-k 40 \
--min-p 0.01Flags notáveis:
--cpu-moe– descarrega a computação dos especialistas do MoE para a CPU-sm graph– ativa o agendamento baseado em grafo-fa on– atenção flash-t 16/-tb 16– 16 threads para computação e lote, respectivamente-b 4096/-ub 4096– tamanho do lote e do sublote-muge– carregamento de especialistas guiado pelo uso de memória (provavelmente)-ger– roteamento de especialistas pela GPU
Contexto e Motivação
O usuário relata que o Q8_0 foi escolhido para mitigar "comportamentos estranhos" observados em quantizações menores. Eles observam que o modelo de rascunho para decodificação especulativa não foi lançado para o M2.7, o que poderia ter melhorado a velocidade. Eles estão principalmente interessados em precisão em vez de velocidade, desde que a geração não leve "literalmente o dia todo".
Conclusão para Desenvolvedores
Este é um dado prático para qualquer pessoa que execute grandes modelos MoE em configurações multi-GPU com RAM do sistema. A abordagem --cpu-moe permite escalar o contexto muito além dos limites da VRAM, embora com velocidade reduzida. Para fluxos de trabalho de agente de codificação onde a latência é menos crítica, essa troca pode ser aceitável.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Claude Code Requer Prompts Específicos, Não Instruções Vagas
Um desenvolvedor relata que o Claude Code produz melhores resultados com prompts detalhados em vez de instruções vagas, citando experiência com 4 bilhões de tokens ao longo de 5 meses.

Códigos de Prompt do Claude Retestados: L99 Mais Aguçado, OODA Mais Estreito, ARTEFATOS Esmaecidos e 3 Novos Códigos para Usar
Um reteste de 6 meses dos códigos de prompt L99, OODA e ARTIFACTS no Claude mostra L99 mais afiado no Sonnet 4.6/Opus 4.7, OODA falhando em prompts estratégicos, ARTIFACTS desnecessário para código, e três novos códigos (/skeptic, /blindspots, /decompose) merecendo uso diário. Não empilhe mais de 2 códigos.

Comunidade Discute Soluções para Consumo de Tokens OpenClaw
Usuários compartilham estratégias para gerenciar alto consumo de tokens ao executar agentes de IA 24 horas por dia.

A auditoria de tokens do Claude Code revela custos ocultos do carregamento padrão de ferramentas
Um desenvolvedor analisou 926 sessões do Claude Code e descobriu que 45.000 tokens são carregados no início da sessão, com 20.000 tokens provenientes de definições de esquema de ferramentas do sistema. Habilitar a configuração ENABLE_TOOL_SEARCH reduziu o contexto inicial de 45k para 20k tokens, economizando 14.000 tokens por turno.