Executando MiniMax M2.7 Q8_0 128K em 2x3090 com Offloading de CPU – Benchmarks e Configurações do Mundo Real

Em uma postagem recente no r/LocalLLaMA, um usuário compartilha sua experiência ao levar o modelo MiniMax M2.7 (na quantização Q8_0) a 128K de contexto em uma configuração com 2x3090, 256GB DDR4 e uma CPU 10900X de segunda mão. O principal desafio: executar um modelo MoE grande com cache KV não quantizado em hardware relativamente modesto para sua classe.
Números de Desempenho
O usuário relata:
- Processamento de prompt: ~50 tokens por segundo
- Geração de tokens: ~10 tokens por segundo
- Descrito como "muito lento, mas utilizável para fluxos de trabalho de agente de codificação"
Configuração
Eles usam ik-llama-cuda (um fork do llama.cpp) com as seguintes flags (do config NixOS):
${ik-llama-cuda}/bin/llama-server \
-m ${modelPath} \
--host 0.0.0.0 \
--port ${toString cfg.port} \
-c ${toString cfg.contextLength} \
-ngl 999 \
--cpu-moe \
-sm graph \
-fa on \
-t 16 \
-tb 16 \
-b 4096 \
-ub 4096 \
-np 1 \
-muge \
-ger \
--jinja \
--metrics \
--temp 1.0 \
--top-p 0.95 \
--top-k 40 \
--min-p 0.01Flags notáveis:
--cpu-moe– descarrega a computação dos especialistas do MoE para a CPU-sm graph– ativa o agendamento baseado em grafo-fa on– atenção flash-t 16/-tb 16– 16 threads para computação e lote, respectivamente-b 4096/-ub 4096– tamanho do lote e do sublote-muge– carregamento de especialistas guiado pelo uso de memória (provavelmente)-ger– roteamento de especialistas pela GPU
Contexto e Motivação
O usuário relata que o Q8_0 foi escolhido para mitigar "comportamentos estranhos" observados em quantizações menores. Eles observam que o modelo de rascunho para decodificação especulativa não foi lançado para o M2.7, o que poderia ter melhorado a velocidade. Eles estão principalmente interessados em precisão em vez de velocidade, desde que a geração não leve "literalmente o dia todo".
Conclusão para Desenvolvedores
Este é um dado prático para qualquer pessoa que execute grandes modelos MoE em configurações multi-GPU com RAM do sistema. A abordagem --cpu-moe permite escalar o contexto muito além dos limites da VRAM, embora com velocidade reduzida. Para fluxos de trabalho de agente de codificação onde a latência é menos crítica, essa troca pode ser aceitável.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Como um comando /loop queimou US$ 6.000 na API Claude durante a noite
O comando /loop não monitorado de um desenvolvedor executado a cada 30 minutos no claude-opus-4-7 consumiu US$ 6.000 em uma noite devido à expiração do cache de prompt e ao crescimento do contexto — uma história de alerta para automação de agentes de IA.

Reduzir os Tokens de Boot OpenClaw em 43% ao Redimensionar Ferramenta e Arquivos de Memória
Reduziu os tokens de inicialização de ~9.457 para ~5.400 (queda de 43%) ao converter TOOLS.md em um índice, mover detalhes das ferramentas para arquivos separados e implementar promoção de memória em estágios.

Usando OpenClaw Cron Jobs para Tarefas Agendadas em Vez de Monitoramento de Heartbeat
Um post no Reddit explica como usar o recurso de tarefas cron do OpenClaw para atividades agendadas como briefings matinais e triagem de e-mails, com a flag crítica --session isolated para evitar vazamento de contexto, e alerta sobre possíveis bugs em sessões isoladas entre versões.
A resposta de um subagente não é um comprovante de conclusão: lista de verificação do orquestrador
O sessions_spawn do OpenClaw é não bloqueante—uma resposta não significa conclusão. Use yield e Task Flow, e reconcilie o estado do filho para evitar falsos sucessos.