Ejecutando MiniMax M2.7 Q8_0 128K en 2x3090 con descarga de CPU: benchmarks y configuración del mundo real

En una publicación reciente en r/LocalLLaMA, un usuario comparte su experiencia llevando el modelo MiniMax M2.7 (con cuantización Q8_0) a 128K de contexto en una configuración de 2x3090 con 256GB DDR4 y un CPU 10900X de segunda mano. El desafío clave: ejecutar un modelo MoE grande con caché KV sin cuantizar en hardware relativamente modesto para su clase.
Números de rendimiento
El usuario reporta:
- Procesamiento de prompt: ~50 tokens por segundo
- Generación de tokens: ~10 tokens por segundo
- Describe como “muy lento pero utilizable para flujos de trabajo de agente de codificación”
Configuración
Usan ik-llama-cuda (un fork de llama.cpp) con los siguientes flags (desde su configuración de NixOS):
${ik-llama-cuda}/bin/llama-server \
-m ${modelPath} \
--host 0.0.0.0 \
--port ${toString cfg.port} \
-c ${toString cfg.contextLength} \
-ngl 999 \
--cpu-moe \
-sm graph \
-fa on \
-t 16 \
-tb 16 \
-b 4096 \
-ub 4096 \
-np 1 \
-muge \
-ger \
--jinja \
--metrics \
--temp 1.0 \
--top-p 0.95 \
--top-k 40 \
--min-p 0.01Flags notables:
--cpu-moe– descarga el cómputo de expertos MoE a la CPU-sm graph– habilita la planificación basada en grafos-fa on– atención flash-t 16/-tb 16– 16 hilos para cómputo y batch respectivamente-b 4096/-ub 4096– tamaño de batch y ubatch-muge– carga de expertos guiada por uso de memoria (probablemente)-ger– enrutamiento de expertos a GPU
Contexto y motivación
El usuario informa que eligió Q8_0 para mitigar el “comportamiento extraño” observado en cuantizaciones más bajas. Señala que el modelo borrador para decodificación especulativa no fue liberado para M2.7, lo que podría haber mejorado la velocidad. Están principalmente interesados en precisión sobre velocidad, siempre que la generación no tome “literalmente todo el día”.
Conclusión para desarrolladores
Este es un dato práctico para cualquiera que ejecute modelos MoE grandes en configuraciones multi-GPU con RAM del sistema. El enfoque --cpu-moe permite escalar el contexto mucho más allá de los límites de VRAM, aunque a velocidad reducida. Para flujos de trabajo de agente de codificación donde la latencia es menos crítica, esta compensación puede ser aceptable.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

Fuentes de Datos de Claude: Cuándo Solicitar Búsquedas Web para Información Actualizada
Claude a veces se basa en datos de entrenamiento internos en lugar de realizar búsquedas web, lo que puede proporcionar información desactualizada. Los usuarios pueden solicitar búsquedas web específicamente para obtener resultados más actuales.

Maximizar Ahorros: Ejecutando Bots de OpenClaw con un Presupuesto
Explora maneras de ejecutar OpenClaw/ClawdBot/MoltBot de forma gratuita o con un presupuesto limitado, aprovechando los consejos de la comunidad y las estrategias ingeniosas compartidas en r/openclaw.

La auditoría de tokens de Claude Code revela costos ocultos por la carga predeterminada de herramientas.
Un desarrollador analizó 926 sesiones de Claude Code y encontró 45,000 tokens cargados al inicio de cada sesión, con 20,000 tokens provenientes de definiciones de esquemas de herramientas del sistema. Habilitar la configuración ENABLE_TOOL_SEARCH redujo el contexto inicial de 45k a 20k tokens, ahorrando 14,000 tokens por turno.

11 consejos profundos de Claude de un usuario diario de 18 meses
Un desarrollador senior comparte 11 consejos no obvios sobre Claude tras 18 meses de uso diario, incluyendo Projects, Custom Styles, Memory, Sonnet 4.6 vs Opus 4.7, Haiku 4.5 para trabajo por lotes, subagentes de Claude Code y Artifacts llamando a la API.