Ejecutando MiniMax M2.7 Q8_0 128K en 2x3090 con descarga de CPU: benchmarks y configuración del mundo real

✍️ OpenClawRadar📅 Publicado: 17 de mayo de 2026🔗 Source
Ejecutando MiniMax M2.7 Q8_0 128K en 2x3090 con descarga de CPU: benchmarks y configuración del mundo real
Ad

En una publicación reciente en r/LocalLLaMA, un usuario comparte su experiencia llevando el modelo MiniMax M2.7 (con cuantización Q8_0) a 128K de contexto en una configuración de 2x3090 con 256GB DDR4 y un CPU 10900X de segunda mano. El desafío clave: ejecutar un modelo MoE grande con caché KV sin cuantizar en hardware relativamente modesto para su clase.

Números de rendimiento

El usuario reporta:

  • Procesamiento de prompt: ~50 tokens por segundo
  • Generación de tokens: ~10 tokens por segundo
  • Describe como “muy lento pero utilizable para flujos de trabajo de agente de codificación”

Configuración

Usan ik-llama-cuda (un fork de llama.cpp) con los siguientes flags (desde su configuración de NixOS):

${ik-llama-cuda}/bin/llama-server \
  -m ${modelPath} \
  --host 0.0.0.0 \
  --port ${toString cfg.port} \
  -c ${toString cfg.contextLength} \
  -ngl 999 \
  --cpu-moe \
  -sm graph \
  -fa on \
  -t 16 \
  -tb 16 \
  -b 4096 \
  -ub 4096 \
  -np 1 \
  -muge \
  -ger \
  --jinja \
  --metrics \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 40 \
  --min-p 0.01

Flags notables:

  • --cpu-moe – descarga el cómputo de expertos MoE a la CPU
  • -sm graph – habilita la planificación basada en grafos
  • -fa on – atención flash
  • -t 16 / -tb 16 – 16 hilos para cómputo y batch respectivamente
  • -b 4096 / -ub 4096 – tamaño de batch y ubatch
  • -muge – carga de expertos guiada por uso de memoria (probablemente)
  • -ger – enrutamiento de expertos a GPU

Ad

Contexto y motivación

El usuario informa que eligió Q8_0 para mitigar el “comportamiento extraño” observado en cuantizaciones más bajas. Señala que el modelo borrador para decodificación especulativa no fue liberado para M2.7, lo que podría haber mejorado la velocidad. Están principalmente interesados en precisión sobre velocidad, siempre que la generación no tome “literalmente todo el día”.

Conclusión para desarrolladores

Este es un dato práctico para cualquiera que ejecute modelos MoE grandes en configuraciones multi-GPU con RAM del sistema. El enfoque --cpu-moe permite escalar el contexto mucho más allá de los límites de VRAM, aunque a velocidad reducida. Para flujos de trabajo de agente de codificación donde la latencia es menos crítica, esta compensación puede ser aceptable.

📖 Lee la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Fuentes de Datos de Claude: Cuándo Solicitar Búsquedas Web para Información Actualizada
Consejos

Fuentes de Datos de Claude: Cuándo Solicitar Búsquedas Web para Información Actualizada

Claude a veces se basa en datos de entrenamiento internos en lugar de realizar búsquedas web, lo que puede proporcionar información desactualizada. Los usuarios pueden solicitar búsquedas web específicamente para obtener resultados más actuales.

OpenClawRadar
Maximizar Ahorros: Ejecutando Bots de OpenClaw con un Presupuesto
Consejos

Maximizar Ahorros: Ejecutando Bots de OpenClaw con un Presupuesto

Explora maneras de ejecutar OpenClaw/ClawdBot/MoltBot de forma gratuita o con un presupuesto limitado, aprovechando los consejos de la comunidad y las estrategias ingeniosas compartidas en r/openclaw.

OpenClawRadar
La auditoría de tokens de Claude Code revela costos ocultos por la carga predeterminada de herramientas.
Consejos

La auditoría de tokens de Claude Code revela costos ocultos por la carga predeterminada de herramientas.

Un desarrollador analizó 926 sesiones de Claude Code y encontró 45,000 tokens cargados al inicio de cada sesión, con 20,000 tokens provenientes de definiciones de esquemas de herramientas del sistema. Habilitar la configuración ENABLE_TOOL_SEARCH redujo el contexto inicial de 45k a 20k tokens, ahorrando 14,000 tokens por turno.

OpenClawRadar
11 consejos profundos de Claude de un usuario diario de 18 meses
Consejos

11 consejos profundos de Claude de un usuario diario de 18 meses

Un desarrollador senior comparte 11 consejos no obvios sobre Claude tras 18 meses de uso diario, incluyendo Projects, Custom Styles, Memory, Sonnet 4.6 vs Opus 4.7, Haiku 4.5 para trabajo por lotes, subagentes de Claude Code y Artifacts llamando a la API.

OpenClawRadar