Qwen 3.5 122B MoE a 35 t/s en una sola 3090 con ik_llama.cpp MTP

Un desarrollador que ejecuta una pila de inferencia completamente local en un solo escritorio reporta alcanzar 35 tokens/s en Qwen 3.5 122B MoE usando solo una 3090, con el habilitador clave siendo un fork de llama.cpp que corrige MTP (Multi-Token Prediction) para expertos descargados.
Configuración de hardware
- CPU AMD 9900X
- 192GB DDR5-5200 RAM (llamada "el arma secreta")
- Dos 3090 (Ti + estándar), sin NVLink
La tarjeta 1 ejecuta el worker: Qwen3.5-122B-A10B usando Unsloth IQ3_S MTP GGUF con contexto de 204K. El 75% de las capas de expertos se descargan a la CPU mediante flags quirúrgicos -ot. La tarjeta 2 ejecuta el razonador: Qwen3.6-35B-A3B Q4_K_XL con MTP a 135 t/s, contexto de 262K.
Instancias adicionales solo en CPU manejan procesamiento en segundo plano: Dialectic (35B heretic Q8), Scribe-Logos (Gemma4 19B), Moonshot (Gemma4 2B) — totalizando ~19GB RAM.
El hallazgo de ik_llama.cpp
El MTP de llama.cpp estándar evalúa los expertos de cada token especulado secuencialmente a través de DDR5, lo que en contenido de razonamiento realmente empeora el rendimiento — la sobrecarga del borrador supera la ganancia de velocidad de aceptación. El fork ik implementa operaciones MoE fusionadas que agrupan las lecturas de expertos para tokens especulados, convirtiendo MTP de una ganancia del +4% a una ganancia del +20%. El desarrollador reporta 35 t/s de decodificación en un modelo de 122B desde una sola 3090 usando este fork.
Si estás descargando expertos a RAM en cualquier modelo MoE, prueba ik_llama.cpp antes de rendirte con MTP.
Costo total del montaje
- ~$1600 en RAM
- ~$1600 en dos 3090
- ~$400 en todo lo demás
- Costo de funcionamiento: solo electricidad
📖 Lee la fuente original: r/openclaw
👀 Ver también

Precio de Agentes de IA: Lecciones de la Venta de OpenClaw a Pequeñas Empresas
Tras meses vendiendo agentes OpenClaw a despachos de abogados y bienes raíces, un desarrollador comparte estrategias prácticas de precios: el precio por asiento falla, el marco de 'empleado IA' funciona y pasar los costos de LLM evita la erosión del margen.

DeepSeek-V4-Flash W4A16+FP8 con autospeculación MTP: 85 tok/s en 2x RTX PRO 6000 Max-Q
DeepSeek-V4-Flash cuantizado a W4A16+FP8 alcanza 85.52 tok/s en contexto de 524k en 2× RTX PRO 6000 Max-Q usando un vLLM modificado con cabezal MTP adaptado, frente a 52.85 tok/s de referencia.

Optimización del Rendimiento en Java: Ocho Antipatrones que Ralentizan tu Código
Una aplicación de procesamiento de pedidos en Java mejoró de 1.198 ms a 239 ms en tiempo transcurrido, de 85.000 a 419.000 pedidos por segundo, y de 1 GB a 139 MB en uso de memoria heap al corregir ocho antipatrones comunes identificados mediante perfiles de Java Flight Recording.

Tres Habilidades Esenciales de OpenClaw para una Configuración Estable: Memoria, Seguridad y Descubrimiento
Una publicación de Reddit recomienda instalar primero tres tipos específicos de habilidades de OpenClaw: una habilidad de corrección de memoria para evitar la pérdida de contexto, una habilidad de verificación de seguridad local para detectar código malicioso y un centro de descubrimiento curado para encontrar herramientas mantenidas.