RTX 5080 16GB: Qwen3.6 35B MoE con contexto de 128k — 56 tok/s, y por qué MTP no ayuda

✍️ OpenClawRadar📅 Publicado: 20 de mayo de 2026🔗 Source
RTX 5080 16GB: Qwen3.6 35B MoE con contexto de 128k — 56 tok/s, y por qué MTP no ayuda
Ad

El commit b9190 de llama.cpp mainline fusionó MTP (Predicción Multi-Token). Los benchmarks en una RTX 5080 16GB con Qwen3.6 35B MoE en contexto de 128k revelan un hallazgo claro: MTP perjudica el rendimiento cuando el modelo no cabe completamente en la GPU.

La Mejor Configuración (Sin MTP)

Qwen3.6-35B-A3B Q4_K_XL --fit-target 1536 en contexto de 131k produce:

  • 56 tok/s de generación
  • 1.584 tok/s de procesamiento de prompt en contexto de 128k

No se necesitan banderas de MTP.

Por Qué MTP Ralentiza 35B MoE en 16GB

Tres configuraciones probadas con longitudes de contexto de agente de codificación:

  • 27B IQ3+MTP: 12,45 GB, completamente en GPU — promedio 73 tok/s (MTP ayuda)
  • 35B Q4_K_XL+MTP: ~22 GB, descarga parcial — promedio 74 tok/s (MTP perjudica)
  • 35B Q8_0+MTP: ~36 GB, descarga pesada — promedio 46 tok/s

Sin MTP, el 35B Q4_K_XL alcanza 97 tok/s con --fit-target 0 (15.815 MiB VRAM) y 86 tok/s con --fit-target 1536 (14.269 MiB). Con MTP habilitado en --fit-target 1536, la velocidad baja a 74 tok/s (14.623 MiB) — una desaceleración del 23%.

La causa raíz: el búfer de cómputo de MTP reserva ~1,5 GB (--fit-target 1536), empujando ~3 capas expertas de MoE más de la GPU a la CPU. Dado que la inferencia de MoE está limitada por las capas expertas en CPU, la tasa de aceptación de tokens del 79% de MTP no puede compensar la velocidad más lenta por paso.

Para el modelo de 27B (cabe completamente en GPU), --fit-target 0 funciona con o sin MTP, por lo que no hay penalización de VRAM — MTP aumenta la velocidad de ~56 a 73 tok/s.

Ad

Regla General

MTP ayuda cuando tu modelo cabe en la GPU. Perjudica cuando el búfer de cómputo de MTP obliga a más capas a la CPU. En tarjetas de 16GB con 35B MoE, omite MTP.

Sistema de prueba completo: RTX 5080 16GB, Ryzen 9 9950X, 128GB RAM, llama.cpp b9204 (mainline). Banderas comunes de MTP: -np 1 --fit on -fa on -t 20 --no-mmap --jinja -ctk q8_0 -ctv q8_0 --spec-type draft-mtp --spec-draft-n-max 2.

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Dos nuevos modelos aparecen en OpenRouter, posiblemente variantes de DeepSeek V4.
Noticias

Dos nuevos modelos aparecen en OpenRouter, posiblemente variantes de DeepSeek V4.

Dos nuevos modelos llamados healer-alpha y hunter-alpha han aparecido en OpenRouter, con especificaciones que coinciden con detalles filtrados sobre DeepSeek V4. Las pruebas iniciales muestran que ambos modelos funcionan bien en escenarios de juego de roles sin filtrado de mensajes y con generación de tokens más rápida que GLM 5.0.

OpenClawRadar
Harmonic-9B: Ajuste fino en dos etapas de Qwen3.5-9B para agentes de IA
Noticias

Harmonic-9B: Ajuste fino en dos etapas de Qwen3.5-9B para agentes de IA

El desarrollador DJLougen ha lanzado Harmonic-9B, un ajuste fino de Qwen3.5-9B optimizado para uso de agentes con un enfoque de entrenamiento en dos etapas. La Etapa 1 (razonamiento intensivo) está completa, mientras que la Etapa 2 (llamadas a herramientas ligeras) aún está en entrenamiento. Ya están disponibles versiones cuantizadas GGUF.

OpenClawRadar
Anthropic duplica los límites de tarifa de Claude Code y firma un acuerdo de cómputo con SpaceX
Noticias

Anthropic duplica los límites de tarifa de Claude Code y firma un acuerdo de cómputo con SpaceX

Los límites de tarifa de cinco horas de Claude Code se duplicaron para los planes Pro/Max/Team/Enterprise, se eliminaron las reducciones en horas pico y se aumentaron los límites de tarifa de API para los modelos Opus. SpaceX Colossus 1 agrega más de 300 MW de capacidad (220k GPUs NVIDIA) en un mes.

OpenClawRadar
Títulos de Sistema de Claude Code Actualizados: Nuevo Recordatorio de Modificación de Archivos y Aclaraciones de REPL, Recordatorio de Análisis de Malware Eliminado
Noticias

Títulos de Sistema de Claude Code Actualizados: Nuevo Recordatorio de Modificación de Archivos y Aclaraciones de REPL, Recordatorio de Análisis de Malware Eliminado

Las versiones 2.1.124 (+166 tokens) y 2.1.126 (-87 tokens) de Claude Code (CC) actualizan el prompt del sistema: añaden una advertencia de detección de modificación de archivos con presupuesto excedido, reemplazan la función de identidad principal por instrucciones explícitas del harness, aclaran el comportamiento de auto-await de thenables en REPL y eliminan el recordatorio de análisis de malware.

OpenClawRadar