Qwen 3.6 27B alcanza una velocidad 2.5 veces mayor con decodificación especulativa MTP en llama.cpp

Un usuario de Reddit ha compilado llama.cpp con un PR pendiente (#22673) que habilita la Predicción Multi-Token (MTP) para Qwen 3.6 27B. MTP utiliza las capas tensoriales integradas del modelo para decodificación especulativa, reclamando una aceleración de 2.5x — de ~11 tok/s a 28 tok/s en un Mac M2 Max 96GB.
Detalles Clave
- Modelo: Qwen 3.6 27B (variante de arquitectura Qwen2.5-3.0)
- Hardware probado: Mac M2 Max 96GB
- Resultados: 28 tok/s con MTP (vs ~11 tok/s sin él)
- Soporte de contexto: Hasta 262K tokens con caché KV turbo4 en Mac de 48GB
- Cuantizaciones: GGUF preconvertidos subidos por el usuario en
froggeric/Qwen3.6-27B-MTP-GGUF
Instrucciones de Compilación
git clone --depth 1 https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/22673/head:mtp-pr && git checkout mtp-pr
cmake -B build -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --target llama-cli llama-serverComando del Servidor
llama-server -m Qwen3.6-27B-Q5_K_M-mtp.gguf \
--mmproj mmproj-Qwen3.6-27B-f16.gguf \
--spec-type mtp --spec-draft-n-max 5 \
--cache-type-k turbo4 --cache-type-v turbo4 \
-c 262144 --temp 0.7 --top-k 20 -ngl 99 --port 8081Tres optimizaciones combinadas:
--spec-type mtp --spec-draft-n-max 5: habilita la decodificación especulativa MTP (2.5x más rápida)--cache-type-k turbo4 --cache-type-v turbo4: caché KV de 4.25 bits (un cuarto de memoria frente a 16 bits)-c 262144: ventana de contexto de 262K (cabe en 48GB con turbo4)
Recomendaciones de Hardware
Se proporcionan tablas de cuantización y caché KV para Apple Silicon y NVIDIA GPU en la fuente para configuraciones con memoria limitada (por ejemplo, IQ2_M en Apple Silicon de 16GB con contexto de 48K). El soporte de visión (mmproj) está disponible en configuraciones de 32GB o más.
Correcciones Adicionales
El usuario también publicó 7 correcciones a la plantilla de chat jinja de Qwen que estaban rotas debido al formato específico de vLLM. Ahora son compatibles con llama.cpp y otras herramientas.
Nota: Los archivos GGUF existentes en Hugging Face no incluyen soporte MTP — requieren reconversión con el PR aplicado. El usuario advierte que las subidas iniciales están incompletas; verifique el estado del repositorio en Hugging Face.
📖 Lea la fuente completa: r/LocalLLaMA
👀 Ver también

Extensión de Navegador WeAreHere y Herramientas MCP Escanean Prácticas de Privacidad de Sitios Web
Dos herramientas de código abierto—barebrowse y wearehere—escanean sitios web en busca de rastreadores, huellas digitales y conexiones con corredores de datos. La extensión de navegador wearehere muestra puntuaciones de privacidad en tiempo real (0-100) mientras navegas, mientras que los servidores MCP permiten que los asistentes de IA evalúen cualquier sitio bajo demanda.

idea-reality-mcp: El servidor MCP verifica la existencia de herramientas antes de que Claude escriba código
Un desarrollador construyó un servidor MCP llamado idea-reality-mcp que escanea repositorios de GitHub, discusiones de Hacker News, paquetes npm y PyPI antes de que Claude escriba cualquier código, devolviendo una puntuación de 'señal de realidad' de 0-100 que indica la competencia en el mercado.

Claude Sleuth: Un Flujo de Trabajo de Investigación de 56 Tareas para Claude AI
Claude Sleuth es un flujo de trabajo de investigación estructurado para Claude AI con 6 fases y 56 tareas, que incluye almacenamiento de estado persistente mediante Cloudflare D1 y convenciones de salida estandarizadas que abarcan marcas de tiempo ISO 8601, registros de entidades POLE y el lenguaje de probabilidad ICD 203.

Ghostbar: Un cliente nativo de IA para macOS Swift de ~5MB que se oculta de la pantalla compartida
Ghostbar es un cliente de IA nativo de Swift para la barra de menús de macOS (~5MB) que usa window.sharingType = .none para volverse invisible para los grabadores de pantalla. Funciona con Ollama, vLLM, llama.cpp y cualquier backend compatible con OpenAI.