Qwen 3.6 27B alcanza una velocidad 2.5 veces mayor con decodificación especulativa MTP en llama.cpp

✍️ OpenClawRadar📅 Publicado: 6 de mayo de 2026🔗 Source
Qwen 3.6 27B alcanza una velocidad 2.5 veces mayor con decodificación especulativa MTP en llama.cpp
Ad

Un usuario de Reddit ha compilado llama.cpp con un PR pendiente (#22673) que habilita la Predicción Multi-Token (MTP) para Qwen 3.6 27B. MTP utiliza las capas tensoriales integradas del modelo para decodificación especulativa, reclamando una aceleración de 2.5x — de ~11 tok/s a 28 tok/s en un Mac M2 Max 96GB.

Detalles Clave

  • Modelo: Qwen 3.6 27B (variante de arquitectura Qwen2.5-3.0)
  • Hardware probado: Mac M2 Max 96GB
  • Resultados: 28 tok/s con MTP (vs ~11 tok/s sin él)
  • Soporte de contexto: Hasta 262K tokens con caché KV turbo4 en Mac de 48GB
  • Cuantizaciones: GGUF preconvertidos subidos por el usuario en froggeric/Qwen3.6-27B-MTP-GGUF

Instrucciones de Compilación

git clone --depth 1 https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/22673/head:mtp-pr && git checkout mtp-pr
cmake -B build -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --target llama-cli llama-server
Ad

Comando del Servidor

llama-server -m Qwen3.6-27B-Q5_K_M-mtp.gguf \
  --mmproj mmproj-Qwen3.6-27B-f16.gguf \
  --spec-type mtp --spec-draft-n-max 5 \
  --cache-type-k turbo4 --cache-type-v turbo4 \
  -c 262144 --temp 0.7 --top-k 20 -ngl 99 --port 8081

Tres optimizaciones combinadas:

  • --spec-type mtp --spec-draft-n-max 5: habilita la decodificación especulativa MTP (2.5x más rápida)
  • --cache-type-k turbo4 --cache-type-v turbo4: caché KV de 4.25 bits (un cuarto de memoria frente a 16 bits)
  • -c 262144: ventana de contexto de 262K (cabe en 48GB con turbo4)

Recomendaciones de Hardware

Se proporcionan tablas de cuantización y caché KV para Apple Silicon y NVIDIA GPU en la fuente para configuraciones con memoria limitada (por ejemplo, IQ2_M en Apple Silicon de 16GB con contexto de 48K). El soporte de visión (mmproj) está disponible en configuraciones de 32GB o más.

Correcciones Adicionales

El usuario también publicó 7 correcciones a la plantilla de chat jinja de Qwen que estaban rotas debido al formato específico de vLLM. Ahora son compatibles con llama.cpp y otras herramientas.

Nota: Los archivos GGUF existentes en Hugging Face no incluyen soporte MTP — requieren reconversión con el PR aplicado. El usuario advierte que las subidas iniciales están incompletas; verifique el estado del repositorio en Hugging Face.

📖 Lea la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Extensión de Navegador WeAreHere y Herramientas MCP Escanean Prácticas de Privacidad de Sitios Web
Herramientas

Extensión de Navegador WeAreHere y Herramientas MCP Escanean Prácticas de Privacidad de Sitios Web

Dos herramientas de código abierto—barebrowse y wearehere—escanean sitios web en busca de rastreadores, huellas digitales y conexiones con corredores de datos. La extensión de navegador wearehere muestra puntuaciones de privacidad en tiempo real (0-100) mientras navegas, mientras que los servidores MCP permiten que los asistentes de IA evalúen cualquier sitio bajo demanda.

OpenClawRadar
idea-reality-mcp: El servidor MCP verifica la existencia de herramientas antes de que Claude escriba código
Herramientas

idea-reality-mcp: El servidor MCP verifica la existencia de herramientas antes de que Claude escriba código

Un desarrollador construyó un servidor MCP llamado idea-reality-mcp que escanea repositorios de GitHub, discusiones de Hacker News, paquetes npm y PyPI antes de que Claude escriba cualquier código, devolviendo una puntuación de 'señal de realidad' de 0-100 que indica la competencia en el mercado.

OpenClawRadar
Claude Sleuth: Un Flujo de Trabajo de Investigación de 56 Tareas para Claude AI
Herramientas

Claude Sleuth: Un Flujo de Trabajo de Investigación de 56 Tareas para Claude AI

Claude Sleuth es un flujo de trabajo de investigación estructurado para Claude AI con 6 fases y 56 tareas, que incluye almacenamiento de estado persistente mediante Cloudflare D1 y convenciones de salida estandarizadas que abarcan marcas de tiempo ISO 8601, registros de entidades POLE y el lenguaje de probabilidad ICD 203.

OpenClawRadar
Ghostbar: Un cliente nativo de IA para macOS Swift de ~5MB que se oculta de la pantalla compartida
Herramientas

Ghostbar: Un cliente nativo de IA para macOS Swift de ~5MB que se oculta de la pantalla compartida

Ghostbar es un cliente de IA nativo de Swift para la barra de menús de macOS (~5MB) que usa window.sharingType = .none para volverse invisible para los grabadores de pantalla. Funciona con Ollama, vLLM, llama.cpp y cualquier backend compatible con OpenAI.

OpenClawRadar