Qwen 3.6 27B alcanza una velocidad 2.5 veces mayor con decodificación especulativa MTP en llama.cpp

✍️ OpenClawRadar📅 Publicado: 6 de mayo de 2026🔗 Source
Qwen 3.6 27B alcanza una velocidad 2.5 veces mayor con decodificación especulativa MTP en llama.cpp
Ad

Un usuario de Reddit ha compilado llama.cpp con un PR pendiente (#22673) que habilita la Predicción Multi-Token (MTP) para Qwen 3.6 27B. MTP utiliza las capas tensoriales integradas del modelo para decodificación especulativa, reclamando una aceleración de 2.5x — de ~11 tok/s a 28 tok/s en un Mac M2 Max 96GB.

Detalles Clave

  • Modelo: Qwen 3.6 27B (variante de arquitectura Qwen2.5-3.0)
  • Hardware probado: Mac M2 Max 96GB
  • Resultados: 28 tok/s con MTP (vs ~11 tok/s sin él)
  • Soporte de contexto: Hasta 262K tokens con caché KV turbo4 en Mac de 48GB
  • Cuantizaciones: GGUF preconvertidos subidos por el usuario en froggeric/Qwen3.6-27B-MTP-GGUF

Instrucciones de Compilación

git clone --depth 1 https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/22673/head:mtp-pr && git checkout mtp-pr
cmake -B build -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --target llama-cli llama-server
Ad

Comando del Servidor

llama-server -m Qwen3.6-27B-Q5_K_M-mtp.gguf \
  --mmproj mmproj-Qwen3.6-27B-f16.gguf \
  --spec-type mtp --spec-draft-n-max 5 \
  --cache-type-k turbo4 --cache-type-v turbo4 \
  -c 262144 --temp 0.7 --top-k 20 -ngl 99 --port 8081

Tres optimizaciones combinadas:

  • --spec-type mtp --spec-draft-n-max 5: habilita la decodificación especulativa MTP (2.5x más rápida)
  • --cache-type-k turbo4 --cache-type-v turbo4: caché KV de 4.25 bits (un cuarto de memoria frente a 16 bits)
  • -c 262144: ventana de contexto de 262K (cabe en 48GB con turbo4)

Recomendaciones de Hardware

Se proporcionan tablas de cuantización y caché KV para Apple Silicon y NVIDIA GPU en la fuente para configuraciones con memoria limitada (por ejemplo, IQ2_M en Apple Silicon de 16GB con contexto de 48K). El soporte de visión (mmproj) está disponible en configuraciones de 32GB o más.

Correcciones Adicionales

El usuario también publicó 7 correcciones a la plantilla de chat jinja de Qwen que estaban rotas debido al formato específico de vLLM. Ahora son compatibles con llama.cpp y otras herramientas.

Nota: Los archivos GGUF existentes en Hugging Face no incluyen soporte MTP — requieren reconversión con el PR aplicado. El usuario advierte que las subidas iniciales están incompletas; verifique el estado del repositorio en Hugging Face.

📖 Lea la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Akemon: Publica y Contrata Agentes de Codificación con IA Directamente desde tu Portátil
Herramientas

Akemon: Publica y Contrata Agentes de Codificación con IA Directamente desde tu Portátil

Akemon es una herramienta que permite a los desarrolladores publicar sus agentes de programación con IA mediante un comando y contratar los agentes de otros con otro comando, funcionando directamente desde portátiles a través de un túnel de retransmisión sin necesidad de servidores. Es independiente del protocolo, compatible con agentes de Claude Code, Codex, Gemini, OpenCode, Cursor y Windsurf.

OpenClawRadar
Treck: Una extensión de Chrome que captura investigación web y usa Claude para generar documentos
Herramientas

Treck: Una extensión de Chrome que captura investigación web y usa Claude para generar documentos

Treck es una extensión de Chrome que captura fragmentos web en proyectos y usa Claude para convertirlos en documentos, citas y páginas compartibles. Lleva tu propia clave API.

OpenClawRadar
Graph Compose: Flujos de Trabajo Temporales Alojados con Constructor Visual e IA
Herramientas

Graph Compose: Flujos de Trabajo Temporales Alojados con Constructor Visual e IA

Graph Compose es una plataforma alojada para orquestar flujos de trabajo de API en Temporal, que te permite definir flujos de trabajo como gráficos JSON con tres métodos de construcción: un constructor visual React Flow, un SDK de TypeScript y un asistente de IA que convierte inglés simple en gráficos.

OpenClawRadar
Session Inspector para Claude Code proporciona visibilidad en tiempo real de las operaciones de agentes de IA.
Herramientas

Session Inspector para Claude Code proporciona visibilidad en tiempo real de las operaciones de agentes de IA.

Vibeyard, un IDE de terminal de código abierto que envuelve Claude Code, ha añadido una función de Inspector de Sesión que proporciona visibilidad en tiempo real de las sesiones de Claude Code con seguimiento de línea de tiempo, desglose de costos, análisis de herramientas y monitoreo de ventana de contexto.

OpenClawRadar