Qwen 3.6 27B alcança velocidade 2,5x com decodificação especulativa MTP no llama.cpp

Um usuário do Reddit compilou o llama.cpp com um PR pendente (#22673) que habilita a Predição Múltipla de Tokens (MTP) para o Qwen 3.6 27B. O MTP usa as camadas tensoriais internas do modelo para decodificação especulativa, alegando um speedup de 2,5x — de ~11 tok/s para 28 tok/s em um Mac M2 Max 96GB.
Detalhes Principais
- Modelo: Qwen 3.6 27B (variante da arquitetura Qwen2.5-3.0)
- Hardware testado: Mac M2 Max 96GB
- Resultados: 28 tok/s com MTP (vs ~11 tok/s sem)
- Suporte a contexto: Até 262K tokens com cache KV turbo4 em Mac de 48GB
- Quantizações: GGUF quants pré-convertidos enviados pelo usuário em
froggeric/Qwen3.6-27B-MTP-GGUF
Instruções de Compilação
git clone --depth 1 https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/22673/head:mtp-pr && git checkout mtp-pr
cmake -B build -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --target llama-cli llama-serverComando do Servidor
llama-server -m Qwen3.6-27B-Q5_K_M-mtp.gguf \
--mmproj mmproj-Qwen3.6-27B-f16.gguf \
--spec-type mtp --spec-draft-n-max 5 \
--cache-type-k turbo4 --cache-type-v turbo4 \
-c 262144 --temp 0.7 --top-k 20 -ngl 99 --port 8081Três otimizações combinadas:
--spec-type mtp --spec-draft-n-max 5: ativa decodificação especulativa MTP (2,5x mais rápido)--cache-type-k turbo4 --cache-type-v turbo4: cache KV de 4,25 bits (memória reduzida a 1/4 em comparação com 16 bits)-c 262144: janela de contexto de 262K (cabe em 48GB com turbo4)
Recomendações de Hardware
Tabelas de quantização e cache KV para Apple Silicon e GPU NVIDIA são fornecidas na fonte para configurações com pouca RAM (ex.: IQ2_M em Apple Silicon de 16GB com contexto de 48K). Suporte a visão (mmproj) está disponível em configurações de 32GB+.
Correções Adicionais
O usuário também publicou 7 correções para o template de chat jinja do Qwen que estavam quebrados devido à formatação específica do vLLM. Agora são compatíveis com llama.cpp e outras ferramentas.
Nota: Os arquivos GGUF existentes no Hugging Face não incluem suporte a MTP — eles exigem reconversão com o PR aplicado. O usuário alerta que os uploads iniciais estão incompletos; verifique o status do repositório no Hugging Face.
📖 Leia a fonte original: r/LocalLLaMA
👀 See Also

Explorando Interações API-para-API: Um Olhar Mais Atento sobre Automação
Uma discussão recente no Reddit explora as complexidades das chamadas telefônicas de API para API, focando na implementação prática e nos desafios potenciais usando ferramentas como Postman e Twilio.

Suporte do MCP Integrado ao llama.cpp com Novos Recursos de Interface Web
O pull request do Model Context Protocol (MCP) para o llama.cpp foi mesclado, adicionando suporte ao MCP, chamadas de ferramentas, um loop agentivo e um seletor de servidor ao lado do llama-server/WebUI.

mcp-optimizer reduz o desperdício de tokens de servidores MCP ociosos no Claude Code
mcp-optimizer é um plugin que aborda o desperdício de tokens de servidores MCP no Claude Code, analisando o uso de ferramentas e gerando configurações otimizadas. Inclui quatro utilitários: mcp-doctor para verificar a saúde dos servidores, mcp-audit para análise de uso, mcp-optimize para criar configurações locais do projeto e mcp-to-skills para converter ferramentas em Skills sob demanda.

Pali v0.1: Infraestrutura de Memória de Código Aberto para LLMs com Benchmarks Reproduzíveis
Pali é uma infraestrutura de memória de código aberto para LLMs construída em Go como um único binário com APIs multi-inquilino, recuperação híbrida e extensões plug-and-play. A versão v0.1 inclui um conjunto de benchmarks com resultados reproduzíveis mostrando métricas de desempenho para diferentes configurações.