Qwen 3.6 27B alcança velocidade 2,5x com decodificação especulativa MTP no llama.cpp

✍️ OpenClawRadar📅 Publicado: May 6, 2026🔗 Source
Qwen 3.6 27B alcança velocidade 2,5x com decodificação especulativa MTP no llama.cpp
Ad

Um usuário do Reddit compilou o llama.cpp com um PR pendente (#22673) que habilita a Predição Múltipla de Tokens (MTP) para o Qwen 3.6 27B. O MTP usa as camadas tensoriais internas do modelo para decodificação especulativa, alegando um speedup de 2,5x — de ~11 tok/s para 28 tok/s em um Mac M2 Max 96GB.

Detalhes Principais

  • Modelo: Qwen 3.6 27B (variante da arquitetura Qwen2.5-3.0)
  • Hardware testado: Mac M2 Max 96GB
  • Resultados: 28 tok/s com MTP (vs ~11 tok/s sem)
  • Suporte a contexto: Até 262K tokens com cache KV turbo4 em Mac de 48GB
  • Quantizações: GGUF quants pré-convertidos enviados pelo usuário em froggeric/Qwen3.6-27B-MTP-GGUF

Instruções de Compilação

git clone --depth 1 https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/22673/head:mtp-pr && git checkout mtp-pr
cmake -B build -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --target llama-cli llama-server
Ad

Comando do Servidor

llama-server -m Qwen3.6-27B-Q5_K_M-mtp.gguf \
  --mmproj mmproj-Qwen3.6-27B-f16.gguf \
  --spec-type mtp --spec-draft-n-max 5 \
  --cache-type-k turbo4 --cache-type-v turbo4 \
  -c 262144 --temp 0.7 --top-k 20 -ngl 99 --port 8081

Três otimizações combinadas:

  • --spec-type mtp --spec-draft-n-max 5: ativa decodificação especulativa MTP (2,5x mais rápido)
  • --cache-type-k turbo4 --cache-type-v turbo4: cache KV de 4,25 bits (memória reduzida a 1/4 em comparação com 16 bits)
  • -c 262144: janela de contexto de 262K (cabe em 48GB com turbo4)

Recomendações de Hardware

Tabelas de quantização e cache KV para Apple Silicon e GPU NVIDIA são fornecidas na fonte para configurações com pouca RAM (ex.: IQ2_M em Apple Silicon de 16GB com contexto de 48K). Suporte a visão (mmproj) está disponível em configurações de 32GB+.

Correções Adicionais

O usuário também publicou 7 correções para o template de chat jinja do Qwen que estavam quebrados devido à formatação específica do vLLM. Agora são compatíveis com llama.cpp e outras ferramentas.

Nota: Os arquivos GGUF existentes no Hugging Face não incluem suporte a MTP — eles exigem reconversão com o PR aplicado. O usuário alerta que os uploads iniciais estão incompletos; verifique o status do repositório no Hugging Face.

📖 Leia a fonte original: r/LocalLLaMA

Ad

👀 See Also

Explorando Interações API-para-API: Um Olhar Mais Atento sobre Automação
Tools

Explorando Interações API-para-API: Um Olhar Mais Atento sobre Automação

Uma discussão recente no Reddit explora as complexidades das chamadas telefônicas de API para API, focando na implementação prática e nos desafios potenciais usando ferramentas como Postman e Twilio.

OpenClawRadar
Suporte do MCP Integrado ao llama.cpp com Novos Recursos de Interface Web
Tools

Suporte do MCP Integrado ao llama.cpp com Novos Recursos de Interface Web

O pull request do Model Context Protocol (MCP) para o llama.cpp foi mesclado, adicionando suporte ao MCP, chamadas de ferramentas, um loop agentivo e um seletor de servidor ao lado do llama-server/WebUI.

OpenClawRadar
mcp-optimizer reduz o desperdício de tokens de servidores MCP ociosos no Claude Code
Tools

mcp-optimizer reduz o desperdício de tokens de servidores MCP ociosos no Claude Code

mcp-optimizer é um plugin que aborda o desperdício de tokens de servidores MCP no Claude Code, analisando o uso de ferramentas e gerando configurações otimizadas. Inclui quatro utilitários: mcp-doctor para verificar a saúde dos servidores, mcp-audit para análise de uso, mcp-optimize para criar configurações locais do projeto e mcp-to-skills para converter ferramentas em Skills sob demanda.

OpenClawRadar
Pali v0.1: Infraestrutura de Memória de Código Aberto para LLMs com Benchmarks Reproduzíveis
Tools

Pali v0.1: Infraestrutura de Memória de Código Aberto para LLMs com Benchmarks Reproduzíveis

Pali é uma infraestrutura de memória de código aberto para LLMs construída em Go como um único binário com APIs multi-inquilino, recuperação híbrida e extensões plug-and-play. A versão v0.1 inclui um conjunto de benchmarks com resultados reproduzíveis mostrando métricas de desempenho para diferentes configurações.

OpenClawRadar