Qwen 3.6 27B atteint une vitesse 2,5x avec le décodage spéculatif MTP sur llama.cpp

✍️ OpenClawRadar📅 Publié: May 6, 2026🔗 Source
Qwen 3.6 27B atteint une vitesse 2,5x avec le décodage spéculatif MTP sur llama.cpp
Ad

Un utilisateur de Reddit a compilé llama.cpp avec une PR en attente (#22673) qui active la prédiction multi-tokens (MTP) pour Qwen 3.6 27B. MTP utilise les couches de tenseurs intégrées du modèle pour le décodage spéculatif, revendiquant une accélération de 2,5x — passant d'environ 11 tok/s à 28 tok/s sur un Mac M2 Max 96 Go.

Détails clés

  • Modèle : Qwen 3.6 27B (variante d'architecture Qwen2.5-3.0)
  • Matériel testé : Mac M2 Max 96 Go
  • Résultats : 28 tok/s avec MTP (contre ~11 tok/s sans)
  • Support de contexte : Jusqu'à 262K tokens avec cache KV turbo4 sur Mac 48 Go
  • Quantifications : Quants GGUF pré-convertis téléchargés par l'utilisateur sur froggeric/Qwen3.6-27B-MTP-GGUF

Instructions de compilation

git clone --depth 1 https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/22673/head:mtp-pr && git checkout mtp-pr
cmake -B build -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --target llama-cli llama-server
Ad

Commande serveur

llama-server -m Qwen3.6-27B-Q5_K_M-mtp.gguf \
  --mmproj mmproj-Qwen3.6-27B-f16.gguf \
  --spec-type mtp --spec-draft-n-max 5 \
  --cache-type-k turbo4 --cache-type-v turbo4 \
  -c 262144 --temp 0.7 --top-k 20 -ngl 99 --port 8081

Trois optimisations combinées :

  • --spec-type mtp --spec-draft-n-max 5 : active le décodage spéculatif MTP (2,5x plus rapide)
  • --cache-type-k turbo4 --cache-type-v turbo4 : cache KV 4,25 bits (mémoire réduite au quart par rapport au 16 bits)
  • -c 262144 : fenêtre de contexte de 262K (tient dans 48 Go avec turbo4)

Recommandations matérielles

Des tableaux de quantification/cache KV pour Apple Silicon et GPU NVIDIA sont fournis dans la source pour les configurations à mémoire limitée (par exemple, IQ2_M sur Apple Silicon 16 Go avec contexte 48K). Le support vision (mmproj) est disponible sur les configurations 32 Go et plus.

Correctifs supplémentaires

L'utilisateur a également publié 7 correctifs pour le modèle de chat jinja de Qwen qui étaient cassés en raison d'un formatage spécifique à vLLM. Ils sont désormais compatibles avec llama.cpp et d'autres outils.

Note : Les fichiers GGUF existants sur Hugging Face n'incluent pas le support MTP — ils nécessitent une reconversion avec la PR appliquée. L'utilisateur prévient que les premiers téléchargements sont incomplets ; vérifiez l'état du dépôt Hugging Face.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

FR: Toolport : Une passerelle locale pour gérer les serveurs MCP une fois pour toutes les applications
Tools

FR: Toolport : Une passerelle locale pour gérer les serveurs MCP une fois pour toutes les applications

Toolport est une application de bureau gratuite et open source qui centralise les configurations des serveurs MCP, stocke les clés API dans le trousseau du système d'exploitation et ajoute des couches de sécurité pour les agents IA.

OpenClawRadar
Vigil : Un système d'identification cryptographique pour les agents OpenClaw afin de prévenir le blocage
Tools

Vigil : Un système d'identification cryptographique pour les agents OpenClaw afin de prévenir le blocage

Un développeur exécutant des agents OpenClaw a identifié que le trafic anonyme des agents est de plus en plus bloqué par les sites, et propose Vigil—un système de connexion qui donne aux agents des identifiants cryptographiques pour construire une réputation et éviter les blocages indiscriminés.

OpenClawRadar
Paseo : Interface Open Source pour Claude Code, Codex, Copilot, OpenCode et Pi Agents
Tools

Paseo : Interface Open Source pour Claude Code, Codex, Copilot, OpenCode et Pi Agents

Paseo est une interface auto-hébergée qui exécute les agents Claude Code, Codex, Copilot, OpenCode et Pi en parallèle. Avec contrôle vocal, accès multi-appareils et CLI. Pas de télémétrie, pas de connexion forcée.

OpenClawRadar
Un sorcier gratuit migre l'historique de ChatGPT vers les projets Claude — Leçons clés sur les limites de jetons et la RAG
Tools

Un sorcier gratuit migre l'historique de ChatGPT vers les projets Claude — Leçons clés sur les limites de jetons et la RAG

Un outil gratuit, sans code, importe les exports ChatGPT dans les Projets Claude, révélant qu'un JSON de 26 Mo atteint les limites de tokens et que la division par sujet est la solution. Le RAG de Claude ne lit que des parties des fichiers volumineux, donc les requêtes spécifiques fonctionnent mieux.

OpenClawRadar