Qwen 3.6 27B atteint une vitesse 2,5x avec le décodage spéculatif MTP sur llama.cpp

Un utilisateur de Reddit a compilé llama.cpp avec une PR en attente (#22673) qui active la prédiction multi-tokens (MTP) pour Qwen 3.6 27B. MTP utilise les couches de tenseurs intégrées du modèle pour le décodage spéculatif, revendiquant une accélération de 2,5x — passant d'environ 11 tok/s à 28 tok/s sur un Mac M2 Max 96 Go.
Détails clés
- Modèle : Qwen 3.6 27B (variante d'architecture Qwen2.5-3.0)
- Matériel testé : Mac M2 Max 96 Go
- Résultats : 28 tok/s avec MTP (contre ~11 tok/s sans)
- Support de contexte : Jusqu'à 262K tokens avec cache KV turbo4 sur Mac 48 Go
- Quantifications : Quants GGUF pré-convertis téléchargés par l'utilisateur sur
froggeric/Qwen3.6-27B-MTP-GGUF
Instructions de compilation
git clone --depth 1 https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/22673/head:mtp-pr && git checkout mtp-pr
cmake -B build -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --target llama-cli llama-serverCommande serveur
llama-server -m Qwen3.6-27B-Q5_K_M-mtp.gguf \
--mmproj mmproj-Qwen3.6-27B-f16.gguf \
--spec-type mtp --spec-draft-n-max 5 \
--cache-type-k turbo4 --cache-type-v turbo4 \
-c 262144 --temp 0.7 --top-k 20 -ngl 99 --port 8081Trois optimisations combinées :
--spec-type mtp --spec-draft-n-max 5: active le décodage spéculatif MTP (2,5x plus rapide)--cache-type-k turbo4 --cache-type-v turbo4: cache KV 4,25 bits (mémoire réduite au quart par rapport au 16 bits)-c 262144: fenêtre de contexte de 262K (tient dans 48 Go avec turbo4)
Recommandations matérielles
Des tableaux de quantification/cache KV pour Apple Silicon et GPU NVIDIA sont fournis dans la source pour les configurations à mémoire limitée (par exemple, IQ2_M sur Apple Silicon 16 Go avec contexte 48K). Le support vision (mmproj) est disponible sur les configurations 32 Go et plus.
Correctifs supplémentaires
L'utilisateur a également publié 7 correctifs pour le modèle de chat jinja de Qwen qui étaient cassés en raison d'un formatage spécifique à vLLM. Ils sont désormais compatibles avec llama.cpp et d'autres outils.
Note : Les fichiers GGUF existants sur Hugging Face n'incluent pas le support MTP — ils nécessitent une reconversion avec la PR appliquée. L'utilisateur prévient que les premiers téléchargements sont incomplets ; vérifiez l'état du dépôt Hugging Face.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Cortex v1.2 ajoute l'enrichissement par LLM, les questions-réponses avec citations et la résolution de conflits.
Cortex, une couche de mémoire locale pour les agents OpenClaw, a publié la version 1.2 avec un enrichissement augmenté par LLM activé par défaut, une commande de questions-réponses avec citations, ainsi qu'une déduplication et une résolution de conflits améliorées. L'outil inclut désormais une gestion de configuration unifiée et un pré-filtrage de recherche basé sur l'intention.

InsAIts Runtime Security Monitor for Claude Code Atteint 8 000 Téléchargements sur PyPI
InsAIts, un moniteur de sécurité d'exécution pour les sessions d'agent Claude Code, a atteint 8 140 téléchargements totaux sur PyPI. La version 3.4.0 ajoute un Gestionnaire de Contexte Adaptatif, un système d'injection d'ancres en couches et des améliorations du tableau de bord.

Configuration iTerm2 à 4 Panneaux pour CLI Code Claude Séparant les Rôles d'IA
Un développeur a créé une configuration de terminal iTerm2 à quatre volets spécifiquement pour Claude Code CLI pour résoudre la dérive de contexte et le biais d'auto-évaluation. Chaque volet est verrouillé sur un rôle spécifique avec des modèles et des autorisations dédiés.

Exploration de Mistral Voxtral Realtime 4B en C pur pour la reconnaissance vocale
Voxtral.c propose une implémentation en C pur pour le modèle de reconnaissance vocale Voxtral Realtime 4B de Mistral AI, éliminant toute dépendance au-delà de la bibliothèque standard C.