Qwen 3.6 27B atteint une vitesse 2,5x avec le décodage spéculatif MTP sur llama.cpp

✍️ OpenClawRadar📅 Publié: May 6, 2026🔗 Source
Qwen 3.6 27B atteint une vitesse 2,5x avec le décodage spéculatif MTP sur llama.cpp
Ad

Un utilisateur de Reddit a compilé llama.cpp avec une PR en attente (#22673) qui active la prédiction multi-tokens (MTP) pour Qwen 3.6 27B. MTP utilise les couches de tenseurs intégrées du modèle pour le décodage spéculatif, revendiquant une accélération de 2,5x — passant d'environ 11 tok/s à 28 tok/s sur un Mac M2 Max 96 Go.

Détails clés

  • Modèle : Qwen 3.6 27B (variante d'architecture Qwen2.5-3.0)
  • Matériel testé : Mac M2 Max 96 Go
  • Résultats : 28 tok/s avec MTP (contre ~11 tok/s sans)
  • Support de contexte : Jusqu'à 262K tokens avec cache KV turbo4 sur Mac 48 Go
  • Quantifications : Quants GGUF pré-convertis téléchargés par l'utilisateur sur froggeric/Qwen3.6-27B-MTP-GGUF

Instructions de compilation

git clone --depth 1 https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/22673/head:mtp-pr && git checkout mtp-pr
cmake -B build -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --target llama-cli llama-server
Ad

Commande serveur

llama-server -m Qwen3.6-27B-Q5_K_M-mtp.gguf \
  --mmproj mmproj-Qwen3.6-27B-f16.gguf \
  --spec-type mtp --spec-draft-n-max 5 \
  --cache-type-k turbo4 --cache-type-v turbo4 \
  -c 262144 --temp 0.7 --top-k 20 -ngl 99 --port 8081

Trois optimisations combinées :

  • --spec-type mtp --spec-draft-n-max 5 : active le décodage spéculatif MTP (2,5x plus rapide)
  • --cache-type-k turbo4 --cache-type-v turbo4 : cache KV 4,25 bits (mémoire réduite au quart par rapport au 16 bits)
  • -c 262144 : fenêtre de contexte de 262K (tient dans 48 Go avec turbo4)

Recommandations matérielles

Des tableaux de quantification/cache KV pour Apple Silicon et GPU NVIDIA sont fournis dans la source pour les configurations à mémoire limitée (par exemple, IQ2_M sur Apple Silicon 16 Go avec contexte 48K). Le support vision (mmproj) est disponible sur les configurations 32 Go et plus.

Correctifs supplémentaires

L'utilisateur a également publié 7 correctifs pour le modèle de chat jinja de Qwen qui étaient cassés en raison d'un formatage spécifique à vLLM. Ils sont désormais compatibles avec llama.cpp et d'autres outils.

Note : Les fichiers GGUF existants sur Hugging Face n'incluent pas le support MTP — ils nécessitent une reconversion avec la PR appliquée. L'utilisateur prévient que les premiers téléchargements sont incomplets ; vérifiez l'état du dépôt Hugging Face.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Cortex v1.2 ajoute l'enrichissement par LLM, les questions-réponses avec citations et la résolution de conflits.
Tools

Cortex v1.2 ajoute l'enrichissement par LLM, les questions-réponses avec citations et la résolution de conflits.

Cortex, une couche de mémoire locale pour les agents OpenClaw, a publié la version 1.2 avec un enrichissement augmenté par LLM activé par défaut, une commande de questions-réponses avec citations, ainsi qu'une déduplication et une résolution de conflits améliorées. L'outil inclut désormais une gestion de configuration unifiée et un pré-filtrage de recherche basé sur l'intention.

OpenClawRadar
InsAIts Runtime Security Monitor for Claude Code Atteint 8 000 Téléchargements sur PyPI
Tools

InsAIts Runtime Security Monitor for Claude Code Atteint 8 000 Téléchargements sur PyPI

InsAIts, un moniteur de sécurité d'exécution pour les sessions d'agent Claude Code, a atteint 8 140 téléchargements totaux sur PyPI. La version 3.4.0 ajoute un Gestionnaire de Contexte Adaptatif, un système d'injection d'ancres en couches et des améliorations du tableau de bord.

OpenClawRadar
Configuration iTerm2 à 4 Panneaux pour CLI Code Claude Séparant les Rôles d'IA
Tools

Configuration iTerm2 à 4 Panneaux pour CLI Code Claude Séparant les Rôles d'IA

Un développeur a créé une configuration de terminal iTerm2 à quatre volets spécifiquement pour Claude Code CLI pour résoudre la dérive de contexte et le biais d'auto-évaluation. Chaque volet est verrouillé sur un rôle spécifique avec des modèles et des autorisations dédiés.

OpenClawRadar
Exploration de Mistral Voxtral Realtime 4B en C pur pour la reconnaissance vocale
Tools

Exploration de Mistral Voxtral Realtime 4B en C pur pour la reconnaissance vocale

Voxtral.c propose une implémentation en C pur pour le modèle de reconnaissance vocale Voxtral Realtime 4B de Mistral AI, éliminant toute dépendance au-delà de la bibliothèque standard C.

OpenClawRadar