Configuration de Qwen3.5-27B en local : Comparaison entre vLLM et llama.cpp

✍️ OpenClawRadar📅 Publié: March 15, 2026🔗 Source
Configuration de Qwen3.5-27B en local : Comparaison entre vLLM et llama.cpp
Ad

Performances et capacités de Qwen3.5-27B

Le modèle Qwen3.5-27B démontre de solides performances dans divers benchmarks selon la source : MMLU-Pro : 85,3, MMLU-Redux : 93,3, C-Eval : 90,2, score d'intelligence globale : 42,1 (meilleur que 91 % des modèles comparés), et indice de codage : 34,9 (dépasse 88 % en capacités de codage). Le modèle présente une architecture dense avec un contexte natif de 262k extensible à plus de 1 million de tokens.

Comparaison des backends : llama.cpp vs vLLM

La source compare deux approches principales pour le déploiement local :

Option 1 : llama.cpp

  • Avantages : Faible empreinte, configuration facile, prend en charge le cache KV q4 pour une utilisation raisonnable de la VRAM
  • Inconvénients : Problème majeur avec le cache KV qui s'efface aléatoirement, forçant un retraitement complet du prompt en milieu de session. Le décodage spéculatif via MTP ne fonctionne pas. Bogue connu sans correctifs solides pour l'instant.

Option 2 : vLLM

  • Avantages : Sessions stables, pas d'effacement du cache KV, prend en charge le décodage spéculatif avec MTP pour des générations plus rapides
  • Inconvénients : Pas de support du cache KV q4, donc pics de VRAM à 256k de contexte. L'analyse des appels d'outils est boguée pour Qwen3.5 dans v0.17.1, avec des correctifs dans des PR GitHub ouvertes mais pas encore fusionnées. Cela casse les flux de codage agentique avec des sorties JSON mal formées.
Ad

Configuration recommandée pour vLLM

La source fournit des recommandations de configuration spécifiques pour des exécutions stables et rapides en utilisant le modèle de HF : osoleve/Qwen3.5-27B-Text-NVFP4-MTP :

  • Utiliser le backend flashinfer cutlass pour des performances optimisées
  • Définir la fenêtre de contexte à 128k (équilibre entre VRAM et utilisabilité ; augmenter à 256k si le matériel le permet)
  • Limiter l'utilisation du GPU à 0,82 pour éviter les plantages par manque de mémoire
  • Définir max-num-seq à 2 (gère une seule session correctement sans surallocation)
  • Activer le décodage spéculatif MTP pour des améliorations de vitesse
  • Patcher vLLM avec les correctifs d'analyse des appels d'outils Qwen des PR ouvertes
  • Utiliser Claude code cli - le code ouvert a toujours des problèmes d'analyse des appels d'outils qui n'apparaissent pas sur Claude code après le patch

Résultats de performances

Selon la source, les performances varient selon le matériel :

  • Sur un RTX 5090 (32 Go de VRAM) : ~50 TPS
  • Sur un RTX Pro 6000 (96 Go de VRAM) : 70 TPS à plein contexte 256k

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Cartes explicatives interactives : conceptions de boucle d’agent Claude Code, des appels uniques aux invites auto-mutantes
Guides

Cartes explicatives interactives : conceptions de boucle d’agent Claude Code, des appels uniques aux invites auto-mutantes

Un site interactif construit avec Opus 4.7 visualise 11 designs réels de boucles d'agent pour Claude Code, des appels de base aux agents qui réécrivent leurs propres invites, avec des animations SVG montrant la mémoire et les mécanismes des boucles.

OpenClawRadar
Checklist de configuration Claude en 72 étapes : de l'utilisateur par défaut à l'expert
Guides

Checklist de configuration Claude en 72 étapes : de l'utilisateur par défaut à l'expert

Un article détaillé sur Medium présente une checklist en 72 étapes pour configurer Claude, passant des paramètres par défaut aux fonctionnalités avancées de power-user. Partagé sur HN avec 10 points et 1 commentaire.

OpenClawRadar
🦀
Guides

Compilation JIT de code en 5μs : construction d'un JIT rapide pour Postgres pgrust

Le compilateur JIT de pgrust compile les requêtes SQL en environ 5μs, permettant la compilation JIT pour chaque requête. L'auteur explique comment le ciblage d'assembleur assisté par IA rend la compilation JIT rapide pratique.

OpenClawRadar
Mise à l'échelle du codage agentique à plus de 150 PR/semaine : leçons tirées de 85 000 $ de jetons chez Lovable
Guides

Mise à l'échelle du codage agentique à plus de 150 PR/semaine : leçons tirées de 85 000 $ de jetons chez Lovable

Alexander Lebedev raconte comment il est passé de 20 à 30 PR/semaine avec un humain à plus de 150 PR/semaine avec une nuée d'agents IA, dépensant 85 000 $ en tokens depuis janvier. Principaux enseignements : classification des risques, revue IA remplaçant la revue humaine, et le défi de préserver la diffusion des connaissances.

OpenClawRadar