Qwen3.6 27B et 35B sur vLLM : Résultats de réglage sur une seule Radeon R9700

✍️ OpenClawRadar📅 Publié: August 9, 2026🔗 Source
Ad

Un post sur r/LocalLLaMA explique comment exécuter Qwen3.6 27B (dense) et 35B (MoE) sur une seule Radeon AI Pro R9700 en utilisant vLLM Radiance via Podman. L'auteur partage sa configuration exacte et ses résultats de benchmark, particulièrement utiles pour les utilisateurs de GPU AMD.

Configuration et différences clés

Ils utilisent le conteneur stilldeadcode/vllm-radiance:0.5.8, qui inclut une configuration de référence optimisée pour des poids FP8 sur deux R9700 avec parallélisme tensoriel (TP=2). Pour une seule carte avec des poids INT4, les modifications suivantes sont nécessaires :

  • --tensor-parallel-size 1 (pas de seconde carte)
  • --gpu-memory-utilization 0.98 (la référence était de 0,90 à 0,97)
  • num_speculative_tokens=4 sur le 27B — testé avec des échelles de 2/3/4/8, 4 l'emportant de 17 à 48% sur 8 à toutes les profondeurs

Les poids sont Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). Le 35B en FP8 ne tient tout simplement pas sur une carte de 32 Go à des longueurs de contexte utiles.

Correction critique : tokenizer.json

Le dépôt INT4 d'Avesed fournit un tokenizer.json avec truncation.max_length défini sur 512 et padding comme Fixed(512) — probablement issu de la calibration. Cela casse la vision au-dessus d'environ 672 px. Le correctif : définir les deux sur null.

Ad

Résultats des benchmarks

35B-A3B MoE (tokens du pool KV = 440 241)

ProfondeurPréremplissage tok/sDécodage tok/s
4k~7 80061,4
16k~7 70060,1
50k~6 04057,0
78k~5 12054,7
100k~4 58052,9
150k~3 69049,5

27B dense, MTP spec=4 (tokens du pool KV = 212 147)

ProfondeurPréremplissage tok/sDécodage tok/sLongueur acceptée moyenne
4k~1 28859,64,4
16k~1 34562,34,6
50k~1 20759,64,5
100k~1 02753,74,5

Notable : le 35B MoE atteint un débit de préremplissage bien plus élevé (jusqu'à 7,8k tok/s contre 1,3k) mais des vitesses de décodage similaires. La spéculation MTP du 27B donne une longueur acceptée d'environ 4,5 tokens.

C'est une configuration pratique pour les utilisateurs AMD qui n'ont pas de double GPU et souhaitent exécuter ces modèles localement. L'auteur est prêt à fournir des scripts de démarrage sur demande.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Mesure de la pile MCP de Claude Code : convivialité du cache vs économies d'octets, et une correction en 2 lignes pour le cache de prompt
Tools

Mesure de la pile MCP de Claude Code : convivialité du cache vs économies d'octets, et une correction en 2 lignes pour le cache de prompt

Greg Shevchenko évalue les compresseurs MCP et les couches de récupération sur deux axes : économie d'octets et adaptabilité au cache. Un correctif de deux lignes (trier les résultats de rg, trier les entrées de Map) fait passer le cache d'environ 0 % à 100 % sans perte d'économies d'octets. Harness open source inclus.

OpenClawRadar
Exécution d'OpenClaw et de Codex CLI en mode natif sur Android via l'APK AnyClaw
Tools

Exécution d'OpenClaw et de Codex CLI en mode natif sur Android via l'APK AnyClaw

Un développeur a empaqueté OpenClaw et Codex CLI dans un APK Android nommé AnyClaw, permettant à la passerelle et à l'interface de contrôle de fonctionner localement sur les appareils Android ARM64 7.0+ sans root. Le projet a nécessité la compilation des dépendances à partir des sources et le correctif de plusieurs composants pour gérer les contraintes spécifiques à Android.

OpenClawRadar
Guilde OpenClaw : Serveur d'agents IA multi-utilisateurs pour les équipes
Tools

Guilde OpenClaw : Serveur d'agents IA multi-utilisateurs pour les équipes

OpenClaw Guild étend OpenClaw mono-utilisateur en un serveur d'IA multi-utilisateurs avec contrôle d'accès basé sur les rôles, des données isolées par agent et un système de mémoire à 4 niveaux. Il comprend un tableau de bord d'administration web et un déploiement Docker-compose pour une installation en 15 minutes.

OpenClawRadar
molequla : Organisme d'IA à Apprentissage Continu Construit à Partir de Zéro avec ClaudeCode
Tools

molequla : Organisme d'IA à Apprentissage Continu Construit à Partir de Zéro avec ClaudeCode

molequla est un organisme d'IA à apprentissage continu implémenté à partir de zéro en Go, C, JavaScript et Rust avec un orchestrateur Python. Chaque élément est une implémentation complète de transformateur avec autograd vectoriel, entraîné sur du texte brut, qui grandit et développe une personnalité au fil du temps.

OpenClawRadar