Qwen3.6 27B et 35B sur vLLM : Résultats de réglage sur une seule Radeon R9700

✍️ OpenClawRadar📅 Publié: August 9, 2026🔗 Source
Ad

Un post sur r/LocalLLaMA explique comment exécuter Qwen3.6 27B (dense) et 35B (MoE) sur une seule Radeon AI Pro R9700 en utilisant vLLM Radiance via Podman. L'auteur partage sa configuration exacte et ses résultats de benchmark, particulièrement utiles pour les utilisateurs de GPU AMD.

Configuration et différences clés

Ils utilisent le conteneur stilldeadcode/vllm-radiance:0.5.8, qui inclut une configuration de référence optimisée pour des poids FP8 sur deux R9700 avec parallélisme tensoriel (TP=2). Pour une seule carte avec des poids INT4, les modifications suivantes sont nécessaires :

  • --tensor-parallel-size 1 (pas de seconde carte)
  • --gpu-memory-utilization 0.98 (la référence était de 0,90 à 0,97)
  • num_speculative_tokens=4 sur le 27B — testé avec des échelles de 2/3/4/8, 4 l'emportant de 17 à 48% sur 8 à toutes les profondeurs

Les poids sont Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). Le 35B en FP8 ne tient tout simplement pas sur une carte de 32 Go à des longueurs de contexte utiles.

Correction critique : tokenizer.json

Le dépôt INT4 d'Avesed fournit un tokenizer.json avec truncation.max_length défini sur 512 et padding comme Fixed(512) — probablement issu de la calibration. Cela casse la vision au-dessus d'environ 672 px. Le correctif : définir les deux sur null.

Ad

Résultats des benchmarks

35B-A3B MoE (tokens du pool KV = 440 241)

ProfondeurPréremplissage tok/sDécodage tok/s
4k~7 80061,4
16k~7 70060,1
50k~6 04057,0
78k~5 12054,7
100k~4 58052,9
150k~3 69049,5

27B dense, MTP spec=4 (tokens du pool KV = 212 147)

ProfondeurPréremplissage tok/sDécodage tok/sLongueur acceptée moyenne
4k~1 28859,64,4
16k~1 34562,34,6
50k~1 20759,64,5
100k~1 02753,74,5

Notable : le 35B MoE atteint un débit de préremplissage bien plus élevé (jusqu'à 7,8k tok/s contre 1,3k) mais des vitesses de décodage similaires. La spéculation MTP du 27B donne une longueur acceptée d'environ 4,5 tokens.

C'est une configuration pratique pour les utilisateurs AMD qui n'ont pas de double GPU et souhaitent exécuter ces modèles localement. L'auteur est prêt à fournir des scripts de démarrage sur demande.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Résultats des tests A/B : Les hooks oh-my-claudecode montrent un impact minimal sur les performances de Claude Code.
Tools

Résultats des tests A/B : Les hooks oh-my-claudecode montrent un impact minimal sur les performances de Claude Code.

Un développeur a dépensé 7 % de ses jetons hebdomadaires Max20 pour tester les crochets oh-my-claudecode avec Claude Sonnet 4.6, sans constater d'amélioration significative de la qualité du code ou du coût pour une tâche de programmation en session unique.

OpenClawRadar
Claude AI classe chaque startup YC Spring 2026 — Détails complets du pipeline
Tools

Claude AI classe chaque startup YC Spring 2026 — Détails complets du pipeline

Un utilisateur de Reddit a utilisé Claude pour analyser toutes les startups du YC Spring 2026, en exploitant LinkedIn et la presse pour leur attribuer des notes de S à D. La plupart ont obtenu B ou C.

OpenClawRadar
lazyclaude : Une interface utilisateur en terminal pour gérer la configuration du code Claude
Tools

lazyclaude : Une interface utilisateur en terminal pour gérer la configuration du code Claude

lazyclaude est un outil d'interface utilisateur en terminal inspiré de lazygit qui offre une vue unique pour gérer toute la configuration de Claude Code stockée sur disque, incluant les fichiers de mémoire, compétences, agents, serveurs MCP, paramètres, permissions, hooks, raccourcis clavier, sessions, statistiques, plugins et tâches.

OpenClawRadar
Crochet de notation de confiance open-source pour Claude Code surveille les sessions, bloque les chemins protégés
Tools

Crochet de notation de confiance open-source pour Claude Code surveille les sessions, bloque les chemins protégés

Un développeur a créé un crochet Python qui évalue chaque session Claude Code sur les dimensions de fiabilité, portée et coût, bloque l'accès aux chemins protégés comme les fichiers .env, et enchaîne les événements par hachage pour détecter les falsifications. L'outil en un seul fichier est disponible sur GitHub.

OpenClawRadar