Qwen3.6 27B et 35B sur vLLM : Résultats de réglage sur une seule Radeon R9700
Un post sur r/LocalLLaMA explique comment exécuter Qwen3.6 27B (dense) et 35B (MoE) sur une seule Radeon AI Pro R9700 en utilisant vLLM Radiance via Podman. L'auteur partage sa configuration exacte et ses résultats de benchmark, particulièrement utiles pour les utilisateurs de GPU AMD.
Configuration et différences clés
Ils utilisent le conteneur stilldeadcode/vllm-radiance:0.5.8, qui inclut une configuration de référence optimisée pour des poids FP8 sur deux R9700 avec parallélisme tensoriel (TP=2). Pour une seule carte avec des poids INT4, les modifications suivantes sont nécessaires :
--tensor-parallel-size 1(pas de seconde carte)--gpu-memory-utilization 0.98(la référence était de 0,90 à 0,97)num_speculative_tokens=4sur le 27B — testé avec des échelles de 2/3/4/8, 4 l'emportant de 17 à 48% sur 8 à toutes les profondeurs
Les poids sont Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). Le 35B en FP8 ne tient tout simplement pas sur une carte de 32 Go à des longueurs de contexte utiles.
Correction critique : tokenizer.json
Le dépôt INT4 d'Avesed fournit un tokenizer.json avec truncation.max_length défini sur 512 et padding comme Fixed(512) — probablement issu de la calibration. Cela casse la vision au-dessus d'environ 672 px. Le correctif : définir les deux sur null.
Résultats des benchmarks
35B-A3B MoE (tokens du pool KV = 440 241)
| Profondeur | Préremplissage tok/s | Décodage tok/s |
|---|---|---|
| 4k | ~7 800 | 61,4 |
| 16k | ~7 700 | 60,1 |
| 50k | ~6 040 | 57,0 |
| 78k | ~5 120 | 54,7 |
| 100k | ~4 580 | 52,9 |
| 150k | ~3 690 | 49,5 |
27B dense, MTP spec=4 (tokens du pool KV = 212 147)
| Profondeur | Préremplissage tok/s | Décodage tok/s | Longueur acceptée moyenne |
|---|---|---|---|
| 4k | ~1 288 | 59,6 | 4,4 |
| 16k | ~1 345 | 62,3 | 4,6 |
| 50k | ~1 207 | 59,6 | 4,5 |
| 100k | ~1 027 | 53,7 | 4,5 |
Notable : le 35B MoE atteint un débit de préremplissage bien plus élevé (jusqu'à 7,8k tok/s contre 1,3k) mais des vitesses de décodage similaires. La spéculation MTP du 27B donne une longueur acceptée d'environ 4,5 tokens.
C'est une configuration pratique pour les utilisateurs AMD qui n'ont pas de double GPU et souhaitent exécuter ces modèles localement. L'auteur est prêt à fournir des scripts de démarrage sur demande.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

MCP Marketplace lance un répertoire sécurisé de plus de 1 900 plugins d'outils MCP.
MCP Marketplace (mcp-marketplace.io) propose un répertoire axé sur la sécurité de plus de 1 900 serveurs MCP, avec une analyse de sécurité multicouche, un score de risque et une installation en un clic pour Claude Desktop, Cursor, ChatGPT et VS Code.

Graft : les hooks de Claude Code réduisent les jetons grep de 42 %
Graft construit un graphe de connaissances persistant pour les agents de codage, réduisant les appels d'outils de 46 %, les tokens de 42 %, et augmentant l'exactitude SWE-bench de 54 % à 66 %.

Système ACO : Pipeline multi-agents open source du ticket GitHub à la PR fusionnée
ACO System est un framework open source multi-agent qui exécute automatiquement un pipeline logiciel complet — du problème GitHub à la PR fusionnée — en utilisant six agents IA spécialisés. Il dispose d'une porte Architecte déterministe qui bloque les hallucinations.

Cartes-éclair de codage : 800+ cartes Anki pour Rust, SQLite, Godot et langage Wolfram
Plus de 800 flashcards en Markdown couvrant Rust, SQLite, Godot et le langage Wolfram à partir des premiers principes, avec des scripts pour les convertir en decks Anki ou en PDF.