Qwen3.6 27B et 35B sur vLLM : Résultats de réglage sur une seule Radeon R9700
Un post sur r/LocalLLaMA explique comment exécuter Qwen3.6 27B (dense) et 35B (MoE) sur une seule Radeon AI Pro R9700 en utilisant vLLM Radiance via Podman. L'auteur partage sa configuration exacte et ses résultats de benchmark, particulièrement utiles pour les utilisateurs de GPU AMD.
Configuration et différences clés
Ils utilisent le conteneur stilldeadcode/vllm-radiance:0.5.8, qui inclut une configuration de référence optimisée pour des poids FP8 sur deux R9700 avec parallélisme tensoriel (TP=2). Pour une seule carte avec des poids INT4, les modifications suivantes sont nécessaires :
--tensor-parallel-size 1(pas de seconde carte)--gpu-memory-utilization 0.98(la référence était de 0,90 à 0,97)num_speculative_tokens=4sur le 27B — testé avec des échelles de 2/3/4/8, 4 l'emportant de 17 à 48% sur 8 à toutes les profondeurs
Les poids sont Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). Le 35B en FP8 ne tient tout simplement pas sur une carte de 32 Go à des longueurs de contexte utiles.
Correction critique : tokenizer.json
Le dépôt INT4 d'Avesed fournit un tokenizer.json avec truncation.max_length défini sur 512 et padding comme Fixed(512) — probablement issu de la calibration. Cela casse la vision au-dessus d'environ 672 px. Le correctif : définir les deux sur null.
Résultats des benchmarks
35B-A3B MoE (tokens du pool KV = 440 241)
| Profondeur | Préremplissage tok/s | Décodage tok/s |
|---|---|---|
| 4k | ~7 800 | 61,4 |
| 16k | ~7 700 | 60,1 |
| 50k | ~6 040 | 57,0 |
| 78k | ~5 120 | 54,7 |
| 100k | ~4 580 | 52,9 |
| 150k | ~3 690 | 49,5 |
27B dense, MTP spec=4 (tokens du pool KV = 212 147)
| Profondeur | Préremplissage tok/s | Décodage tok/s | Longueur acceptée moyenne |
|---|---|---|---|
| 4k | ~1 288 | 59,6 | 4,4 |
| 16k | ~1 345 | 62,3 | 4,6 |
| 50k | ~1 207 | 59,6 | 4,5 |
| 100k | ~1 027 | 53,7 | 4,5 |
Notable : le 35B MoE atteint un débit de préremplissage bien plus élevé (jusqu'à 7,8k tok/s contre 1,3k) mais des vitesses de décodage similaires. La spéculation MTP du 27B donne une longueur acceptée d'environ 4,5 tokens.
C'est une configuration pratique pour les utilisateurs AMD qui n'ont pas de double GPU et souhaitent exécuter ces modèles localement. L'auteur est prêt à fournir des scripts de démarrage sur demande.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Mesure de la pile MCP de Claude Code : convivialité du cache vs économies d'octets, et une correction en 2 lignes pour le cache de prompt
Greg Shevchenko évalue les compresseurs MCP et les couches de récupération sur deux axes : économie d'octets et adaptabilité au cache. Un correctif de deux lignes (trier les résultats de rg, trier les entrées de Map) fait passer le cache d'environ 0 % à 100 % sans perte d'économies d'octets. Harness open source inclus.

Exécution d'OpenClaw et de Codex CLI en mode natif sur Android via l'APK AnyClaw
Un développeur a empaqueté OpenClaw et Codex CLI dans un APK Android nommé AnyClaw, permettant à la passerelle et à l'interface de contrôle de fonctionner localement sur les appareils Android ARM64 7.0+ sans root. Le projet a nécessité la compilation des dépendances à partir des sources et le correctif de plusieurs composants pour gérer les contraintes spécifiques à Android.

Guilde OpenClaw : Serveur d'agents IA multi-utilisateurs pour les équipes
OpenClaw Guild étend OpenClaw mono-utilisateur en un serveur d'IA multi-utilisateurs avec contrôle d'accès basé sur les rôles, des données isolées par agent et un système de mémoire à 4 niveaux. Il comprend un tableau de bord d'administration web et un déploiement Docker-compose pour une installation en 15 minutes.

molequla : Organisme d'IA à Apprentissage Continu Construit à Partir de Zéro avec ClaudeCode
molequla est un organisme d'IA à apprentissage continu implémenté à partir de zéro en Go, C, JavaScript et Rust avec un orchestrateur Python. Chaque élément est une implémentation complète de transformateur avec autograd vectoriel, entraîné sur du texte brut, qui grandit et développe une personnalité au fil du temps.