Qwen3.6 27B et 35B sur vLLM : Résultats de réglage sur une seule Radeon R9700
Un post sur r/LocalLLaMA explique comment exécuter Qwen3.6 27B (dense) et 35B (MoE) sur une seule Radeon AI Pro R9700 en utilisant vLLM Radiance via Podman. L'auteur partage sa configuration exacte et ses résultats de benchmark, particulièrement utiles pour les utilisateurs de GPU AMD.
Configuration et différences clés
Ils utilisent le conteneur stilldeadcode/vllm-radiance:0.5.8, qui inclut une configuration de référence optimisée pour des poids FP8 sur deux R9700 avec parallélisme tensoriel (TP=2). Pour une seule carte avec des poids INT4, les modifications suivantes sont nécessaires :
--tensor-parallel-size 1(pas de seconde carte)--gpu-memory-utilization 0.98(la référence était de 0,90 à 0,97)num_speculative_tokens=4sur le 27B — testé avec des échelles de 2/3/4/8, 4 l'emportant de 17 à 48% sur 8 à toutes les profondeurs
Les poids sont Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). Le 35B en FP8 ne tient tout simplement pas sur une carte de 32 Go à des longueurs de contexte utiles.
Correction critique : tokenizer.json
Le dépôt INT4 d'Avesed fournit un tokenizer.json avec truncation.max_length défini sur 512 et padding comme Fixed(512) — probablement issu de la calibration. Cela casse la vision au-dessus d'environ 672 px. Le correctif : définir les deux sur null.
Résultats des benchmarks
35B-A3B MoE (tokens du pool KV = 440 241)
| Profondeur | Préremplissage tok/s | Décodage tok/s |
|---|---|---|
| 4k | ~7 800 | 61,4 |
| 16k | ~7 700 | 60,1 |
| 50k | ~6 040 | 57,0 |
| 78k | ~5 120 | 54,7 |
| 100k | ~4 580 | 52,9 |
| 150k | ~3 690 | 49,5 |
27B dense, MTP spec=4 (tokens du pool KV = 212 147)
| Profondeur | Préremplissage tok/s | Décodage tok/s | Longueur acceptée moyenne |
|---|---|---|---|
| 4k | ~1 288 | 59,6 | 4,4 |
| 16k | ~1 345 | 62,3 | 4,6 |
| 50k | ~1 207 | 59,6 | 4,5 |
| 100k | ~1 027 | 53,7 | 4,5 |
Notable : le 35B MoE atteint un débit de préremplissage bien plus élevé (jusqu'à 7,8k tok/s contre 1,3k) mais des vitesses de décodage similaires. La spéculation MTP du 27B donne une longueur acceptée d'environ 4,5 tokens.
C'est une configuration pratique pour les utilisateurs AMD qui n'ont pas de double GPU et souhaitent exécuter ces modèles localement. L'auteur est prêt à fournir des scripts de démarrage sur demande.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Résultats des tests A/B : Les hooks oh-my-claudecode montrent un impact minimal sur les performances de Claude Code.
Un développeur a dépensé 7 % de ses jetons hebdomadaires Max20 pour tester les crochets oh-my-claudecode avec Claude Sonnet 4.6, sans constater d'amélioration significative de la qualité du code ou du coût pour une tâche de programmation en session unique.

Claude AI classe chaque startup YC Spring 2026 — Détails complets du pipeline
Un utilisateur de Reddit a utilisé Claude pour analyser toutes les startups du YC Spring 2026, en exploitant LinkedIn et la presse pour leur attribuer des notes de S à D. La plupart ont obtenu B ou C.

lazyclaude : Une interface utilisateur en terminal pour gérer la configuration du code Claude
lazyclaude est un outil d'interface utilisateur en terminal inspiré de lazygit qui offre une vue unique pour gérer toute la configuration de Claude Code stockée sur disque, incluant les fichiers de mémoire, compétences, agents, serveurs MCP, paramètres, permissions, hooks, raccourcis clavier, sessions, statistiques, plugins et tâches.

Crochet de notation de confiance open-source pour Claude Code surveille les sessions, bloque les chemins protégés
Un développeur a créé un crochet Python qui évalue chaque session Claude Code sur les dimensions de fiabilité, portée et coût, bloque l'accès aux chemins protégés comme les fichiers .env, et enchaîne les événements par hachage pour détecter les falsifications. L'outil en un seul fichier est disponible sur GitHub.