Benchmarks 12 Go VRAM : Exécution des modèles Qwen 3.6 et Gemma 4 sur une RTX 4070 Super

Un utilisateur de Reddit a publié des benchmarks de vitesse pour l'exécution de plusieurs grands modèles MoE sur une RTX 4070 Super de 12 Go (avec +10% d'overclocking), couplée à un CPU AMD 9800X3D et 64 Go de RAM DDR5-6000. L'utilisateur décharge l'affichage sur le GPU intégré pour économiser de la VRAM, notant une pénalité de performance d'environ 10% dans le cas contraire. La configuration utilise CUDA 13.1 et la dernière version de llama.cpp avec la configuration matérielle suivante :
n-gpu-layers = 999
threads = 8
threads-batch = 16
batch-size = 4096
ubatch-size = 4096
ctx-size = 65536
flash-attn = true
Résultats des benchmarks
L'utilisateur a testé quatre modèles via les quantifications Unsloth GGUF dans VS Code avec Cline et KiloCode (aucun problème d'appel d'outil). Toutes les mesures sont en tokens par seconde (tgs) et en traitement par seconde (pps).
- Qwen3.6-35B-A3B-GGUF Q6_K_XL : 40 tgs, 2100 pps
- Qwen3.6-27B-IQ3_XXS : 16 tgs, 1000 pps
- Gemma 4 26B-A4B-it-UD-Q8 : 26 tgs, 2150 pps
- Gemma-4-31B-it-IQ3_XXS : 13-16 tgs, 650 pps
Détails notables de la configuration
L'utilisateur a partagé les configurations individuelles des modèles avec des réglages spécifiques. Points clés :
- Pour Qwen3.6-35B-A3B :
n-cpu-moe = 35(décharge 35 experts MoE sur le CPU),cache-type-k = q8_0,cache-type-v = q8_0,swa-full = true,cache-reuse = 512, taille de contexte 131072, raisonnement activé avec budget 8096. - Pour Gemma 4 26B :
n-cpu-moe = 27, contexte 102400,fit = onavecfit-target = 256etfit-ctx = 32768. - Pour Gemma 4 31B : utilise le décodage spéculatif avec
ngram-mod(spec-type = ngram-mod),n-gpu-layers = 58(déchargement partiel sur GPU),cache-type-k = q4_0,no-kv-offload = true. - Tous les modèles utilisent
flash-attn = trueetno-mmproj-offload = true.
Le modèle préféré de l'utilisateur pour le développement web est Qwen3.6-35B-A3B, louant sa qualité sans problème d'appel d'outil dans les extensions VS Code.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also
OpenClaw 2026.9.1 Migration : Notes de mise à niveau des systèmes multi-agents hérités provenant de r/openclaw
Un utilisateur documente une mise à niveau réussie d'OpenClaw 2026.7.1-2 vers 2026.9.1, couvrant les migrations de configuration, les mises à jour de schéma et les correctifs multi-agents—réalisée via Codex en environ 30 minutes.

Résolution des Problèmes d'Autonomie de l'Agent OpenClaw : Fichiers de Compétences, Sélection d'Outils et Configuration Cron
Un développeur partage des solutions pour les agents OpenClaw qui cessent de fonctionner de manière autonome après la configuration initiale. Les correctifs clés incluent l'utilisation de fichiers de compétences externes au lieu d'instructions de chat, le remplacement des outils de navigateur par des outils basés sur des API ou des scripts Puppeteer, et la configuration appropriée des tâches cron.

Création d'un système de glossaire hindi personnalisé avec Claude : De 76 % à 92 % de précision en 10 mois
Un développeur solo à Bangalore a créé un système de glossaire personnalisé pour Claude, faisant passer la précision du vocabulaire hindi spécialisé de 76 % à 92 %. Les termes basés sur des exemples avec des phrases contextuelles ont donné les meilleurs résultats.

Exécution de Qwen3.6-35B-A3B avec ~190k de contexte sur 8 Go de VRAM + 32 Go de RAM – Configuration et benchmarks
Un utilisateur de Reddit partage une configuration fonctionnelle de llama.cpp pour les modèles GGUF Qwen3.6-35B-A3B sur une RTX 4060 (8 Go de VRAM) + 32 Go DDR5, atteignant 37-51 tok/s à 192k de contexte en utilisant TurboQuant et des indicateurs spécifiques.