Exécution de Qwen3.6-35B-A3B avec ~190k de contexte sur 8 Go de VRAM + 32 Go de RAM – Configuration et benchmarks

Un utilisateur de Reddit a publié une configuration détaillée pour exécuter des modèles GGUF Qwen3.6-35B-A3B avec environ 190k de contexte sur un ordinateur portable doté de 8 Go de VRAM (RTX 4060) et 32 Go de RAM DDR5. Il rapporte 37-43 tok/s sortie de boîte, et avec des ajustements, jusqu'à ~51 tok/s.
Matériel et modèles
- GPU : RTX 4060 8 Go VRAM
- RAM : 32 Go DDR5 5600 MHz
- Système d'exploitation : Linux (les performances sont meilleures que sous Windows)
- Modèles testés (quantification Q5) :
mudler/Qwen3.6-35B-A3B-APEX-GGUF– ~40 tok/s à 37 tok/shesamation/Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF– ~43 tok/s à 37 tok/s
Configuration clé
En utilisant un fork de llama.cpp avec le support TurboQuant (turboquant_plus), l'utilisateur exécute llama-server avec les indicateurs suivants :
--model "<chemin>" \
--host 0.0.0.0 \
--port 8085 \
--ctx-size 192640 \
--n-gpu-layers 430 \
--n-cpu-moe 35 \
--cache-type-k "turbo4" \
--cache-type-v "turbo4" \
--flash-attn on \
--batch-size 2048 \
--parallel 1 \
--no-mmap \
--mlock \
--ubatch-size 512 \
--threads 6 \
--cont-batching \
--timeout 300 \
--temp 0.2 \
--top-p 0.95 \
--min-p 0.05 \
--top-k 20 \
--metrics \
--chat-template-kwargs '{"preserve_thinking": true}'
Pour atteindre des vitesses d'environ 51 tok/s, ajustez trois indicateurs : --ctx-size 192640, --n-gpu-layers 430, --n-cpu-moe 35 (modifiez légèrement selon la stabilité/la mémoire).
Précautions
- La quantification Q4 est nettement moins bonne pour le raisonnement en contexte long par rapport à Q5.
--no-mmap+--mlockréduit les ralentissements et les saccades.- Le cache KV TurboQuant est essentiel pour les contextes de grande taille.
- Une bande passante RAM élevée (DDR5) est importante pour ces vitesses.
- Linux surpasse Windows de manière significative pour cette charge de travail.
À qui cela s'adresse
Développeurs exécutant des LLM locaux avec des contextes très longs (170k+ tokens) sur du matériel grand public, notamment ceux avec 8 à 12 Go de VRAM et une RAM système rapide.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Comment optimiser votre configuration OpenClaw avec des instructions spécifiques et des ajustements
L'optimisation d'OpenClaw repose sur des instructions précises et un affinement continu des personnalités des agents ainsi qu'une utilisation rentable des modèles.

Exécution de Qwen3.6 27B et 35B sur 6 Go de VRAM avec ik_llama : configurations pratiques et benchmarks
Un utilisateur partage des configurations ik_llama détaillées et des métriques de performance pour exécuter les modèles Qwen3.6 27B et 35B A3B sur un RTX2060 mobile (6 Go VRAM, 32 Go RAM), avec des vitesses de préremplissage de 40-100 t/s et une génération jusqu'à 11 t/s.

Création de compétences personnalisées pour Claude Co-Work : meilleures pratiques et formats
Découvrez les meilleures pratiques pour créer des compétences personnalisées pour Claude Co-Work avec des conseils de mise en forme spécifiques et des recommandations d'implémentation issues d'expériences utilisateurs.

Résolution des Problèmes d'Autonomie de l'Agent OpenClaw : Fichiers de Compétences, Sélection d'Outils et Configuration Cron
Un développeur partage des solutions pour les agents OpenClaw qui cessent de fonctionner de manière autonome après la configuration initiale. Les correctifs clés incluent l'utilisation de fichiers de compétences externes au lieu d'instructions de chat, le remplacement des outils de navigateur par des outils basés sur des API ou des scripts Puppeteer, et la configuration appropriée des tâches cron.