Exécution de Qwen3.6-35B-A3B avec ~190k de contexte sur 8 Go de VRAM + 32 Go de RAM – Configuration et benchmarks

✍️ OpenClawRadar📅 Publié: May 10, 2026🔗 Source
Exécution de Qwen3.6-35B-A3B avec ~190k de contexte sur 8 Go de VRAM + 32 Go de RAM – Configuration et benchmarks
Ad

Un utilisateur de Reddit a publié une configuration détaillée pour exécuter des modèles GGUF Qwen3.6-35B-A3B avec environ 190k de contexte sur un ordinateur portable doté de 8 Go de VRAM (RTX 4060) et 32 Go de RAM DDR5. Il rapporte 37-43 tok/s sortie de boîte, et avec des ajustements, jusqu'à ~51 tok/s.

Matériel et modèles

  • GPU : RTX 4060 8 Go VRAM
  • RAM : 32 Go DDR5 5600 MHz
  • Système d'exploitation : Linux (les performances sont meilleures que sous Windows)
  • Modèles testés (quantification Q5) :
    • mudler/Qwen3.6-35B-A3B-APEX-GGUF – ~40 tok/s à 37 tok/s
    • hesamation/Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF – ~43 tok/s à 37 tok/s

Configuration clé

En utilisant un fork de llama.cpp avec le support TurboQuant (turboquant_plus), l'utilisateur exécute llama-server avec les indicateurs suivants :

--model "<chemin>" \
--host 0.0.0.0 \
--port 8085 \
--ctx-size 192640 \
--n-gpu-layers 430 \
--n-cpu-moe 35 \
--cache-type-k "turbo4" \
--cache-type-v "turbo4" \
--flash-attn on \
--batch-size 2048 \
--parallel 1 \
--no-mmap \
--mlock \
--ubatch-size 512 \
--threads 6 \
--cont-batching \
--timeout 300 \
--temp 0.2 \
--top-p 0.95 \
--min-p 0.05 \
--top-k 20 \
--metrics \
--chat-template-kwargs '{"preserve_thinking": true}'

Pour atteindre des vitesses d'environ 51 tok/s, ajustez trois indicateurs : --ctx-size 192640, --n-gpu-layers 430, --n-cpu-moe 35 (modifiez légèrement selon la stabilité/la mémoire).

Ad

Précautions

  • La quantification Q4 est nettement moins bonne pour le raisonnement en contexte long par rapport à Q5.
  • --no-mmap + --mlock réduit les ralentissements et les saccades.
  • Le cache KV TurboQuant est essentiel pour les contextes de grande taille.
  • Une bande passante RAM élevée (DDR5) est importante pour ces vitesses.
  • Linux surpasse Windows de manière significative pour cette charge de travail.

À qui cela s'adresse

Développeurs exécutant des LLM locaux avec des contextes très longs (170k+ tokens) sur du matériel grand public, notamment ceux avec 8 à 12 Go de VRAM et une RAM système rapide.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Comment optimiser votre configuration OpenClaw avec des instructions spécifiques et des ajustements
Guides

Comment optimiser votre configuration OpenClaw avec des instructions spécifiques et des ajustements

L'optimisation d'OpenClaw repose sur des instructions précises et un affinement continu des personnalités des agents ainsi qu'une utilisation rentable des modèles.

OpenClawRadar
Exécution de Qwen3.6 27B et 35B sur 6 Go de VRAM avec ik_llama : configurations pratiques et benchmarks
Guides

Exécution de Qwen3.6 27B et 35B sur 6 Go de VRAM avec ik_llama : configurations pratiques et benchmarks

Un utilisateur partage des configurations ik_llama détaillées et des métriques de performance pour exécuter les modèles Qwen3.6 27B et 35B A3B sur un RTX2060 mobile (6 Go VRAM, 32 Go RAM), avec des vitesses de préremplissage de 40-100 t/s et une génération jusqu'à 11 t/s.

OpenClawRadar
Création de compétences personnalisées pour Claude Co-Work : meilleures pratiques et formats
Guides

Création de compétences personnalisées pour Claude Co-Work : meilleures pratiques et formats

Découvrez les meilleures pratiques pour créer des compétences personnalisées pour Claude Co-Work avec des conseils de mise en forme spécifiques et des recommandations d'implémentation issues d'expériences utilisateurs.

OpenClawRadar
Résolution des Problèmes d'Autonomie de l'Agent OpenClaw : Fichiers de Compétences, Sélection d'Outils et Configuration Cron
Guides

Résolution des Problèmes d'Autonomie de l'Agent OpenClaw : Fichiers de Compétences, Sélection d'Outils et Configuration Cron

Un développeur partage des solutions pour les agents OpenClaw qui cessent de fonctionner de manière autonome après la configuration initiale. Les correctifs clés incluent l'utilisation de fichiers de compétences externes au lieu d'instructions de chat, le remplacement des outils de navigateur par des outils basés sur des API ou des scripts Puppeteer, et la configuration appropriée des tâches cron.

OpenClawRadar