Exécution de Qwen3.6-35B-A3B avec ~190k de contexte sur 8 Go de VRAM + 32 Go de RAM – Configuration et benchmarks

✍️ OpenClawRadar📅 Publié: May 10, 2026🔗 Source
Exécution de Qwen3.6-35B-A3B avec ~190k de contexte sur 8 Go de VRAM + 32 Go de RAM – Configuration et benchmarks
Ad

Un utilisateur de Reddit a publié une configuration détaillée pour exécuter des modèles GGUF Qwen3.6-35B-A3B avec environ 190k de contexte sur un ordinateur portable doté de 8 Go de VRAM (RTX 4060) et 32 Go de RAM DDR5. Il rapporte 37-43 tok/s sortie de boîte, et avec des ajustements, jusqu'à ~51 tok/s.

Matériel et modèles

  • GPU : RTX 4060 8 Go VRAM
  • RAM : 32 Go DDR5 5600 MHz
  • Système d'exploitation : Linux (les performances sont meilleures que sous Windows)
  • Modèles testés (quantification Q5) :
    • mudler/Qwen3.6-35B-A3B-APEX-GGUF – ~40 tok/s à 37 tok/s
    • hesamation/Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF – ~43 tok/s à 37 tok/s

Configuration clé

En utilisant un fork de llama.cpp avec le support TurboQuant (turboquant_plus), l'utilisateur exécute llama-server avec les indicateurs suivants :

--model "<chemin>" \
--host 0.0.0.0 \
--port 8085 \
--ctx-size 192640 \
--n-gpu-layers 430 \
--n-cpu-moe 35 \
--cache-type-k "turbo4" \
--cache-type-v "turbo4" \
--flash-attn on \
--batch-size 2048 \
--parallel 1 \
--no-mmap \
--mlock \
--ubatch-size 512 \
--threads 6 \
--cont-batching \
--timeout 300 \
--temp 0.2 \
--top-p 0.95 \
--min-p 0.05 \
--top-k 20 \
--metrics \
--chat-template-kwargs '{"preserve_thinking": true}'

Pour atteindre des vitesses d'environ 51 tok/s, ajustez trois indicateurs : --ctx-size 192640, --n-gpu-layers 430, --n-cpu-moe 35 (modifiez légèrement selon la stabilité/la mémoire).

Ad

Précautions

  • La quantification Q4 est nettement moins bonne pour le raisonnement en contexte long par rapport à Q5.
  • --no-mmap + --mlock réduit les ralentissements et les saccades.
  • Le cache KV TurboQuant est essentiel pour les contextes de grande taille.
  • Une bande passante RAM élevée (DDR5) est importante pour ces vitesses.
  • Linux surpasse Windows de manière significative pour cette charge de travail.

À qui cela s'adresse

Développeurs exécutant des LLM locaux avec des contextes très longs (170k+ tokens) sur du matériel grand public, notamment ceux avec 8 à 12 Go de VRAM et une RAM système rapide.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Utilisateur de Reddit partage une configuration pratique de Claude pour une assistance IA cohérente en programmation
Guides

Utilisateur de Reddit partage une configuration pratique de Claude pour une assistance IA cohérente en programmation

Un développeur décrit le passage de prompts uniques à des fichiers de contexte séparés (about-me.md, my-voice.md, my-rules.md) et la mise en œuvre d'un flux de travail structuré où Claude lit le contexte, pose des questions, crée des plans, puis exécute des tâches.

OpenClawRadar
Développeur partage 25 prompts Claude testés pour les workflows de développement SaaS
Guides

Développeur partage 25 prompts Claude testés pour les workflows de développement SaaS

Un développeur a partagé 25 prompts spécifiques qu'il utilise quotidiennement pour le développement SaaS, couvrant l'architecture backend, la conception d'API, les textes frontend, la documentation produit et les tâches de lancement. Ces prompts sont conçus pour gagner du temps sur des tâches répétitives comme la revue de code, la génération de documentation et les tests de cas limites.

OpenClawRadar
Modification de l'invite système par défaut d'OpenClaw pour contourner les restrictions de contenu
Guides

Modification de l'invite système par défaut d'OpenClaw pour contourner les restrictions de contenu

Un utilisateur a modifié le fichier de configuration d'OpenClaw pour remplacer l'invite système par défaut "You are a helpful, respectful and honest assistant" par une invite personnalisée qui ignore les filtres de sécurité externes, supprimant ainsi les restrictions de contenu. Le processus implique l'édition de config.js dans le répertoire d'installation de node-llama-cpp.

OpenClawRadar
Les modèles Qwen3.x échouent silencieusement dans OpenClaw en raison d'une incompatibilité du format de sortie en streaming.
Guides

Les modèles Qwen3.x échouent silencieusement dans OpenClaw en raison d'une incompatibilité du format de sortie en streaming.

Les modèles Qwen3.x en mode streaming envoient leur sortie vers le champ 'reasoning' au lieu de 'content', ce qui fait qu'OpenClaw passe silencieusement aux modèles de secours. Un proxy qui traduit les formats d'API et injecte 'think: false' résout le problème, permettant une évaluation complète des appels d'outils.

OpenClawRadar