Exécution de Qwen3.6 27B et 35B sur 6 Go de VRAM avec ik_llama : configurations pratiques et benchmarks

Un utilisateur de Reddit rapporte avoir réussi à exécuter les modèles Qwen3.6 27B et 35B A3B sur un ancien PC portable de jeu équipé d'une RTX 2060 Mobile (6 Go VRAM) et 32 Go RAM en utilisant ik_llama et llama.cpp. Les optimisations clés incluent le décodage spéculatif double avec MTP et ngram, --fit et --mtp-requantize-output-tensor, plus le réempaquetage du tenseur de sortie. Voici les configurations exactes et les vitesses observées.
Configuration pour Qwen3.6 27B (Q3_K_XL)
export GGML_CUDA_GRAPHS=1
./llama-server \
-m /mnt/second-ssd/lib/llama.cpp/models/Qwen3.6-27B-MTP-UD-Q3_K_XL.gguf \
-c 16000 \
-b 512 -ub 512 \
--fit --fit-margin 3076 \
-fa on \
-np 1 \
-ctk q4_0 -ctv q4_0 \
--mtp-requantize-output-tensor q4_0 \
-khad -vhad -rtr \
--threads 6 --threads-batch 8 \
--slot-save-path ./slots \
--prompt-cache "prompt.cache" \
--port 8888 --host 0.0.0.0 \
--spec-stage ngram-mod:n_max=64,n_min=2,spec-ngram-size-n=16 \
--spec-stage mtp:n_max=1,draft-p-min=0.0 \
--temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
--jinja \
--chat-template-kwargs '{"preserve_thinking": true}' \
--reasoning on
Configuration pour Qwen3.6 35B A3B (IQ4_XS, Claude Opus Distill)
export GGML_CUDA_GRAPHS=1
./llama-server \
-m /mnt/second-ssd/lib/llama.cpp/models/lordx64-Claude-4.7-Opus-Reasoning-Distilled-Qwen3.6-35B-A3B-MTP-IQ4_XS.gguf \
-c 80000 \
-b 1024 -ub 1024 \
--fit --fit-margin 2048 \
-fa on \
-np 1 \
-ctk q8_0 -ctv q4_0 \
--mtp-requantize-output-tensor q4_0 \
-khad -vhad -rtr \
--threads 6 --threads-batch 8 \
--slot-save-path ./slots \
--prompt-cache "prompt.cache" \
--mlock --no-mmap \
--port 8888 --host 0.0.0.0 \
--spec-stage ngram-mod:n_max=64,n_min=2,spec-ngram-size-n=16 \
--spec-stage mtp:n_max=3,draft-p-min=0.0 \
--temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
--jinja \
--chat-template-kwargs '{"preserve_thinking": true}' \
--reasoning on
Métriques de performance
- 27B : préremplissage ~100 t/s, premier token jusqu'à 4 t/s, ~1 t/s à 10k de contexte
- 35B A3B : préremplissage ~40 t/s, premier token jusqu'à 15 t/s, constant ~11 t/s à 10k de contexte
L'utilisateur note que le 27B est devenu utilisable pour raisonner sur des fichiers jusqu'à 1000 lignes (nécessitant des minutes mais utile), et que le 35B Opus distill fonctionne à une sortie stable de 11 t/s. Il l'utilise pour générer des diagrammes mermaid, des images, du markdown et des PDF avec des workflows de codage little-coder ou agentic.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Benchmarks 12 Go VRAM : Exécution des modèles Qwen 3.6 et Gemma 4 sur une RTX 4070 Super
Un utilisateur de Reddit partage des benchmarks de vitesse détaillés pour Qwen3.6-35B-A3B, Qwen3.6-27B, Gemma 4 26B et Gemma 4 31B sur une RTX 4070 Super 12 Go utilisant llama.cpp avec des paramètres optimisés.

Opus 4.7 a cassé 40% des prompts ; la solution a été de structurer CLAUDE.md et Skills
Après la sortie d'Opus 4.7, qui a dégradé environ 40 % des prompts sur 6 configurations, un responsable IA a résolu le problème en remplaçant les prompts ad hoc par des fichiers Skill structurés, un CLAUDE.md hiérarchique et des fichiers de mémoire séparés — réduisant l'utilisation de tokens de 22 % et le nombre d'itérations de 3-4 à 1-2.

Configuration locale de Claude Code avec Qwen3.5 27B via llama.cpp
Un développeur partage sa configuration pour exécuter Claude Code localement en utilisant Qwen3.5 27B avec llama.cpp, incluant les variables d'environnement, les paramètres du serveur et les benchmarks de performance sur sept tâches de codage.

Optimisation de GLM-4.7-Flash sur Mac Mini M4 avec 24 Go de RAM
Un développeur partage des détails de configuration spécifiques pour exécuter GLM-4.7-Flash sur un Mac Mini M4 avec 24 Go de RAM, incluant la quantification Q3_K_XL, une taille de contexte de 32k avec MLA, et les réalités d'allocation mémoire pour Metal.