10.33 t/s sur Qwen 3.5 35B avec un ordinateur portable à 300 $ : Répartition complète de l'optimisation

Un utilisateur de Reddit a poussé l'inférence de Qwen 3.5 35B à 10,33 t/s sur un Lenovo Ideapad Slim 3i à 300 $ (i3-1215U 12e génération, 8 Go soudés + 32 Go DDR4 d'extension). La configuration utilise un modèle MoE quantifié en Q4_K_S avec seulement ~3B paramètres actifs et le build 4509 de ik_llama.cpp.
Matériel et modèle
- PC portable : Lenovo Ideapad Slim 3i 2023 (~300 $)
- CPU : Intel i3-1215U (6 cœurs, 2 cœurs performance utilisés)
- RAM : 8 Go soudés + 32 Go DDR4 SO-DIMM (mode Flex)
- OS : Linux Mint
- Modèle :
Qwen3.5-35B-A3B-uncensored-heretic-v2-Native-MTP-Preserved-Q4_K_S.gguf(35B MoE, 3B paramètres actifs par token) - Backend : ik_llama.cpp commit 40aae0b6, compilé avec GCC 13.3.0
Optimisations appliquées
- BIOS : Batterie → Mode performance extrême ; ventilateur réglé sur silencieux (éteint)
- Profil d'alimentation OS : performance
- Core pinning : threads épinglés aux cœurs performance 0 et 2 via
taskset -c 0,2 - Quantification : Q4_K_S
- Taille de lot : 64 (
-ub 64) - Décodage spéculatif : type MTP, draft max 3
- Flash attention, fmoe, rtr — tous activés par défaut
- Redémarrage à froid avant le benchmark
Commande utilisée
taskset -c 0,2 ./build/bin/llama-cli \
-m "/home/default/LLM Models/Qwen3.5-35B-A3B-uncensored-heretic-v2-Native-MTP-Preserved-Q4_K_S.gguf" \
-p "User: Please explain the history of france \nAI:" \
-n 1028 \
--spec-type mtp \
--draft-max 3 \
-t 2 \
-ub 64 \
--temp 1.0 \
--top-p 0.95 \
--top-k 20 \
--min-p 0.0 \
--presence-penalty 1.5 \
--repeat-penalty 1.0
Résultats
- Évaluation de prompt : 22,49 t/s
- Inférence : 10,33 t/s (sur 1028 tokens)
- Thermique : ~90°C, pas de limitation de wattage nécessaire avec ik_llama (auparavant besoin d'une limite à 17,5 W avec llama.cpp)
Pourquoi Qwen 3.5 MoE est rapide
L'architecture MoE de Qwen 3.5 35B n'active qu'environ 3B paramètres par token, contrairement aux modèles denses. À titre de comparaison, Gemma 4 26b (4B actifs) n'a atteint qu'environ 3 t/s dans des conditions similaires — ce qui suggère que le routage MoE et le calcul sparse de Qwen 3.5 sont particulièrement adaptés au CPU.
Gains potentiels supplémentaires
- BIOS personnalisé pour timings mémoire XMP → +10 % t/s
- Repaste thermique avec pâte haut de gamme
- Passage de DDR4 à DDR5 (combiné avec repaste → +20 % t/s)
À qui cela s'adresse : Aux développeurs exécutant des LLM locaux sur du matériel économique qui veulent tirer le maximum des modèles MoE Qwen en inférence CPU uniquement.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Configurations éphémères d'OpenClaw avec sandboxing réseau et démantèlement automatique
Une configuration qui démarre OpenClaw dans une VM éphémère avec une liste d'autorisation de sortie réseau, injecte des clés API dans un stockage en mémoire vive et inclut un arrêt automatique après 2 heures. Tous les appels LLM sont enregistrés dans SQLite pour relecture.

Qwen 3.6 27B atteint une vitesse 2,5x avec le décodage spéculatif MTP sur llama.cpp
Un utilisateur de Reddit rapporte une inférence 2,5 fois plus rapide sur Qwen 3.6 27B en utilisant le décodage spéculatif MTP avec une PR personnalisée de llama.cpp, atteignant 28 tok/s sur Mac M2 Max 96GB. Inclut des quants GGUF pré-convertis et des modèles de chat fixes.

Homebutler : Compétence OpenClaw pour la Gestion de Homelab via Telegram
Homebutler est un binaire Go unique (~13 Mo, zéro dépendance) qui fonctionne comme une compétence OpenClaw pour gérer les homelabs depuis le chat Telegram. Il surveille les serveurs, redémarre les conteneurs Docker, réveille les machines, scanne les réseaux et alerte en cas de pics de ressources sans sessions SSH ni connexions à un tableau de bord.

Modèle Qwen3.5-9B-Claude-4.6-Opus-Uncensored-v2 publié avec configuration LM Studio
Un modèle fusionné non censuré combinant l'architecture Qwen3.5-9B avec les données d'entraînement Claude 4.6 Opus est désormais disponible, avec des paramètres spécifiques LM Studio 0.4.7 fournis pour des performances optimales, incluant une température de 0,7 et un échantillonnage Top K de 20.