Qwen 3.5 122B MoE à 35 t/s sur une seule 3090 avec ik_llama.cpp MTP

Un développeur exécutant un stack d'inférence entièrement local sur un seul bureau rapporte atteindre 35 tokens/s sur Qwen 3.5 122B MoE en utilisant seulement une 3090, le facilitateur clé étant un fork de llama.cpp qui corrige MTP (Multi-Token Prediction) pour les experts déchargés.
Configuration matérielle
- CPU AMD 9900X
- 192 Go DDR5-5200 RAM (surnommée « l'arme secrète »)
- Deux 3090 (Ti + standard), sans NVLink
La carte 1 exécute le worker : Qwen3.5-122B-A10B utilisant Unsloth IQ3_S MTP GGUF avec un contexte de 204K. 75 % des couches expertes sont déchargées sur le CPU via des drapeaux -ot précis. La carte 2 exécute le raisonneur : Qwen3.6-35B-A3B Q4_K_XL avec MTP à 135 t/s, contexte de 262K.
Des instances supplémentaires uniquement CPU gèrent le traitement en arrière-plan : Dialectic (35B heretic Q8), Scribe-Logos (Gemma4 19B), Moonshot (Gemma4 2B) — totalisant environ 19 Go RAM.
La découverte d'ik_llama.cpp
Le MTP du llama.cpp standard évalue séquentiellement les experts de chaque token spéculé via la DDR5, ce qui sur du contenu de raisonnement régresse en fait les performances — le surcoût de l'ébauche dépasse le gain d'acceptation. Le fork ik implémente des opérations MoE fusionnées qui regroupent les lectures d'experts pour les tokens spéculés, transformant le MTP d'un gain de +4 % en un gain de +20 %. Le développeur rapporte un décodage à 35 t/s sur un modèle 122B à partir d'une seule 3090 en utilisant ce fork.
Si vous déchargez des experts vers la RAM sur un modèle MoE, essayez ik_llama.cpp avant d'abandonner le MTP.
Coût total de la construction
- ~1600 $ pour la RAM
- ~1600 $ pour deux 3090
- ~400 $ pour tout le reste
- Coût de fonctionnement : électricité uniquement
📖 Lire la source complète : r/openclaw
👀 See Also

Intégration d'OpenClaw avec l'API WhatsApp Cloud
Un développeur a configuré OpenClaw pour communiquer directement avec WhatsApp en utilisant l'API Cloud officielle de Meta et a documenté le processus de configuration pour aider les autres à éviter une documentation dispersée.

Correction d’automatisation de navigateur à distance avec configuration du nœud OpenClaw
Utilisez un nœud OpenClaw local pour éviter les maux de tête liés au CDP/RDP — exécutez le navigateur visible, conservez votre IP et vos cookies.

Exporter l'historique de ChatGPT vers le système de mémoire OpenClaw
Un utilisateur de Reddit partage un processus pour exporter des années d'historique de conversations ChatGPT et l'importer dans le système de mémoire d'OpenClaw en utilisant l'outil ai-chat-md-export, permettant aux agents IA locaux d'accéder au contexte historique.

Évaluation du chatbot RAG : comment un balayage de modèle + des correctifs de récupération ont réduit les coûts de 79 % et amélioré la qualité de 19 %
Un développeur a évalué un chatbot RAG de support client et a découvert des erreurs de configuration de la récupération, des défauts dans l'évaluateur heuristique, ainsi qu'un modèle moins cher qui surpassait celui en production. La qualité est passée de 6,62 à 7,88 tandis que le coût par session a chuté de 0,002420 $ à 0,000509 $.