Qwen 3.5 122B MoE à 35 t/s sur une seule 3090 avec ik_llama.cpp MTP

✍️ OpenClawRadar📅 Publié: June 6, 2026🔗 Source
Qwen 3.5 122B MoE à 35 t/s sur une seule 3090 avec ik_llama.cpp MTP
Ad

Un développeur exécutant un stack d'inférence entièrement local sur un seul bureau rapporte atteindre 35 tokens/s sur Qwen 3.5 122B MoE en utilisant seulement une 3090, le facilitateur clé étant un fork de llama.cpp qui corrige MTP (Multi-Token Prediction) pour les experts déchargés.

Configuration matérielle

  • CPU AMD 9900X
  • 192 Go DDR5-5200 RAM (surnommée « l'arme secrète »)
  • Deux 3090 (Ti + standard), sans NVLink

La carte 1 exécute le worker : Qwen3.5-122B-A10B utilisant Unsloth IQ3_S MTP GGUF avec un contexte de 204K. 75 % des couches expertes sont déchargées sur le CPU via des drapeaux -ot précis. La carte 2 exécute le raisonneur : Qwen3.6-35B-A3B Q4_K_XL avec MTP à 135 t/s, contexte de 262K.

Des instances supplémentaires uniquement CPU gèrent le traitement en arrière-plan : Dialectic (35B heretic Q8), Scribe-Logos (Gemma4 19B), Moonshot (Gemma4 2B) — totalisant environ 19 Go RAM.

Ad

La découverte d'ik_llama.cpp

Le MTP du llama.cpp standard évalue séquentiellement les experts de chaque token spéculé via la DDR5, ce qui sur du contenu de raisonnement régresse en fait les performances — le surcoût de l'ébauche dépasse le gain d'acceptation. Le fork ik implémente des opérations MoE fusionnées qui regroupent les lectures d'experts pour les tokens spéculés, transformant le MTP d'un gain de +4 % en un gain de +20 %. Le développeur rapporte un décodage à 35 t/s sur un modèle 122B à partir d'une seule 3090 en utilisant ce fork.

Si vous déchargez des experts vers la RAM sur un modèle MoE, essayez ik_llama.cpp avant d'abandonner le MTP.

Coût total de la construction

  • ~1600 $ pour la RAM
  • ~1600 $ pour deux 3090
  • ~400 $ pour tout le reste
  • Coût de fonctionnement : électricité uniquement

📖 Lire la source complète : r/openclaw

Ad

👀 See Also

Comment éviter des coûts imprévus d'OpenRouter dans l'automatisation OpenClaw
Guides

Comment éviter des coûts imprévus d'OpenRouter dans l'automatisation OpenClaw

Une équipe de développeurs a accidentellement dépensé 750 $ en 3 jours sur OpenRouter en utilisant par défaut Claude Sonnet 4.6 (3 $/M tokens) pour toutes les tâches d'automatisation. Ils ont réduit les coûts de 97 % en changeant les modèles par défaut, en verrouillant les tâches cron et les sous-agents sur des options moins chères, et en réservant les modèles coûteux uniquement pour les travaux sensibles.

OpenClawRadar
Méthode de codage AI en laisse courte : battre Fable en gardant le contrôle
Guides

Méthode de codage AI en laisse courte : battre Fable en gardant le contrôle

La méthode de la laisse courte de Greg Slepak pour les agents de codage IA : planifier, examiner chaque diff, refuser les mauvaises modifications, valider après chaque sous-tâche. Surpasse la qualité de Fable en gardant le développeur dans la boucle.

OpenClawRadar
Exploiter les Compétences des Agents pour Écrire des Noyaux CUDA avec Upskill
Guides

Exploiter les Compétences des Agents pour Écrire des Noyaux CUDA avec Upskill

Hugging Face présente une approche pratique pour améliorer les modèles dans l'écriture de noyaux CUDA grâce au nouvel outil Upskill, optimisant l'efficacité des modèles via les compétences d'agent.

OpenClawRadar
Limites de débit de l'API Claude : Fenêtres horaires, gestion du contexte et surcharge MCP
Guides

Limites de débit de l'API Claude : Fenêtres horaires, gestion du contexte et surcharge MCP

L'analyse des limites de débit de l'API Claude révèle des restrictions plus strictes pendant les heures de pointe (5h-11h PT / 8h-14h ET en semaine), avec la gestion du contexte et l'utilisation du serveur MCP ayant un impact significatif sur la consommation de tokens. Les stratégies pratiques incluent le travail en dehors des fenêtres de pointe, le démarrage de nouvelles conversations pour chaque nouvelle tâche et l'audit des intégrations MCP.

OpenClawRadar