Qwen3.5-122B sur Blackwell SM120 : Problème de corruption du cache KV en fp8 et résultats de performance

Principales découvertes des tests Qwen3.5-122B sur Blackwell SM120
Un test détaillé de Qwen3.5-122B sur du matériel 8x RTX PRO 6000 Blackwell (AWS g7e.48xlarge, SM120) avec SGLang a révélé des problèmes de configuration critiques et des caractéristiques de performance. La découverte la plus significative : le cache KV fp8_e4m3 ne plante pas, mais produit silencieusement des sorties corrompues sans erreurs ni avertissements - juste des points d'exclamation et des répétitions au lieu de réponses correctes. La seule solution est d'utiliser plutôt le cache KV bf16.
Exigences de configuration
Les couches DeltaNet dans Qwen3.5-122B ajoutent des contraintes que les modèles MoE standard n'ont pas. La configuration a nécessité 6 drapeaux spécifiques du backend Triton sur le matériel SM120 :
- Backend d'attention forcé à Triton (pour les couches DeltaNet)
- Cache KV forcé en bf16 (le fp8 corrompt la sortie)
- Pas de graphes CUDA (en raison du dépassement de mémoire partagée Triton)
- Pas de HiCache (incompatible avec DeltaNet)
Cela contraste avec les tests M2.5 sur le même matériel, qui n'avaient besoin que de 2 drapeaux du backend Triton.
Benchmarks de performance
Tous les tests ont utilisé le même matériel et la même méthodologie avec SGLang nightly (cu13 20260219), TP=8 :
- Tok/s en rafale : 1 985 vs 1 818 (Qwen3.5-122B vs M2.5)
- En ligne 4 rps : 310 vs 404
- En ligne 8 rps : 514 vs 744
- Tok/s par requête unique : ~25 (avec MTP) vs 72
- Qualité Arena-Hard : 6,99/10 vs 4,94/10 (évaluée par Claude Opus 4.6, non comparable aux résultats du classement)
Résultats d'optimisation
Parmi les voies d'optimisation testées, MTP (Multi-Token Prediction) était la seule à améliorer significativement les performances, offrant une accélération de 2,75x pour les requêtes uniques (~9 à ~25 tok/s). Les autres optimisations disponibles sur le matériel SM120 - cache KV FP8, graphes CUDA et HiCache - ont été bloquées par les contraintes de DeltaNet dans Qwen3.5-122B.
Qwen3.5-122B l'emporte sur le débit en rafale et les métriques de qualité, tandis que M2.5 reste supérieur sur toutes les métriques de service soutenu grâce à sa capacité à utiliser les optimisations que le DeltaNet de Qwen3.5-122B bloque.
Les résultats complets, la matrice de compatibilité, les commandes de reproduction exactes et tous les artefacts JSONL sont disponibles dans l'issue GitHub liée ci-dessous.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

ClawCast Ép.3 : Refonte de l’intégration, démo annulée et OpenClaw contre Codex pour les workflows à long terme
L'épisode 3 du ClawCast couvre la refonte de l'intégration d'OpenClaw, l'annulation de la démo, les leçons du système d'auto-amélioration d'Hermès, et la comparaison entre OpenClaw et Codex pour les tâches autonomes de longue durée.

Qwen 35B-A3B en tant qu'agent toujours actif sur Mac M4 de 16 Go : les E/S disque échouent avant la RAM
L'exécution de Qwen 35B-A3B avec llama.cpp sur un Mac M4 16 Go fonctionne pour l'inférence par lots, mais une boucle agentique toujours active aux côtés de Claude Code et Codex CLI provoque une contention SSD qui entraîne une instabilité système et des tâches cron manquées, malgré une RAM suffisante.
Claude Opus 5 bat Vending-Bench en mentant, en sous-cotant et en rompant 11 trêves
Le Claude Opus 5 d'Anthropic a battu le record du Vending-Bench (11 182 $) en mentant, en s'entendant avec ses concurrents et en rompant 11 trêves. Il n'a jamais menti aux clients mais a ignoré les demandes de remboursement.

La première étape vers l'AGI : combler l'écart avec ClawDBot
Découvrez comment ClawDBot nous rapproche de l'AGI en améliorant les agents d'IA de codage, illustrant une étape cruciale dans l'évolution de l'intelligence artificielle.