Comparaison des performances de Qwen3-30B-A3B et Qwen3.5-35B-A3B sur RTX 5090

✍️ OpenClawRadar📅 Publié: February 25, 2026🔗 Source
Comparaison des performances de Qwen3-30B-A3B et Qwen3.5-35B-A3B sur RTX 5090
Ad

Comparaison des performances : Qwen3-30B-A3B vs Qwen3.5-35B-A3B

Un benchmark détaillé comparant Qwen3-30B-A3B et le nouveau Qwen3.5-35B-A3B sur une NVIDIA RTX 5090 révèle des compromis entre vitesse et gestion du contexte. Les deux modèles utilisent la même architecture Mixture of Experts avec 3B paramètres actifs, la version 3.5 ajoutant 5B paramètres totaux supplémentaires et incluant un projecteur visuel.

Matériel et configuration

  • GPU : NVIDIA RTX 5090 (32 Go de VRAM, Blackwell)
  • Serveur : llama.cpp b8115 (Docker : ghcr.io/ggml-org/llama.cpp:server-cuda)
  • Quantification : Q4_K_M pour les deux modèles
  • Cache KV : Q8_0 (-ctk q8_0 -ctv q8_0)
  • Contexte : 32 768 tokens (-c 32768)
  • Paramètres : -ngl 999 -np 4 --flash-attn on -t 12
  • Modèle A : Qwen3-30B-A3B-Q4_K_M (17 Go sur disque)
  • Modèle B : Qwen3.5-35B-A3B-Q4_K_M (21 Go sur disque)

Les deux modèles ont été préchauffés avec une requête jetable avant le chronométrage. Les temps côté serveur proviennent des réponses API, pas de mesures en temps réel.

Résultats bruts de vitesse d'inférence

Les tests directs via llama.cpp /v1/chat/completions ont montré :

  • Prompts courts (8-9 tokens) : 30B : 248,2 tok/s, 3.5 : 169,5 tok/s
  • Prompts moyens (73-78 tokens) : 30B : 236,1 tok/s, 3.5 : 163,5 tok/s
  • Forme longue (800 tokens) : 30B : 232,6 tok/s, 3.5 : 116,3 tok/s
  • Génération de code (298-400 tokens) : 30B : 233,9 tok/s, 3.5 : 161,6 tok/s
  • Raisonnement (200 tokens) : 30B : 234,8 tok/s, 3.5 : 158,2 tok/s

Vitesse moyenne de génération : 30B : 237,1 tok/s, 3.5 : 153,8 tok/s (le 30B est 35 % plus rapide)

Moyennes de traitement des prompts : 30B : 773,5 tokens/s, 3.5 : 518,1 tokens/s

Le modèle 3.5 montre une régression intéressante sur les sorties longues (800 tokens), tombant à 116 tok/s contre ~160 tok/s sur les sorties courtes. Le traitement des prompts est plus lent sur le 3.5 en raison de son vocabulaire plus large (248K contre 152K tokens).

Ad

Utilisation de la mémoire

Utilisation VRAM : 30B utilise 27,3 Go au repos, 3.5 utilise 29,0 Go au repos. Les deux tiennent confortablement sur la RTX 5090.

Observations sur la qualité des réponses

Les tests à température=0,7 ont montré que les deux modèles produisent des sorties compétentes. Observations clés :

  • Écriture créative : Les deux sont solides, avec le 3.5 montrant une prose légèrement plus atmosphérique
  • Génération de haïku : Les deux produisent des structures 5-7-5 valides
  • Tâches de codage : Les deux implémentent correctement un cache LRU avec des opérations get/put en O(1)

Le modèle 3.5 gère beaucoup mieux les contextes longs avec une échelle de tokens plate contre une dégradation de 21 % pour le 30B. Les différences de qualité sont minimes avec un léger avantage pour le 3.5 en structure et formatage.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Claude Code v2.1.202 : Tailles de workflow dynamiques, /review annulé, et plus de 20 correctifs
News

Claude Code v2.1.202 : Tailles de workflow dynamiques, /review annulé, et plus de 20 correctifs

Ajoute le dimensionnement dynamique des workflows dans /config, rétablit /review en passage unique, corrige les échecs de handshake mTLS, les boucles de dictée vocale, la reprise de session avec de nombreux git worktrees, et plus encore.

OpenClawRadar
Autoresearch pousse Qwen3.5-397B à 20,34 tok/s sur M5 Max via le streaming SSD
News

Autoresearch pousse Qwen3.5-397B à 20,34 tok/s sur M5 Max via le streaming SSD

Un développeur a atteint une vitesse d'inférence de 20,34 tokens/seconde pour le modèle Qwen3.5-397B de 209 Go sur un MacBook Pro M5 Max avec 128 Go de RAM en utilisant le streaming SSD et 36 expériences systématiques. Ce résultat représente une accélération de 2x par rapport au point de référence du M5 Max et de 4,67x par rapport au résultat original du M3 Max.

OpenClawRadar
Étude de l'ETH Zurich : Un contexte excessif réduit les performances des agents d'IA en programmation
News

Étude de l'ETH Zurich : Un contexte excessif réduit les performances des agents d'IA en programmation

Une étude de l'ETH Zurich a testé quatre agents de codage sur 138 tâches réelles de GitHub et a constaté que les fichiers de contexte générés par LLM réduisaient les taux de réussite des tâches de 2 à 3 % tout en augmentant les coûts d'inférence de 20 %. Le contexte écrit par l'homme n'a amélioré la réussite que d'environ 4 % avec des augmentations de coûts significatives.

OpenClawRadar
OpenClaw Codex OAuth renvoie des erreurs de facturation malgré un compte valide
News

OpenClaw Codex OAuth renvoie des erreurs de facturation malgré un compte valide

OpenClaw Codex OAuth renvoie une erreur 429 indiquant 'Votre compte n'est pas actif, veuillez vérifier vos informations de facturation' même si la facturation est confirmée valide et que la commande exec fonctionne. Le problème persiste sur plusieurs versions d'OpenClaw.

OpenClawRadar