Comparaison de référence de Qwen3.6 Plus avec les modèles SOTA occidentaux

Un post Reddit sur r/LocalLLaMA compare Qwen3.6 Plus à plusieurs modèles occidentaux de pointe à travers plusieurs benchmarks. La comparaison inclut des métriques de performance spécifiques pour chaque modèle.
Résultats des Benchmarks
La source fournit ces scores exacts :
- Qwen3.6-Plus : SWE-bench Verified 78,8, GPQA / GPQA Diamond 90,4, HLE (sans outils) 28,8, MMMU-Pro 78,8
- GPT‑5.4 (xhigh) : SWE-bench Verified 78,2, GPQA / GPQA Diamond 93,0, HLE (sans outils) 39,8, MMMU-Pro 81,2
- Claude Opus 4.6 (thinking heavy) : SWE-bench Verified 80,8, GPQA / GPQA Diamond 91,3, HLE (sans outils) 34,44, MMMU-Pro 77,3
- Gemini 3.1 Pro Preview : SWE-bench Verified 80,6, GPQA / GPQA Diamond 94,3, HLE (sans outils) 44,7, MMMU-Pro 80,5
Le post inclut un graphique de comparaison visuel disponible à l'adresse : https://preview.redd.it/6kq4tt07yrsg1.png?width=714&format=png&auto=webp&s=ad8b207fb13729ae84f5b74cec5fd84a81dcface
Évaluation de l'Utilisateur
L'auteur original du post note que Qwen3.6 Plus est "compétitif mais pas le meilleur" et déclare : "Ce sera mon nouveau modèle étant donné son faible coût, mais sa réelle efficacité dépendra de plus que des benchmarks." Il observe également que "Opus surpasse tous les autres malgré sa 3e ou 4e place sur artificalanalysis."
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Les autoencodeurs en langage naturel d'Anthropic transforment les activations de Claude en anglais lisible — Voici comment
Anthropic publie les Autoencodeurs en Langage Naturel (NLAs) qui convertissent les activations internes de Claude en explications en texte clair, révélant le raisonnement du modèle sur les rimes, la conscience des tests de sécurité et la détection de triche.

Claude Code v2.1.85 est disponible : Améliorations MCP, Filtres de Hook et Corrections de Bogues
Claude Code v2.1.85 ajoute des variables d'environnement pour les scripts d'aide aux en-têtes MCP, des champs conditionnels if pour les hooks afin de réduire le lancement de processus, et des correctifs pour les échecs de /compact, les problèmes d'activation/désactivation des plugins, et les problèmes de clavier dans les terminaux Ghostty, Kitty et WezTerm.

Qwen 3 8B surpasse des modèles plus volumineux lors d'évaluations en aveugle par les pairs sur des tâches difficiles.
Lors d'une évaluation en aveugle par les pairs de 10 petits modèles de langage sur 13 tâches difficiles de niveau frontière, Qwen 3 8B a remporté 6 évaluations et s'est classé dans le top 3 dans 12 des 13 tâches, surpassant des modèles ayant jusqu'à 4 fois plus de paramètres. L'évaluation couvrait le débogage de verrous distribués, les bogues de concurrence en Go, l'optimisation SQL, le diagnostic médical bayésien, le paradoxe de Simpson, le théorème de vote d'Arrow et l'analyse du biais du survivant.

Claude Code v2.1.118 ajoute le mode visuel Vim, des thèmes personnalisés et des améliorations MCP.
Claude Code v2.1.118 introduit le mode visuel Vim avec des opérateurs de sélection, la gestion de thèmes personnalisés via la commande /theme, et plusieurs corrections pour l'authentification OAuth MCP et la résolution des dépendances des plugins.