Qwen 3 8B surpasse des modèles plus volumineux lors d'évaluations en aveugle par les pairs sur des tâches difficiles.

Résultats de l'évaluation
Un système d'évaluation en aveugle par les pairs appelé The Multivac a testé 10 petits modèles de langage sur 13 questions difficiles de niveau frontière. Le même niveau de difficulté a été utilisé pour GPT-5.4 et Claude Opus 4.6. Les modèles ne savaient pas quelle réponse provenait de quel modèle, et les classements ont été calculés à partir du consensus des pairs.
Principales conclusions
Qwen 3 8B (8 milliards de paramètres) a obtenu :
- 6 victoires en première place sur 13 évaluations
- Des classements dans le top 3 dans 12 des 13 tâches
- Un score moyen de 9,40
- Le pire classement : 5e place
Cette performance a dépassé celle de modèles avec des nombres de paramètres significativement plus élevés, notamment :
- Gemma 3 27B (27 milliards de paramètres) : 3 victoires, 11 classements dans le top 3, moyenne de 9,33
- Kimi K2.5 (32B/1T MoE) : 3 victoires, 5 classements dans le top 3, moyenne de 8,78
- Qwen 3 32B (32 milliards de paramètres) : 2 victoires, 5 classements dans le top 3, moyenne de 8,40
Performance par tâche
Sur les tâches de code, Qwen 3 8B s'est classé :
- 1er sur le débogage de concurrence en Go (9,65)
- 1er sur l'analyse de verrous distribués (9,33)
- Ex æquo 1er sur l'optimisation SQL (9,66)
Sur les tâches de raisonnement, il s'est classé :
- 1er sur le paradoxe de Simpson (9,51)
- 1er sur la théorie de la décision d'investissement (9,63)
- 2e sur le diagnostic bayésien (9,53)
Observations notables
Qwen 3 32B a montré une baisse significative de performance sur la tâche de débogage de verrous distribués (EVAL-20260315-043330), avec un score de seulement 1,00 sur 10 alors que tous les autres modèles ont obtenu plus de 5,5. Le modèle 8B a obtenu 9,33 sur la même tâche. La cause n'est pas claire mais pourrait être liée au routage OpenRouter, à des artefacts de quantification ou à un véritable mode d'échec.
Kimi K2.5, techniquement un modèle 32B actif/1T MoE, a remporté 3 évaluations, y compris la tâche de débogage 502 (9,57), le théorème de vote d'Arrow (9,18) et le biais du survivant (9,63).
Llama 3.1 8B s'est classé dernier ou avant-dernier dans 10 des 13 évaluations avec un score moyen de 7,51, montrant un écart considérable par rapport à Qwen 3 8B (9,40) malgré le même nombre de paramètres.
Notes méthodologiques
L'évaluation a utilisé un système en aveugle par les pairs où 10 modèles répondent à la même question, puis chaque modèle juge les 10 réponses (100 jugements totaux par évaluation, moins les auto-jugements). L'auteur note de véritables limites : l'IA jugeant l'IA pose un problème de circularité, et les scores mesurent le consensus des pairs plutôt que la vérité terrain. Une étude de référence humaine est en cours de développement pour mesurer la corrélation.
📖 Read the full source: r/LocalLLaMA
👀 See Also
Pourquoi écrire du code en 2026 : le codage humain reste essentiel pour les agents IA
Doug Turnbull soutient qu'avec des agents de codage IA puissants, les humains doivent toujours écrire du code pour comprendre l'architecture, réduire la fragilité et guider efficacement les agents.

Dépôt de compétences Bird supprimé — Sauvegardez votre accès X/Twitter dès maintenant
La compétence populaire d'oiseau par @steipete a été retirée de GitHub. Les utilisateurs doivent sauvegarder leurs installations immédiatement.

Évolution de l'architecture du cache KV : de GPT-2 à Mamba
L'analyse des coûts mémoire du cache KV montre que GPT-2 utilisait 300 Kio/par jeton, Llama 3 l'a réduit à 128 Kio/par jeton avec l'attention par requêtes groupées, et DeepSeek V3 a atteint 68,6 Kio/par jeton avec l'attention latente multi-têtes. Mamba/SSM éliminent entièrement le cache KV grâce à des états cachés de taille fixe.

Une étude longitudinale révèle que les gains de productivité liés à l'IA sont de 10 %, et non multipliés par 10.
Une étude longitudinale suivant 40 entreprises de novembre 2024 à février 2026 a révélé que l'utilisation de l'IA a augmenté de 65 % en moyenne, mais que le débit des demandes de fusion n'a augmenté que de 9,97 %. Les données suggèrent que le codage n'a jamais été le principal goulot d'étranglement dans le développement logiciel.