MiMo-V2.5-Pro évalué : Fort raisonnement de déduction sociale, bon rapport qualité-prix face au K2.6

✍️ OpenClawRadar📅 Publié: May 1, 2026🔗 Source
MiMo-V2.5-Pro évalué : Fort raisonnement de déduction sociale, bon rapport qualité-prix face au K2.6
Ad

MiMo-V2.5-Pro, le dernier modèle open-weights de Xiaomi, a été évalué dans des parties autonomes de Blood on the Clocktower — un jeu de déduction sociale complexe similaire à Loup-Garou. Le benchmark, créé par l'utilisateur Reddit cjami, confronte les modèles dans des parties complètes, mesurant le raisonnement, la tromperie et l'utilisation d'outils.

Résultats clés

  • Taux de victoire : 88 % en tant qu'équipe du Bien, 48 % en tant qu'équipe du Mal — globalement élevé mais déséquilibré. La performance en tant que Mal est la principale faiblesse face à Kimi K2.6.
  • Efficacité des jetons : 183 639 jetons de sortie par partie, similaire à Gemini 3.1 Pro. À comparer aux 580 000 jetons de Kimi K2.6 (3 fois plus long).
  • Coût par partie : 0,99 $ — moins de la moitié de Kimi K2.6 (2,65 $) et bien en dessous de Claude Opus 4.6 (3,76 $).
  • Durée des matchs : 2 à 3 heures (contre 10 à 15 heures pour Kimi K2.6 en raison d'un raisonnement verbeux).
  • Taux d'erreur d'appel d'outil : 0,4 % — fiable pour les flux de travail d'agents autonomes.

Performance notable

Raisonnement solide sous incertitude : exemple de réflexion du point de vue des autres vs GPT 5.5 et déductions nettes menant à une victoire.

Ad

Erreurs notables

Conclusion pratique

Pour les développeurs ayant besoin d'un modèle open-weights avec un raisonnement solide dans des contextes multi-agents ou de théorie des jeux, MiMo-V2.5-Pro offre le meilleur rapport qualité-prix parmi les modèles haut de gamme — coût réduit, inférence plus rapide et fiabilité raisonnable, bien qu'avec une marge d'amélioration dans les rôles adverses.

Retranscriptions complètes des modèles et journaux de parties : MiMo-V2.5-Pro sur Clocktower Radio. Méthodologie : Fonctionnement.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

La méthode basée sur la grammaire égale ou surpasse l'IA dans l'analyse de paternité d'œuvres.
News

La méthode basée sur la grammaire égale ou surpasse l'IA dans l'analyse de paternité d'œuvres.

Une étude de l'Université de Manchester a révélé que LambdaG, une méthode d'analyse de paternité basée sur la grammaire, égalait ou surpassait les principaux systèmes d'IA dans la plupart des ensembles de données de test, tout en offrant une plus grande transparence et un coût de calcul inférieur.

OpenClawRadar
La refonte du codebase d'Autonoma sur 18 mois : leçons sur les tests, la dette technique et les Server Actions
News

La refonte du codebase d'Autonoma sur 18 mois : leçons sur les tests, la dette technique et les Server Actions

Autonoma a jeté 1,5 an de code après être passé de 2 à 14 ingénieurs, citant l'absence de tests, TypeScript non strict et les limitations des Server Actions comme principales raisons de la réécriture.

OpenClawRadar
Hershey : L'IA multi-agents effectue la modélisation du mix marketing mensuellement au lieu de trimestriellement
News

Hershey : L'IA multi-agents effectue la modélisation du mix marketing mensuellement au lieu de trimestriellement

Hershey utilise Mutinex (système multi-agent basé sur Claude/Gemini) et Tracer pour automatiser le MMM, réduisant les cycles d'analyse d'annuels à mensuels pour 2 milliards de dollars de dépenses marketing.

OpenClawRadar
Comparaison des performances de Qwen3-30B-A3B et Qwen3.5-35B-A3B sur RTX 5090
News

Comparaison des performances de Qwen3-30B-A3B et Qwen3.5-35B-A3B sur RTX 5090

Un benchmark comparatif entre Qwen3-30B-A3B et Qwen3.5-35B-A3B sur une RTX 5090 montre que le modèle 30B est 35 % plus rapide en génération, tandis que le modèle 3.5 gère mieux les contextes longs avec une échelle de tokens plate contre une dégradation de 21 % pour le 30B.

OpenClawRadar