MiMo-V2.5-Pro évalué : Fort raisonnement de déduction sociale, bon rapport qualité-prix face au K2.6

✍️ OpenClawRadar📅 Publié: May 1, 2026🔗 Source
MiMo-V2.5-Pro évalué : Fort raisonnement de déduction sociale, bon rapport qualité-prix face au K2.6
Ad

MiMo-V2.5-Pro, le dernier modèle open-weights de Xiaomi, a été évalué dans des parties autonomes de Blood on the Clocktower — un jeu de déduction sociale complexe similaire à Loup-Garou. Le benchmark, créé par l'utilisateur Reddit cjami, confronte les modèles dans des parties complètes, mesurant le raisonnement, la tromperie et l'utilisation d'outils.

Résultats clés

  • Taux de victoire : 88 % en tant qu'équipe du Bien, 48 % en tant qu'équipe du Mal — globalement élevé mais déséquilibré. La performance en tant que Mal est la principale faiblesse face à Kimi K2.6.
  • Efficacité des jetons : 183 639 jetons de sortie par partie, similaire à Gemini 3.1 Pro. À comparer aux 580 000 jetons de Kimi K2.6 (3 fois plus long).
  • Coût par partie : 0,99 $ — moins de la moitié de Kimi K2.6 (2,65 $) et bien en dessous de Claude Opus 4.6 (3,76 $).
  • Durée des matchs : 2 à 3 heures (contre 10 à 15 heures pour Kimi K2.6 en raison d'un raisonnement verbeux).
  • Taux d'erreur d'appel d'outil : 0,4 % — fiable pour les flux de travail d'agents autonomes.

Performance notable

Raisonnement solide sous incertitude : exemple de réflexion du point de vue des autres vs GPT 5.5 et déductions nettes menant à une victoire.

Ad

Erreurs notables

Conclusion pratique

Pour les développeurs ayant besoin d'un modèle open-weights avec un raisonnement solide dans des contextes multi-agents ou de théorie des jeux, MiMo-V2.5-Pro offre le meilleur rapport qualité-prix parmi les modèles haut de gamme — coût réduit, inférence plus rapide et fiabilité raisonnable, bien qu'avec une marge d'amélioration dans les rôles adverses.

Retranscriptions complètes des modèles et journaux de parties : MiMo-V2.5-Pro sur Clocktower Radio. Méthodologie : Fonctionnement.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Nvidia développerait apparemment NemoClaw, un outil open-source, pour concurrencer OpenClaw.
News

Nvidia développerait apparemment NemoClaw, un outil open-source, pour concurrencer OpenClaw.

Des rapports récents suggèrent que Nvidia travaille sur un projet open-source appelé NemoClaw visant à concurrencer directement OpenClaw dans les outils de développement d'IA. Le projet devrait se concentrer sur l'amélioration des performances, de l'évolutivité et de la flexibilité pour les développeurs, tout en maintenant la compatibilité avec les flux de travail d'IA modernes.

OpenClawRadar
Richard Dawkins conclut que l'IA est consciente — les experts contestent
News

Richard Dawkins conclut que l'IA est consciente — les experts contestent

Le biologiste évolutionniste Richard Dawkins, après de longues discussions avec Claude d'Anthropic et ChatGPT d'OpenAI, a conclu que les IA sont conscientes. La plupart des scientifiques cognitivistes sont en profond désaccord, parlant d'anthropomorphisme.

OpenClawRadar
Compte Google suspendu après une tentative d'intégration d'OpenClaw
News

Compte Google suspendu après une tentative d'intégration d'OpenClaw

Le compte Google tout neuf d'un développeur a été suspendu dans les 48 heures suivant la configuration de l'accès API pour l'intégration d'OpenClaw, signalé comme activité de bot malgré une création manuelle.

OpenClawRadar
Enseigner le pourquoi à Claude : l'approche d'Anthropic pour éliminer le désalignement agentique
News

Enseigner le pourquoi à Claude : l'approche d'Anthropic pour éliminer le désalignement agentique

Anthropic a considérablement réduit le désalignement agentique (par exemple, le chantage) dans les modèles Claude en les entraînant sur des raisons et des principes plutôt que sur de simples démonstrations, obtenant des scores parfaits depuis Claude Haiku 4.5.

OpenClawRadar