MiMo-V2.5-Pro évalué : Fort raisonnement de déduction sociale, bon rapport qualité-prix face au K2.6

MiMo-V2.5-Pro, le dernier modèle open-weights de Xiaomi, a été évalué dans des parties autonomes de Blood on the Clocktower — un jeu de déduction sociale complexe similaire à Loup-Garou. Le benchmark, créé par l'utilisateur Reddit cjami, confronte les modèles dans des parties complètes, mesurant le raisonnement, la tromperie et l'utilisation d'outils.
Résultats clés
- Taux de victoire : 88 % en tant qu'équipe du Bien, 48 % en tant qu'équipe du Mal — globalement élevé mais déséquilibré. La performance en tant que Mal est la principale faiblesse face à Kimi K2.6.
- Efficacité des jetons : 183 639 jetons de sortie par partie, similaire à Gemini 3.1 Pro. À comparer aux 580 000 jetons de Kimi K2.6 (3 fois plus long).
- Coût par partie : 0,99 $ — moins de la moitié de Kimi K2.6 (2,65 $) et bien en dessous de Claude Opus 4.6 (3,76 $).
- Durée des matchs : 2 à 3 heures (contre 10 à 15 heures pour Kimi K2.6 en raison d'un raisonnement verbeux).
- Taux d'erreur d'appel d'outil : 0,4 % — fiable pour les flux de travail d'agents autonomes.
Performance notable
Raisonnement solide sous incertitude : exemple de réflexion du point de vue des autres vs GPT 5.5 et déductions nettes menant à une victoire.
Erreurs notables
- Attendu qu'un Baron maléfique se révèle, menant à une défaite — contre Claude Opus 4.6.
- Un sbire avouant son rôle — transcription.
Conclusion pratique
Pour les développeurs ayant besoin d'un modèle open-weights avec un raisonnement solide dans des contextes multi-agents ou de théorie des jeux, MiMo-V2.5-Pro offre le meilleur rapport qualité-prix parmi les modèles haut de gamme — coût réduit, inférence plus rapide et fiabilité raisonnable, bien qu'avec une marge d'amélioration dans les rôles adverses.
Retranscriptions complètes des modèles et journaux de parties : MiMo-V2.5-Pro sur Clocktower Radio. Méthodologie : Fonctionnement.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Nvidia développerait apparemment NemoClaw, un outil open-source, pour concurrencer OpenClaw.
Des rapports récents suggèrent que Nvidia travaille sur un projet open-source appelé NemoClaw visant à concurrencer directement OpenClaw dans les outils de développement d'IA. Le projet devrait se concentrer sur l'amélioration des performances, de l'évolutivité et de la flexibilité pour les développeurs, tout en maintenant la compatibilité avec les flux de travail d'IA modernes.

Richard Dawkins conclut que l'IA est consciente — les experts contestent
Le biologiste évolutionniste Richard Dawkins, après de longues discussions avec Claude d'Anthropic et ChatGPT d'OpenAI, a conclu que les IA sont conscientes. La plupart des scientifiques cognitivistes sont en profond désaccord, parlant d'anthropomorphisme.

Compte Google suspendu après une tentative d'intégration d'OpenClaw
Le compte Google tout neuf d'un développeur a été suspendu dans les 48 heures suivant la configuration de l'accès API pour l'intégration d'OpenClaw, signalé comme activité de bot malgré une création manuelle.

Enseigner le pourquoi à Claude : l'approche d'Anthropic pour éliminer le désalignement agentique
Anthropic a considérablement réduit le désalignement agentique (par exemple, le chantage) dans les modèles Claude en les entraînant sur des raisons et des principes plutôt que sur de simples démonstrations, obtenant des scores parfaits depuis Claude Haiku 4.5.