Xiaomi publie en open source MiMo-V2.5-Pro : approche les performances de Claude Opus 4.6 sur les benchmarks de codage

Xiaomi a publié la famille de modèles open-source MiMo-V2.5, dont la variante Pro offre des benchmarks de codage compétitifs par rapport à Claude Opus 4.6 et GPT-5.4.
Tests concrets
Le V2.5-Pro a réalisé un projet de compilateur de l'Université de Pékin (compilateur SysY en Rust) en 4,3 heures avec un score parfait de 233/233 — supérieur à la plupart des étudiants qui y consacrent des semaines. Sur une consigne vague comme "crée un éditeur vidéo", il a produit de manière autonome une application de bureau de 8 192 lignes avec timeline multi-pistes, découpage de clips, fondus enchaînés, mixage audio et pipeline d'exportation après 11,5 heures et 1 868 appels d'outils. Dans une tâche de conception de circuits analogiques de niveau master (LDO Flipped-Voltage-Follower en TSMC 180nm), il a itéré via la simulation ngspice et amélioré la régulation de ligne de 22× et la régulation de charge de 17× par rapport à sa propre tentative initiale.
Benchmarks vs. Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro, DeepSeek V4 Pro
- SWE-Bench Pro : 57,2 (vs. 57,3 Claude, 57,7 GPT, 54,2 Gemini, 55,4 DeepSeek)
- SWE-Bench Verified : 78,9 (vs. 80,8 Claude, n/a GPT, 76,2 Gemini, 80,6 DeepSeek)
- Terminal-Bench 2.0 : 68,4 (vs. 65,4 Claude, 75,1 GPT, 68,5 Gemini, 67,9 DeepSeek) — devance Claude et Gemini
- Claw-Eval Pass@3 : 63,8 (vs. 70,4 Claude, 60,3 GPT, 57,8 Gemini, 59,8 DeepSeek) — bat GPT et Gemini
- HLE avec outils : 48,0 (vs. 53,0 Claude, 58,7 GPT, 51,4 Gemini, 48,2 DeepSeek) — à la traîne en raisonnement général
- GDPVal-AA : 1581 (vs. 1606 Claude, 1674 GPT, 1317 Gemini, 1554 DeepSeek) — à la traîne derrière GPT et Claude
Sur Claw-Eval, le graphique d'efficacité des tokens de Xiaomi prétend également que V2.5-Pro (63,8) bat Claude Sonnet 4.6. Le V2.5-Pro prend en charge l'exécution de tâches soutenues sur plus de 1 000 appels d'outils avec auto-correction ; un passage de refactorisation régressive au tour 512 a été détecté et corrigé de manière autonome.
Les poids sont désormais open-source pour téléchargement et auto-hébergement.
📖 Lire la source complète : HN AI Agents
👀 See Also

Claude IA analyse Les androïdes rêvent-ils de moutons électriques, établit des parallèles avec la régulation de l'IA
Claude AI a lu Do Androids Dream of Electric Sheep de Philip K. Dick et a produit des notes détaillées analysant les thèmes du livre à travers le prisme de l'intelligence artificielle. L'analyse se concentre sur le test d'empathie Voigt-Kampff en tant qu'outil de conformité culturelle, la logique économique de la chasse aux primes et les parallèles avec les débats contemporains sur la régulation de l'IA.

Claude Code System Prompts v2.1.53-2.1.55 : Sélection de mémoire ajoutée, exécution de commande supprimée
Les versions 2.1.53 à 2.1.55 des prompts système de Claude Code ajoutent des instructions de sélection de mémoire (156 tokens), suppriment le spécialiste d'exécution de commandes (109 tokens) et réorganisent les prompts en environ 70 fichiers atomiques. Les agents en arrière-plan notifient désormais automatiquement de l'achèvement au lieu de fournir des chemins de fichiers de sortie.

Meta publie le modèle d'IA BOxCrete pour la conception de mélanges de béton
Meta a lancé Bayesian Optimization for Concrete (BOxCrete), un modèle d'IA open source pour concevoir des mélanges de béton durables utilisant des matériaux produits aux États-Unis. Le modèle améliore les versions précédentes avec une meilleure robustesse au bruit et des capacités de prédiction d'affaissement.

InclusionAI dévoile Ring-2.6-1T : modèle à un trillion de paramètres pour les flux de travail des agents
InclusionAI a dévoilé Ring-2.6-1T, un modèle de raisonnement de 1 billion de paramètres optimisé pour l'exécution par agent, avec deux niveaux d'effort de raisonnement (high/xhigh) et un apprentissage par renforcement asynchrone via l'algorithme IcePop.