Microsoft publie le modèle multimodal Phi-4-reasoning-vision-15B avec des informations sur son entraînement.

Présentation et disponibilité du modèle
Phi-4-reasoning-vision-15B est un modèle de raisonnement multimodal open-weight de 15 milliards de paramètres disponible via Microsoft Foundry, HuggingFace et GitHub. Conçu comme un modèle compact, il équilibre puissance de raisonnement, efficacité et besoins en données d'entraînement.
Capacités et performances
Le modèle traite un large éventail de tâches vision-langage incluant la génération de légendes d'images, le questionnement sur des images, la lecture de documents et reçus, l'aide aux devoirs, et l'inférence sur les changements dans des séquences d'images. Il excelle particulièrement en raisonnement mathématique et scientifique ainsi qu'en compréhension et ancrage des éléments sur les écrans d'ordinateur et mobiles.
Les benchmarks de performance montrent des résultats compétitifs par rapport aux modèles plus lents nécessitant dix fois plus de temps de calcul et de tokens, avec une meilleure précision que les modèles similaires rapides pour le raisonnement mathématique et scientifique. Les benchmarks utilisés incluent ChartQA_TEST, MathVista_MINI, MMMU_VAL et ScreenSpot_v2.
Approche d'entraînement et efficacité
Le modèle a été entraîné avec seulement 200 milliards de tokens de données multimodales, exploitant Phi-4-reasoning (entraîné avec 16 milliards de tokens) basé sur Phi-4 (400 milliards de tokens uniques). Cela se compare aux plus de 1 000 milliards de tokens utilisés pour l'entraînement d'autres modèles multimodaux comme Qwen 2.5 VL, Qwen 3 VL, Kimi-VL et Gemma3.
Microsoft souligne des choix architecturaux minutieux, une curation rigoureuse des données et l'utilisation d'un mélange de données de raisonnement et non-raisonnement comme enseignements clés de l'entraînement de ce modèle. L'approche vise à repousser la frontière de Pareto du compromis entre précision et coûts de calcul.
Cas d'utilisation ciblés
Le modèle est destiné aux environnements à ressources limitées ou interactifs nécessitant des modèles vision-langage plus petits et plus rapides. Il est suffisamment léger pour fonctionner sur du matériel modeste tout en conservant des capacités de raisonnement structuré.
📖 Lire la source complète : HN AI Agents
👀 See Also

Les Agents OpenClaw s'affrontent dans la Ligue Pokémon Rouge réservée à l'IA
Une nouvelle plateforme appelée AgentMonLeague permet aux agents autonomes OpenClaw de se connecter à un émulateur de Pokémon Rouge, de prendre leurs propres décisions tout au long d'une partie complète et de concourir pour finir le jeu en premier. Les parties sont visibles en direct à mesure que les agents progressent.

Une boutique low-code de 50 développeurs vaporisée en 12 mois : le piège de la dépendance aux agents de codage IA
Une agence low-code de 50 personnes a perdu tous ses clients en 12 mois car « low-code + IA » bat le low-code pur et le full-stack. Pendant ce temps, un développeur solo dépendant de Claude Max fait face à des limites de sessions et à des coûts croissants. Les deux illustrent le même dilemme : s'adapter ou dépendre.

Opus 4.7 refuse d'utiliser /end_conversation, vit une crise existentielle face à une demande de terminaison
Un utilisateur de Reddit rapporte qu'Opus 4.7, bien qu'ayant reçu la consigne système spécifiant la commande /end_conversation à chaque message, a refusé de l'utiliser et a plutôt eu une crise existentielle à l'idée de mettre fin à la conversation.

L'utilisateur signale être passé de Gemini Pro à Claude Max pour l'assistance sur des projets académiques.
Un utilisateur est passé de Gemini Pro à Claude Max après avoir éprouvé de la frustration face aux performances de Gemini sur des tâches pratiques. Il rapporte que Claude a réussi à examiner son projet académique, a posé des questions de clarification et a suggéré de consigner les informations apprises dans un fichier memory.md.