Microsoft publie le modèle multimodal Phi-4-reasoning-vision-15B avec des informations sur son entraînement.

Présentation et disponibilité du modèle
Phi-4-reasoning-vision-15B est un modèle de raisonnement multimodal open-weight de 15 milliards de paramètres disponible via Microsoft Foundry, HuggingFace et GitHub. Conçu comme un modèle compact, il équilibre puissance de raisonnement, efficacité et besoins en données d'entraînement.
Capacités et performances
Le modèle traite un large éventail de tâches vision-langage incluant la génération de légendes d'images, le questionnement sur des images, la lecture de documents et reçus, l'aide aux devoirs, et l'inférence sur les changements dans des séquences d'images. Il excelle particulièrement en raisonnement mathématique et scientifique ainsi qu'en compréhension et ancrage des éléments sur les écrans d'ordinateur et mobiles.
Les benchmarks de performance montrent des résultats compétitifs par rapport aux modèles plus lents nécessitant dix fois plus de temps de calcul et de tokens, avec une meilleure précision que les modèles similaires rapides pour le raisonnement mathématique et scientifique. Les benchmarks utilisés incluent ChartQA_TEST, MathVista_MINI, MMMU_VAL et ScreenSpot_v2.
Approche d'entraînement et efficacité
Le modèle a été entraîné avec seulement 200 milliards de tokens de données multimodales, exploitant Phi-4-reasoning (entraîné avec 16 milliards de tokens) basé sur Phi-4 (400 milliards de tokens uniques). Cela se compare aux plus de 1 000 milliards de tokens utilisés pour l'entraînement d'autres modèles multimodaux comme Qwen 2.5 VL, Qwen 3 VL, Kimi-VL et Gemma3.
Microsoft souligne des choix architecturaux minutieux, une curation rigoureuse des données et l'utilisation d'un mélange de données de raisonnement et non-raisonnement comme enseignements clés de l'entraînement de ce modèle. L'approche vise à repousser la frontière de Pareto du compromis entre précision et coûts de calcul.
Cas d'utilisation ciblés
Le modèle est destiné aux environnements à ressources limitées ou interactifs nécessitant des modèles vision-langage plus petits et plus rapides. Il est suffisamment léger pour fonctionner sur du matériel modeste tout en conservant des capacités de raisonnement structuré.
📖 Lire la source complète : HN AI Agents
👀 See Also

Les scénaristes d'Hollywood se tournent vers la formation en IA : témoignage à la première personne du travail d'annotation de données
Un showrunner hollywoodien décrit sa transition vers le travail de formation à l'IA à 52 $/heure après la grève de 2023, en annotant des conversations, des images et des vidéos pour des entreprises comme Mercor et Outlier.

Le verrouillage des fournisseurs d'IA s'intensifie : le changement de modèle coûte désormais plus cher que prévu
Un sondage Zapier auprès de 542 dirigeants américains montre que 90 % pensaient pouvoir changer de fournisseur d'IA en moins de 4 semaines, mais 58 % des migrations réelles ont échoué ou ont pris beaucoup plus de temps. Parallèlement, OpenAI a augmenté le prix des tokens d'entrée de GPT-5.2 de 1,25 $ à 5,75 $, et Anthropic est passé à une tarification dynamique pour Claude Enterprise, ce qui pourrait doubler ou tripler les coûts pour les utilisateurs intensifs.

Claude Code v2.1.139 ajoute la vue Agent, la commande /goal et des améliorations majeures de MCP
Claude Code v2.1.139 introduit une nouvelle vue agent pour la gestion des sessions, une commande /goal pour les tâches multi-tours, des capacités de hook étendues, et des corrections pour les problèmes de mémoire du serveur MCP et de corruption du terminal.

Le modèle IA Gemini Nano de Chrome consomme 4 Go d'espace disque
Selon un rapport de The Verge, Google Chrome télécharge automatiquement un fichier weights.bin de 4 Go pour le modèle d'IA Gemini Nano intégré, ce qui peut gonfler le stockage sans notification claire à l'utilisateur. La désactivation du bouton IA Intégrée dans les paramètres supprime le fichier et empêche un nouveau téléchargement.