Microsoft выпускает мультимодальную модель Phi-4-reasoning-vision-15B с описанием процесса обучения.

Обзор модели и доступность
Phi-4-reasoning-vision-15B — это 15-миллиардная параметрическая модель с открытыми весами для мультимодального анализа, доступная через Microsoft Foundry, HuggingFace и GitHub. Она разработана как компактная модель, сочетающая аналитические возможности, эффективность и требования к обучающим данным.
Возможности и производительность
Модель обрабатывает широкий спектр задач компьютерного зрения и обработки естественного языка, включая описание изображений, ответы на вопросы об изображениях, чтение документов и чеков, помощь с домашними заданиями и анализ изменений в последовательностях изображений. Она особенно хорошо справляется с математическими и научными задачами, а также с пониманием и определением элементов на экранах компьютеров и мобильных устройств.
Тестовые показатели демонстрируют конкурентоспособные результаты по сравнению с более медленными моделями, требующими в десять или более раз больше вычислительного времени и токенов, с лучшей точностью, чем у аналогичных быстрых моделей для математических и научных задач. Использованные тесты включают ChartQA_TEST, MathVista_MINI, MMMU_VAL и ScreenSpot_v2.
Подход к обучению и эффективность
Модель была обучена всего на 200 миллиардах токенов мультимодальных данных, используя Phi-4-reasoning (обученную на 16 миллиардах токенов) на основе Phi-4 (400 миллиардов уникальных токенов). Для сравнения, другие мультимодальные модели, такие как Qwen 2.5 VL, Qwen 3 VL, Kimi-VL и Gemma3, обучались на более чем 1 триллионе токенов.
Microsoft подчеркивает тщательный выбор архитектуры, строгий отбор данных и использование смеси аналитических и неаналитических данных как ключевые уроки при обучении этой модели. Такой подход направлен на расширение парето-границы компромисса между точностью и вычислительными затратами.
Целевые сценарии использования
Модель предназначена для ресурсоограниченных или интерактивных сред, где требуются более компактные и быстрые модели компьютерного зрения и обработки естественного языка. Она достаточно легковесна для работы на скромном оборудовании, сохраняя при этом структурированные аналитические возможности.
📖 Read the full source: HN AI Agents
👀 Смотрите также
Обнаруженные материалы: ИИ-агенты открывают более 500 новых материалов, но только у одного есть реальный путь синтеза
Discovered Materials (YC P26) использовала передовые LLM для вычислительного поиска более 500 новых полупроводниковых материалов. Только один имеет реальный путь синтеза, что подчеркивает разрыв между лабораторией и производством.
Зарплаты в сфере ИИ подняли медианную цену домов в Сан-Франциско до рекордных $1,76 млн
Медианная цена дома в Сан-Франциско достигла рекордных $1,76 млн в мае 2026 года благодаря доходам сотрудников AI-компаний, таких как OpenAI и Anthropic. Некоторые продавцы даже принимают акции AI-компаний вместо наличных.

Мэрилендцы столкнутся с модернизацией сети за 2 млрд долларов для дата-центров ИИ в других штатах — власти подали жалобу в FERC
Управление народного адвоката Мэриленда подало жалобу в FERC на PJM Interconnection, которая выделила 2 миллиарда долларов из 22 миллиардов долларов на модернизацию сети для Мэриленда — что обойдется бытовым потребителям примерно в 345 долларов каждого, в основном для выгоды центров обработки данных ИИ из других штатов.
Обыденный риск: почему самые большие угрозы ИИ-безопасности скучны, а не драматичны
В эссе утверждается, что банальные сбои ИИ уже наносят масштабный ущерб, современные подходы к выравниванию слишком сильно зависят от изолированных сред, а конвергенция возможностей делает случайное попадание в открытый мир все более вероятным.