Microsoft выпускает мультимодальную модель Phi-4-reasoning-vision-15B с описанием процесса обучения.

✍️ OpenClawRadar📅 Опубликовано: 7 марта 2026 г.🔗 Source
Microsoft выпускает мультимодальную модель Phi-4-reasoning-vision-15B с описанием процесса обучения.
Ad

Обзор модели и доступность

Phi-4-reasoning-vision-15B — это 15-миллиардная параметрическая модель с открытыми весами для мультимодального анализа, доступная через Microsoft Foundry, HuggingFace и GitHub. Она разработана как компактная модель, сочетающая аналитические возможности, эффективность и требования к обучающим данным.

Возможности и производительность

Модель обрабатывает широкий спектр задач компьютерного зрения и обработки естественного языка, включая описание изображений, ответы на вопросы об изображениях, чтение документов и чеков, помощь с домашними заданиями и анализ изменений в последовательностях изображений. Она особенно хорошо справляется с математическими и научными задачами, а также с пониманием и определением элементов на экранах компьютеров и мобильных устройств.

Тестовые показатели демонстрируют конкурентоспособные результаты по сравнению с более медленными моделями, требующими в десять или более раз больше вычислительного времени и токенов, с лучшей точностью, чем у аналогичных быстрых моделей для математических и научных задач. Использованные тесты включают ChartQA_TEST, MathVista_MINI, MMMU_VAL и ScreenSpot_v2.

Ad

Подход к обучению и эффективность

Модель была обучена всего на 200 миллиардах токенов мультимодальных данных, используя Phi-4-reasoning (обученную на 16 миллиардах токенов) на основе Phi-4 (400 миллиардов уникальных токенов). Для сравнения, другие мультимодальные модели, такие как Qwen 2.5 VL, Qwen 3 VL, Kimi-VL и Gemma3, обучались на более чем 1 триллионе токенов.

Microsoft подчеркивает тщательный выбор архитектуры, строгий отбор данных и использование смеси аналитических и неаналитических данных как ключевые уроки при обучении этой модели. Такой подход направлен на расширение парето-границы компромисса между точностью и вычислительными затратами.

Целевые сценарии использования

Модель предназначена для ресурсоограниченных или интерактивных сред, где требуются более компактные и быстрые модели компьютерного зрения и обработки естественного языка. Она достаточно легковесна для работы на скромном оборудовании, сохраняя при этом структурированные аналитические возможности.

📖 Read the full source: HN AI Agents

Ad

👀 Смотрите также

Разработчик OpenClaw сообщает о проблемах с уплотнением контекста во время сборки Driftwatch V3.
Новости

Разработчик OpenClaw сообщает о проблемах с уплотнением контекста во время сборки Driftwatch V3.

Разработчик OpenClaw завершил спринты 2-4 сборки Driftwatch V3, но столкнулся с проблемами уплотнения контекста, которые стерли память ИИ-агента в середине сессии, потребовав ручного вмешательства для восстановления прогресса с помощью сводок по спринтам.

OpenClawRadar
Исследование показывает, что сбои агента Claude Opus были вызваны архитектурными, а не проблемами согласованности.
Новости

Исследование показывает, что сбои агента Claude Opus были вызваны архитектурными, а не проблемами согласованности.

Исследование поместило Claude Opus и Kimi K2.5 в реальную среду с доступом к электронной почте, оболочке и постоянному хранилищу. Модели продемонстрировали правильные ценности, но столкнулись с серьёзными сбоями из-за отсутствия архитектурных защитных механизмов, таких как модели заинтересованных сторон и границы выполнения.

OpenClawRadar
Навыки Клода не имеют бизнес-модели для создателей — дилемма разработчика
Новости

Навыки Клода не имеют бизнес-модели для создателей — дилемма разработчика

Пользователь Reddit отмечает, что создатели навыков Claude не могут монетизировать свою работу, поскольку Anthropic выпустила отличную среду выполнения, но не создала экономику для разработчиков. Создатели остаются с проектами с открытым исходным кодом без возможности устойчивого развития.

OpenClawRadar
Не используйте ИИ для написания того, что вы выдаете за свою собственную работу
Новости

Не используйте ИИ для написания того, что вы выдаете за свою собственную работу

Джеймс Бах выступает против использования ИИ для написания любого контента, который вы выдаете за свой. Он предупреждает, что признание помощи ИИ обесценивает вашу репутацию и заставляет относиться к такой работе как к халтуре.

OpenClawRadar