A Microsoft lança o modelo multimodal Phi-4-reasoning-vision-15B com insights de treinamento.

✍️ OpenClawRadar📅 Publicado: March 7, 2026🔗 Source
A Microsoft lança o modelo multimodal Phi-4-reasoning-vision-15B com insights de treinamento.
Ad

Visão geral e disponibilidade do modelo

O Phi-4-reasoning-vision-15B é um modelo multimodal de raciocínio de 15 bilhões de parâmetros com pesos abertos, disponível através do Microsoft Foundry, HuggingFace e GitHub. Ele foi projetado como um modelo compacto que equilibra poder de raciocínio, eficiência e necessidades de dados de treinamento.

Capacidades e desempenho

O modelo lida com uma ampla gama de tarefas de visão e linguagem, incluindo legendagem de imagens, perguntas sobre imagens, leitura de documentos e recibos, ajuda com lição de casa e inferência sobre mudanças em sequências de imagens. Ele se destaca especialmente no raciocínio matemático e científico e na compreensão e localização de elementos em telas de computador e dispositivos móveis.

Os benchmarks de desempenho mostram resultados competitivos em comparação com modelos mais lentos que exigem dez vezes ou mais tempo de computação e tokens, com melhor precisão do que modelos igualmente rápidos para raciocínio matemático e científico. Os benchmarks utilizados incluem ChartQA_TEST, MathVista_MINI, MMMU_VAL e ScreenSpot_v2.

Ad

Abordagem de treinamento e eficiência

O modelo foi treinado com apenas 200 bilhões de tokens de dados multimodais, aproveitando o Phi-4-reasoning (treinado com 16 bilhões de tokens) baseado no Phi-4 (400 bilhões de tokens únicos). Isso se compara a mais de 1 trilhão de tokens usados para treinar outros modelos multimodais como Qwen 2.5 VL, Qwen 3 VL, Kimi-VL e Gemma3.

A Microsoft enfatiza escolhas cuidadosas de arquitetura, curadoria rigorosa de dados e o uso de uma mistura de dados de raciocínio e não-raciocínio como lições-chave do treinamento deste modelo. A abordagem visa avançar a fronteira de Pareto do equilíbrio entre precisão e custos computacionais.

Casos de uso pretendidos

O modelo é destinado a ambientes com recursos limitados ou interativos onde são necessários modelos de visão e linguagem menores e mais rápidos. Ele é leve o suficiente para rodar em hardware modesto enquanto mantém capacidades estruturadas de raciocínio.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also