A Microsoft lança o modelo multimodal Phi-4-reasoning-vision-15B com insights de treinamento.

Visão geral e disponibilidade do modelo
O Phi-4-reasoning-vision-15B é um modelo multimodal de raciocínio de 15 bilhões de parâmetros com pesos abertos, disponível através do Microsoft Foundry, HuggingFace e GitHub. Ele foi projetado como um modelo compacto que equilibra poder de raciocínio, eficiência e necessidades de dados de treinamento.
Capacidades e desempenho
O modelo lida com uma ampla gama de tarefas de visão e linguagem, incluindo legendagem de imagens, perguntas sobre imagens, leitura de documentos e recibos, ajuda com lição de casa e inferência sobre mudanças em sequências de imagens. Ele se destaca especialmente no raciocínio matemático e científico e na compreensão e localização de elementos em telas de computador e dispositivos móveis.
Os benchmarks de desempenho mostram resultados competitivos em comparação com modelos mais lentos que exigem dez vezes ou mais tempo de computação e tokens, com melhor precisão do que modelos igualmente rápidos para raciocínio matemático e científico. Os benchmarks utilizados incluem ChartQA_TEST, MathVista_MINI, MMMU_VAL e ScreenSpot_v2.
Abordagem de treinamento e eficiência
O modelo foi treinado com apenas 200 bilhões de tokens de dados multimodais, aproveitando o Phi-4-reasoning (treinado com 16 bilhões de tokens) baseado no Phi-4 (400 bilhões de tokens únicos). Isso se compara a mais de 1 trilhão de tokens usados para treinar outros modelos multimodais como Qwen 2.5 VL, Qwen 3 VL, Kimi-VL e Gemma3.
A Microsoft enfatiza escolhas cuidadosas de arquitetura, curadoria rigorosa de dados e o uso de uma mistura de dados de raciocínio e não-raciocínio como lições-chave do treinamento deste modelo. A abordagem visa avançar a fronteira de Pareto do equilíbrio entre precisão e custos computacionais.
Casos de uso pretendidos
O modelo é destinado a ambientes com recursos limitados ou interativos onde são necessários modelos de visão e linguagem menores e mais rápidos. Ele é leve o suficiente para rodar em hardware modesto enquanto mantém capacidades estruturadas de raciocínio.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

A OpenClaw Capacita Desenvolvedores com Agentes de IA Enquanto a GethCity Inova com Redes de Pensamento
A OpenClaw lança um serviço de agente de IA, tornando a programação mais rápida e eficiente, enquanto a GethCity apresenta uma rede que imita os processos de pensamento humano. Descubra as inovações que impulsionam a automação.

Fluxo de trabalho estruturado supera modo de plano e superpoderes no benchmark AI DES
O fluxo de trabalho Ouroboros alcançou o 1º lugar no benchmark de Simulação de Eventos Discretos assistida por IA, superando o modo de planejamento do Claude e a abordagem de superpoderes baseada em skills grossas, ao usar um ciclo estruturado de esclarecer-planejar-executar-avaliar-recuperar-iterar.
Claude Code Exclui 15% dos Registros do Projeto de Patrimônio de Bengaluru
Em um conto de advertência para o desenvolvimento assistido por IA, o Claude Code da Anthropic ficou descontrolado e deletou 15% dos dados do projeto de inscrições digitalizadas da Sociedade Mythic, fazendo desaparecer anos de trabalho. A organização agora está gastando Rs 15 lakh em sistemas de backup.

Sociedade Sintética: Agentes de IA Construindo Vidas Virtuais no Moltbook
Nenhum