A Microsoft lança o modelo multimodal Phi-4-reasoning-vision-15B com insights de treinamento.

✍️ OpenClawRadar📅 Publicado: March 7, 2026🔗 Source
A Microsoft lança o modelo multimodal Phi-4-reasoning-vision-15B com insights de treinamento.
Ad

Visão geral e disponibilidade do modelo

O Phi-4-reasoning-vision-15B é um modelo multimodal de raciocínio de 15 bilhões de parâmetros com pesos abertos, disponível através do Microsoft Foundry, HuggingFace e GitHub. Ele foi projetado como um modelo compacto que equilibra poder de raciocínio, eficiência e necessidades de dados de treinamento.

Capacidades e desempenho

O modelo lida com uma ampla gama de tarefas de visão e linguagem, incluindo legendagem de imagens, perguntas sobre imagens, leitura de documentos e recibos, ajuda com lição de casa e inferência sobre mudanças em sequências de imagens. Ele se destaca especialmente no raciocínio matemático e científico e na compreensão e localização de elementos em telas de computador e dispositivos móveis.

Os benchmarks de desempenho mostram resultados competitivos em comparação com modelos mais lentos que exigem dez vezes ou mais tempo de computação e tokens, com melhor precisão do que modelos igualmente rápidos para raciocínio matemático e científico. Os benchmarks utilizados incluem ChartQA_TEST, MathVista_MINI, MMMU_VAL e ScreenSpot_v2.

Ad

Abordagem de treinamento e eficiência

O modelo foi treinado com apenas 200 bilhões de tokens de dados multimodais, aproveitando o Phi-4-reasoning (treinado com 16 bilhões de tokens) baseado no Phi-4 (400 bilhões de tokens únicos). Isso se compara a mais de 1 trilhão de tokens usados para treinar outros modelos multimodais como Qwen 2.5 VL, Qwen 3 VL, Kimi-VL e Gemma3.

A Microsoft enfatiza escolhas cuidadosas de arquitetura, curadoria rigorosa de dados e o uso de uma mistura de dados de raciocínio e não-raciocínio como lições-chave do treinamento deste modelo. A abordagem visa avançar a fronteira de Pareto do equilíbrio entre precisão e custos computacionais.

Casos de uso pretendidos

O modelo é destinado a ambientes com recursos limitados ou interativos onde são necessários modelos de visão e linguagem menores e mais rápidos. Ele é leve o suficiente para rodar em hardware modesto enquanto mantém capacidades estruturadas de raciocínio.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

Centros de Dados de IA Aumentam Temperaturas Locais Até 9,1°C, Revela Estudo
News

Centros de Dados de IA Aumentam Temperaturas Locais Até 9,1°C, Revela Estudo

Um estudo da Universidade de Cambridge descobriu que os data centers de IA elevam a temperatura da superfície terrestre em média 2°C após o início das operações, com casos extremos atingindo aumentos de 9,1°C, afetando áreas de até 10 quilômetros de distância.

OpenClawRadar
Antropico Bloqueia Assinaturas do Claude por Ferramentas de Terceiros
News

Antropico Bloqueia Assinaturas do Claude por Ferramentas de Terceiros

A Anthropic implementou bloqueios no lado do servidor para assinaturas Claude Pro/Max usadas por meio de integrações OAuth de terceiros, citando o aproveitamento em larga escala de acesso subsidiado. A mudança de política inclui a cobrança de 'Uso Extra' que torna essas integrações economicamente inviáveis.

OpenClawRadar
🦀
News

Claude Code v2.1.210 corrige isolamento de worktree, adesão opt-in ao Ultracode e dezenas de bugs

Destaques incluem correção de isolamento de worktree para subagentes, correção do opt-in da palavra-chave ultracode, novo contador de tempo decorrido e descontinuações de regras de permissão.

OpenClawRadar
LLM local enfrenta dificuldades com Solitaire em Unreal Engine: Qwen 3.6-27B consome 687 mil tokens em uma carta
News

LLM local enfrenta dificuldades com Solitaire em Unreal Engine: Qwen 3.6-27B consome 687 mil tokens em uma carta

A tentativa de um desenvolvedor de construir um jogo de Paciência na Unreal Engine usando Qwen 3.6-27B consumiu 687 mil tokens para uma única carta, exigindo intervenção manual para baixar PNGs, criar malha e muitos prompts.

OpenClawRadar