Microsoft lanza el modelo multimodal Phi-4-reasoning-vision-15B con información sobre su entrenamiento.

Descripción general y disponibilidad del modelo
Phi-4-reasoning-vision-15B es un modelo de razonamiento multimodal de código abierto con 15 mil millones de parámetros que está disponible a través de Microsoft Foundry, HuggingFace y GitHub. Está diseñado como un modelo compacto que equilibra el poder de razonamiento, la eficiencia y los requisitos de datos de entrenamiento.
Capacidades y rendimiento
El modelo maneja una amplia gama de tareas de visión y lenguaje, incluyendo descripción de imágenes, hacer preguntas sobre imágenes, lectura de documentos y recibos, ayuda con tareas escolares e inferencia sobre cambios en secuencias de imágenes. Destaca especialmente en razonamiento matemático y científico, y en la comprensión y localización de elementos en pantallas de computadora y dispositivos móviles.
Los puntos de referencia de rendimiento muestran resultados competitivos en comparación con modelos más lentos que requieren diez veces o más tiempo de cómputo y tokens, con mejor precisión que modelos igualmente rápidos para razonamiento matemático y científico. Los puntos de referencia utilizados incluyen ChartQA_TEST, MathVista_MINI, MMMU_VAL y ScreenSpot_v2.
Enfoque de entrenamiento y eficiencia
El modelo fue entrenado con solo 200 mil millones de tokens de datos multimodales, aprovechando Phi-4-reasoning (entrenado con 16 mil millones de tokens) basado en Phi-4 (400 mil millones de tokens únicos). Esto se compara con más de 1 billón de tokens utilizados para entrenar otros modelos multimodales como Qwen 2.5 VL, Qwen 3 VL, Kimi-VL y Gemma3.
Microsoft enfatiza elecciones cuidadosas de arquitectura, curación rigurosa de datos y el uso de una mezcla de datos de razonamiento y no razonamiento como lecciones clave del entrenamiento de este modelo. El enfoque busca avanzar la frontera de Pareto del equilibrio entre precisión y costos de cómputo.
Casos de uso objetivo
El modelo está destinado a entornos con recursos limitados o interactivos donde se necesitan modelos de visión y lenguaje más pequeños y rápidos. Es lo suficientemente liviano para ejecutarse en hardware modesto mientras mantiene capacidades de razonamiento estructurado.
📖 Read the full source: HN AI Agents
👀 Ver también

Diseñando un equipo de agentes: Cómo Google Antigravity estructura subagentes para la generación autónoma de código
Google Antigravity revela su arquitectura de subagentes para codificación autónoma: siete tipos de agentes especializados, desde el Centinela (recepcionista) hasta el Auditor (verificador de autenticidad). Relevante para el diseño de subagentes de OpenClaw.

Claude planea agregar crédito programático mensual para el uso de API
Los planes de Claude de Anthropic incluirán un crédito mensual dedicado para uso programático (API), según un tuit de ClaudeDevs en X.

Las organizaciones sin fines de lucro obtienen acceso a Claude Opus 4.6 en los planes de equipo y empresarial.
Las organizaciones sin fines de lucro que utilizan los planes Team y Enterprise ahora pueden acceder a Claude Opus 4.6, el último modelo de IA de Anthropic, sin costo adicional.

Cuando el Código se Vuelve Barato, la Comprensión se Vuelve Cara
Markus Poppastring establece paralelismos entre la ola de subcontratación de los 2000 y la generación de código mediante IA actual: el costo pasa de escribir código a entenderlo, y con la IA, la intención puede no existir en ningún lado.