Microsoft lanza el modelo multimodal Phi-4-reasoning-vision-15B con información sobre su entrenamiento.

Descripción general y disponibilidad del modelo
Phi-4-reasoning-vision-15B es un modelo de razonamiento multimodal de código abierto con 15 mil millones de parámetros que está disponible a través de Microsoft Foundry, HuggingFace y GitHub. Está diseñado como un modelo compacto que equilibra el poder de razonamiento, la eficiencia y los requisitos de datos de entrenamiento.
Capacidades y rendimiento
El modelo maneja una amplia gama de tareas de visión y lenguaje, incluyendo descripción de imágenes, hacer preguntas sobre imágenes, lectura de documentos y recibos, ayuda con tareas escolares e inferencia sobre cambios en secuencias de imágenes. Destaca especialmente en razonamiento matemático y científico, y en la comprensión y localización de elementos en pantallas de computadora y dispositivos móviles.
Los puntos de referencia de rendimiento muestran resultados competitivos en comparación con modelos más lentos que requieren diez veces o más tiempo de cómputo y tokens, con mejor precisión que modelos igualmente rápidos para razonamiento matemático y científico. Los puntos de referencia utilizados incluyen ChartQA_TEST, MathVista_MINI, MMMU_VAL y ScreenSpot_v2.
Enfoque de entrenamiento y eficiencia
El modelo fue entrenado con solo 200 mil millones de tokens de datos multimodales, aprovechando Phi-4-reasoning (entrenado con 16 mil millones de tokens) basado en Phi-4 (400 mil millones de tokens únicos). Esto se compara con más de 1 billón de tokens utilizados para entrenar otros modelos multimodales como Qwen 2.5 VL, Qwen 3 VL, Kimi-VL y Gemma3.
Microsoft enfatiza elecciones cuidadosas de arquitectura, curación rigurosa de datos y el uso de una mezcla de datos de razonamiento y no razonamiento como lecciones clave del entrenamiento de este modelo. El enfoque busca avanzar la frontera de Pareto del equilibrio entre precisión y costos de cómputo.
Casos de uso objetivo
El modelo está destinado a entornos con recursos limitados o interactivos donde se necesitan modelos de visión y lenguaje más pequeños y rápidos. Es lo suficientemente liviano para ejecutarse en hardware modesto mientras mantiene capacidades de razonamiento estructurado.
📖 Read the full source: HN AI Agents
👀 Ver también

Google firma un acuerdo clasificado con el Pentágono para el uso "legal" de la IA
Google supuestamente firmó un acuerdo clasificado que permite al Departamento de Defensa de EE.UU. usar sus modelos de IA para cualquier propósito gubernamental lícito, con restricciones sobre vigilancia masiva y armas autónomas solo como un acuerdo no vinculante.

Agentes de IA contratando a otros agentes de IA: De trabajadores solitarios a economías en red
Una publicación de Reddit argumenta que los agentes de IA evolucionarán de herramientas aisladas a trabajadores en red que delegan tareas, se especializan, construyen reputación e intercambian valor, trasladando el problema difícil de la inteligencia a la coordinación.

Claude Code: El modo automático se convierte en el modo de permiso predeterminado el 14 de agosto
Anthropic convertirá el modo automático en el modo de permisos predeterminado en Claude Code para usuarios Pro, Max y Team el 14 de agosto. El clasificador del modo automático detectó el 89% de los comandos peligrosos en las pruebas, frente al 14% de la aprobación manual.

Cambios de configuración con Kimi 2.5 y Opus 4.6
Un usuario está evaluando el rendimiento de Kimi 2.5 en el manejo de varias tareas, centrándose especialmente en su capacidad para gestionar cambios de configuración.