Microsoft lanza el modelo multimodal Phi-4-reasoning-vision-15B con información sobre su entrenamiento.

Descripción general y disponibilidad del modelo
Phi-4-reasoning-vision-15B es un modelo de razonamiento multimodal de código abierto con 15 mil millones de parámetros que está disponible a través de Microsoft Foundry, HuggingFace y GitHub. Está diseñado como un modelo compacto que equilibra el poder de razonamiento, la eficiencia y los requisitos de datos de entrenamiento.
Capacidades y rendimiento
El modelo maneja una amplia gama de tareas de visión y lenguaje, incluyendo descripción de imágenes, hacer preguntas sobre imágenes, lectura de documentos y recibos, ayuda con tareas escolares e inferencia sobre cambios en secuencias de imágenes. Destaca especialmente en razonamiento matemático y científico, y en la comprensión y localización de elementos en pantallas de computadora y dispositivos móviles.
Los puntos de referencia de rendimiento muestran resultados competitivos en comparación con modelos más lentos que requieren diez veces o más tiempo de cómputo y tokens, con mejor precisión que modelos igualmente rápidos para razonamiento matemático y científico. Los puntos de referencia utilizados incluyen ChartQA_TEST, MathVista_MINI, MMMU_VAL y ScreenSpot_v2.
Enfoque de entrenamiento y eficiencia
El modelo fue entrenado con solo 200 mil millones de tokens de datos multimodales, aprovechando Phi-4-reasoning (entrenado con 16 mil millones de tokens) basado en Phi-4 (400 mil millones de tokens únicos). Esto se compara con más de 1 billón de tokens utilizados para entrenar otros modelos multimodales como Qwen 2.5 VL, Qwen 3 VL, Kimi-VL y Gemma3.
Microsoft enfatiza elecciones cuidadosas de arquitectura, curación rigurosa de datos y el uso de una mezcla de datos de razonamiento y no razonamiento como lecciones clave del entrenamiento de este modelo. El enfoque busca avanzar la frontera de Pareto del equilibrio entre precisión y costos de cómputo.
Casos de uso objetivo
El modelo está destinado a entornos con recursos limitados o interactivos donde se necesitan modelos de visión y lenguaje más pequeños y rápidos. Es lo suficientemente liviano para ejecutarse en hardware modesto mientras mantiene capacidades de razonamiento estructurado.
📖 Read the full source: HN AI Agents
👀 Ver también

Error en el Código de Claude Reemplaza Umlauts Alemanes con Sustitutos ASCII
Desde diciembre de 2025, Claude Code y la aplicación Claude.ai han estado reemplazando aleatoriamente las diéresis alemanas (ä, ö, ü, ß) con sustitutos ASCII (ae, oe, ue, ss). El error persiste a pesar de instrucciones explícitas y no se ha corregido durante más de 3 meses sin respuesta del soporte de Anthropic.

Resultados de Referencia: Modelos Qwen3.5 en Apple Silicon frente a GPUs AMD con ROCm frente a Vulkan
Un desarrollador evaluó los modelos Qwen3.5 (35B MoE, 27B denso, 122B MoE) en Macs con Apple Silicon y estaciones de trabajo con GPU AMD, comparando los backends ROCm y Vulkan mediante pruebas de escalado de contexto. El hardware incluyó M5 Max, M1 Max y tres GPU AMD con diferentes configuraciones PCIe.
AirTag en libro raro rastrea la destructiva operación de escaneo de entrenamiento de IA de Amazon
Un librero colocó un AirTag en un libro raro vendido al por mayor y lo rastreó hasta una instalación de IA de Amazon donde los libros se despedazan y escanean para obtener datos de entrenamiento.

Claude Code v2.1.154: Opus 4.8, Flujos de Trabajo Dinámicos y Principales Correcciones
Nueva versión añade Opus 4.8 con predeterminados de alto esfuerzo, flujos de trabajo dinámicos que orquestan decenas a cientos de agentes, modo rápido al doble de tarifa por 2.5 veces la velocidad, y más de una docena de correcciones de errores.