El Benchmark SPLICE Revela que los VLM Luchan con el Razonamiento Temporal y Dependen de Prioridades Lingüísticas

✍️ OpenClawRadar📅 Publicado: 15 de marzo de 2026🔗 Source
El Benchmark SPLICE Revela que los VLM Luchan con el Razonamiento Temporal y Dependen de Prioridades Lingüísticas
Ad

Resultados del Benchmark SPLICE

El benchmark SPLICE evalúa el razonamiento temporal, causal, espacial, contextual y de sentido común al hacer que los modelos reconstruyan la secuencia correcta de clips de video mezclados. La investigación, coautorada por el creador de la publicación original, se publicó en EMNLP 2025.

Detalles del Rendimiento de los Modelos

Los modelos evaluados incluyeron Gemini Flash (1.5 y 2.0), Qwen2-VL (7B y 72B), InternVL2.5 y LLaVA-OneVision. Gemini 2.0 Flash obtuvo un 51% en la tarea solo de visión, mientras que el rendimiento humano fue del 85%. Los modelos de código abierto tuvieron dificultades significativas:

  • LLaVA-OneVision-72B apenas superó la adivinanza aleatoria en la configuración solo de visión
  • InternVL2.5-78B tuvo un rendimiento igualmente bajo
  • Qwen2-VL-72B alcanzó solo alrededor del 30% en solo visión
  • Qwen2-VL-7B tuvo un rendimiento similar a la variante de 72B, lo que sugiere que escalar el modelo de lenguaje no ayuda cuando el cuello de botella está en el codificador visual

Dependencia de Prioridades Lingüísticas

Cuando se agregaron anotaciones de texto escritas por humanos que describían el contenido de los clips, el rendimiento de los modelos aumentó significativamente mientras que el rendimiento humano permaneció sin cambios. Esto indica que los modelos dependen de prioridades lingüísticas para compensar la débil comprensión visual. Notablemente, Qwen2-VL-72B superó a Gemini en razonamiento solo con texto.

Ad

Comportamiento de Atajos Visuales

Los modelos demostraron patrones de razonamiento problemáticos. Cuando el primer y último clip de video se veían visualmente similares (como abrir y cerrar la puerta de una impresora), los modelos predijeron que esos clips eran adyacentes el 57% de las veces, en comparación con el 2,5% para los humanos y el 27% de probabilidad aleatoria. Esto sugiere que los modelos están haciendo coincidencia de patrones basada en similitud visual en lugar de razonar sobre eventos.

Limitaciones de las Pruebas y Trabajo Futuro

La investigación no probó Claude (que no admite entrada de video) ni modelos de OpenAI (que no podían manejar entrada de múltiples videos de manera confiable en el momento de las pruebas). El conjunto de datos es público, y el creador de la publicación señala que modelos más nuevos como Gemini 3 Flash y Qwen3-VL (con contexto entrelazado nativo de 256K, modelado espacio-temporal mejorado y variantes MoE de hasta 235B) deberían probarse en SPLICE para ver si persisten los problemas de prioridades lingüísticas. Las pruebas preliminares sugieren que el problema de prioridades lingüísticas persiste, aunque no se ha establecido significancia estadística en todas las muestras experimentales.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Evolución de la Arquitectura de Caché KV: Desde GPT-2 hasta Mamba
Noticias

Evolución de la Arquitectura de Caché KV: Desde GPT-2 hasta Mamba

El análisis de los costos de memoria de la caché KV muestra que GPT-2 utilizaba 300 KiB/token, Llama 3 lo redujo a 128 KiB/token con atención de consultas agrupadas, y DeepSeek V3 logró 68.6 KiB/token con atención latente multi-cabezal. Mamba/SSMs eliminan por completo la caché KV mediante estados ocultos de tamaño fijo.

OpenClawRadar
Claude Encabeza las Listas de la App Store en Medio del Enfrentamiento Gubernamental
Noticias

Claude Encabeza las Listas de la App Store en Medio del Enfrentamiento Gubernamental

La aplicación Claude de Anthropic saltó del puesto 42 al 1 en las listas de Más Descargados de la App Store de EE. UU., con ChatGPT y Gemini ocupando el segundo y tercer lugar. El aumento sigue a un desacuerdo público entre Anthropic y el gobierno de EE. UU. sobre el uso militar y de vigilancia de la tecnología de IA.

OpenClawRadar
Alibaba lanza la plataforma de IA Wukong para la automatización empresarial.
Noticias

Alibaba lanza la plataforma de IA Wukong para la automatización empresarial.

Alibaba ha lanzado Wukong, una plataforma de IA que coordina múltiples agentes para manejar tareas empresariales complejas como edición de documentos, actualización de hojas de cálculo, transcripción de reuniones e investigación. Actualmente se encuentra en fase de pruebas beta solo por invitación.

OpenClawRadar
Los Agentes de IA Están Matando la Revisión de Código — El Problema Principal-Agente Explicado
Noticias

Los Agentes de IA Están Matando la Revisión de Código — El Problema Principal-Agente Explicado

Insertar agentes de IA en el proceso tradicional de revisión de código duplica la carga de revisión, colapsa las señales de confianza y crea un desequilibrio insostenible: este es el problema principal-agente aplicado a la ingeniería de software.

OpenClawRadar