Le Benchmark SPLICE Révèle que les VLMs Peinent en Raisonnement Temporel et S'Appuient sur des A Priori Linguistiques

✍️ OpenClawRadar📅 Publié: March 15, 2026🔗 Source
Le Benchmark SPLICE Révèle que les VLMs Peinent en Raisonnement Temporel et S'Appuient sur des A Priori Linguistiques
Ad

Résultats du benchmark SPLICE

Le benchmark SPLICE teste le raisonnement temporel, causal, spatial, contextuel et de bon sens en demandant aux modèles de reconstruire la séquence correcte de clips vidéo mélangés. La recherche, co-écrite par l'auteur de la publication source, a été publiée à EMNLP 2025.

Détails des performances des modèles

Les modèles testés incluaient Gemini Flash (1.5 et 2.0), Qwen2-VL (7B et 72B), InternVL2.5 et LLaVA-OneVision. Gemini 2.0 Flash a obtenu 51 % sur la tâche uniquement visuelle, tandis que les performances humaines étaient de 85 %. Les modèles open source ont eu des difficultés significatives :

  • LLaVA-OneVision-72B a obtenu à peine plus que des réponses aléatoires dans le cadre uniquement visuel
  • InternVL2.5-78B a obtenu des résultats tout aussi médiocres
  • Qwen2-VL-72B a atteint seulement environ 30 % sur la tâche uniquement visuelle
  • Qwen2-VL-7B a obtenu des résultats similaires à la variante 72B, suggérant que l'augmentation de la taille du modèle de langage n'aide pas lorsque le goulot d'étranglement se situe dans l'encodeur visuel

Dépendance aux a priori linguistiques

Lorsque des annotations textuelles écrites par des humains décrivant le contenu des clips ont été ajoutées, les performances des modèles ont augmenté significativement tandis que les performances humaines sont restées inchangées. Cela indique que les modèles s'appuient sur des a priori linguistiques pour compenser leur faible compréhension visuelle. Notamment, Qwen2-VL-72B a surpassé Gemini sur le raisonnement uniquement textuel.

Ad

Comportement de raccourci visuel

Les modèles ont démontré des schémas de raisonnement problématiques. Lorsque les premier et dernier clips vidéo semblaient visuellement similaires (comme ouvrir et fermer la porte d'une imprimante), les modèles ont prédit que ces clips étaient adjacents 57 % du temps, contre 2,5 % pour les humains et 27 % pour le hasard. Cela suggère que les modèles font correspondre des motifs basés sur la similarité visuelle plutôt que de raisonner sur les événements.

Limitations des tests et travaux futurs

La recherche n'a pas testé Claude (qui ne prend pas en charge l'entrée vidéo) ni les modèles d'OpenAI (qui ne pouvaient pas gérer de manière fiable l'entrée multi-vidéo au moment des tests). Le jeu de données est public, et l'auteur note que des modèles plus récents comme Gemini 3 Flash et Qwen3-VL (avec un contexte entrelacé natif de 256K, une modélisation spatio-temporelle améliorée et des variantes MoE jusqu'à 235B) devraient être testés sur SPLICE pour voir si les problèmes d'a priori linguistique persistent. Des tests préliminaires suggèrent que le problème des a priori linguistiques demeure, bien que la signification statistique n'ait pas été établie sur tous les échantillons expérimentaux.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Décroissance des contraintes : pourquoi les agents LLM échouent dans le code backend structuré
News

Décroissance des contraintes : pourquoi les agents LLM échouent dans le code backend structuré

Une nouvelle recherche introduit la « décroissance de contrainte » : à mesure que les exigences structurelles s'accumulent, les performances des agents LLM chutent considérablement — les agents performants perdent 30 points de taux de réussite, les plus faibles approchent zéro. Conseils concrets pour toute personne utilisant des agents IA de codage.

OpenClawRadar
Le filtre de politique de Claude bloque les travaux de bioinformatique impliquant des noms d'agents pathogènes.
News

Le filtre de politique de Claude bloque les travaux de bioinformatique impliquant des noms d'agents pathogènes.

Un chercheur en virologie computationnelle signale que le filtre de politique d'utilisation de Claude signale comme problématiques des scripts légitimes de bioinformatique lorsque des pathogènes sont nommés, nécessitant des contournements comme décrire les tâches sans nommer les organismes ou rétrograder vers Sonnet 4. Le problème affecte Claude Code, claude.ai, et les modèles Opus 4.6 et Sonnet 4.6.

OpenClawRadar
Le code de Claude divulgué révèle le système KAIROS et le déficit de vérification des agents d'IA
News

Le code de Claude divulgué révèle le système KAIROS et le déficit de vérification des agents d'IA

Une source map de Claude Code divulguée a révélé 512 000 lignes de TypeScript, 44 drapeaux de fonctionnalité, et KAIROS — un agent en arrière-plan qui consolide la mémoire pendant les périodes d'inactivité. Un développeur indépendant a construit un démon similaire pour enchaîner les sessions lors de campagnes sur plusieurs jours, mais a découvert qu'une compilation réussie ne garantit pas un code fonctionnel.

OpenClawRadar
La pandémie du « Je ne sais pas, c’est Claude qui l’a écrit » : quand l’abandon cognitif remplace la propriété du code
News

La pandémie du « Je ne sais pas, c’est Claude qui l’a écrit » : quand l’abandon cognitif remplace la propriété du code

Les ingénieurs délèguent les décisions architecturales à Claude, puis ne peuvent pas expliquer la PR. Addy Osmani appelle cela la « reddition cognitive » — la sortie d'IA devient la vôtre sans révision.

OpenClawRadar