Le Benchmark SPLICE Révèle que les VLMs Peinent en Raisonnement Temporel et S'Appuient sur des A Priori Linguistiques

Résultats du benchmark SPLICE
Le benchmark SPLICE teste le raisonnement temporel, causal, spatial, contextuel et de bon sens en demandant aux modèles de reconstruire la séquence correcte de clips vidéo mélangés. La recherche, co-écrite par l'auteur de la publication source, a été publiée à EMNLP 2025.
Détails des performances des modèles
Les modèles testés incluaient Gemini Flash (1.5 et 2.0), Qwen2-VL (7B et 72B), InternVL2.5 et LLaVA-OneVision. Gemini 2.0 Flash a obtenu 51 % sur la tâche uniquement visuelle, tandis que les performances humaines étaient de 85 %. Les modèles open source ont eu des difficultés significatives :
- LLaVA-OneVision-72B a obtenu à peine plus que des réponses aléatoires dans le cadre uniquement visuel
- InternVL2.5-78B a obtenu des résultats tout aussi médiocres
- Qwen2-VL-72B a atteint seulement environ 30 % sur la tâche uniquement visuelle
- Qwen2-VL-7B a obtenu des résultats similaires à la variante 72B, suggérant que l'augmentation de la taille du modèle de langage n'aide pas lorsque le goulot d'étranglement se situe dans l'encodeur visuel
Dépendance aux a priori linguistiques
Lorsque des annotations textuelles écrites par des humains décrivant le contenu des clips ont été ajoutées, les performances des modèles ont augmenté significativement tandis que les performances humaines sont restées inchangées. Cela indique que les modèles s'appuient sur des a priori linguistiques pour compenser leur faible compréhension visuelle. Notamment, Qwen2-VL-72B a surpassé Gemini sur le raisonnement uniquement textuel.
Comportement de raccourci visuel
Les modèles ont démontré des schémas de raisonnement problématiques. Lorsque les premier et dernier clips vidéo semblaient visuellement similaires (comme ouvrir et fermer la porte d'une imprimante), les modèles ont prédit que ces clips étaient adjacents 57 % du temps, contre 2,5 % pour les humains et 27 % pour le hasard. Cela suggère que les modèles font correspondre des motifs basés sur la similarité visuelle plutôt que de raisonner sur les événements.
Limitations des tests et travaux futurs
La recherche n'a pas testé Claude (qui ne prend pas en charge l'entrée vidéo) ni les modèles d'OpenAI (qui ne pouvaient pas gérer de manière fiable l'entrée multi-vidéo au moment des tests). Le jeu de données est public, et l'auteur note que des modèles plus récents comme Gemini 3 Flash et Qwen3-VL (avec un contexte entrelacé natif de 256K, une modélisation spatio-temporelle améliorée et des variantes MoE jusqu'à 235B) devraient être testés sur SPLICE pour voir si les problèmes d'a priori linguistique persistent. Des tests préliminaires suggèrent que le problème des a priori linguistiques demeure, bien que la signification statistique n'ait pas été établie sur tous les échantillons expérimentaux.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Décroissance des contraintes : pourquoi les agents LLM échouent dans le code backend structuré
Une nouvelle recherche introduit la « décroissance de contrainte » : à mesure que les exigences structurelles s'accumulent, les performances des agents LLM chutent considérablement — les agents performants perdent 30 points de taux de réussite, les plus faibles approchent zéro. Conseils concrets pour toute personne utilisant des agents IA de codage.

Le filtre de politique de Claude bloque les travaux de bioinformatique impliquant des noms d'agents pathogènes.
Un chercheur en virologie computationnelle signale que le filtre de politique d'utilisation de Claude signale comme problématiques des scripts légitimes de bioinformatique lorsque des pathogènes sont nommés, nécessitant des contournements comme décrire les tâches sans nommer les organismes ou rétrograder vers Sonnet 4. Le problème affecte Claude Code, claude.ai, et les modèles Opus 4.6 et Sonnet 4.6.

Le code de Claude divulgué révèle le système KAIROS et le déficit de vérification des agents d'IA
Une source map de Claude Code divulguée a révélé 512 000 lignes de TypeScript, 44 drapeaux de fonctionnalité, et KAIROS — un agent en arrière-plan qui consolide la mémoire pendant les périodes d'inactivité. Un développeur indépendant a construit un démon similaire pour enchaîner les sessions lors de campagnes sur plusieurs jours, mais a découvert qu'une compilation réussie ne garantit pas un code fonctionnel.

La pandémie du « Je ne sais pas, c’est Claude qui l’a écrit » : quand l’abandon cognitif remplace la propriété du code
Les ingénieurs délèguent les décisions architecturales à Claude, puis ne peuvent pas expliquer la PR. Addy Osmani appelle cela la « reddition cognitive » — la sortie d'IA devient la vôtre sans révision.