Résultats de référence en raisonnement visuel pour 15 modèles d'IA multimodaux

Vue d'ensemble du benchmark
AIMultiple a réalisé un benchmark de raisonnement visuel sur 15 modèles d'IA multimodaux de premier plan en utilisant 200 questions basées sur des éléments visuels. Le benchmark a été divisé en deux catégories distinctes : 100 questions de compréhension des graphiques axées sur l'interprétation des visualisations de données, et 100 questions de logique visuelle couvrant la reconnaissance de motifs et le raisonnement spatial.
Méthodologie
Chaque question a été exécutée 5 fois pour garantir la fiabilité statistique. Le benchmark a spécifiquement testé la capacité des modèles à interpréter les visualisations de données et à résoudre des problèmes de logique visuelle nécessitant la reconnaissance de motifs et le raisonnement spatial.
Résultats
Le classement général montre Gemini-3.1-pro-preview et Gemini-3-pro-preview en tête, suivis par GPT-5.2, Kimi-K2.5 et GPT-5.2-pro. Les résultats révèlent un schéma cohérent pour la plupart des systèmes : les modèles obtiennent de meilleures performances sur les tâches d'interprétation de graphiques basées sur des données que sur les problèmes de logique visuelle, où les performances chutent significativement.
Pour les développeurs travaillant avec des systèmes d'IA multimodaux, ce benchmark fournit des données concrètes sur les forces relatives dans différents types de tâches de raisonnement visuel. L'écart de performance entre l'interprétation des graphiques et la logique visuelle suggère que les modèles actuels ont des capacités plus solides dans le traitement des données visuelles structurées que dans le raisonnement spatial abstrait.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Utilisateur de Reddit rapporte 18,8 tok/s en inférence CPU avec Qwen 3 30B Q4 sur Zen 4
Un utilisateur de r/LocalLLaMA a testé Qwen 3 30B Q4 sur CPU et a obtenu 18,8 tokens par seconde avec un processeur Zen 4 et de la mémoire DDR5, dépassant largement les attentes de 3-5 tok/s.

Analyse approfondie de la quantification du cache KV de Qwen : PPL, divergence KL et résultats asymétriques K/V
Deuxième série de benchmarks sur Qwen 3.6-35B-A3B avec quantification du cache KV : perplexité, divergence KL, combinaisons K/V asymétriques et profondeur de contexte 64K sur Apple M5 Max.

Pentagon promet de ne plus avoir un unique fournisseur d'IA après le contrecoup d'Anthropic, signe des accords avec AWS, Google, Microsoft, NVIDIA, OpenAI, Oracle, SpaceX
Le secrétaire adjoint à la Défense, Emil Michael, déclare que le Pentagone ne « comptera plus jamais » sur un seul fournisseur de modèles d'IA, citant la complexité de l'intégration et le récent différend avec Anthropic. De nouveaux accords avec huit entreprises d'IA visent à diversifier la stack technologique.

Automatiser les médias sociaux avec OpenClaw : Possibilités et discussions
Une discussion sur Reddit explore le potentiel de l'automatisation des tâches sur les réseaux sociaux à l'aide d'OpenClaw.