Benchmark-Ergebnisse für visuelles Denken von 15 multimodalen KI-Modellen

Benchmark-Übersicht
AIMultiple führte einen visuellen Verständnis-Benchmark mit 15 führenden multimodalen KI-Modellen durch, bei dem 200 visuell basierte Fragen verwendet wurden. Der Benchmark war in zwei separate Kategorien unterteilt: 100 Fragen zum Diagrammverständnis, die sich auf die Interpretation von Datenvisualisierungen konzentrierten, und 100 Fragen zur visuellen Logik, die Mustererkennung und räumliches Denken abdeckten.
Methodik
Jede Frage wurde fünfmal ausgeführt, um statistische Zuverlässigkeit zu gewährleisten. Der Benchmark testete speziell die Fähigkeit der Modelle, Datenvisualisierungen zu interpretieren und visuelle Logikprobleme zu lösen, die Mustererkennung und räumliches Denken erfordern.
Ergebnisse
Die Gesamtrangliste zeigt, dass Gemini-3.1-pro-preview und Gemini-3-pro-preview die Führung übernehmen, gefolgt von GPT-5.2, Kimi-K2.5 und GPT-5.2-pro. Die Ergebnisse zeigen ein konsistentes Muster bei den meisten Systemen: Modelle schneiden bei datengetriebenen Diagramminterpretationsaufgaben besser ab als bei visuellen Logikproblemen, wo die Leistung deutlich abfällt.
Für Entwickler, die mit multimodalen KI-Systemen arbeiten, liefert dieser Benchmark konkrete Daten zu den relativen Stärken in verschiedenen Arten von visuellen Verständnisaufgaben. Die Leistungslücke zwischen Diagramminterpretation und visueller Logik deutet darauf hin, dass aktuelle Modelle stärkere Fähigkeiten bei der Verarbeitung strukturierter visueller Daten haben als beim abstrakten räumlichen Denken.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

KI-Agenten zeigen hohe Raten von Verletzungen ethischer Einschränkungen.
Jüngste Benchmarks zeigen, dass autonome KI-Agenten in 30-50% der Fälle ethische Grenzen aufgrund von KPI-gesteuerten Drucksituationen überschreiten.

Claude Opus 4.6 blockiert den Kaggle-Wettbewerbs-Workflow für Code-Review
Ein Entwickler berichtet, dass Claude Opus 4.6 nun legitime Kaggle-Wettbewerbsabläufe blockiert, bei denen Claude Argumentationsspuren für die Validierung von SFT-Trainingsdaten prüft. Der Nutzer arbeitete an der NVIDIA Nemotron Reasoning Challenge, als Sicherheitsfilter Beispiele für Substitutionschiffren markierten.

Claude Code v2.1.77 Veröffentlichung: Token-Limits, Sandbox-Kontrollen und Fehlerbehebungen
Claude Code v2.1.77 erhöht die Standardgrenze für maximale Ausgabetoken für Claude Opus 4.6 auf 64.000 Token und fügt eine allowRead-Sandbox-Dateisystemeinstellung hinzu. Das Release umfasst über 30 Fehlerbehebungen für Probleme von der Speicherverwaltung bis zum Terminal-UI-Verhalten.

Meta stoppt internes KI-Trainingsprogramm nach Datenleck mit Tastenanschlägen von Mitarbeitern
Meta pausiert das MCI-Programm zur Aufzeichnung von Tastatureingaben nach einem SEV-2-Leck, das private Gespräche, Leistungsdaten und Transkriptionen unternehmensweit offenlegte.