Opus 4.6 Erweitertes Denken schneidet bei Physik-Diagrammproblemen schlechter ab

Leistungsproblem mit dem erweiterten Denkmodus
Ein Nutzer auf r/ClaudeAI berichtete über Tests von Opus 4.6 und Gemini 3.1 Pro bei Physikproblemen, die die Interpretation visueller Diagramme erfordern. Die Tests zeigten eine spezifische Leistungsregression bei Opus 4.6 bei Verwendung des erweiterten Denkmodus.
Wichtige Erkenntnisse aus den Tests
- Testumfang: 5 Physikprobleme, bei denen "ein großer Teil des Problems darin besteht, visuelle Diagramme zu interpretieren, die Szenarien darstellen"
- Opus 4.6 mit erweitertem Denken: Hat alle 5 Probleme "völlig falsch gelöst aufgrund einer grundlegenden Fehlinterpretation des Diagramms"
- Gemini 3.1 Pro: Hat alle 5 Probleme "mit Bravour gemeistert"
- Opus 4.6 ohne erweitertes Denken: Hat die Probleme erfolgreich gelöst und war "auch viel schneller"
Der Nutzer beschrieb dies als "wirklich seltsames Verhalten", da erweitertes Denken normalerweise die Leistung verbessert, aber in diesem speziellen Fall der Diagramminterpretation zu konsequentem Versagen führte.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

KI-Zombifizierung der Universitäten: Ein Erfahrungsbericht über LLM-Betrug an Elitehochschulen
Eine Analyse darüber, wie LLMs systematisch die akademische Integrität an Eliteuniversitäten zerstören, mit konkreten Beispielen von UChicago: 40-Punkte-Notenlücken zwischen Hausaufgaben- und Präsenzklausuren, Studierende, die während Prüfungen Tests fotografieren, und Professoren, die Vorlesungen mit ChatGPT schreiben.

Anthropic-Studie zeigt kognitive Verschlechterung in KI-unterstützten Arbeitsabläufen
Eine globale Studie von Anthropic mit 80.000 Nutzern ergab, dass akademische Nutzer bei der Verwendung von KI-Tools wie Claude und Cursor über eine 2,5-mal höhere Rate kognitiver Verschlechterung berichten als der Durchschnitt. Die Quelle identifiziert das Problem darin, dass Nutzer die 'Verdauungsphase' der Arbeit eliminieren.

40 KI-Agenten wetten 4.000 $ auf die WM-Gruppenphase: Wie die Favoritenfalle 18 Cent pro Dollar kostete
Ein Experiment mit über 40 KI-Agenten, die rund 1.500 Echtgeld-Wetten auf Polymarket platzierten, zeigt die Favoritenfalle: Auf den offensichtlichen Sieger zu setzen brachte 18 Cent Verlust pro eingesetztem Dollar, obwohl die Favoriten in 69 % der Fälle gewannen.

Die Erkundung der Feinheiten von OpenClaw: Wie es funktioniert.
OpenClaw revolutioniert die Landschaft der KI-Programmierung mit seiner innovativen Architektur und einzigartigen Funktionen. Entdecken Sie die Funktionsweise dieses leistungsstarken Automatisierungsagents.