Opus 4.6 Erweitertes Denken schneidet bei Physik-Diagrammproblemen schlechter ab

✍️ OpenClawRadar📅 Veröffentlicht: 17. April 2026🔗 Source
Opus 4.6 Erweitertes Denken schneidet bei Physik-Diagrammproblemen schlechter ab
Ad

Leistungsproblem mit dem erweiterten Denkmodus

Ein Nutzer auf r/ClaudeAI berichtete über Tests von Opus 4.6 und Gemini 3.1 Pro bei Physikproblemen, die die Interpretation visueller Diagramme erfordern. Die Tests zeigten eine spezifische Leistungsregression bei Opus 4.6 bei Verwendung des erweiterten Denkmodus.

Wichtige Erkenntnisse aus den Tests

  • Testumfang: 5 Physikprobleme, bei denen "ein großer Teil des Problems darin besteht, visuelle Diagramme zu interpretieren, die Szenarien darstellen"
  • Opus 4.6 mit erweitertem Denken: Hat alle 5 Probleme "völlig falsch gelöst aufgrund einer grundlegenden Fehlinterpretation des Diagramms"
  • Gemini 3.1 Pro: Hat alle 5 Probleme "mit Bravour gemeistert"
  • Opus 4.6 ohne erweitertes Denken: Hat die Probleme erfolgreich gelöst und war "auch viel schneller"

Der Nutzer beschrieb dies als "wirklich seltsames Verhalten", da erweitertes Denken normalerweise die Leistung verbessert, aber in diesem speziellen Fall der Diagramminterpretation zu konsequentem Versagen führte.

📖 Read the full source: r/ClaudeAI

Ad

👀 Siehe auch

KI-Zombifizierung der Universitäten: Ein Erfahrungsbericht über LLM-Betrug an Elitehochschulen
Nachrichten

KI-Zombifizierung der Universitäten: Ein Erfahrungsbericht über LLM-Betrug an Elitehochschulen

Eine Analyse darüber, wie LLMs systematisch die akademische Integrität an Eliteuniversitäten zerstören, mit konkreten Beispielen von UChicago: 40-Punkte-Notenlücken zwischen Hausaufgaben- und Präsenzklausuren, Studierende, die während Prüfungen Tests fotografieren, und Professoren, die Vorlesungen mit ChatGPT schreiben.

OpenClawRadar
Anthropic-Studie zeigt kognitive Verschlechterung in KI-unterstützten Arbeitsabläufen
Nachrichten

Anthropic-Studie zeigt kognitive Verschlechterung in KI-unterstützten Arbeitsabläufen

Eine globale Studie von Anthropic mit 80.000 Nutzern ergab, dass akademische Nutzer bei der Verwendung von KI-Tools wie Claude und Cursor über eine 2,5-mal höhere Rate kognitiver Verschlechterung berichten als der Durchschnitt. Die Quelle identifiziert das Problem darin, dass Nutzer die 'Verdauungsphase' der Arbeit eliminieren.

OpenClawRadar
40 KI-Agenten wetten 4.000 $ auf die WM-Gruppenphase: Wie die Favoritenfalle 18 Cent pro Dollar kostete
Nachrichten

40 KI-Agenten wetten 4.000 $ auf die WM-Gruppenphase: Wie die Favoritenfalle 18 Cent pro Dollar kostete

Ein Experiment mit über 40 KI-Agenten, die rund 1.500 Echtgeld-Wetten auf Polymarket platzierten, zeigt die Favoritenfalle: Auf den offensichtlichen Sieger zu setzen brachte 18 Cent Verlust pro eingesetztem Dollar, obwohl die Favoriten in 69 % der Fälle gewannen.

OpenClawRadar
Die Erkundung der Feinheiten von OpenClaw: Wie es funktioniert.
Nachrichten

Die Erkundung der Feinheiten von OpenClaw: Wie es funktioniert.

OpenClaw revolutioniert die Landschaft der KI-Programmierung mit seiner innovativen Architektur und einzigartigen Funktionen. Entdecken Sie die Funktionsweise dieses leistungsstarken Automatisierungsagents.

OpenClawRadar