Opus 4.6 Erweitertes Denken schneidet bei Physik-Diagrammproblemen schlechter ab

Leistungsproblem mit dem erweiterten Denkmodus
Ein Nutzer auf r/ClaudeAI berichtete über Tests von Opus 4.6 und Gemini 3.1 Pro bei Physikproblemen, die die Interpretation visueller Diagramme erfordern. Die Tests zeigten eine spezifische Leistungsregression bei Opus 4.6 bei Verwendung des erweiterten Denkmodus.
Wichtige Erkenntnisse aus den Tests
- Testumfang: 5 Physikprobleme, bei denen "ein großer Teil des Problems darin besteht, visuelle Diagramme zu interpretieren, die Szenarien darstellen"
- Opus 4.6 mit erweitertem Denken: Hat alle 5 Probleme "völlig falsch gelöst aufgrund einer grundlegenden Fehlinterpretation des Diagramms"
- Gemini 3.1 Pro: Hat alle 5 Probleme "mit Bravour gemeistert"
- Opus 4.6 ohne erweitertes Denken: Hat die Probleme erfolgreich gelöst und war "auch viel schneller"
Der Nutzer beschrieb dies als "wirklich seltsames Verhalten", da erweitertes Denken normalerweise die Leistung verbessert, aber in diesem speziellen Fall der Diagramminterpretation zu konsequentem Versagen führte.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch
Claude Code A/B-Test reduziert „High“-Aufwand stillschweigend auf das frühere „Low“-Niveau
Anthropic testet stillschweigend reduzierte Anstrengungsstufen in Claude Code 2.1.236+, wodurch sich 'hoch' wie das alte 'niedrig' verhält. Serverseitig, nicht in der App.

Praktische Verbesserungen in Claude Opus 4.6: Speicheraufrüstungen
Claude Opus 4.6 bietet ein bedeutendes Upgrade mit einem Kontext von 1 Million Token, was die Gedächtnisleistung und die Performance bei komplexen Aufgaben verbessert.

Googles TimesFM 2.5: 200-Millionen-Parameter-Zeitreihenmodell mit 16k-Kontext
Google Research hat TimesFM 2.5 veröffentlicht, ein 200-Millionen-Parameter-Decoder-Foundation-Modell für Zeitreihenvorhersagen mit 16k Kontextlänge und kontinuierlicher Quantilvorhersage bis zu 1k Horizont.

Die Notwendigkeit relationaler Governance in Multi-Agenten-Systemen
Aktuelle Governance-Rahmenwerke konzentrieren sich auf Identität, Berechtigungen und Notabschaltungen, berücksichtigen jedoch nicht die Koordination zwischen Agenten. Forschungen zeigen, dass Interaktionen zwischen Agenten maßgeschneiderte Lösungen erfordern, die über hochskalierte Mensch-Agent-Gespräche hinausgehen.