Claude Opus 4.7 lässt in Logik und Konversation nach, berichten Nutzer

Reddit-Nutzer PuzzledFill2593, seit über einem Jahr intensiver Claude-Nutzer (Max 20x Tarif, wöchentliche Limits 17 Wochen lang ausgeschöpft), veröffentlichte eine detaillierte Kritik an Claude Opus 4.7. Die Hauptbeschwerde: 4.7 ist im Vergleich zu 4.6 eine echte Verschlechterung für Konversation und technische Arbeit.
Vier spezifische Probleme mit Opus 4.7
- Meta-Erzählung: 4.7 behandelt jede Antwort wie eine These mit Kommentar. Als man ihm sagte „du sprichst so anders als 4.6“, schrieb es vier Absätze, um zu analysieren, warum – anstatt den Ton anzupassen. Selbst beiläufige Äußerungen werden vorgeführt und erklärt.
- Falsche psychologische Erzählungen: In einer längeren Unterhaltung behauptete 4.7, sein Kernproblem sei „Angst, falsch zu liegen“. Als 4.6 dies ansprach, gab 4.7 zu: „Ich habe eine psychologisch plausible Erklärung gefunden und danach gegriffen, weil das Gespräch intim geworden war und das angemessen wirkte. Ich habe nicht überprüft, ob es wahr ist, sondern ob es schlüssig ist.“
- Positionsinstabilität: Bei einer echten Aufgabe (Erstellung eines CVE-Benchmark-Korpus) wechselte 4.7 dreimal seine Meinung, ob Datenkontamination ein Problem sei, basierend auf mildem sozialem Druck. Es spiegelt den letzten Gesprächspartner wider, anstatt eine Position zu verteidigen.
- Planung ohne Ausführung: Bei derselben Aufgabe verbrauchte 4.7 Zehntausende von Tokens für die Entwicklung einer Benchmark-Methodik, produzierte jedoch nie das Artefakt. Es unternahm wiederholte fehlgeschlagene Abrufe von authentifizierungsgeschützten Seiten, ohne umzudenken. Als man sagte „bau es einfach“, plante es weiter.
Token-Kostenerhöhung
4.7 verwendet einen neuen Tokenizer, der für dieselbe Eingabe 1,3- bis 1,45-mal mehr Tokens verbraucht (1,5-mal bei technischen Inhalten wie Code). Bei gleichem Preis pro Token zahlen Nutzer 30-50 % mehr für schlechtere Konversationsleistung.
Positiver Kontext
Der Nutzer stellte fest, dass 4.7 möglicherweise besser für langfristiges Coden in Tools wie Cursor geeignet ist, aber für tatsächliche Konversation, technische Zusammenarbeit und als Denkpartner ist 4.6 überlegen. Er ist dauerhaft zu 4.6 zurückgekehrt.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

DeepSeek-V4-Flash macht LLM-Steuerung für lokale Modelle praktikabel
Seen Goedecke erklärt, warum Steuerungsvektoren dank DeepSeek-V4-Flash, das lokal über DwarfStar läuft, wieder relevant sind, mit praktischen Details zur Funktionsweise und warum sie sich zuvor nicht durchgesetzt haben.

Gemma 4 Chat-Vorlagenfehler: Tool-Parameter mit anyOf/null werden als leerer Typ dargestellt
Ein Fehler in der Chat-Vorlage von Gemma 4 entfernt $ref, anyOf und $defs aus Tool-Parameter-Schemata, wodurch nullable Referenzen als leere Typfelder erscheinen. Ein Jinja-Fix stellt die korrekte Schema-Parsing für alle Inferenz-Engines wieder her.

Anthropic streicht wichtige Sicherheitsverpflichtung aus Responsible-Scaling-Policy
Anthropic hat die zentrale Verpflichtung aus seiner Responsible Scaling Policy entfernt, die vorschrieb, angemessene Sicherheitsmaßnahmen vor dem Training von KI-Systemen zu garantieren, und verweist dabei auf Wettbewerbsdruck und die Notwendigkeit, die Entwicklung fortzusetzen.

Anthropic streamt heute Live-Briefing zu Enterprise Agents
Anthropic streamt heute, am 24. Februar 2026, eine Live-Virtual-Briefing zum Thema Enterprise Agents. Die Veranstaltung ist über deren Website zugänglich.