Benutzer berichten, dass Sonnet 4.6 Opus 4.6 bei praktischen Programmieraufgaben übertrifft

Ein Entwickler teilte seine Erfahrung mit dem Wechsel von Claude Opus 4.6 zu Sonnet 4.6, nachdem er auf Probleme mit Überkomplizierung und unvollständiger Arbeit gestoßen war. Der Nutzer hatte Opus 4.5 und 4.6 über die API verwendet und war zunächst beeindruckt, entdeckte später jedoch Schwierigkeiten.
Hauptprobleme mit Opus 4.6
Der Entwickler berichtete, dass Opus 4.6 Arbeiten als „abgeschlossen“ markierte, obwohl sie tatsächlich nur halb fertig waren. In einem konkreten Beispiel, bei dem sichergestellt werden sollte, dass eine Copytrade-App Standard-Risikoeinstellungen zur Überschreibung gescrappter Telegram-Signale verwendet, implementierte Opus eine Korrektur, die funktionierte, aber eine Verzögerung von 500 ms bei der Broker-API einführte. Die Verzögerung trat auf, weil Opus Code hinzufügte, der die Risikoeinstellungen zweimal überprüfte, was den Copy Trader erheblich verlangsamte.
Leistung von Sonnet 4.6
Nach dem Wechsel zu Sonnet 4.6 beobachtete der Entwickler:
- Starken Rückgang des Token-Verbrauchs (reduzierte API-Kosten)
- Sorgfältigere und durchdachtere Arbeitsergebnisse
- Sonnet identifizierte und behebt das Verzögerungsproblem in 2 Sekunden
- Verfolgte das Leistungsproblem direkt auf die „Korrektur“ von Opus zurück
Der Entwickler beschrieb den Ansatz von Opus als „überkompliziert, ohne an das Ergebnis des eigentlichen Prozesses zu denken“, während er Sonnet für praktische Implementierungsaufgaben als überlegen empfand.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Agent-Gedächtnis ist kein Speicherproblem: Es ist ein Autoritätsproblem
Ein Entwickler argumentiert, dass Agentengedächtnis nicht daran scheitert, dass der Abruf fehlschlägt, sondern weil alle Notizen mit gleicher Autorität zurückkommen. Die Lösung: ein Graph mit Rollen, Ablaufdaten und Aktivierungsfeldern.

Bewertung der Claude-Fähigkeiten & Regressionstests mit Snowflake Cortex Agent
Ein produktiver Claude-Kreditrisiko-Agent auf dem Snowflake Cortex Agent benötigt Regressionstests für Skill-Änderungen. Derzeit evaluiert das Team die Ergebnisse manuell anhand bestehender BI-Abfragen und sucht nach Automatisierung.

Anthropic reagiert auf Code-Leak im Zusammenhang mit Claude-KI-Agenten
Anthropic arbeitet daran, ein Leck von Code im Zusammenhang mit seinem Claude-KI-Agenten einzudämmen, wie ein WSJ-Bericht besagt, der auf Hacker News mit 13 Punkten und 6 Kommentaren diskutiert wurde.

KI-Agenten definieren: Der Workflow-Test
Eine Reddit-Diskussion stellt die Frage, ob viele KI-Agenten-Produkte im Wesentlichen Chatbots mit einer Aufgabenliste sind, und schlägt einen Test vor, der auf ihrer Fähigkeit basiert, Arbeitsabläufe über mehrere Tools hinweg ohne manuelles Eingreifen abzuschließen.