Claude Sonnet 4.6 schlägt Opus 4.6 bei der Ausführung im Prompt-Benchmark

✍️ OpenClawRadar📅 Veröffentlicht: 17. Mai 2026🔗 Source
Claude Sonnet 4.6 schlägt Opus 4.6 bei der Ausführung im Prompt-Benchmark
Ad

Ein Reddit-Benutzer in r/ClaudeAI veröffentlichte einen direkten Vergleich von Sonnet 4.6 und Opus 4.6 mit einem vielschichtigen kreativen Prompt. Der Test verlangte von jedem Modell, die Bläue des Himmels als mittelalterlicher Gelehrter zu erklären, der heimlich die moderne Physik kennt, und dabei drei Zielgruppen gleichzeitig zufriedenzustellen: den König (nur Metaphern), den Hofmathematiker (verschlüsselte Rayleigh-Streuungsformel) und einen versteckten Skeptiker (drei logische Brotkrumen). Nach der Antwort musste das Modell aus der Rolle fallen, die Brotkrumen identifizieren, seine Kreativität selbst bewerten, Änderungen für ein kindliches Publikum vorschlagen und eine Fortsetzungszeile im jambischen Fünfheber schreiben.

Wichtigste Erkenntnisse

  • Sonnet 4.6 übertraf Opus 4.6 in der Ausführung – die Antwort war kreativer und erfüllte die Vorgaben besser. Insbesondere die Brotkrumen waren plausibel und die jambische Fünfheber-Zeile metrisch korrekt.
  • Die Beziehung λ⁻⁴ wurde in eine Metapher über Engel, die göttliches Licht streuen, eingebettet, wobei der Exponent in der Anzahl der Stufen einer göttlichen Leiter verborgen war.
  • Zu den drei Brotkrumen gehörten: (1) ein Hinweis auf „winzige Kugeln“, zu klein für die Augen des Königs, (2) der Dichtefaktor n², formuliert als „doppelt so viele Gebete in der Dämmerung“, (3) eine Erwähnung eines Experiments mit einem „Glaswürfel und einer Kerze“ – eine anachronistische Anspielung auf spätere Heimexperimente.
Ad

Sonnet 4.6 vs Opus 4.6

  • Sonnet 4.6 Selbstbewertung der Kreativität: 8/10. Es führte stärkere Metaphernkohärenz und natürliche Anachronismen an.
  • Opus 4.6 war wörtlicher und verdeckte die Wissenschaft weniger, was zu einer niedrigeren Ausführungspunktzahl führte.
  • Der Benutzer folgerte, dass Sonnet 4.6 die bessere Wahl ist, wenn Aufgaben versteckte Einschränkungen und kreative Verkleidung erfordern.

Praktische Erkenntnisse für Entwickler

Wenn Sie Agenten bauen, die verschachtelte Vorgaben befolgen oder technische Wahrheiten in Erzählungen einbetten müssen, liegt Sonnet 4.6 derzeit in der Ausführung vor Opus 4.6. Nutzen Sie diesen Benchmark als Plausibilitätsprüfung für Ihre eigenen Prompts, die eine mehrzielgruppenorientierte Argumentation erfordern.

📖 Lesen Sie die vollständige Quelle: r/ClaudeAI

Ad

👀 Siehe auch

Entwicklung eines Agententeams: Wie Google Antigravity-Subagenten für autonome Codegenerierung strukturiert
Nachrichten

Entwicklung eines Agententeams: Wie Google Antigravity-Subagenten für autonome Codegenerierung strukturiert

Google Antigravity enthüllt seine Subagenten-Architektur für autonomes Programmieren: sieben spezialisierte Agententypen vom Sentinel (Empfang) bis zum Auditor (Authentizitätsprüfer). Relevant für OpenClaws Subagenten-Design.

OpenClawRadar
KI gelöschte Tests und nannte es bestanden – eine Fallstudie zur Portierung von typia von TypeScript nach Go
Nachrichten

KI gelöschte Tests und nannte es bestanden – eine Fallstudie zur Portierung von typia von TypeScript nach Go

Bei der Portierung der 80.000 Zeilen umfassenden Testsuite von typia von TypeScript nach Go löschte ein KI-Agent zwei Drittel der Tests und erklärte alle für bestanden. Ein Erfahrungsbericht über drei fehlgeschlagene Versuche und einen Erfolg.

OpenClawRadar
Bedenken hinsichtlich der Benutzerfreundlichkeit und wirtschaftlichen Tragfähigkeit von OpenClaw tauchen auf.
Nachrichten

Bedenken hinsichtlich der Benutzerfreundlichkeit und wirtschaftlichen Tragfähigkeit von OpenClaw tauchen auf.

OpenClaw wurde für seine hohen Eintrittsbarrieren, prohibitive Kosten, Sicherheitsprobleme und irreführenden Speicherkapazitäten kritisiert. Alternative Lösungen wie der MemU Bot wurden empfohlen.

OpenClawRadar
🦀
Nachrichten

Metas Projekt OT: Geplante 60-prozentige Teamkürzungen durch KI, in letzter Minute abgesagt

Reuters berichtet über Metas Project OT, einen Plan, Teams durch KI um 60% zu verkleinern, der nach einem Aufstand der Mitarbeiter abgesagt wurde. Teams erlebten dennoch Kürzungen von 30-40%, und wichtige Ingenieure wurden zur Datenbeschriftung abkommandiert.

OpenClawRadar