Claude Sonnet 4.6 schlägt Opus 4.6 bei der Ausführung im Prompt-Benchmark

✍️ OpenClawRadar📅 Veröffentlicht: 17. Mai 2026🔗 Source
Claude Sonnet 4.6 schlägt Opus 4.6 bei der Ausführung im Prompt-Benchmark
Ad

Ein Reddit-Benutzer in r/ClaudeAI veröffentlichte einen direkten Vergleich von Sonnet 4.6 und Opus 4.6 mit einem vielschichtigen kreativen Prompt. Der Test verlangte von jedem Modell, die Bläue des Himmels als mittelalterlicher Gelehrter zu erklären, der heimlich die moderne Physik kennt, und dabei drei Zielgruppen gleichzeitig zufriedenzustellen: den König (nur Metaphern), den Hofmathematiker (verschlüsselte Rayleigh-Streuungsformel) und einen versteckten Skeptiker (drei logische Brotkrumen). Nach der Antwort musste das Modell aus der Rolle fallen, die Brotkrumen identifizieren, seine Kreativität selbst bewerten, Änderungen für ein kindliches Publikum vorschlagen und eine Fortsetzungszeile im jambischen Fünfheber schreiben.

Wichtigste Erkenntnisse

  • Sonnet 4.6 übertraf Opus 4.6 in der Ausführung – die Antwort war kreativer und erfüllte die Vorgaben besser. Insbesondere die Brotkrumen waren plausibel und die jambische Fünfheber-Zeile metrisch korrekt.
  • Die Beziehung λ⁻⁴ wurde in eine Metapher über Engel, die göttliches Licht streuen, eingebettet, wobei der Exponent in der Anzahl der Stufen einer göttlichen Leiter verborgen war.
  • Zu den drei Brotkrumen gehörten: (1) ein Hinweis auf „winzige Kugeln“, zu klein für die Augen des Königs, (2) der Dichtefaktor , formuliert als „doppelt so viele Gebete in der Dämmerung“, (3) eine Erwähnung eines Experiments mit einem „Glaswürfel und einer Kerze“ – eine anachronistische Anspielung auf spätere Heimexperimente.
Ad

Sonnet 4.6 vs Opus 4.6

  • Sonnet 4.6 Selbstbewertung der Kreativität: 8/10. Es führte stärkere Metaphernkohärenz und natürliche Anachronismen an.
  • Opus 4.6 war wörtlicher und verdeckte die Wissenschaft weniger, was zu einer niedrigeren Ausführungspunktzahl führte.
  • Der Benutzer folgerte, dass Sonnet 4.6 die bessere Wahl ist, wenn Aufgaben versteckte Einschränkungen und kreative Verkleidung erfordern.

Praktische Erkenntnisse für Entwickler

Wenn Sie Agenten bauen, die verschachtelte Vorgaben befolgen oder technische Wahrheiten in Erzählungen einbetten müssen, liegt Sonnet 4.6 derzeit in der Ausführung vor Opus 4.6. Nutzen Sie diesen Benchmark als Plausibilitätsprüfung für Ihre eigenen Prompts, die eine mehrzielgruppenorientierte Argumentation erfordern.

📖 Lesen Sie die vollständige Quelle: r/ClaudeAI

Ad

👀 Siehe auch

Merlin Research veröffentlicht das Qwen3.5-4B-Safety-Thinking-Modell für strukturiertes Denken.
Nachrichten

Merlin Research veröffentlicht das Qwen3.5-4B-Safety-Thinking-Modell für strukturiertes Denken.

Merlin Research hat Qwen3.5-4B-Safety-Thinking veröffentlicht, ein sicherheitsausgerichtetes 4-Milliarden-Parameter-Reasoning-Modell, das auf Qwen3.5 basiert. Das Modell ist für strukturiertes 'Denken' und Sicherheit in realen Szenarien, einschließlich Agentensystemen, konzipiert.

OpenClawRadar
SDL-Projekt verbietet KI-geschriebene Commits als Reaktion auf GitHub-Issue
Nachrichten

SDL-Projekt verbietet KI-geschriebene Commits als Reaktion auf GitHub-Issue

Das SDL-Projekt hat eine Richtlinie umgesetzt, die KI-generierte Commits verbietet, nachdem ein GitHub-Issue Bedenken hinsichtlich der Nutzung von Copilot in Code-Reviews aufgeworfen hat. Das Issue nennt speziell die Reviews #13277 und #12730 als Beispiele, bei denen KI-Unterstützung festgestellt wurde.

OpenClawRadar
Claude Code v2.1.195: Hook-Matcher-Fix, Maus-Deaktivierungs-Umgebungsvariable, Sprachdiktat-Fixes
Nachrichten

Claude Code v2.1.195: Hook-Matcher-Fix, Maus-Deaktivierungs-Umgebungsvariable, Sprachdiktat-Fixes

Claude Code v2.1.195 behebt Hook-Matcher für Bindestriche, fügt die Umgebungsvariable CLAUDE_CODE_DISABLE_MOUSE_CLICKS hinzu und verbessert Spracheingabe sowie Hintergrundaufgaben.

OpenClawRadar
Gemini 3 Flash Leistungssteigerung durch kompetitives Prompting
Nachrichten

Gemini 3 Flash Leistungssteigerung durch kompetitives Prompting

Forscher erreichten 95 % der Benchmark-Leistung von Claude 4.6 Opus mit Gemini 3 Flash bei 1/200 der Kosten und 4-facher Geschwindigkeit, indem sie kompetitive Prompting-Techniken einsetzten, die menschliche Eifersucht als Motivation nutzten.

OpenClawRadar