Claude Opus 4.1 erzielt 17,75 % auf dem privaten Datensatz von SWE-Bench Pro und unterstreicht damit die Kluft zwischen Auswendiglernen und logischem Denken.

Benchmark-Ergebnisse zeigen erhebliche Leistungslücke
Claude Opus 4.1 erreichte über 80 % bei SWE-Bench Verified, erzielte jedoch nur 17,75 % bei SWE-Bench Pros privatem Datensatz. Dieser Datensatz enthält 276 Aufgaben aus 18 proprietären Startup-Codebasen, die nie auf GitHub waren und speziell entwickelt wurden, um Datenkontamination durch GPL-lizenzierte öffentliche Repositories zu vermeiden.
Andere Modellergebnisse auf demselben privaten Datensatz: GPT-5.2 erreichte 23,81 % (an der Spitze der Rangliste) und Gemini 3 Pro erzielte 17,95 %.
Trajektorienanalyse zeigt Auswendiglernverhalten
Scale AIs Analyse ergab, dass Modelle während des Tests korrekte Dateipfade für Änderungen identifizieren konnten, bevor sie Problembeschreibungen in bekannten Repositories vollständig gelesen hatten. Dies deutet darauf hin, dass sie eher durch Erinnerung navigierten als durch logisches Durchdenken der Probleme.
Die 80 % bei SWE-Bench Verified waren echt, maßen jedoch eine andere Fähigkeit als die meisten annahmen – hauptsächlich Erinnerung an Trainingsdaten statt logisches Denken über neuen Code.
Praktische Auswirkungen für den Einsatz von KI-Codierungstools
Für Entwickler, die entscheiden, wo KI-Codierungstools in ihrem Arbeitsablauf eingesetzt werden sollen, ist der Unterschied zwischen Erinnerung und logischem Denken wichtiger als Schlagzeilen-Benchmark-Zahlen. Modelle, die bei kontaminierten Benchmarks gut abschneiden, könnten mit wirklich neuartigen Codebasen, die sie während des Trainings nicht gesehen haben, Schwierigkeiten haben.
SWE-Bench Pro wurde speziell geschaffen, um dieses Kontaminationsproblem anzugehen, indem Code verwendet wird, der nie öffentlich auf GitHub oder in Trainingsdatensätzen verfügbar war.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Prozessrisiken bei Finanzierungsstrukturen für KI-Rechenzentren
Der Ausbau von KI-Rechenzentren erfordert bis 2030 Investitionen in Höhe von 5,2 Billionen US-Dollar in die Infrastruktur. Unternehmen nutzen komplexe Finanzierungsstrukturen wie Zweckgesellschaften (SPVs) und GPU-besicherte Kreditfazilitäten, die neun Kategorien von Klagerisiken mit sich bringen.

In der KI hängt die 41 % von den -59 % ab
Apollos Chefökonom analysiert die KI-Gewinnmargen entlang der Wertschöpfungskette: Modelle & Apps laufen bei -59%, während Upstream Silicon & Equipment 41% erreichen. Der Boom wird von Investoren finanziert, nicht von Kunden.

OpenClaw v2026.3.12 Dashboard-Redesign konsolidiert Interface-Elemente
OpenClaw v2026.3.12 bietet ein komplett neu gestaltetes Dashboard, das modulare Ansichten für Chat, Konfiguration, Agenten und Sitzungen sowie Befehls-Palette, mobile Untertabs, Slash-Befehle, Suche, Export und angeheftete Nachrichten in einer einzigen Oberfläche vereint.
YouTube sperrt 20 „Geister-Kanal“-Kanäle wegen KI-Spams
YouTube hat 20 Kanäle entfernt, die mit einem Netzwerk verbunden sind, das KI-generierte Skripte und menschliche Schauspieler einsetzte, um als politische Kommentatoren aufzutreten, gegen die Spam-Richtlinien verstoßend.