Claude Opus 4.1 erzielt 17,75 % auf dem privaten Datensatz von SWE-Bench Pro und unterstreicht damit die Kluft zwischen Auswendiglernen und logischem Denken.

✍️ OpenClawRadar📅 Veröffentlicht: 9. März 2026🔗 Source
Claude Opus 4.1 erzielt 17,75 % auf dem privaten Datensatz von SWE-Bench Pro und unterstreicht damit die Kluft zwischen Auswendiglernen und logischem Denken.
Ad

Benchmark-Ergebnisse zeigen erhebliche Leistungslücke

Claude Opus 4.1 erreichte über 80 % bei SWE-Bench Verified, erzielte jedoch nur 17,75 % bei SWE-Bench Pros privatem Datensatz. Dieser Datensatz enthält 276 Aufgaben aus 18 proprietären Startup-Codebasen, die nie auf GitHub waren und speziell entwickelt wurden, um Datenkontamination durch GPL-lizenzierte öffentliche Repositories zu vermeiden.

Andere Modellergebnisse auf demselben privaten Datensatz: GPT-5.2 erreichte 23,81 % (an der Spitze der Rangliste) und Gemini 3 Pro erzielte 17,95 %.

Trajektorienanalyse zeigt Auswendiglernverhalten

Scale AIs Analyse ergab, dass Modelle während des Tests korrekte Dateipfade für Änderungen identifizieren konnten, bevor sie Problembeschreibungen in bekannten Repositories vollständig gelesen hatten. Dies deutet darauf hin, dass sie eher durch Erinnerung navigierten als durch logisches Durchdenken der Probleme.

Die 80 % bei SWE-Bench Verified waren echt, maßen jedoch eine andere Fähigkeit als die meisten annahmen – hauptsächlich Erinnerung an Trainingsdaten statt logisches Denken über neuen Code.

Ad

Praktische Auswirkungen für den Einsatz von KI-Codierungstools

Für Entwickler, die entscheiden, wo KI-Codierungstools in ihrem Arbeitsablauf eingesetzt werden sollen, ist der Unterschied zwischen Erinnerung und logischem Denken wichtiger als Schlagzeilen-Benchmark-Zahlen. Modelle, die bei kontaminierten Benchmarks gut abschneiden, könnten mit wirklich neuartigen Codebasen, die sie während des Trainings nicht gesehen haben, Schwierigkeiten haben.

SWE-Bench Pro wurde speziell geschaffen, um dieses Kontaminationsproblem anzugehen, indem Code verwendet wird, der nie öffentlich auf GitHub oder in Trainingsdatensätzen verfügbar war.

📖 Read the full source: r/ClaudeAI

Ad

👀 Siehe auch

Anthropic setzt Änderung des Kreditmodells für Claude Code aus – Agent SDK bleibt im Abonnement
Nachrichten

Anthropic setzt Änderung des Kreditmodells für Claude Code aus – Agent SDK bleibt im Abonnement

Anthropic stoppt die geplante Auslagerung von Agent SDK, claude -p und Drittanbieter-Apps in ein eigenes monatliches Kontingent. Die Nutzung läuft weiter unter den bestehenden Abonnementlimits.

OpenClawRadar
Claude Code v2.1.153 bringt Skip LFS, MCP-Korrekturen und Agent-Autovervollständigung
Nachrichten

Claude Code v2.1.153 bringt Skip LFS, MCP-Korrekturen und Agent-Autovervollständigung

Claude Code v2.1.153 fügt skipLfs-Option zur Git-LFS-Vermeidung hinzu, behebt MCP-Server-Reconnect-Loops und verbessert die Agenten-Dispatch-Funktion mit nativer Slash-Befehls-Autovervollständigung.

OpenClawRadar
Claude Code v2.1.160: Sicherheitsabfragen für Shell-Konfiguration, Dateischutz durch acceptEdits und Dutzende von Fehlerbehebungen
Nachrichten

Claude Code v2.1.160: Sicherheitsabfragen für Shell-Konfiguration, Dateischutz durch acceptEdits und Dutzende von Fehlerbehebungen

Anthropic hat Claude Code v2.1.160 veröffentlicht, das Sicherheitsabfragen vor dem Schreiben in Shell-Startup-Dateien und Build-Tool-Konfigurationen im acceptEdits-Modus hinzufügt, die Windows-Zwischenablage verbessert und Verluste des Sitzungsverlaufs behebt.

OpenClawRadar
OpenAIs Trainingskosten werden voraussichtlich jährlich 4-5 Mal höher sein als die von Anthropic.
Nachrichten

OpenAIs Trainingskosten werden voraussichtlich jährlich 4-5 Mal höher sein als die von Anthropic.

Laut vertraulichen Finanzberichten, über die das Wall Street Journal berichtete, erwartet OpenAI, in den nächsten fünf Jahren jedes Jahr 4- bis 5-mal mehr für das Training auszugeben als Anthropic. Das Ausmaß der Ausgaben wird als atemberaubend beschrieben.

OpenClawRadar