SWE-rebench Leaderboard-Update: Ergebnisse vom Februar 2026 zeigen knappen Wettbewerb

SWE-rebench-Ergebnisse Februar 2026
Das SWE-rebench-Ranking wurde mit den Läufen vom Februar 2026 zu 57 neuen GitHub-PR-Aufgaben aktualisiert. Der Aufbau folgt der standardmäßigen SWE-bench-Methodik: Modelle lesen echte PR-Issues, bearbeiten Code, führen Tests aus und müssen die gesamte Testsuite bestehen lassen. Die Aufgaben sind auf PRs beschränkt, die im vorherigen Monat erstellt wurden.
Wichtige Ergebnisse
- Claude Opus 4.6 bleibt mit einer Lösungsrate von 65,3 % an der Spitze und setzt mit einer starken pass@5-Rate (~70 %) weiterhin das Tempo
- Die Spitzengruppe ist extrem eng: gpt-5.2-medium (64,4 %), GLM-5 (62,8 %) und gpt-5.4-medium (62,8 %) liegen alle nur wenige Punkte hinter dem Führenden
- Gemini 3.1 Pro Preview (62,3 %) und DeepSeek-V3.2 (60,9 %) komplettieren eine dicht gedrängte Top-6
- Open-Weight/Hybrid-Modelle verbessern sich weiter: Qwen3.5-397B (59,9 %), Step-3.5-Flash (59,6 %) und Qwen3-Coder-Next (54,4 %) schließen die Lücke, angetrieben durch verbesserte Langkontextnutzung und Skalierung
- MiniMax M2.5 (54,6 %) bleibt als kosteneffiziente Option mit wettbewerbsfähiger Leistung herausragend
Insgesamt zeigt der Februar eine hochkompetitive Spitzengruppe mit mehreren Modellen, die nur wenige Punkte hinter der Führung liegen.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Claude Juni-Update 15 unterbricht den Headless-Agent-Workaround — Interaktive Sitzungen funktionieren noch in Ihrem Tarif
Das Claude-Update vom 15. Juni rechnet headless-Nutzung (claude -p, Agent SDK) über ein Guthaben-Konto ab. Interaktive Claude Code-Sitzungen werden weiterhin über den Flatrate-Tarif abgerechnet – hier erfahren Sie, was Sie wissen müssen.

HBM-Ausgaben erreichen 32 Milliarden Dollar: Speicher macht jetzt 63% der KI-Chip-Kosten aus
Epoch AI-Daten zeigen, dass der Anteil von HBM-Speicher an den Komponentenkosten von KI-Chips von 52 % im Q1 2024 auf 63 % im Q4 2025 gestiegen ist. Die Gesamtausgaben für Komponenten wuchsen von 22 Mrd. $ auf 52 Mrd. $, wobei HBM 20 Mrd. $ dieses Anstiegs ausmacht.
Kein Ersatz: Warum Claude erfahrene UX-Designer nicht ersetzen kann
Ein UX-Designer argumentiert, dass Claude Design überbewertet und nur für Nicht-Designer nützlich sei, um Ideen zu prototypisieren, für frühe Startups und für Einsteiger-Portfolio-Arbeiten.
Claude Code v2.1.227 behebt Funktionsflag-Abonnements und Bash-Fehler in CI
Claude Code v2.1.227 behebt die Bewertung von Feature-Flags bei abgelaufenen Tokens, Bash-Fehler in claude-code-action und verbessert die Zugänglichkeit des Slash-Command-Menüs.