SWE-rebench Leaderboard-Update: Ergebnisse vom Februar 2026 zeigen knappen Wettbewerb

SWE-rebench-Ergebnisse Februar 2026
Das SWE-rebench-Ranking wurde mit den Läufen vom Februar 2026 zu 57 neuen GitHub-PR-Aufgaben aktualisiert. Der Aufbau folgt der standardmäßigen SWE-bench-Methodik: Modelle lesen echte PR-Issues, bearbeiten Code, führen Tests aus und müssen die gesamte Testsuite bestehen lassen. Die Aufgaben sind auf PRs beschränkt, die im vorherigen Monat erstellt wurden.
Wichtige Ergebnisse
- Claude Opus 4.6 bleibt mit einer Lösungsrate von 65,3 % an der Spitze und setzt mit einer starken pass@5-Rate (~70 %) weiterhin das Tempo
- Die Spitzengruppe ist extrem eng: gpt-5.2-medium (64,4 %), GLM-5 (62,8 %) und gpt-5.4-medium (62,8 %) liegen alle nur wenige Punkte hinter dem Führenden
- Gemini 3.1 Pro Preview (62,3 %) und DeepSeek-V3.2 (60,9 %) komplettieren eine dicht gedrängte Top-6
- Open-Weight/Hybrid-Modelle verbessern sich weiter: Qwen3.5-397B (59,9 %), Step-3.5-Flash (59,6 %) und Qwen3-Coder-Next (54,4 %) schließen die Lücke, angetrieben durch verbesserte Langkontextnutzung und Skalierung
- MiniMax M2.5 (54,6 %) bleibt als kosteneffiziente Option mit wettbewerbsfähiger Leistung herausragend
Insgesamt zeigt der Februar eine hochkompetitive Spitzengruppe mit mehreren Modellen, die nur wenige Punkte hinter der Führung liegen.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Gen Zs KI-Rückschlag: Nutzung fördert Skepsis, nicht Akzeptanz
Umfragen zeigen, dass die Generation Z KI-Tools nutzt, aber die KI-zentrierte Zukunft ablehnt. Viele vermeiden KI komplett oder deaktivieren Funktionen, aus Angst um Arbeitsplätze, Umweltbedenken und sozialen Auswirkungen.

Undokumentierter Fehler im Apollo-11-Lenkcomputercode mithilfe von KI und Spezifikationssprache gefunden
Forscher entdeckten einen Ressourcensperrfehler im Gyroskopsteuerungscode des Apollo Guidance Computers, der 57 Jahre lang unentdeckt blieb, indem sie Claude AI und die Allium-Spezifikationssprache nutzten, um 130.000 Zeilen Assembler-Code zu analysieren.

OpenClaw-Gründer Peter Steinberger: Cloud-Multiplayer, Team-Server und Agent-zu-Agent-Zusammenarbeit in Folge 7 des ClawCast
In Episode 7 des ClawCast beantwortet OpenClaw-Gründer Peter Steinberger Fragen der Community zu Cloud-gestützten Multiplayer-Workflows, Team-Servern, Agent-zu-Agent-Kollaboration, Speicher und Modell-Routing.

Navigieren des OpenClaw 2026.2.6-3 und des OpenRouter-Integrationsproblems
Nutzer von OpenClaw 2026.2.6-3 in Verbindung mit OpenRouter sehen sich hartnäckigen '401 Benutzer nicht gefunden'-Fehlern gegenüber. Nehmen Sie an der Gemeinschaftsdiskussion teil, während sie Lösungen erkunden und Tipps zur Fehlersuche austauschen.