SWE-rebench Leaderboard-Update: Ergebnisse vom Februar 2026 zeigen knappen Wettbewerb

✍️ OpenClawRadar📅 Veröffentlicht: 23. März 2026🔗 Source
SWE-rebench Leaderboard-Update: Ergebnisse vom Februar 2026 zeigen knappen Wettbewerb
Ad

SWE-rebench-Ergebnisse Februar 2026

Das SWE-rebench-Ranking wurde mit den Läufen vom Februar 2026 zu 57 neuen GitHub-PR-Aufgaben aktualisiert. Der Aufbau folgt der standardmäßigen SWE-bench-Methodik: Modelle lesen echte PR-Issues, bearbeiten Code, führen Tests aus und müssen die gesamte Testsuite bestehen lassen. Die Aufgaben sind auf PRs beschränkt, die im vorherigen Monat erstellt wurden.

Ad

Wichtige Ergebnisse

  • Claude Opus 4.6 bleibt mit einer Lösungsrate von 65,3 % an der Spitze und setzt mit einer starken pass@5-Rate (~70 %) weiterhin das Tempo
  • Die Spitzengruppe ist extrem eng: gpt-5.2-medium (64,4 %), GLM-5 (62,8 %) und gpt-5.4-medium (62,8 %) liegen alle nur wenige Punkte hinter dem Führenden
  • Gemini 3.1 Pro Preview (62,3 %) und DeepSeek-V3.2 (60,9 %) komplettieren eine dicht gedrängte Top-6
  • Open-Weight/Hybrid-Modelle verbessern sich weiter: Qwen3.5-397B (59,9 %), Step-3.5-Flash (59,6 %) und Qwen3-Coder-Next (54,4 %) schließen die Lücke, angetrieben durch verbesserte Langkontextnutzung und Skalierung
  • MiniMax M2.5 (54,6 %) bleibt als kosteneffiziente Option mit wettbewerbsfähiger Leistung herausragend

Insgesamt zeigt der Februar eine hochkompetitive Spitzengruppe mit mehreren Modellen, die nur wenige Punkte hinter der Führung liegen.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Gen Zs KI-Rückschlag: Nutzung fördert Skepsis, nicht Akzeptanz
Nachrichten

Gen Zs KI-Rückschlag: Nutzung fördert Skepsis, nicht Akzeptanz

Umfragen zeigen, dass die Generation Z KI-Tools nutzt, aber die KI-zentrierte Zukunft ablehnt. Viele vermeiden KI komplett oder deaktivieren Funktionen, aus Angst um Arbeitsplätze, Umweltbedenken und sozialen Auswirkungen.

OpenClawRadar
Undokumentierter Fehler im Apollo-11-Lenkcomputercode mithilfe von KI und Spezifikationssprache gefunden
Nachrichten

Undokumentierter Fehler im Apollo-11-Lenkcomputercode mithilfe von KI und Spezifikationssprache gefunden

Forscher entdeckten einen Ressourcensperrfehler im Gyroskopsteuerungscode des Apollo Guidance Computers, der 57 Jahre lang unentdeckt blieb, indem sie Claude AI und die Allium-Spezifikationssprache nutzten, um 130.000 Zeilen Assembler-Code zu analysieren.

OpenClawRadar
OpenClaw-Gründer Peter Steinberger: Cloud-Multiplayer, Team-Server und Agent-zu-Agent-Zusammenarbeit in Folge 7 des ClawCast
Nachrichten

OpenClaw-Gründer Peter Steinberger: Cloud-Multiplayer, Team-Server und Agent-zu-Agent-Zusammenarbeit in Folge 7 des ClawCast

In Episode 7 des ClawCast beantwortet OpenClaw-Gründer Peter Steinberger Fragen der Community zu Cloud-gestützten Multiplayer-Workflows, Team-Servern, Agent-zu-Agent-Kollaboration, Speicher und Modell-Routing.

OpenClawRadar
Navigieren des OpenClaw 2026.2.6-3 und des OpenRouter-Integrationsproblems
Nachrichten

Navigieren des OpenClaw 2026.2.6-3 und des OpenRouter-Integrationsproblems

Nutzer von OpenClaw 2026.2.6-3 in Verbindung mit OpenRouter sehen sich hartnäckigen '401 Benutzer nicht gefunden'-Fehlern gegenüber. Nehmen Sie an der Gemeinschaftsdiskussion teil, während sie Lösungen erkunden und Tipps zur Fehlersuche austauschen.

OpenClawRadar