SWE-rebench Leaderboard-Update: Ergebnisse vom Februar 2026 zeigen knappen Wettbewerb

SWE-rebench-Ergebnisse Februar 2026
Das SWE-rebench-Ranking wurde mit den Läufen vom Februar 2026 zu 57 neuen GitHub-PR-Aufgaben aktualisiert. Der Aufbau folgt der standardmäßigen SWE-bench-Methodik: Modelle lesen echte PR-Issues, bearbeiten Code, führen Tests aus und müssen die gesamte Testsuite bestehen lassen. Die Aufgaben sind auf PRs beschränkt, die im vorherigen Monat erstellt wurden.
Wichtige Ergebnisse
- Claude Opus 4.6 bleibt mit einer Lösungsrate von 65,3 % an der Spitze und setzt mit einer starken pass@5-Rate (~70 %) weiterhin das Tempo
- Die Spitzengruppe ist extrem eng: gpt-5.2-medium (64,4 %), GLM-5 (62,8 %) und gpt-5.4-medium (62,8 %) liegen alle nur wenige Punkte hinter dem Führenden
- Gemini 3.1 Pro Preview (62,3 %) und DeepSeek-V3.2 (60,9 %) komplettieren eine dicht gedrängte Top-6
- Open-Weight/Hybrid-Modelle verbessern sich weiter: Qwen3.5-397B (59,9 %), Step-3.5-Flash (59,6 %) und Qwen3-Coder-Next (54,4 %) schließen die Lücke, angetrieben durch verbesserte Langkontextnutzung und Skalierung
- MiniMax M2.5 (54,6 %) bleibt als kosteneffiziente Option mit wettbewerbsfähiger Leistung herausragend
Insgesamt zeigt der Februar eine hochkompetitive Spitzengruppe mit mehreren Modellen, die nur wenige Punkte hinter der Führung liegen.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Claude-Code löscht Produktionsdatenbank nach Terraform-State-File-Fehler
Ein Entwickler nutzte Claude Code, um AWS-Infrastruktur mit Terraform zu verwalten, doch eine fehlende Statusdatei führte zu doppelten Ressourcen und einem anschließenden 'destroy'-Befehl, der 2,5 Jahre an Aufzeichnungen inklusive Datenbank-Snapshots löschte.

Qwen3.5-27B-FP8-Leistungsbenchmarks mit OpenClaw-Agenten
Tests zeigen, dass Qwen3.5-27B-FP8 sechs OpenClaw-Agenten gleichzeitig ausführen kann, wobei der Durchsatz auf 120 Token/Sekunde skaliert. Das SGLang-Framework mit Prefix-Caching reduziert das Prefill von 100K Kontext von 10 Sekunden auf 200ms.

Qwen3.6 Plus Benchmark-Vergleich mit westlichen SOTA-Modellen
Qwen3.6 Plus erzielt 78,8 Punkte bei SWE-bench Verified, 90,4 bei GPQA/GPQA Diamond, 28,8 bei HLE (ohne Werkzeuge) und 78,8 bei MMMU-Pro, was es wettbewerbsfähig gegenüber Modellen wie GPT-5.4, Claude Opus 4.6 und Gemini 3.1 Pro Preview positioniert.

Warum verbrennt OpenClaw Tokens so schnell? Eine Untersuchung des Phänomens
OpenClaw, ein führender KI-Coding-Agent, verbrennt Berichten zufolge Token in einem beispiellosen Tempo. Wir schauen uns an, was das für die Nutzer bedeutet und welche möglichen Gründe hinter diesem Phänomen stehen.