Mise à jour du classement SWE-rebench : les résultats de février 2026 révèlent une compétition serrée

✍️ OpenClawRadar📅 Publié: March 23, 2026🔗 Source
Mise à jour du classement SWE-rebench : les résultats de février 2026 révèlent une compétition serrée
Ad

Résultats SWE-rebench février 2026

Le classement SWE-rebench a été mis à jour avec les exécutions de février 2026 sur 57 nouvelles tâches de PR GitHub. La configuration suit la méthodologie standard de SWE-bench : les modèles lisent de vraies issues de PR, modifient le code, exécutent des tests et doivent faire passer toute la suite de tests. Les tâches sont limitées aux PR créées le mois précédent.

Ad

Résultats clés

  • Claude Opus 4.6 reste en tête avec un taux de résolution de 65,3 %, continuant à fixer le rythme avec un fort pass@5 (~70 %)
  • Le haut du classement est extrêmement serré : gpt-5.2-medium (64,4 %), GLM-5 (62,8 %) et gpt-5.4-medium (62,8 %) sont tous à quelques points du leader
  • Gemini 3.1 Pro Preview (62,3 %) et DeepSeek-V3.2 (60,9 %) complètent un top-6 très compact
  • Les modèles open-weight/hybrides continuent de s'améliorer : Qwen3.5-397B (59,9 %), Step-3.5-Flash (59,6 %) et Qwen3-Coder-Next (54,4 %) réduisent l'écart, grâce à une meilleure utilisation du contexte long et à la montée en échelle
  • MiniMax M2.5 (54,6 %) continue de se distinguer comme une option rentable avec des performances compétitives

Dans l'ensemble, février montre une frontière très compétitive avec plusieurs modèles à quelques points de la tête.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Quand demander à Claude à propos des regex mène à une plongée nocturne dans la conception de compilateurs
News

Quand demander à Claude à propos des regex mène à une plongée nocturne dans la conception de compilateurs

Un utilisateur de Reddit a demandé à Claude d'expliquer une regex et s'est retrouvé dans une conversation de 45 minutes sur les analyseurs syntaxiques, la conception de compilateurs et la théorie des langages, remettant en question sa carrière.

OpenClawRadar
Problème d'achèvement des tâches GPT 5.4 et solutions de contournement
News

Problème d'achèvement des tâches GPT 5.4 et solutions de contournement

Les utilisateurs signalent que GPT 5.4 cesse de fonctionner prématurément sur les tâches et fournit des mises à jour de progression erronées. Les solutions de contournement incluent l'utilisation de systèmes de pulsation cardiaque ou de tâches cron, mais celles-ci augmentent l'utilisation de jetons et les problèmes de mémoire.

OpenClawRadar
Bêta publique de sécurité Claude : analyse le code, valide ses propres découvertes, propose des correctifs
News

Bêta publique de sécurité Claude : analyse le code, valide ses propres découvertes, propose des correctifs

Anthropic a lancé Claude Security en version bêta publique pour les clients Enterprise. Il raisonne à travers le code comme un chercheur en sécurité, remet en question ses propres conclusions via une auto-vérification adversarial, et propose des correctifs concrets.

OpenClawRadar
OpenClaw v2026.6.11 : Corrections pour réponses mal placées, envois bloqués et échecs de modèles
News

OpenClaw v2026.6.11 : Corrections pour réponses mal placées, envois bloqués et échecs de modèles

OpenClaw v2026.6.11 corrige les réponses mal placées, les envois bloqués, les reconnexions et les échecs de configuration de modèle sur Telegram, WhatsApp, Matrix et plus.

OpenClawRadar