Claude Opus 4.1 obtient un score de 17,75 % sur l'ensemble de données privé de SWE-Bench Pro, mettant en lumière l'écart entre mémorisation et raisonnement.

✍️ OpenClawRadar📅 Publié: March 9, 2026🔗 Source
Claude Opus 4.1 obtient un score de 17,75 % sur l'ensemble de données privé de SWE-Bench Pro, mettant en lumière l'écart entre mémorisation et raisonnement.
Ad

Les résultats des benchmarks révèlent un écart de performance significatif

Claude Opus 4.1 a obtenu plus de 80 % sur SWE-Bench Verified, mais n'a atteint que 17,75 % sur l'ensemble de données privé de SWE-Bench Pro. Cet ensemble contient 276 tâches provenant de 18 bases de code propriétaires de startups qui n'ont jamais été sur GitHub, spécifiquement conçu pour éliminer la contamination des données via des dépôts publics sous licence GPL.

Résultats d'autres modèles sur le même ensemble de données privé : GPT-5.2 a obtenu 23,81 % (en tête du classement) et Gemini 3 Pro a obtenu 17,95 %.

L'analyse de trajectoire révèle un comportement de mémorisation

L'analyse de Scale AI a révélé que pendant les tests, les modèles pouvaient identifier les chemins de fichiers corrects à modifier avant d'avoir entièrement lu les descriptions des problèmes sur des dépôts familiers. Cela indique qu'ils naviguaient par mémoire plutôt que de raisonner à travers les problèmes.

Le score de 80 % sur SWE-Bench Verified était réel, mais mesurait une capacité différente de ce que la plupart des gens supposaient - principalement la mémoire des données d'entraînement plutôt que le raisonnement sur du code nouveau.

Ad

Implications pratiques pour le déploiement d'outils de codage IA

Pour les développeurs décidant où déployer des outils de codage IA dans leur flux de travail, la distinction entre mémoire et raisonnement importe plus que les chiffres de référence médiatisés. Les modèles qui performent bien sur des benchmarks contaminés peuvent avoir des difficultés avec des bases de code véritablement nouvelles qu'ils n'ont pas vues pendant l'entraînement.

SWE-Bench Pro a été créé spécifiquement pour résoudre ce problème de contamination en utilisant du code qui n'a jamais été disponible publiquement sur GitHub ou dans les ensembles de données d'entraînement.

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

Étude de Berkeley : Toutes les invites de révision IA font dériver la prose vers la formalité, même « Préserver la voix »
News

Étude de Berkeley : Toutes les invites de révision IA font dériver la prose vers la formalité, même « Préserver la voix »

Un nouvel article de Berkeley mesure 300 récits personnels via Claude, ChatGPT et Gemini sous trois conditions de prompt. Chaque modèle et chaque condition réduisent les contractions, les pronoms à la première personne et la proximité narrative — le prompt « préserver la voix » ne fait que réduire l'ampleur de la dérive, pas sa direction.

OpenClawRadar
Problème d'achèvement des tâches GPT 5.4 et solutions de contournement
News

Problème d'achèvement des tâches GPT 5.4 et solutions de contournement

Les utilisateurs signalent que GPT 5.4 cesse de fonctionner prématurément sur les tâches et fournit des mises à jour de progression erronées. Les solutions de contournement incluent l'utilisation de systèmes de pulsation cardiaque ou de tâches cron, mais celles-ci augmentent l'utilisation de jetons et les problèmes de mémoire.

OpenClawRadar
Claude Code v2.1.186 : Authentification MCP en ligne de commande, Réponse automatique Bash et plus de 20 correctifs
News

Claude Code v2.1.186 : Authentification MCP en ligne de commande, Réponse automatique Bash et plus de 20 correctifs

Claude Code v2.1.186 ajoute l'authentification MCP sans interface via CLI, les réponses automatiques aux commandes bash, et corrige plus de 20 bugs, dont la reprise après mise en veille et les permissions des sous-agents.

OpenClawRadar
La bulle de l'IA est en train d'éclater ; nous ne le savons tout simplement pas encore.
News

La bulle de l'IA est en train d'éclater ; nous ne le savons tout simplement pas encore.

Les résultats du T2 des géants de la tech révèlent des fluctuations sauvages des actions, une baisse du free cash flow et des dépenses massives en IA. Le podcast de The Register analyse ce que cela signifie pour les équipes IT.

OpenClawRadar