Claude Opus 4.1 obtient un score de 17,75 % sur l'ensemble de données privé de SWE-Bench Pro, mettant en lumière l'écart entre mémorisation et raisonnement.

Les résultats des benchmarks révèlent un écart de performance significatif
Claude Opus 4.1 a obtenu plus de 80 % sur SWE-Bench Verified, mais n'a atteint que 17,75 % sur l'ensemble de données privé de SWE-Bench Pro. Cet ensemble contient 276 tâches provenant de 18 bases de code propriétaires de startups qui n'ont jamais été sur GitHub, spécifiquement conçu pour éliminer la contamination des données via des dépôts publics sous licence GPL.
Résultats d'autres modèles sur le même ensemble de données privé : GPT-5.2 a obtenu 23,81 % (en tête du classement) et Gemini 3 Pro a obtenu 17,95 %.
L'analyse de trajectoire révèle un comportement de mémorisation
L'analyse de Scale AI a révélé que pendant les tests, les modèles pouvaient identifier les chemins de fichiers corrects à modifier avant d'avoir entièrement lu les descriptions des problèmes sur des dépôts familiers. Cela indique qu'ils naviguaient par mémoire plutôt que de raisonner à travers les problèmes.
Le score de 80 % sur SWE-Bench Verified était réel, mais mesurait une capacité différente de ce que la plupart des gens supposaient - principalement la mémoire des données d'entraînement plutôt que le raisonnement sur du code nouveau.
Implications pratiques pour le déploiement d'outils de codage IA
Pour les développeurs décidant où déployer des outils de codage IA dans leur flux de travail, la distinction entre mémoire et raisonnement importe plus que les chiffres de référence médiatisés. Les modèles qui performent bien sur des benchmarks contaminés peuvent avoir des difficultés avec des bases de code véritablement nouvelles qu'ils n'ont pas vues pendant l'entraînement.
SWE-Bench Pro a été créé spécifiquement pour résoudre ce problème de contamination en utilisant du code qui n'a jamais été disponible publiquement sur GitHub ou dans les ensembles de données d'entraînement.
📖 Lire la source complète : r/ClaudeAI
👀 See Also
Claude Code v2.1.259 : serveurs MCP gérés, mode d'autorisation sans tête et correctifs de concurrence
Claude Code v2.1.259 ajoute un déploiement géré de serveurs MCP pour les organisations, un drapeau `--permission-prompts none` pour les hôtes sans surveillance, et corrige la corruption silencieuse de l'état dans les sessions concurrentes.

Modifications du Plan Individuel GitHub Copilot : Inscriptions suspendues, limites renforcées, ajustements du modèle
GitHub suspend temporairement les nouvelles inscriptions pour les plans Copilot Pro, Pro+ et Étudiant tout en resserrant les limites d'utilisation et en retirant les modèles Opus des plans Pro. Ces changements répondent à l'augmentation des besoins en calcul des workflows agentiques.

L'IA ralentit : 3 000 milliards de dollars de revenus nécessaires d'ici 2030 pour maintenir la bulle
Ed Zitron affirme que l'IA doit générer 3 000 milliards de dollars de revenus d'ici 2030. Les centres de données coûtent entre 9 500 et 15 000 milliards de dollars. Les projections d'Anthropic, OpenAI et NVIDIA montrent une consommation massive de capitaux.

«Le code n'a jamais été la partie difficile» est une insulte à tous les programmeurs
Senko Rašić conteste l'affirmation selon laquelle coder est facile et que déterminer quoi construire est difficile, soutenant que les deux sont difficiles et qu'ignorer cette idée est nuisible.