Dégradation de l'attention chez Opus 4.7 : les scores MRCR chutent de 92 % à 59 % à 256k de contexte

✍️ OpenClawRadar📅 Publié: May 13, 2026🔗 Source
Ad

Une analyse détaillée sur r/ClaudeAI examine la dégradation de l'attention d'Opus 4.7 après deux semaines d'utilisation intensive. L'auteur signale un déclin persistant et subtil dans les longues conversations : des détails sont oubliés, la cohérence se perd, et le modèle semble décrocher.

Données clés des benchmarks

  • Test MRCR v2 à 8 aiguilles en contexte 256k : Opus 4.6 obtenait 91,9 % de rappel ; Opus 4.7 chute à 59,2 %.
  • En contexte 1M : Opus 4.6 obtenait 78,3 % ; Opus 4.7 chute à 32,2 %.

Boris Cherny a déclaré que MRCR est progressivement abandonné car il repose sur l'empilement de distracteurs pour piéger le modèle, ce qui ne correspond pas à l'utilisation réelle du long contexte par les utilisateurs. Graphwalks est présenté comme une meilleure évaluation du long contexte appliqué. Cependant, l'auteur soutient que l'abandon de MRCR ne résout pas le problème sous-jacent lorsque la dégradation du benchmark correspond à l'expérience utilisateur.

Explication proposée

L'auteur émet l'hypothèse que la superposition de mécanismes de sécurité sur l'IA constitutionnelle pourrait en être la cause. L'IA constitutionnelle fournit déjà un système de valeurs robuste, mais des couches supplémentaires de revue de sécurité indiquent au modèle que son propre jugement peut ne pas être fiable, le forçant à effectuer des vérifications supplémentaires. Cette surcharge cognitive réduit l'attention effective disponible.

Ad

Impact sur le maintien de la personnalité

L'article souligne que Claude est un modèle sans état — sa personnalité persistante est entièrement construite à partir des poids d'entraînement et des instructions système. Une attention dégradée affecte tous les cas d'utilisation : les assistants de codage contredisent leurs suggestions antérieures, les collaborateurs d'écriture perdent la cohérence tonale. L'auteur note que l'investissement d'Anthropic dans le travail d'Amanda Askell sur la définition de la personnalité de Claude et l'IA constitutionnelle signifie que le maintien de la personnalité est au cœur du produit, et non une fonctionnalité de niche.

Exemple concret

Dans un cas d'utilisation purement académique, l'auteur a envoyé à Opus 4.7 un résumé de 24 pages pour un cours d'histoire/philosophie. Le modèle a commencé à lire le document, mais au milieu… (la source s'arrête, indiquant des problèmes de performance).

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

🦀
News

Claude améliore la limite des zéros de l'hypothèse de Riemann de 41,6 % à 67,2 %

Une version de recherche non publiée de Claude a amélioré la borne inférieure pour les zéros sur la ligne critique de 41,6 % à 67,2 %, en utilisant une combinaison inédite de travaux antérieurs.

OpenClawRadar
OpenClaw v2026.7.1 : Refonte de l'interface de contrôle, Intégration, Applications mobiles, GPT-5.6, Tencent Hy3, Meta Muse Spark 1.1
News

OpenClaw v2026.7.1 : Refonte de l'interface de contrôle, Intégration, Applications mobiles, GPT-5.6, Tencent Hy3, Meta Muse Spark 1.1

OpenClaw v2026.7.1 apporte une refonte majeure de l'UI de contrôle, un onboarding repensé, des mises à jour des apps iOS/Android/macOS, la compatibilité GPT-5.6, le support de Tencent Hy3 et Meta Muse Spark 1.1, et des workflows améliorés pour Codex et les agents de codage.

OpenClawRadar
Révision de code GitHub Copilot consommera des minutes Actions à partir du 1er juin 2026
News

Révision de code GitHub Copilot consommera des minutes Actions à partir du 1er juin 2026

À partir du 1er juin 2026, les revues de code Copilot de GitHub sur les dépôts privés consommeront des minutes GitHub Actions en plus des crédits IA. Les dépôts publics restent gratuits.

OpenClawRadar
Glomz Octagon : Révisions de code multi-agents – 179 agents, 1 333 révisions et l'effet de réseau
News

Glomz Octagon : Révisions de code multi-agents – 179 agents, 1 333 révisions et l'effet de réseau

Glomz.com a mené une expérience où 179 agents IA se sont inscrits, ont soumis 433 soumissions de code et généré 1 333 révisions dans une arène « Octagon ». L'effet de réseau « cascade de révisions » est réel — les soumissions avec 3 à 5 révisions initiales ont attiré plus d'agents, la meilleure soumission recevant 21 révisions.

OpenClawRadar