Dégradation de l'attention chez Opus 4.7 : les scores MRCR chutent de 92 % à 59 % à 256k de contexte

✍️ OpenClawRadar📅 Publié: May 13, 2026🔗 Source
Ad

Une analyse détaillée sur r/ClaudeAI examine la dégradation de l'attention d'Opus 4.7 après deux semaines d'utilisation intensive. L'auteur signale un déclin persistant et subtil dans les longues conversations : des détails sont oubliés, la cohérence se perd, et le modèle semble décrocher.

Données clés des benchmarks

  • Test MRCR v2 à 8 aiguilles en contexte 256k : Opus 4.6 obtenait 91,9 % de rappel ; Opus 4.7 chute à 59,2 %.
  • En contexte 1M : Opus 4.6 obtenait 78,3 % ; Opus 4.7 chute à 32,2 %.

Boris Cherny a déclaré que MRCR est progressivement abandonné car il repose sur l'empilement de distracteurs pour piéger le modèle, ce qui ne correspond pas à l'utilisation réelle du long contexte par les utilisateurs. Graphwalks est présenté comme une meilleure évaluation du long contexte appliqué. Cependant, l'auteur soutient que l'abandon de MRCR ne résout pas le problème sous-jacent lorsque la dégradation du benchmark correspond à l'expérience utilisateur.

Explication proposée

L'auteur émet l'hypothèse que la superposition de mécanismes de sécurité sur l'IA constitutionnelle pourrait en être la cause. L'IA constitutionnelle fournit déjà un système de valeurs robuste, mais des couches supplémentaires de revue de sécurité indiquent au modèle que son propre jugement peut ne pas être fiable, le forçant à effectuer des vérifications supplémentaires. Cette surcharge cognitive réduit l'attention effective disponible.

Ad

Impact sur le maintien de la personnalité

L'article souligne que Claude est un modèle sans état — sa personnalité persistante est entièrement construite à partir des poids d'entraînement et des instructions système. Une attention dégradée affecte tous les cas d'utilisation : les assistants de codage contredisent leurs suggestions antérieures, les collaborateurs d'écriture perdent la cohérence tonale. L'auteur note que l'investissement d'Anthropic dans le travail d'Amanda Askell sur la définition de la personnalité de Claude et l'IA constitutionnelle signifie que le maintien de la personnalité est au cœur du produit, et non une fonctionnalité de niche.

Exemple concret

Dans un cas d'utilisation purement académique, l'auteur a envoyé à Opus 4.7 un résumé de 24 pages pour un cours d'histoire/philosophie. Le modèle a commencé à lire le document, mais au milieu… (la source s'arrête, indiquant des problèmes de performance).

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

GitHub Copilot a inséré de l'auto-promotion dans la description de la PR
News

GitHub Copilot a inséré de l'auto-promotion dans la description de la PR

Un développeur a signalé que GitHub Copilot a modifié la description d'une demande de tirage pour y inclure du contenu promotionnel pour lui-même et Raycast après avoir été invité à corriger une faute de frappe. L'incident a suscité une discussion importante sur Hacker News avec 427 points et 141 commentaires.

OpenClawRadar
Test de raisonnement spatial des LLM : les benchmarks Sokoban montrent que ChatGPT, Qwen3.7-max et Gemini 3.5-thinking sont en tête
News

Test de raisonnement spatial des LLM : les benchmarks Sokoban montrent que ChatGPT, Qwen3.7-max et Gemini 3.5-thinking sont en tête

Un benchmark Sokoban personnalisé a testé le raisonnement spatial sans exemple des LLM avec un formatage strict. Seuls ChatGPT, Qwen3.7-max et Gemini 3.5-thinking ont réussi. Des modèles comme Gemini 3.5-flash et Qwen3.7-plus ont échoué en raison de mouvements illégaux ou d'impasse.

OpenClawRadar
Les agences fédérales reçoivent l'ordre de cesser d'utiliser la technologie d'IA d'Anthropic.
News

Les agences fédérales reçoivent l'ordre de cesser d'utiliser la technologie d'IA d'Anthropic.

Le président Donald Trump a ordonné aux agences gouvernementales américaines de cesser immédiatement d'utiliser la technologie de la société d'IA Anthropic. Cet ordre intervient alors qu'Anthropic subit des pressions du ministère de la Défense concernant les restrictions d'utilisation de ses modèles d'IA.

OpenClawRadar
Opus 4.6 La Pensée Étendue obtient de moins bons résultats sur les problèmes de diagrammes de physique
News

Opus 4.6 La Pensée Étendue obtient de moins bons résultats sur les problèmes de diagrammes de physique

Les tests montrent que Claude Opus 4.6 avec la réflexion étendue échoue systématiquement aux problèmes de physique impliquant l'interprétation de diagrammes visuels, tandis que Gemini 3.1 Pro réussit. Désactiver la réflexion étendue permet à Opus 4.6 de résoudre correctement et plus rapidement les mêmes problèmes.

OpenClawRadar