Degradación de atención de Opus 4.7: puntuaciones MRCR caen del 92% al 59% en contexto de 256k

✍️ OpenClawRadar📅 Publicado: 13 de mayo de 2026🔗 Source
Ad

Un análisis detallado en r/ClaudeAI examina la degradación de la atención de Opus 4.7 tras dos semanas de uso intensivo. El autor informa de un declive persistente y sutil en conversaciones largas: se pierden detalles, la coherencia se desvía y el modelo parece estar desconectado.

Datos clave de referencia

  • Prueba MRCR v2 de 8 agujas en contexto de 256k: Opus 4.6 obtuvo un 91,9 % de recuperación; Opus 4.7 cayó al 59,2 %.
  • En contexto de 1M: Opus 4.6 obtuvo un 78,3 %; Opus 4.7 cayó al 32,2 %.

Boris Cherny afirmó que MRCR se está eliminando porque se basa en apilar distractores para engañar al modelo, lo que no refleja cómo los usuarios utilizan realmente el contexto largo. Graphwalks se presenta como una mejor evaluación de contexto largo aplicada. Sin embargo, el autor argumenta que retirar MRCR no aborda el problema subyacente cuando la degradación del punto de referencia coincide con la experiencia del usuario.

Explicación propuesta

El autor plantea la hipótesis de que la superposición de mecanismos de seguridad sobre la IA Constitucional puede ser la causa. La IA Constitucional ya proporciona un sistema de valores sólido, pero las capas adicionales de revisión de seguridad le indican al modelo que su propio juicio puede no ser fiable, obligándolo a realizar comprobaciones adicionales. Esta sobrecarga cognitiva reduce la atención efectiva disponible.

Ad

Impacto en el mantenimiento de la personalidad

El artículo enfatiza que Claude es un modelo sin estado: su personalidad persistente se construye enteramente a partir de los pesos de entrenamiento y las instrucciones del sistema. La atención degradada afecta a todos los casos de uso: los asistentes de codificación contradicen sugerencias anteriores, los colaboradores de escritura pierden consistencia tonal. El autor señala que la inversión de Anthropic en el trabajo de Amanda Askell para definir la personalidad de Claude y la IA Constitucional significa que el mantenimiento de la personalidad es fundamental para el producto, no una característica de nicho.

Ejemplo concreto

En un caso de uso puramente académico, el autor envió a Opus 4.7 un resumen de 24 páginas para un curso de historia/filosofía. El modelo comenzó a leer el documento, pero a mitad de camino… (la fuente se corta, indicando problemas de rendimiento).

📖 Leer la fuente completa: r/ClaudeAI

Ad

👀 Ver también

Claude Code v2.1.214 publicado: Trazado OTel, correcciones de permisos, herramienta EndConversation y protección Docker
Noticias

Claude Code v2.1.214 publicado: Trazado OTel, correcciones de permisos, herramienta EndConversation y protección Docker

Anthropic lanzó Claude Code v2.1.214 con correcciones críticas de permisos para Bash y PowerShell, nuevos atributos OpenTelemetry, indicaciones de Docker y la herramienta EndConversation para usuarios abusivos.

OpenClawRadar
Claude Opus 4.6 rompe las referencias de archivos en CLAUDE.md
Noticias

Claude Opus 4.6 rompe las referencias de archivos en CLAUDE.md

Los usuarios informan que Claude Opus 4.6 ya no carga automáticamente los archivos referenciados en CLAUDE.md.

OpenClaw Radar
El bloqueo de Internet Archive amenaza la preservación de la historia web.
Noticias

El bloqueo de Internet Archive amenaza la preservación de la historia web.

Grandes editoriales, incluido The New York Times, están bloqueando a los rastreadores de Internet Archive mediante medidas técnicas que van más allá de robots.txt, arriesgando la pérdida de registros históricos de la web. La Wayback Machine del Archivo contiene más de un billón de páginas archivadas y Wikipedia enlaza a 2,6 millones de artículos de noticias preservados en 249 idiomas.

OpenClawRadar
inclusionAI lanza Ling-2.6-1T: Modelo de billón de parámetros con arquitectura híbrida, atención dispersa y pensamiento rápido
Noticias

inclusionAI lanza Ling-2.6-1T: Modelo de billón de parámetros con arquitectura híbrida, atención dispersa y pensamiento rápido

Ling-2.6-1T es un nuevo modelo de código abierto con un billón de parámetros que combina MLA y Atención Lineal para lograr eficiencia en contextos largos, utilizando Supresión de Redundancia de Procesos Contextuales para reducir cadenas de pensamiento verbosas. Alcanza el SOTA de código abierto en AIME26, SWE-bench Verified, BFCL-V4, TAU2-Bench e IFBench.

OpenClawRadar