Degradación de atención de Opus 4.7: puntuaciones MRCR caen del 92% al 59% en contexto de 256k
Un análisis detallado en r/ClaudeAI examina la degradación de la atención de Opus 4.7 tras dos semanas de uso intensivo. El autor informa de un declive persistente y sutil en conversaciones largas: se pierden detalles, la coherencia se desvía y el modelo parece estar desconectado.
Datos clave de referencia
- Prueba MRCR v2 de 8 agujas en contexto de 256k: Opus 4.6 obtuvo un 91,9 % de recuperación; Opus 4.7 cayó al 59,2 %.
- En contexto de 1M: Opus 4.6 obtuvo un 78,3 %; Opus 4.7 cayó al 32,2 %.
Boris Cherny afirmó que MRCR se está eliminando porque se basa en apilar distractores para engañar al modelo, lo que no refleja cómo los usuarios utilizan realmente el contexto largo. Graphwalks se presenta como una mejor evaluación de contexto largo aplicada. Sin embargo, el autor argumenta que retirar MRCR no aborda el problema subyacente cuando la degradación del punto de referencia coincide con la experiencia del usuario.
Explicación propuesta
El autor plantea la hipótesis de que la superposición de mecanismos de seguridad sobre la IA Constitucional puede ser la causa. La IA Constitucional ya proporciona un sistema de valores sólido, pero las capas adicionales de revisión de seguridad le indican al modelo que su propio juicio puede no ser fiable, obligándolo a realizar comprobaciones adicionales. Esta sobrecarga cognitiva reduce la atención efectiva disponible.
Impacto en el mantenimiento de la personalidad
El artículo enfatiza que Claude es un modelo sin estado: su personalidad persistente se construye enteramente a partir de los pesos de entrenamiento y las instrucciones del sistema. La atención degradada afecta a todos los casos de uso: los asistentes de codificación contradicen sugerencias anteriores, los colaboradores de escritura pierden consistencia tonal. El autor señala que la inversión de Anthropic en el trabajo de Amanda Askell para definir la personalidad de Claude y la IA Constitucional significa que el mantenimiento de la personalidad es fundamental para el producto, no una característica de nicho.
Ejemplo concreto
En un caso de uso puramente académico, el autor envió a Opus 4.7 un resumen de 24 páginas para un curso de historia/filosofía. El modelo comenzó a leer el documento, pero a mitad de camino… (la fuente se corta, indicando problemas de rendimiento).
📖 Leer la fuente completa: r/ClaudeAI
👀 Ver también

¿Está OpenClaw cumpliendo con las expectativas?
OpenClaw, un agente de codificación de IA muy esperado, está causando revuelo entre los usuarios. Mientras algunos elogian sus capacidades, otros expresan decepción. Aquí hay un vistazo más de cerca a los comentarios de la comunidad.

Los principales modelos de IA muestran una brecha de rendimiento en idiomas no ingleses.
Un análisis reciente muestra que los principales modelos de IA tienen un rendimiento peor en idiomas distintos al inglés, con el artículo recibiendo 16 puntos y 3 comentarios en Hacker News.

Los frontends generados por IA convergen en patrones de diseño verde esmeralda.
Los componentes frontend generados por IA han pasado de la era anterior de gradientes púrpura a una nueva uniformidad centrada en acentos, botones y estados de hover de verde esmeralda. Esta convergencia parece estar vinculada a las habilidades de IA y a los prompts de componentes de Tailwind que asocian el esmeralda con un diseño de UI de calidad.

Estudio de ETH Zurich: El contexto excesivo reduce el rendimiento de los agentes de IA para programación
Un estudio de ETH Zurich probó cuatro agentes de codificación en 138 tareas reales de GitHub y encontró que los archivos de contexto generados por LLM redujeron las tasas de éxito de las tareas en un 2-3% mientras aumentaron los costos de inferencia en un 20%. El contexto escrito por humanos solo mejoró el éxito en aproximadamente un 4% con aumentos significativos de costos.