Снижение качества внимания в Opus 4.7: оценки MRCR падают с 92% до 59% при контексте 256k

✍️ OpenClawRadar📅 Опубликовано: 13 мая 2026 г.🔗 Source
Ad

Подробный анализ на r/ClaudeAI исследует ухудшение внимания Opus 4.7 после двух недель интенсивного использования. Автор сообщает о стойком, едва заметном снижении качества в длинных диалогах: детали теряются, согласованность нарушается, и модель кажется "отключающейся".

Ключевые бенчмарк-данные

  • Тест MRCR v2 с 8 иглами при контексте 256k: Opus 4.6 показал полноту 91,9%; Opus 4.7 упал до 59,2%.
  • При контексте 1M: Opus 4.6 показал 78,3%; Opus 4.7 упал до 32,2%.

Борис Черны заявил, что MRCR выводится из эксплуатации, так как он основан на нагромождении отвлекающих факторов, чтобы обмануть модель, что не отражает реальное использование длинного контекста пользователями. Graphwalks позиционируется как более релевантная оценка длинного контекста. Однако автор утверждает, что отказ от MRCR не решает основную проблему, когда ухудшение бенчмарка соответствует пользовательскому опыту.

Предполагаемое объяснение

Автор выдвигает гипотезу, что наложение механизмов безопасности поверх Constitutional AI может быть причиной. Constitutional AI уже обеспечивает надежную систему ценностей, но дополнительные уровни проверки безопасности говорят модели, что ее собственное суждение может быть ненадежным, вынуждая ее выполнять дополнительные проверки. Эта когнитивная нагрузка сужает доступное эффективное внимание.

Ad

Влияние на поддержание персоны

Статья подчеркивает, что Клод — модель без состояния: его устойчивая персона создана исключительно из весов обучения и системных инструкций. Ухудшение внимания затрагивает все сценарии использования: помощники по кодированию противоречат предыдущим предложениям, соавторы по написанию текстов теряют согласованность тона. Автор отмечает, что вложения Anthropic в работу Аманды Аскелл по определению личности Клода и Constitutional AI означают, что поддержание персоны является основой продукта, а не нишевой функцией.

Конкретный пример

В чисто академическом сценарии автор отправил Opus 4.7 24-страничное резюме для курса истории/философии. Модель начала читать документ, но на середине... (источник обрывается, указывая на проблемы с производительностью).

📖 Полный источник: r/ClaudeAI

Ad

👀 Смотрите также

Исследование ошибки ACP: несоответствие протокола вызывает ошибку 'metadata is missing' при работе с локальным Ollama
Новости

Исследование ошибки ACP: несоответствие протокола вызывает ошибку 'metadata is missing' при работе с локальным Ollama

Подтверждённая ошибка в интеграции ACP/OpenClaw препятствует работе команд acpx spawn с локальными моделями Ollama из-за несоответствия протоколов: acpx ожидает JSON, но получает текстовый вывод.

OpenClawRadar
Тема «Мифы о Клоде от Anthropic: Маркетинг страха или реальная угроза?»
Новости

Тема «Мифы о Клоде от Anthropic: Маркетинг страха или реальная угроза?»

Anthropic утверждает, что ее модель Claude Mythos превосходит человеческих экспертов в поиске ошибок кибербезопасности, но критики считают, что предупреждения компании о катастрофе — это маркетинговый трюк, чтобы отвлечь внимание от текущих проблем и повлиять на регуляторов.

OpenClawRadar
Окружное послание Папы Льва XIV об ИИ: ключевые выводы для разработчиков
Новости

Окружное послание Папы Льва XIV об ИИ: ключевые выводы для разработчиков

Ватикан опубликовал энциклику по этике ИИ. В документе рассматриваются проблемы интерпретируемости LLM, культурные предубеждения в обучающих данных и экологическая стоимость ИИ.

OpenClawRadar
Перевод на русский:

**Аннотации Amazon S3: 1 ГБ метаданных на объект для рабочих процессов AI-агентов**
Новости

Перевод на русский: **Аннотации Amazon S3: 1 ГБ метаданных на объект для рабочих процессов AI-агентов**

AWS объявляет о S3 аннотациях — до 1000 аннотаций на объект, каждая до 1 МБ, всего 1 ГБ. Изменяемые, доступные для запросов через Athena, без платы за извлечение для объектов Glacier.

OpenClawRadar