Опус 4.6: Расширенное мышление демонстрирует худшие результаты в задачах с физическими диаграммами.

✍️ OpenClawRadar📅 Опубликовано: 17 апреля 2026 г.🔗 Source
Опус 4.6: Расширенное мышление демонстрирует худшие результаты в задачах с физическими диаграммами.
Ad

Проблема производительности в режиме расширенного мышления

Пользователь на r/ClaudeAI сообщил о тестировании Opus 4.6 и Gemini 3.1 Pro на физических задачах, требующих интерпретации визуальных диаграмм. Тестирование выявило конкретную регрессию производительности в Opus 4.6 при использовании режима расширенного мышления.

Ключевые выводы тестирования

  • Объём тестирования: 5 физических задач, где «значительная часть задачи заключается в интерпретации визуальных диаграмм, отображающих сценарии»
  • Opus 4.6 с расширенным мышлением: Допустил ошибки во всех 5 задачах «из-за фундаментального неверного толкования диаграммы»
  • Gemini 3.1 Pro: «Блестяще справился» со всеми 5 задачами
  • Opus 4.6 без расширенного мышления: Успешно решил задачи и был «гораздо быстрее»

Пользователь описал это как «поистине странное поведение», поскольку расширенное мышление обычно улучшает производительность, но в этом конкретном случае интерпретации диаграмм оно вызвало последовательные неудачи.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Отчет Anthropic об интенсивности внедрения искусственного интеллекта в мире
Новости

Отчет Anthropic об интенсивности внедрения искусственного интеллекта в мире

Последние данные Anthropic показывают неравномерное внедрение ИИ в мире, измеряя интенсивность использования, а не общее количество пользователей. Отчёт демонстрирует, где ИИ интегрирован в рабочие процессы, такие как программирование, исследования и принятие решений, как среди частных лиц, так и в бизнесе.

OpenClawRadar
Окружное послание Папы Льва XIV об ИИ: ключевые выводы для разработчиков
Новости

Окружное послание Папы Льва XIV об ИИ: ключевые выводы для разработчиков

Ватикан опубликовал энциклику по этике ИИ. В документе рассматриваются проблемы интерпретируемости LLM, культурные предубеждения в обучающих данных и экологическая стоимость ИИ.

OpenClawRadar
编码代理取代人类代码审查:论文认为传统审查已死
Новости

编码代理取代人类代码审查:论文认为传统审查已死

Статья на arXiv утверждает, что кодовые агенты перешли порог, за которым они могут заменить человеческое ревью кода, предлагая меньшую стоимость и более высокую пропускную способность.

OpenClawRadar
ИИ-агенты, не сокращающие расходы на обслуживание, потянут вашу команду на дно
Новости

ИИ-агенты, не сокращающие расходы на обслуживание, потянут вашу команду на дно

Джеймс Шор утверждает, что удвоение скорости написания кода с помощью ИИ без пропорционального снижения затрат на обслуживание приводит к чистой потере производительности в течение нескольких месяцев. Модель показывает, что при двукратном увеличении объема вывода кода с двукратными затратами на обслуживание каждой строки производительность через ~5 месяцев становится хуже исходной.

OpenClawRadar