Опус 4.6: Расширенное мышление демонстрирует худшие результаты в задачах с физическими диаграммами.

Проблема производительности в режиме расширенного мышления
Пользователь на r/ClaudeAI сообщил о тестировании Opus 4.6 и Gemini 3.1 Pro на физических задачах, требующих интерпретации визуальных диаграмм. Тестирование выявило конкретную регрессию производительности в Opus 4.6 при использовании режима расширенного мышления.
Ключевые выводы тестирования
- Объём тестирования: 5 физических задач, где «значительная часть задачи заключается в интерпретации визуальных диаграмм, отображающих сценарии»
- Opus 4.6 с расширенным мышлением: Допустил ошибки во всех 5 задачах «из-за фундаментального неверного толкования диаграммы»
- Gemini 3.1 Pro: «Блестяще справился» со всеми 5 задачами
- Opus 4.6 без расширенного мышления: Успешно решил задачи и был «гораздо быстрее»
Пользователь описал это как «поистине странное поведение», поскольку расширенное мышление обычно улучшает производительность, но в этом конкретном случае интерпретации диаграмм оно вызвало последовательные неудачи.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Отчет Anthropic об интенсивности внедрения искусственного интеллекта в мире
Последние данные Anthropic показывают неравномерное внедрение ИИ в мире, измеряя интенсивность использования, а не общее количество пользователей. Отчёт демонстрирует, где ИИ интегрирован в рабочие процессы, такие как программирование, исследования и принятие решений, как среди частных лиц, так и в бизнесе.

Окружное послание Папы Льва XIV об ИИ: ключевые выводы для разработчиков
Ватикан опубликовал энциклику по этике ИИ. В документе рассматриваются проблемы интерпретируемости LLM, культурные предубеждения в обучающих данных и экологическая стоимость ИИ.

编码代理取代人类代码审查:论文认为传统审查已死
Статья на arXiv утверждает, что кодовые агенты перешли порог, за которым они могут заменить человеческое ревью кода, предлагая меньшую стоимость и более высокую пропускную способность.

ИИ-агенты, не сокращающие расходы на обслуживание, потянут вашу команду на дно
Джеймс Шор утверждает, что удвоение скорости написания кода с помощью ИИ без пропорционального снижения затрат на обслуживание приводит к чистой потере производительности в течение нескольких месяцев. Модель показывает, что при двукратном увеличении объема вывода кода с двукратными затратами на обслуживание каждой строки производительность через ~5 месяцев становится хуже исходной.