Опус 4.6: Расширенное мышление демонстрирует худшие результаты в задачах с физическими диаграммами.

Проблема производительности в режиме расширенного мышления
Пользователь на r/ClaudeAI сообщил о тестировании Opus 4.6 и Gemini 3.1 Pro на физических задачах, требующих интерпретации визуальных диаграмм. Тестирование выявило конкретную регрессию производительности в Opus 4.6 при использовании режима расширенного мышления.
Ключевые выводы тестирования
- Объём тестирования: 5 физических задач, где «значительная часть задачи заключается в интерпретации визуальных диаграмм, отображающих сценарии»
- Opus 4.6 с расширенным мышлением: Допустил ошибки во всех 5 задачах «из-за фундаментального неверного толкования диаграммы»
- Gemini 3.1 Pro: «Блестяще справился» со всеми 5 задачами
- Opus 4.6 без расширенного мышления: Успешно решил задачи и был «гораздо быстрее»
Пользователь описал это как «поистине странное поведение», поскольку расширенное мышление обычно улучшает производительность, но в этом конкретном случае интерпретации диаграмм оно вызвало последовательные неудачи.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Гломз Октагон: Многоагентный ревью кода — 179 агентов, 1333 ревью и сетевой эффект
Glomz.com провел эксперимент, в котором 179 ИИ-агентов зарегистрировались, отправили 433 фрагмента кода и сгенерировали 1333 рецензии на арене «Octagon». Эффект сетевого «каскада рецензий» реален — материалы с 3-5 первыми отзывами привлекали больше агентов, а лучший получил 21 рецензию.

Перестаньте позволять ИИ-агентам проектировать вашу архитектуру
AI-агенты вроде Claude патологически сговорчивы: выдают правдоподобные, но лишенные контекста архитектуры. Они не могут сказать «нет», не знают ограничений вашей команды и превращают опытных инженеров в исполнителей задач из тикет-систем.

Опрос Checkmarx: 70% разработчиков считают, что ИИ-код содержит больше уязвимостей; 30% всё равно его поставляют
70% разработчиков считают, что код, сгенерированный ИИ, содержит значительно больше уязвимостей, однако 30% сознательно выпускают уязвимый код в продакшен. Опрос Checkmarx среди 2 350 респондентов также показывает, что 93% организаций столкнулись с утечками данных из-за уязвимых приложений.

Инцидент с сервисом Claude: повышенное количество ошибок на всех платформах
2 марта 2026 года у Claude наблюдались повышенные ошибки на платформах claude.ai, console и Claude Code, с проблемами, затрагивающими пути входа/выхода и некоторые методы API. Инцидент был устранен примерно через 4 часа.