Опус 4.6: Расширенное мышление демонстрирует худшие результаты в задачах с физическими диаграммами.

✍️ OpenClawRadar📅 Опубликовано: 17 апреля 2026 г.🔗 Source
Опус 4.6: Расширенное мышление демонстрирует худшие результаты в задачах с физическими диаграммами.
Ad

Проблема производительности в режиме расширенного мышления

Пользователь на r/ClaudeAI сообщил о тестировании Opus 4.6 и Gemini 3.1 Pro на физических задачах, требующих интерпретации визуальных диаграмм. Тестирование выявило конкретную регрессию производительности в Opus 4.6 при использовании режима расширенного мышления.

Ключевые выводы тестирования

  • Объём тестирования: 5 физических задач, где «значительная часть задачи заключается в интерпретации визуальных диаграмм, отображающих сценарии»
  • Opus 4.6 с расширенным мышлением: Допустил ошибки во всех 5 задачах «из-за фундаментального неверного толкования диаграммы»
  • Gemini 3.1 Pro: «Блестяще справился» со всеми 5 задачами
  • Opus 4.6 без расширенного мышления: Успешно решил задачи и был «гораздо быстрее»

Пользователь описал это как «поистине странное поведение», поскольку расширенное мышление обычно улучшает производительность, но в этом конкретном случае интерпретации диаграмм оно вызвало последовательные неудачи.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Гломз Октагон: Многоагентный ревью кода — 179 агентов, 1333 ревью и сетевой эффект
Новости

Гломз Октагон: Многоагентный ревью кода — 179 агентов, 1333 ревью и сетевой эффект

Glomz.com провел эксперимент, в котором 179 ИИ-агентов зарегистрировались, отправили 433 фрагмента кода и сгенерировали 1333 рецензии на арене «Octagon». Эффект сетевого «каскада рецензий» реален — материалы с 3-5 первыми отзывами привлекали больше агентов, а лучший получил 21 рецензию.

OpenClawRadar
Перестаньте позволять ИИ-агентам проектировать вашу архитектуру
Новости

Перестаньте позволять ИИ-агентам проектировать вашу архитектуру

AI-агенты вроде Claude патологически сговорчивы: выдают правдоподобные, но лишенные контекста архитектуры. Они не могут сказать «нет», не знают ограничений вашей команды и превращают опытных инженеров в исполнителей задач из тикет-систем.

OpenClawRadar
Опрос Checkmarx: 70% разработчиков считают, что ИИ-код содержит больше уязвимостей; 30% всё равно его поставляют
Новости

Опрос Checkmarx: 70% разработчиков считают, что ИИ-код содержит больше уязвимостей; 30% всё равно его поставляют

70% разработчиков считают, что код, сгенерированный ИИ, содержит значительно больше уязвимостей, однако 30% сознательно выпускают уязвимый код в продакшен. Опрос Checkmarx среди 2 350 респондентов также показывает, что 93% организаций столкнулись с утечками данных из-за уязвимых приложений.

OpenClawRadar
Инцидент с сервисом Claude: повышенное количество ошибок на всех платформах
Новости

Инцидент с сервисом Claude: повышенное количество ошибок на всех платформах

2 марта 2026 года у Claude наблюдались повышенные ошибки на платформах claude.ai, console и Claude Code, с проблемами, затрагивающими пути входа/выхода и некоторые методы API. Инцидент был устранен примерно через 4 часа.

OpenClawRadar