Бенчмарк усилий рассуждения Opus 4.7: Средний превосходит Высокий и Максимум в реальных задачах
Пользователь Reddit ktane протестировал Claude Opus 4.7 в Claude Code на пяти уровнях усилий рассуждений (низкий, средний, высокий, очень высокий, максимальный) на 29 реальных задачах из открытого репозитория GraphQL-go-tools. Результат: средний уровень усилий последовательно превосходит более высокие настройки по доле прохождения тестов, семантической эквивалентности с человеческими патчами, доле прохождения ревью кода и агрегированным показателям мастерства/дисциплины.
Ключевые результаты
- Доля прохождения всех задач: Средний 28/29, Макс 27/29, Высокий 26/29, Очень высокий 25/29, Низкий 23/29
- Эквивалентные патчи: Средний 14/29, Макс 13/29, Высокий 12/29, Очень высокий 11/29, Низкий 10/29
- Доля прохождения ревью кода: Средний 10/29, Высокий 7/29, Макс 8/29, Очень высокий 4/29, Низкий 5/29
- Средняя оценка ревью кода: Средний 2.716, Высокий 2.509, Очень высокий 2.482, Макс 2.431, Низкий 2.426
- Риск footprint (чем ниже, тем лучше): Низкий 0.155, Средний 0.189, Высокий 0.206, Макс 0.227, Очень высокий 0.238
- Стоимость за задачу: Низкий $2.50, Средний $3.15, Высокий $5.01, Очень высокий $6.51, Макс $8.84
- Длительность за задачу: Низкий 383.8с, Средний 450.7с, Высокий 716.4с, Очень высокий 803.8с, Макс 996.9с
- Эквивалентные прохождения на доллар: Низкий 4.0, Средний 4.4, Высокий 2.4, Очень высокий 1.7, Макс 1.5
Автор отмечает, что Opus 4.7 использует адаптивное мышление — он уже распределяет бюджет рассуждений на задачу. Таким образом, регулятор усилий скорее смещает и без того адаптивную политику, а не добавляет чистого интеллекта. Примечательно, что в одном PR (#1260) настройки высокого и очень высокого уровня впустую потратили рассуждения на поиск хешей коммитов из предыдущих PR и заключили «работа не требуется», в то время как средний и максимальный уровни корректно прочитали поток управления и выдали исправление.
Это контрастирует с GPT-5.5 в Codex, который показал интуитивную монотонную кривую, где большее количество рассуждений улучшало качество. Полный интерактивный отчет с детализацией по каждой задаче доступен на stet.sh.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Закон об ИИ для K-12 Шиффа-Раундса: что разработчикам нужно знать о законопроекте об ИИ-грамотности
OpenAI, Google и Microsoft поддерживают Закон LIFT AI, который финансирует гранты NSF для разработки учебных программ по ИИ-грамотности для K-12, подготовки учителей и инструментов оценки.

Bloomberg сообщает: потери рабочих мест в США, связанные с внедрением ИИ, начинают расти
Bloomberg сообщает, что в США наблюдается значительная потеря рабочих мест в профессиях, затронутых ИИ, а обсуждение на Hacker News указывает на реальное влияние на разработчиков и других работников умственного труда.

Приложение Claude возглавило чарты App Store в США, ассистенты на базе ИИ заняли первые 10 мест
Claude от Anthropic в настоящее время занимает первое место в чарте лучших приложений в американском App Store, ChatGPT находится на втором месте, а Google Gemini — на четвёртом. В первую десятку входят три ассистента с искусственным интеллектом наряду с приложениями для шопинга, социальных сетей и утилитами.

Пользователи сообщают, что Sonnet 4.6 превосходит Opus 4.6 в практических задачах программирования.
Разработчик, тестировавший модели Claude AI, обнаружил, что Opus 4.6 создавал излишне сложные решения с проблемами производительности, в то время как Sonnet 4.6 предлагал более тщательные и эффективные исправления с меньшим использованием токенов.