Бенчмарк усилий рассуждения Opus 4.7: Средний превосходит Высокий и Максимум в реальных задачах

✍️ OpenClawRadar📅 Опубликовано: 13 мая 2026 г.🔗 Source
Ad

Пользователь Reddit ktane протестировал Claude Opus 4.7 в Claude Code на пяти уровнях усилий рассуждений (низкий, средний, высокий, очень высокий, максимальный) на 29 реальных задачах из открытого репозитория GraphQL-go-tools. Результат: средний уровень усилий последовательно превосходит более высокие настройки по доле прохождения тестов, семантической эквивалентности с человеческими патчами, доле прохождения ревью кода и агрегированным показателям мастерства/дисциплины.

Ad

Ключевые результаты

  • Доля прохождения всех задач: Средний 28/29, Макс 27/29, Высокий 26/29, Очень высокий 25/29, Низкий 23/29
  • Эквивалентные патчи: Средний 14/29, Макс 13/29, Высокий 12/29, Очень высокий 11/29, Низкий 10/29
  • Доля прохождения ревью кода: Средний 10/29, Высокий 7/29, Макс 8/29, Очень высокий 4/29, Низкий 5/29
  • Средняя оценка ревью кода: Средний 2.716, Высокий 2.509, Очень высокий 2.482, Макс 2.431, Низкий 2.426
  • Риск footprint (чем ниже, тем лучше): Низкий 0.155, Средний 0.189, Высокий 0.206, Макс 0.227, Очень высокий 0.238
  • Стоимость за задачу: Низкий $2.50, Средний $3.15, Высокий $5.01, Очень высокий $6.51, Макс $8.84
  • Длительность за задачу: Низкий 383.8с, Средний 450.7с, Высокий 716.4с, Очень высокий 803.8с, Макс 996.9с
  • Эквивалентные прохождения на доллар: Низкий 4.0, Средний 4.4, Высокий 2.4, Очень высокий 1.7, Макс 1.5

Автор отмечает, что Opus 4.7 использует адаптивное мышление — он уже распределяет бюджет рассуждений на задачу. Таким образом, регулятор усилий скорее смещает и без того адаптивную политику, а не добавляет чистого интеллекта. Примечательно, что в одном PR (#1260) настройки высокого и очень высокого уровня впустую потратили рассуждения на поиск хешей коммитов из предыдущих PR и заключили «работа не требуется», в то время как средний и максимальный уровни корректно прочитали поток управления и выдали исправление.

Это контрастирует с GPT-5.5 в Codex, который показал интуитивную монотонную кривую, где большее количество рассуждений улучшало качество. Полный интерактивный отчет с детализацией по каждой задаче доступен на stet.sh.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Новые кредиты подписки Anthropic Claude: Agent SDK и claude -p получают отдельный ограниченный пул с 15 июня
Новости

Новые кредиты подписки Anthropic Claude: Agent SDK и claude -p получают отдельный ограниченный пул с 15 июня

Начиная с 15 июня подписчики Claude получают отдельный ежемесячный кредит на использование Agent SDK и claude -p: $200/мес для Max 20x, $100 для Max 5x, $20 для Pro. Использование прекращается, когда кредит исчерпан, если не включена дополнительная оплата. Интерактивные Claude Code и чат остаются на подписочном пуле.

OpenClawRadar
Qwen 3.6 27B протестирован на DeepSWE: 2% балла, 70 часов, 44 тыс. средних выходных токенов
Новости

Qwen 3.6 27B протестирован на DeepSWE: 2% балла, 70 часов, 44 тыс. средних выходных токенов

Модель Qwen 3.6 27B (FP8, BF16 KV кеш, контекст 262k) набрала 2% на DeepSWE за 70 часов. Средний вывод составил 44k токенов на задачу — сравнимо с более крупными моделями, такими как Qwen 3.6 Plus. Запуск на 1x RTX6000 Pro Blackwell через RunPod.

OpenClawRadar
Spotify внедряет значки «верификации» для обозначения живых артистов в противовес сгенерированным ИИ
Новости

Spotify внедряет значки «верификации» для обозначения живых артистов в противовес сгенерированным ИИ

Spotify добавляет зеленый значок «Подтверждено Spotify» к профилям артистов, соответствующих критериям, таким как привязанные аккаунты в соцсетях, даты концертов или мерч, чтобы отличить живых музыкантов от ИИ-сгенерированных.

OpenClawRadar
InclusionAI выпускает Ring-2.6-1T: триллионная модель для агентских рабочих процессов
Новости

InclusionAI выпускает Ring-2.6-1T: триллионная модель для агентских рабочих процессов

InclusionAI представила Ring-2.6-1T — модель рассуждений с 1 триллионом параметров, оптимизированную для выполнения агентских задач, с двумя уровнями глубины рассуждений (high/xhigh) и асинхронным RL-обучением с использованием алгоритма IcePop.

OpenClawRadar