Claude Opus 4.1 набирает 17.75% на приватном наборе данных SWE-Bench Pro, что подчеркивает разрыв между запоминанием и логическим мышлением.

✍️ OpenClawRadar📅 Опубликовано: 9 марта 2026 г.🔗 Source
Claude Opus 4.1 набирает 17.75% на приватном наборе данных SWE-Bench Pro, что подчеркивает разрыв между запоминанием и логическим мышлением.
Ad

Результаты бенчмарков показывают значительный разрыв в производительности

Claude Opus 4.1 достиг 80%+ на SWE-Bench Verified, но набрал всего 17,75% на приватном наборе данных SWE-Bench Pro. Этот набор данных содержит 276 задач из 18 проприетарных кодбейсов стартапов, которые никогда не были на GitHub, специально разработанных для исключения загрязнения данных через репозитории с лицензией GPL.

Результаты других моделей на том же приватном наборе данных: GPT-5.2 набрал 23,81% (возглавив таблицу лидеров), а Gemini 3 Pro — 17,95%.

Анализ траекторий выявляет поведение запоминания

Анализ Scale AI показал, что во время тестирования модели могли определять правильные пути к файлам для изменения ещё до полного прочтения описания проблем на знакомых репозиториях. Это указывает на то, что они ориентировались по памяти, а не рассуждали над задачами.

Результат в 80% на SWE-Bench Verified был реальным, но измерял иную способность, чем предполагало большинство людей — в основном память о тренировочных данных, а не рассуждения о новом коде.

Ad

Практические последствия для развёртывания инструментов ИИ-кодирования

Для разработчиков, решающих, где развернуть инструменты ИИ-кодирования в своём рабочем процессе, различие между памятью и рассуждениями важнее заголовочных цифр бенчмарков. Модели, которые хорошо показывают себя на загрязнённых бенчмарках, могут испытывать трудности с действительно новыми кодбейсами, которых они не видели во время обучения.

SWE-Bench Pro был создан специально для решения этой проблемы загрязнения, используя код, который никогда не был публично доступен на GitHub или в тренировочных наборах данных.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Песочница для агентов: устойчивое выполнение и холодные старты
Новости

Песочница для агентов: устойчивое выполнение и холодные старты

Запуск цикла агента вне песочницы изолирует учетные данные, позволяет приостанавливать песочницу и упрощает совместное использование несколькими пользователями, но требует решения проблем устойчивого выполнения и задержки холодного старта.

OpenClawRadar
EU заставляет Google открыть Android AI для сторонних разработчиков в соответствии с DMA
Новости

EU заставляет Google открыть Android AI для сторонних разработчиков в соответствии с DMA

Европейская комиссия предлагает меры, позволяющие сторонним AI-ассистентам получать системный доступ на Android, включая вызов по ключевым словам, контекст экрана и доступ к аппаратному обеспечению для локальных моделей. Google называет это 'неоправданным вмешательством'.

OpenClawRadar
Простой метод самодистилляции улучшает генерацию кода в больших языковых моделях.
Новости

Простой метод самодистилляции улучшает генерацию кода в больших языковых моделях.

Исследователи показали, что дообучение больших языковых моделей на их собственных сгенерированных ответах (простая самодистилляция) улучшает качество генерации кода, повышая показатель Qwen3-30B-Instruct с 42,4% до 55,3% pass@1 на LiveCodeBench v6.

OpenClawRadar
Проверка цен на DeepSeek V4: кэшированные токены в 178 раз дешевле Opus, но признано отставание в возможностях
Новости

Проверка цен на DeepSeek V4: кэшированные токены в 178 раз дешевле Opus, но признано отставание в возможностях

Вход DeepSeek V4 Pro стоит $0.145/М токенов против $5/М у Claude Opus 4.7 (в 34 раза дешевле); попадание в кеш — $0.0036/М против $0.625/М (в 173 раза дешевле). По возможностям он отстает от GPT-5.4 и Gemini 3.1 Pro на 3-6 месяцев.

OpenClawRadar