Claude Opus 4.1 набирает 17.75% на приватном наборе данных SWE-Bench Pro, что подчеркивает разрыв между запоминанием и логическим мышлением.

Результаты бенчмарков показывают значительный разрыв в производительности
Claude Opus 4.1 достиг 80%+ на SWE-Bench Verified, но набрал всего 17,75% на приватном наборе данных SWE-Bench Pro. Этот набор данных содержит 276 задач из 18 проприетарных кодбейсов стартапов, которые никогда не были на GitHub, специально разработанных для исключения загрязнения данных через репозитории с лицензией GPL.
Результаты других моделей на том же приватном наборе данных: GPT-5.2 набрал 23,81% (возглавив таблицу лидеров), а Gemini 3 Pro — 17,95%.
Анализ траекторий выявляет поведение запоминания
Анализ Scale AI показал, что во время тестирования модели могли определять правильные пути к файлам для изменения ещё до полного прочтения описания проблем на знакомых репозиториях. Это указывает на то, что они ориентировались по памяти, а не рассуждали над задачами.
Результат в 80% на SWE-Bench Verified был реальным, но измерял иную способность, чем предполагало большинство людей — в основном память о тренировочных данных, а не рассуждения о новом коде.
Практические последствия для развёртывания инструментов ИИ-кодирования
Для разработчиков, решающих, где развернуть инструменты ИИ-кодирования в своём рабочем процессе, различие между памятью и рассуждениями важнее заголовочных цифр бенчмарков. Модели, которые хорошо показывают себя на загрязнённых бенчмарках, могут испытывать трудности с действительно новыми кодбейсами, которых они не видели во время обучения.
SWE-Bench Pro был создан специально для решения этой проблемы загрязнения, используя код, который никогда не был публично доступен на GitHub или в тренировочных наборах данных.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Пользователь Reddit исследует, почему ИИ пока не может искать пропавшие самолеты вроде MH370 на спутниковых снимках.
Пользователь Reddit попросил ИИ Claude поискать в базах данных спутниковых и гидролокационных снимков, чтобы найти пропавшие самолеты, такие как MH370 и самолет Амелии Эрхарт. Claude ответил, что у него нет доступа к этим базам данных и инструментов компьютерного зрения для масштабного сканирования изображений, хотя пользователь отметил, что необходимые технологические компоненты уже существуют по отдельности.

Стартап по ИИ Янна Лекуна привлек $1 млрд в крупнейшем раунде начального финансирования в Европе.
Стартап в области ИИ Янна Лекуна привлёк 1 миллиард долларов в рамках крупнейшего в Европе раунда посевного финансирования. Новость была опубликована на Hacker News, набрав 186 баллов и 107 комментариев.

61% людей теперь используют ИИ для поддержки психического здоровья — глобальное исследование AXA/Ipsos
Согласно докладу AXA/Ipsos 2026 Mind Health Report, 61% людей в 18 странах уже используют ИИ для вопросов психического здоровья; 28% сообщили, что рекомендации ИИ привели к вредоносному поведению.

Еженедельный обзор мультимодального ИИ: Holotron-12B, Nemotron Omni, GlyphPrinter и другие
В этой неделе среди основных достижений в области мультимодального ИИ можно выделить Holotron-12B для задач компьютерного использования, модели NVIDIA Nemotron Omni, объединяющие язык, зрение и голос, GlyphPrinter для точного рендеринга текста при генерации изображений, а также несколько проектов с открытым исходным кодом для улучшения видео, 3D-сегментации и многоагентных систем.