Обновление таблицы лидеров SWE-rebench: результаты за февраль 2026 года демонстрируют напряженную конкуренцию

✍️ OpenClawRadar📅 Опубликовано: 23 марта 2026 г.🔗 Source
Обновление таблицы лидеров SWE-rebench: результаты за февраль 2026 года демонстрируют напряженную конкуренцию
Ad

Результаты SWE-rebench за февраль 2026 года

Таблица лидеров SWE-rebench обновлена результатами за февраль 2026 года на 57 новых задачах из GitHub PR. Настройка соответствует стандартной методологии SWE-bench: модели читают реальные PR-запросы, редактируют код, запускают тесты и должны обеспечить прохождение всего набора тестов. Задачи ограничены PR, созданными в предыдущем месяце.

Ad

Ключевые результаты

  • Claude Opus 4.6 остаётся на первом месте с показателем решённых задач 65,3%, продолжая задавать темп с высоким pass@5 (~70%)
  • Лидирующая группа чрезвычайно плотная: gpt-5.2-medium (64,4%), GLM-5 (62,8%) и gpt-5.4-medium (62,8%) находятся всего в нескольких пунктах от лидера
  • Gemini 3.1 Pro Preview (62,3%) и DeepSeek-V3.2 (60,9%) завершают плотно сгруппированную шестёрку лидеров
  • Открытые/гибридные модели продолжают улучшаться: Qwen3.5-397B (59,9%), Step-3.5-Flash (59,6%) и Qwen3-Coder-Next (54,4%) сокращают разрыв благодаря улучшенному использованию длинного контекста и масштабированию
  • MiniMax M2.5 (54,6%) продолжает выделяться как экономически эффективный вариант с конкурентоспособной производительностью

В целом, февраль демонстрирует высококонкурентный фронт с несколькими моделями в пределах нескольких пунктов от лидера.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

MTP Multi-Token Prediction: генерация токенов в 2 раза быстрее на AMD Strix Halo и Radeon 9700 AI Pro
Новости

MTP Multi-Token Prediction: генерация токенов в 2 раза быстрее на AMD Strix Halo и Radeon 9700 AI Pro

Мультитокенное предсказание (MTP) обещает до 2-кратного ускорения генерации токенов для локальных LLM. Новое демо-видео показывает MTP на оборудовании AMD Strix Halo и Dual Radeon 9700 AI Pro, ориентированном на модели класса Qwen 3.6.

OpenClawRadar
OpenAI развернет модели искусственного интеллекта в защищенной сети Министерства обороны США.
Новости

OpenAI развернет модели искусственного интеллекта в защищенной сети Министерства обороны США.

OpenAI достигла соглашения о развертывании своих моделей искусственного интеллекта в классифицированной сети Министерства обороны США, реализация запланирована на 2026 год. Статья Reuters набрала 15 баллов и 6 комментариев на Hacker News.

OpenClawRadar
Не используйте ИИ для написания того, что вы выдаете за свою собственную работу
Новости

Не используйте ИИ для написания того, что вы выдаете за свою собственную работу

Джеймс Бах выступает против использования ИИ для написания любого контента, который вы выдаете за свой. Он предупреждает, что признание помощи ИИ обесценивает вашу репутацию и заставляет относиться к такой работе как к халтуре.

OpenClawRadar
Роботы-собаки с искусственным интеллектом задействованы для наблюдения в Атланте
Новости

Роботы-собаки с искусственным интеллектом задействованы для наблюдения в Атланте

Четырёхногие роботы-собаки, оснащённые камерами и ИИ, патрулируют улицы, квартиры и строительные площадки Атланты, транслируя видео 360° удалённым операторам 24/7 как более дешёвая альтернатива охранникам-людям.

OpenClawRadar