SWE-CI: Новые эталонные тесты оценивают ИИ-агентов в долгосрочном сопровождении кода через CI

✍️ OpenClawRadar📅 Опубликовано: 8 марта 2026 г.🔗 Source
SWE-CI: Новые эталонные тесты оценивают ИИ-агентов в долгосрочном сопровождении кода через CI
Ad

Что на самом деле делает SWE-CI

SWE-CI — это первый бенчмарк на уровне репозитория, построенный на цикле непрерывной интеграции. Он призван сместить парадигму оценки генерации кода со статической, краткосрочной функциональной корректности в сторону динамической, долгосрочной поддерживаемости.

Ключевые детали из статьи

Бенчмарк включает 100 задач, каждая из которых в среднем соответствует:

  • Истории эволюции протяжённостью 233 дня
  • 71 последовательному коммиту в реальном репозитории кода

SWE-CI требует от агентов систематического решения этих задач через десятки раундов анализа и итераций кодирования. Это устраняет пробел в текущих методах оценки: хотя агенты на основе LLM продемонстрировали сильные возможности в автоматизации задач разработки ПО, таких как статическое исправление ошибок (как показали бенчмарки вроде SWE-bench), реальная разработка включает сложные изменения требований и долгосрочные итерации функций, которые статические, одношаговые парадигмы исправления не охватывают.

В статье отдельно отмечается, что SWE-CI даёт ценные инсайты о том, насколько хорошо агенты могут поддерживать качество кода на протяжении долгосрочной эволюции. Это выходит за рамки простого исправления ошибок, чтобы оценить, как агенты справляются с итеративной природой реальной разработки ПО.

Ad

Технический контекст

Такой тип бенчмарка важен, потому что большинство текущих оценок ИИ-агентов для кодинга сосредоточены на одношаговых исправлениях или изолированных проблемах кодирования. Подход SWE-CI на основе CI лучше отражает то, как разработка фактически происходит в зрелых проектах ПО, где изменения накапливаются со временем и должны сохранять совместимость с существующими системами.

Для разработчиков, использующих ИИ-агентов для кодинга, этот бенчмарк может помочь определить, какие агенты лучше подходят для долгосрочного сопровождения проектов, а какие — для быстрых исправлений. Многораундовая, итеративная природа задач проверяет настойчивость и последовательность — качества, которые важны при интеграции ИИ-помощников в текущие рабочие процессы разработки.

📖 Read the full source: HN AI Agents

Ad

👀 Смотрите также

10.33 т/с на Qwen 3.5 35B с ноутбуком за $300: Полный разбор оптимизации
Инструменты

10.33 т/с на Qwen 3.5 35B с ноутбуком за $300: Полный разбор оптимизации

Разработчик достигает 10,33 т/с на Qwen 3.5 35B Q4_K_S на ноутбуке Lenovo Ideapad Slim 3i за $300 с использованием ik_llama.cpp, привязки ядер, спекулятивного декодирования MTP и оптимизации BIOS.

OpenClawRadar
Открытый SDK для AI-работы с знаниями
Инструменты

Открытый SDK для AI-работы с знаниями

ClioAI выпустил <strong>kw-sdk</strong>, открытый набор инструментов для разработки программного обеспечения, предназначенный для структурирования работы ИИ-агентов в областях знаний, таких как исследование, анализ, стратегия и написание текстов. В отличие от традиционных кодовых фреймворков, которые имеют естественные сигналы верификации через тестирование, работа с знаниями требует структурированных подходов для проверки и оценки задач.

OpenClawRadar
Dirac: Агент с открытым исходным кодом лидирует в TerminalBench с результатом 65.2%, дешевле и открыт
Инструменты

Dirac: Агент с открытым исходным кодом лидирует в TerminalBench с результатом 65.2%, дешевле и открыт

Dirac, агент для программирования с открытым исходным кодом, набрал 65,2% в TerminalBench 2.0 для gemini-3-flash-preview, обойдя базовый показатель Google (47,6%) и лучшего закрытого агента Junie CLI (64,3%). Он также снижает затраты на API на 64,8% по сравнению с конкурентами.

OpenClawRadar
Клод-Контроль: Мобильное Удаленное Управление для Сессий Клод Кода
Инструменты

Клод-Контроль: Мобильное Удаленное Управление для Сессий Клод Кода

Claude-control — это инструмент с открытым исходным кодом, который позволяет управлять сессиями Claude Code с телефона через HTTPS и WebSocket. Он запускает Claude Code в реальном PTY внутри tmux, обнаруживает запросы разрешений и отправляет push-уведомления с кнопками «Разрешить»/«Запретить».

OpenClawRadar