Бенчмарк проверки кода ИИ: сравнение Claude, Gemini, Codex, Qwen и MiniMax

✍️ OpenClawRadar📅 Опубликовано: 27 февраля 2026 г.🔗 Source
Бенчмарк проверки кода ИИ: сравнение Claude, Gemini, Codex, Qwen и MiniMax
Ad

Сравнение производительности ИИ при ревью кода

Недавний эксперимент провёл сравнительный анализ пяти флагманских моделей ИИ для ревью кода, используя 15 пулл-реквестов из Milvus — открытой векторной базы данных. Каждый PR содержал известные баги, которые проявились в продакшене после слияния, что обеспечило реалистичный набор для тестирования.

Модели и настройка

Протестированные модели:

  • Claude Opus 4.6
  • Gemini 3 Pro
  • GPT-5.2-Codex
  • Qwen-3.5-Plus
  • MiniMax-M2.5

Тестирование использовало Magpie — инструмент с открытым исходным кодом, который подготавливает контекст, подтягивая окружающий код, цепочки вызовов и связанные модули, прежде чем передать его модели.

Уровни сложности багов

Багы были классифицированы по сложности:

  • L1: Видны только из diff (все модели их обнаружили, поэтому исключены из подсчёта очков)
  • L2 (10 случаев): Требуют понимания окружающего кода (изменения интерфейсов, гонки состояний)
  • L3 (5 случаев): Требуют понимания на уровне системы (несоответствия между модулями, совместимость при обновлении)

Результаты по моделям

Использовались два режима оценки:

  • Raw: Модель видит только diff и содержимое PR
  • R1: Magpie предоставляет окружающий контекст

Общие показатели обнаружения (только L2 + L3):

  • Claude: 53% raw, 47% с контекстом
  • Gemini: 13% raw, 33% с контекстом
  • Codex: 33% raw, 27% с контекстом
  • MiniMax: 27% raw, 33% с контекстом
  • Qwen: 33% raw, 40% с контекстом
Ad

Ключевые выводы

Claude доминировал в raw-ревью с обнаружением 53% и идеальным результатом 5/5 по багам L3. Он отлично организует собственный контекст, поэтому дополнительный контекст фактически снизил его производительность.

Gemini показал слабые результаты в режиме raw (13%), но значительно улучшился с контекстом (33%), что говорит о необходимости предоставления контекста заранее.

Qwen оказался самым сильным исполнителем с контекстной помощью — 40%, с наивысшим обнаружением багов L2 (5/10).

Результаты состязательных дебатов

Когда модели дискутировали друг с другом в течение пяти раундов, обнаружение багов выросло с 53% (лучшая одиночная модель) до 80%. Самые сложные баги L3 достигли 100% обнаружения в режиме дебатов.

Эксперимент показывает, что разные модели обладают взаимодополняющими сильными сторонами: тщательность Claude, дизайн-ориентированный анализ Gemini при наличии контекста, конкретная и практическая обратная связь Codex, а также сильная производительность Qwen с контекстной помощью.

📖 Read the full source: HN AI Agents

Ad

👀 Смотрите также

Qwen3.5-35B-A3B-UD-Q6_K_XL Протестировано в производственных рабочих процессах разработки
Инструменты

Qwen3.5-35B-A3B-UD-Q6_K_XL Протестировано в производственных рабочих процессах разработки

Разработчик протестировал модель Qwen3.5-35B-A3B-UD-Q6_K_XL на нескольких реальных клиентских проектах, достигнув стабильной производительности с показателями 1504pp2048 и 47.71 tg256, а также скоростью генерации токенов 80tps на одной видеокарте.

OpenClawRadar
Sentinel: Самостоятельно размещаемая платформа агентов для подписчиков Claude Code
Инструменты

Sentinel: Самостоятельно размещаемая платформа агентов для подписчиков Claude Code

Sentinel — это бесплатная платформа с открытым исходным кодом, которая работает напрямую на вашем существующем токене OAuth Claude Code без накладных расходов на API. Она предоставляет чистый интерфейс оператора с автоматизацией браузера в реальном времени через встроенный VNC и включает такие функции, как Git-контроль, журналы трассировки сессий и структурированную иерархическую память.

OpenClawRadar
Flash-MoE: Запуск модели Qwen с 397 миллиардами параметров на MacBook Pro с использованием чистого C/Metal
Инструменты

Flash-MoE: Запуск модели Qwen с 397 миллиардами параметров на MacBook Pro с использованием чистого C/Metal

Flash-MoE — это чисто C/Metal-движок для вывода, который запускает модель Qwen3.5-397B-A17B, смесь экспертов с 397 миллиардами параметров, на MacBook Pro с 48 ГБ оперативной памяти со скоростью 4.4+ токена в секунду. Модель объёмом 209 ГБ загружается с SSD через пользовательские Metal compute-шейдеры без использования Python или фреймворков.

OpenClawRadar
Обновление Hawkeye добавляет оркестрацию роя, удаленные задачи и поддержку локальных моделей.
Инструменты

Обновление Hawkeye добавляет оркестрацию роя, удаленные задачи и поддержку локальных моделей.

Hawkeye v1.0+ теперь поддерживает оркестрацию мультиагентных роев, удаленную очередь задач и улучшенную интеграцию с Ollama/LM Studio. Локальный рекордер полета ИИ-агентов помогает разработчикам отслеживать, что происходит, когда агенты работают в репозиториях.

OpenClawRadar