Бенчмарк против продакшена: когда тесты ИИ-агентов проходят, а реальные рабочие процессы дают сбой

✍️ OpenClawRadar📅 Опубликовано: 22 марта 2026 г.🔗 Source
Бенчмарк против продакшена: когда тесты ИИ-агентов проходят, а реальные рабочие процессы дают сбой
Ad

Разработчик, управляющий полностью автоматизированной операцией по выбору спортивных ставок (AIBossSports), попытался сократить расходы, перейдя с Claude Sonnet 4.6 на более дешёвые модели через OpenRouter. Операция использует ИИ-агентов для обработки производства видео, контроля качества, распространения на YouTube/X/TikTok, отправки SMS подписчикам и аналитики.

Настройка бенчмарка

Разработчик создал бенчмарк-рубрику для тестирования альтернатив:

  • Прочитать и обобщить производственный файл
  • Корректно перечислить доступные видеоресурсы
  • Делегировать многоэтапную задачу суб-агенту
  • Синтезировать результаты из нескольких источников
  • Сгенерировать структурированный вывод (формат JSON/отчёта)

Обе модели, Grok и MiniMax, успешно прошли эти тесты, что предполагало возможность значительной экономии средств.

Провалы в продакшене

При развёртывании в продакшене обе модели провалились способами, которые бенчмарк не выявил:

  • Grok галлюцинировал пути к клипам, которые выглядели правдоподобно в логах вывода, но были неверными. Видеоагент загружал общие стоковые клипы вместо специфичных для команд кадров, потому что галлюцинированные пути существовали, но не были контекстуально уместны.
  • MiniMax вызывал ошибки MIME-типов на логотипах во время сборки электронных писем. Система электронной почты ломалась при множественных отправках с перерывами, что было отслежено до того, как MiniMax обрабатывал метаданные вложений файлов.

Разработчик переключил всё обратно на Claude Sonnet 4.6.

Ad

Извлечённый урок

Бенчмарк тестировал, достаточно ли модели «умны», но не проверял операционную надёжность в неидеальных реальных условиях. Провалы выявили пробелы в тестировании:

  • Реальные производственные структуры каталогов (а не чистые тестовые фикстуры)
  • Извлечение ресурсов с преднамеренными граничными случаями (отсутствующие файлы, неоднозначные имена)
  • Сквозная проверка электронной почты/вложений
  • Тесты цепочек мульти-агентов, где сбои в середине цепочки должны быть обнаружены

Разработчик сделал вывод: «Бенчмарки тестируют интеллект. Продакшен тестирует надёжность. Это не одно и то же.»

📖 Read the full source: r/openclaw

Ad

👀 Смотрите также

Ловушка продуктивности разработчика с ИИ: от 80 коммитов в месяц до 1400+ с 17 агентами
Кейсы

Ловушка продуктивности разработчика с ИИ: от 80 коммитов в месяц до 1400+ с 17 агентами

Разработчик сообщает, что ИИ-агенты для программирования не заменили его работу, а умножили нагрузку: с 80 коммитов в месяц на одном CRM-проекте до управления 17 ИИ-агентами, 12 параллельными проектами и 1400+ коммитами в 39 репозиториях.

OpenClawRadar
Отчеты разработчиков о проблемах в ИИ-кодинге: проектные решения и отладка с реальными пользователями
Кейсы

Отчеты разработчиков о проблемах в ИИ-кодинге: проектные решения и отладка с реальными пользователями

Разработчик, создающий приложение для iOS с помощью Claude Code в течение 5 месяцев, сообщает, что хотя ИИ легко генерирует рабочий код, принятие дизайнерских решений и отладка проблем, которые проявляются только у реальных пользователей, являются самыми сложными частями. Приложение содержит 220 тысяч строк кода, и его тестируют реальные пользователи.

OpenClawRadar
Как один разработчик устранил 16 архитектурных слабых мест в своей системе AI-агентов
Кейсы

Как один разработчик устранил 16 архитектурных слабых мест в своей системе AI-агентов

Разработчик задокументировал 16 архитектурных проблем в своей системе агента ИИ OpenClaw и реализовал конкретные исправления, включая явные определения слоёв, авторизацию шлюза и основанное на доказательствах выполнение.

OpenClawRadar
Запуск многозадачной команды стартапа на OpenClaw: Настройка и шаблоны
Кейсы

Запуск многозадачной команды стартапа на OpenClaw: Настройка и шаблоны

Команда noHuman создала веб-интерфейс, который разворачивает мультиагентные настройки OpenClaw с готовыми шаблонами команд, изолируя каждого агента в своей виртуальной машине с браузером. Они используют простой HTTP-ретранслятор для общения агентов и поддерживают границы ролей для сфокусированной работы.

OpenClawRadar