Бенчмарк против продакшена: когда тесты ИИ-агентов проходят, а реальные рабочие процессы дают сбой

Разработчик, управляющий полностью автоматизированной операцией по выбору спортивных ставок (AIBossSports), попытался сократить расходы, перейдя с Claude Sonnet 4.6 на более дешёвые модели через OpenRouter. Операция использует ИИ-агентов для обработки производства видео, контроля качества, распространения на YouTube/X/TikTok, отправки SMS подписчикам и аналитики.
Настройка бенчмарка
Разработчик создал бенчмарк-рубрику для тестирования альтернатив:
- Прочитать и обобщить производственный файл
- Корректно перечислить доступные видеоресурсы
- Делегировать многоэтапную задачу суб-агенту
- Синтезировать результаты из нескольких источников
- Сгенерировать структурированный вывод (формат JSON/отчёта)
Обе модели, Grok и MiniMax, успешно прошли эти тесты, что предполагало возможность значительной экономии средств.
Провалы в продакшене
При развёртывании в продакшене обе модели провалились способами, которые бенчмарк не выявил:
- Grok галлюцинировал пути к клипам, которые выглядели правдоподобно в логах вывода, но были неверными. Видеоагент загружал общие стоковые клипы вместо специфичных для команд кадров, потому что галлюцинированные пути существовали, но не были контекстуально уместны.
- MiniMax вызывал ошибки MIME-типов на логотипах во время сборки электронных писем. Система электронной почты ломалась при множественных отправках с перерывами, что было отслежено до того, как MiniMax обрабатывал метаданные вложений файлов.
Разработчик переключил всё обратно на Claude Sonnet 4.6.
Извлечённый урок
Бенчмарк тестировал, достаточно ли модели «умны», но не проверял операционную надёжность в неидеальных реальных условиях. Провалы выявили пробелы в тестировании:
- Реальные производственные структуры каталогов (а не чистые тестовые фикстуры)
- Извлечение ресурсов с преднамеренными граничными случаями (отсутствующие файлы, неоднозначные имена)
- Сквозная проверка электронной почты/вложений
- Тесты цепочек мульти-агентов, где сбои в середине цепочки должны быть обнаружены
Разработчик сделал вывод: «Бенчмарки тестируют интеллект. Продакшен тестирует надёжность. Это не одно и то же.»
📖 Read the full source: r/openclaw
👀 Смотрите также

Использование Telegram Topics для неограниченных параллельных диалогов с ИИ-агентами
Разработчик обнаружил, что преобразование групп Telegram в форумы позволяет каждой теме функционировать как изолированная сессия для ИИ-агентов, обеспечивая неограниченное количество параллельных диалогов без создания дополнительных ботов или токенов.

Как архитектура централизованного контекста с Claude экономит 10+ часов в неделю
Пользователь Reddit сообщает об экономии более 10 часов в неделю, перенеся стандартные операционные процедуры, заметки с совещаний и CRM в централизованное рабочее пространство Notion и подключив Claude напрямую к этому контексту. Три конкретных рабочих процесса устраняют ручное составление электронных писем, ввод данных в таблицы и создание контента.

Проект Клод для ежедневного планирования с интеграцией Todoist и Google Календаря
Разработчик создал проект Claude, который функционирует как помощник по управлению на полную ставку, подключенный к Todoist и Google Calendar. Система планирует ежедневные расписания, отслеживает привычки и проводит обзоры с использованием трех конкретных ролей: Аудитор задач, Планировщик привычек и Составитель расписаний.

Создание рабочего процесса квалификации лидов в LinkedIn с использованием Claude и MCP
Разработчик использовал Claude с интеграцией MCP-сервера для создания автоматизированного конвейера, который извлекает данные профилей LinkedIn, оценивает потенциальных клиентов по шкале от 1 до 10, фильтрует их на основе пороговых значений оценок и отправляет запросы на подключение без ручной проверки.