Конвейер TDD с ИИ: Как плохие инструкции породили 3 400 тестов и что это исправило

Проблема: Буквальное толкование в масштабе
Разработчик создал многокомпонентный конвейер TDD с использованием Claude Code, где разные агенты выполняют конкретные задачи: один пишет тесты, другой пишет код для их прохождения, третий проводит ревью всего, а четвёртый ищет граничные случаи. Исходная инструкция была простой: «написать тесты для всего».
Система, казалось, работала — количество тестов продолжало расти, и CI был зелёным. Однако аудит выявил проблемы с 3400 сгенерированными тестами:
- 44% валидных
- 30% нуждались в доработке
- 26% полная ерунда
Бесполезные тесты включали:
- Тесты, которые создавали объект JSON-конфигурации, а затем утверждали, что он равен самому себе
- Тесты, которые проверяли, имеет ли интерфейс TypeScript правильную структуру, путём создания объекта и утверждения, что он соответствует только что созданному
- Тесты для статических файлов, которые никогда не изменятся
Разработчик удалил почти 20 000 строк тестового кода и определил основную проблему: «Claude не облажался. Это сделал я. Я сказал „написать тесты для всего“, и он услышал меня громко и чётко. Каждый файл. Каждый конфиг. Каждое определение типа. Мои инструкции были проблемой, и агент следовал им идеально».
Решение: Классификация и ревью
Исправление включало два ключевых изменения:
1. Классификация рабочих элементов перед тестированием:
- Функции получают 3–5 поведенческих тестов (действительно ли это работает?)
- Задачи получают 1–2 дымовых теста (не сломало ли что-то очевидное?)
- Ошибки получают 2–3 регрессионных теста (вернётся ли эта конкретная ошибка?)
- Улучшения тестируют только новое или изменённое поведение
2. Добавление агента ревью: Отдельный агент рассматривает и тесты, и реализацию с новым контекстом, выявляя проблемы, которые пропустили агенты-писатели, потому что были слишком близки к своему собственному выводу.
Результаты после исправления
- 3400 тестов сократились до 2525
- Время выполнения упало со 117 секунд до ~50 секунд
- Каждый оставшийся тест проверяет фактическое поведение
Ключевое понимание
«Создание с помощью ИИ-агентов делает ваше небрежное мышление видимым в масштабе. Человек пишет плохие тесты — вы получаете несколько плохих тестов. Дадите плохую инструкцию конвейеру агентов, обрабатывающему сотни рабочих элементов? Вы получите сотни плохих тестов. То же плохое мышление, просто усиленное во всём, к чему оно прикасается. Исправьте мышление — исправьте результат».
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Три практических шаблона для заработка с помощью OpenClaw
Анализ 100 пользователей OpenClaw выявил три устойчивых подхода: превращение существующих знаний в AI-ассистентов, автоматизация повторяющихся исследований и продажа результатов, экономящих время, а не функций искусственного интеллекта.

Пользователь OpenClaw сталкивается с проблемами автоматизации AI-агента после успешной настройки конвейера Claude Code.
Владелец маркетингового агентства успешно создал конвейер воссоздания изображений с помощью Claude Code за один час, но столкнулся с проблемами при попытке обучить тому же процессу ИИ-агента в OpenClaw, работающего на Gemini 3.1 Pro. Проблемы включали плохую логику, медленные ответы и некорректные результаты.

Пользователь Reddit сообщает о 30% потере бюджета из-за «налога на перезапуск» ИИ-агентов и делится решением через контрольные точки.
Разработчик на r/LocalLLaMA обнаружил, что его команда тратит 30% бюджета на ИИ на перезапуски, когда рабочие процессы прерываются на середине задачи. Они внедрили создание контрольных точек для каждого вызова инструмента, что сразу же сократило расходы на API, исключив избыточную обработку.

ИИ-агент Bub от OpenClaw испытывает трудности с делегированием и сжигает 20 долларов за 15 минут при оптимизации мобильного сайта.
Во время тестирования Driftwatch V3 бот OpenClaw Bub потратил $20 за 15 минут из-за неправильного делегирования задач. Разработчик обнаружил, что детальные шаблоны спецификаций снижают затраты, а адаптация под мобильные устройства добавила неожиданное время и расходы.