Конвейер TDD с ИИ: Как плохие инструкции породили 3 400 тестов и что это исправило

Проблема: Буквальное толкование в масштабе
Разработчик создал многокомпонентный конвейер TDD с использованием Claude Code, где разные агенты выполняют конкретные задачи: один пишет тесты, другой пишет код для их прохождения, третий проводит ревью всего, а четвёртый ищет граничные случаи. Исходная инструкция была простой: «написать тесты для всего».
Система, казалось, работала — количество тестов продолжало расти, и CI был зелёным. Однако аудит выявил проблемы с 3400 сгенерированными тестами:
- 44% валидных
- 30% нуждались в доработке
- 26% полная ерунда
Бесполезные тесты включали:
- Тесты, которые создавали объект JSON-конфигурации, а затем утверждали, что он равен самому себе
- Тесты, которые проверяли, имеет ли интерфейс TypeScript правильную структуру, путём создания объекта и утверждения, что он соответствует только что созданному
- Тесты для статических файлов, которые никогда не изменятся
Разработчик удалил почти 20 000 строк тестового кода и определил основную проблему: «Claude не облажался. Это сделал я. Я сказал „написать тесты для всего“, и он услышал меня громко и чётко. Каждый файл. Каждый конфиг. Каждое определение типа. Мои инструкции были проблемой, и агент следовал им идеально».
Решение: Классификация и ревью
Исправление включало два ключевых изменения:
1. Классификация рабочих элементов перед тестированием:
- Функции получают 3–5 поведенческих тестов (действительно ли это работает?)
- Задачи получают 1–2 дымовых теста (не сломало ли что-то очевидное?)
- Ошибки получают 2–3 регрессионных теста (вернётся ли эта конкретная ошибка?)
- Улучшения тестируют только новое или изменённое поведение
2. Добавление агента ревью: Отдельный агент рассматривает и тесты, и реализацию с новым контекстом, выявляя проблемы, которые пропустили агенты-писатели, потому что были слишком близки к своему собственному выводу.
Результаты после исправления
- 3400 тестов сократились до 2525
- Время выполнения упало со 117 секунд до ~50 секунд
- Каждый оставшийся тест проверяет фактическое поведение
Ключевое понимание
«Создание с помощью ИИ-агентов делает ваше небрежное мышление видимым в масштабе. Человек пишет плохие тесты — вы получаете несколько плохих тестов. Дадите плохую инструкцию конвейеру агентов, обрабатывающему сотни рабочих элементов? Вы получите сотни плохих тестов. То же плохое мышление, просто усиленное во всём, к чему оно прикасается. Исправьте мышление — исправьте результат».
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Создание корпоративной логистической платформы на $20 тыс./год с Claude и суперспособностями
TRMNL заменила ShipHero на Claude и Superpowers менее чем за месяц, создав собственную систему выполнения заказов с интеграциями UPS, FedEx, DHL и USPS за $100 на токены.

Пользователь Reddit делится опытом, как ИИ-агент за ночь создал проект на Next.js.
Разработчик на сабреддите r/openclaw поделился опытом, дав своему ИИ-агенту открытую задачу — создать проект с нуля за ночь, документируя, что агент сделал хорошо, а где потребовалось вмешательство человека. Агент успешно создал каркас проекта на Next.js, написал контент, управлял операциями Git, развернул проект на Vercel и итеративно улучшал дизайн на основе обратной связи.

Как я сократил расходы на OpenClaw на 60% с помощью маршрутизации моделей
Пользователь OpenClaw сократил расходы на API с $420 до $168 за 20 дней, проанализировав шаблоны использования и направляя задачи соответствующим моделям вместо использования Claude Opus для всего. Разбивка показала, что 70% задач были простыми и могли использовать более дешёвые модели.

Создание Концертного Радара с OpenClaw: Сбор информации о выступлениях артистов из нескольких источников
Разработчик создал радар концертов с помощью OpenClaw на VPS, который получает артистов из Spotify, ежедневно сканирует несколько источников, нормализует события, сопоставляет артистов, удаляет дубликаты и отслеживает новые анонсы через cron-задачи.