Воссоздание системы генератор-оценщик Anthropic с помощью Kiro CLI: создание сайта за 12 итераций

Разработчик воспроизвел дизайн обвязки Generator-Evaluator от Anthropic для долгоиграющих приложений, вдохновленный GAN. Архитектура: Planner (запускается один раз), затем цикл Generator ↔ Evaluator на 12 итераций. Каждый агент — отдельный CLI-процесс без общего контекста, общающийся только через файлы (spec.md, eval-report.md). Evaluator использует Playwright для просмотра живого сайта, а не просто чтения кода.
Ключевые детали архитектуры
- Чистый лист при каждом запуске: Каждый агент стартует с нуля, читает только свои входные файлы. Предотвращает "контекстную тревогу".
- Playwright MCP для тестирования: Навигация, клики, изменение размеров окна. Выявляет визуальные баги, которые никогда не нашёл бы код-ревью.
- Навык фронтенд-дизайна Anthropic: Явно штрафует типичные AI-шаблоны (шрифт Inter, фиолетовые градиенты, карточные макеты). Поощряет творческий риск.
- Непрерывная итерация, а не повтор при ошибке: Все 12 раундов выполняются независимо. Каждый улучшает результат.
Результаты и статистика
Итерация 1: функционально, но безлико. Итерация 4: генератор переключился на "Terminal Noir" — IBM Plex Mono, янтарный на чёрном, текстура зерна, линии развертки. Итерации 5–12: полировка, доступность, адаптивность, поддержка уменьшения движения.
- Общее время: 3 ч 20 мин
- Итерации: 12 (генератор + оценщик каждый)
- Кода написано вручную: 0 строк (несколько визуальных проблем исправлено после)
- Технологии: Next.js, Tailwind, Framer Motion, TypeScript
Результат вживую
https://mnemo-mcp.github.io/Mnemo/
Главный вывод
Модель — это двигатель. Обвязка — ограничения, обратная связь и состязательная структура — определяет, получите ли вы AI-мусор или нечто действительно уникальное.
📖 Читать полный источник: r/ClaudeAI
👀 Смотрите также

Снижение затрат на AI-агентов на 30% за счет мониторинга поведения и изменения конфигураций.
Разработчик сократил потребление токенов своего бота OpenClaw на 30%, обнаружив, что 70 cron-задач сбрасывали результаты в основной чат-сеанс, вызывая раздувание контекста и повторное сжатие. Решение заключалось в перенаправлении выводов cron напрямую в Telegram и создании навыка мониторинга для выявления неэффективностей, таких как избыточные поиски и чтение слишком больших файлов.

Кейс отладки Claude: Агент молча завершил работу из-за отсутствующего параметра, контекст оказался важнее модели.
Разработчик использовал Claude для создания календарного агента, затем потратил 40 минут на отладку с помощью Claude, прежде чем понял, что инструмент write_calendar не имел параметра attendees. Когда была предоставлена полная контекстная информация, Claude определил проблему за 10 секунд.

Исследование OpenClaw: Управление электронной почтой в течение 10 дней без вмешательства человека
Фриланс-консультант предоставил OpenClaw полный доступ к своему Gmail на 10 дней во время путешествия, с инструкциями отвечать в точности его тоном, отмечать только критические вопросы и автономно выполнять рутинные задачи. Система обработала 187 писем с одной незначительной ошибкой.

Разработчик восстановил расширение для Chrome за 7 дней с помощью Claude после того, как миграция на Google MV3 "убила" оригинал.
Разработчик перестроил расширение Chrome, его API, веб-сайт и агента контроля качества за 7 дней с помощью Claude после того, как миграция Google с Manifest V2 на V3 уничтожила оригинальную версию. Расширение находит реальные скидки на Amazon в 21 домене и получило 4000 установок за первую неделю.