Kiro CLI로 Anthropic의 Generator-Evaluator Harness 구현하기: 12회 반복 웹사이트 구축

한 개발자가 GAN에서 영감을 받아 장기 실행 앱을 위한 Anthropic의 Generator-Evaluator 하네스 설계를 복제했습니다. 아키텍처: Planner(한 번 실행) 후 Generator ↔ Evaluator 루프가 12회 반복됩니다. 각 에이전트는 별도의 CLI 프로세스로 공유 컨텍스트가 전혀 없으며, 파일(spec.md, eval-report.md)을 통해서만 통신합니다. Evaluator는 단순히 코드를 읽는 것이 아니라 Playwright를 사용하여 라이브 사이트를 탐색합니다.
주요 아키텍처 세부사항
- 호출 시마다 완전 초기화: 각 에이전트는 새로 시작하여 입력 파일만 읽습니다. 컨텍스트 불안을 방지합니다.
- 테스트용 Playwright MCP: 탐색, 클릭, 뷰포트 크기 조정. 코드 리뷰로는 절대 발견할 수 없는 시각적 버그를 잡아냅니다.
- Anthropic의 프론트엔드 디자인 기술: 일반적인 AI 패턴(Inter 폰트, 보라색 그라데이션, 카드 레이아웃)에 명시적으로 불이익을 줍니다. 창의적인 위험 감수를 강제합니다.
- 지속적 반복, 실패 시 재시도 아님: 12라운드 모두 실행됩니다. 각 라운드마다 개선됩니다.
결과 및 통계
1차 반복: 기능적이지만 평범함. 4차 반복: Generator가 "Terminal Noir"로 전환—IBM Plex Mono, 검정 바탕에 호박색, 입자 질감, 스캔라인. 5-12차 반복: 다듬기, 접근성, 반응형 수정, 축소 모션 지원.
- 총 소요 시간: 3시간 20분
- 반복 횟수: 12회 (generator + evaluator 각각)
- 직접 작성한 코드: 0줄 (이후 몇 가지 시각적 문제 수정)
- 기술 스택: Next.js, Tailwind, Framer Motion, TypeScript
실제 결과물
https://mnemo-mcp.github.io/Mnemo/
주요 시사점
모델은 엔진입니다. 하네스—제약 조건, 피드백 루프, 적대적 구조—가 AI 쓰레기인지 아니면 진정으로 독특한 결과물인지를 결정합니다.
📖 전체 원문 읽기: r/ClaudeAI
👀 See Also

레딧 사용자가 클로드를 이용한 스토리 아키텍처가 영상 시청률 향상에 도움이 된다고 보고합니다
레딧 사용자가 150개 이상의 AI 채널을 추적한 결과, 대부분이 일관성 없는 콘텐츠로 인해 10개 비디오도 채우지 못하고 사라졌다고 합니다. 이들은 스크립트 작성 대신 Claude를 활용해 스토리 구조를 설계하고, LongStories와 결합해 시각적 일관성을 유지함으로써 시청자 유지율을 40%에서 60%로 높였다고 보고했습니다.

OpenClaw 패밀리 게이트웨이: 토큰 예산, 메모리 튜닝, 그리고 커스텀 플러그인
한 개발자가 Mac과 QNAP NAS에서 OpenClaw를 사용하여 가족용 AI 게이트웨이를 구축했습니다. 엄격한 토큰 예산을 설정하고, 재순위화와 상황별 임베딩으로 메모리 회상을 조정하며, 175개 이상의 명령어를 가진 12개의 맞춤 플러그인을 만들었습니다.

사용자가 Claude AI를 활용해 법적 경감 진술서 초안 작성에 성공
레딧 사용자가 교통법규 위반 사건에서 Claude AI를 활용해 위반 세부사항을 다운로드하고 감경 진술서 작성을 요청하여 작성된 진술서가 판사를 감명시켜 사건에서 승소한 사례를 보고했습니다.

로컬에서 Jetson Nano와 게임용 노트북을 사용하여 Ollama로 OpenClaw 실행하기
한 개발자가 Jetson Nano와 2022년형 MSI 게이밍 노트북을 사용해 OpenClaw를 로컬에서 실행하도록 설정했습니다. Qwen 3.5 9B 모델을 Ollama로 구동하고, 전력 효율을 위해 웨이크온랜(Wake-on-LAN) 기능을 구현했으며, 복잡한 작업은 OpenAI로 하이브리드 라우팅합니다.