AI TDD 파이프라인: 잘못된 지시가 3,400개의 테스트를 생성한 이유와 해결 방법

문제: 대규모의 문자 그대로 해석
한 개발자가 Claude Code를 사용해 다중 에이전트 TDD 파이프라인을 만들었습니다. 각 에이전트는 특정 작업을 담당합니다: 하나는 테스트를 작성하고, 하나는 테스트를 통과하는 코드를 작성하며, 하나는 모든 것을 검토하고, 하나는 경계 사례를 찾습니다. 초기 지시는 간단했습니다: "모든 것에 대한 테스트를 작성하라."
시스템은 작동하는 것처럼 보였습니다. 테스트 수는 계속 증가했고 CI는 정상 상태였습니다. 그러나 감사 결과 생성된 3,400개의 테스트에 문제가 있음이 드러났습니다:
- 44% 유효함
- 30% 재작업 필요
- 26% 완전히 쓸모없음
쓸모없는 테스트에는 다음이 포함되었습니다:
- JSON 설정 객체를 구성한 후 그것이 자기 자신과 동일하다고 주장하는 테스트
- TypeScript 인터페이스가 올바른 형태를 갖추었는지 확인하기 위해 객체를 구성하고 방금 구성한 것과 일치한다고 주장하는 테스트
- 절대 변경되지 않을 정적 파일에 대한 테스트
개발자는 거의 20,000줄의 테스트 코드를 삭제하고 핵심 문제를 파악했습니다: "Claude가 실수한 게 아닙니다. 제가 실수했습니다. 저는 '모든 것에 대한 테스트를 작성하라'고 말했고, 그것은 제 말을 명확히 이해했습니다. 모든 파일, 모든 설정, 모든 타입 정의. 제 지시가 문제였고, 에이전트는 그것을 완벽히 따랐습니다."
해결책: 분류와 검토
해결책에는 두 가지 주요 변경 사항이 포함되었습니다:
1. 테스트 전 작업 항목 분류:
- 기능에는 3-5개의 동작 테스트 적용 (이것이 실제로 작동하는가?)
- 작업에는 1-2개의 스모크 테스트 적용 (명백한 것을 망가뜨렸는가?)
- 버그에는 2-3개의 회귀 테스트 적용 (이 특정 버그가 다시 발생할 것인가?)
- 개선 사항은 새롭거나 변경된 동작만 테스트
2. 검토 에이전트 추가: 별도의 에이전트가 테스트와 구현을 새로운 맥락으로 살펴보며, 작성 에이전트가 자신의 출력에 너무 가까워서 놓친 문제를 포착합니다.
수정 후 결과
- 3,400개 테스트에서 2,525개로 감소
- 실행 시간 117초에서 약 50초로 단축
- 남은 모든 테스트가 실제 동작을 검증
핵심 통찰
"AI 에이전트로 구축하는 것은 당신의 부주의한 사고를 대규모로 가시화합니다. 인간이 나쁜 테스트를 작성하면 몇 개의 나쁜 테스트를 얻습니다. 수백 개의 작업 항목을 처리하는 에이전트 파이프라인에 나쁜 지시를 내리면? 수백 개의 나쁜 테스트를 얻습니다. 같은 나쁜 사고, 단지 그것이 접촉하는 모든 것에 걸쳐 증폭된 것입니다. 사고를 고치면 출력이 고쳐집니다."
📖 전체 Source 읽기: r/ClaudeAI
👀 See Also

비개발자가 MiniMax Agent 플랫폼에서 MaxClaw를 통해 관리형 OpenClaw 설정을 찾았습니다.
코딩 경험이 없는 프리랜서 마케팅 컨설턴트가 MiniMax Agent 플랫폼에서 MaxClaw를 사용해 도커와 API 키 관리를 피하며 AI 에이전트를 성공적으로 배포했습니다. 이 에이전트는 매일 경쟁사 모니터링, 소셜 콘텐츠 초안 작성, 기사 요약을 처리합니다.

개발자가 Base44와 Claude로 스포츠 앱을 구축하며 얻은 교훈 공유
한 개발자가 Base44에서 glanceplay.com이라는 스포츠 앱을 구축하여 빠르고 캐주얼한 게임 브리핑을 제공했지만, 반복적인 코드 변경에 Base44 크레딧이 비싸다는 것을 발견했습니다. 그들은 초기 구조 구축에는 Base44와 같은 플랫폼을 사용하고, 증분 변경과 디버깅에는 Claude에 의존할 것을 권장합니다.

로컬에서 Jetson Nano와 게임용 노트북을 사용하여 Ollama로 OpenClaw 실행하기
한 개발자가 Jetson Nano와 2022년형 MSI 게이밍 노트북을 사용해 OpenClaw를 로컬에서 실행하도록 설정했습니다. Qwen 3.5 9B 모델을 Ollama로 구동하고, 전력 효율을 위해 웨이크온랜(Wake-on-LAN) 기능을 구현했으며, 복잡한 작업은 OpenAI로 하이브리드 라우팅합니다.

실제 응용 분야에서 AI 에이전트 자율성 이해하기
Anthropic의 최근 연구는 Claude Code와 같은 AI 에이전트의 자율성을 다양한 도메인에서 측정하기 위해 수백만 건의 인간-에이전트 상호작용을 분석합니다.