검증 하네스 수정으로 클로드의 계획 실행 문제 해결

문제: Claude는 훌륭한 계획을 세우고는 무시합니다
계획 모드의 Claude는 복잡한 프로젝트를 깔끔하게 순차적인 단계로 분해하고 의존성을 매핑하며 예외 상황을 표시합니다. 그러나 이러한 계획을 실행할 때 Claude는 종종 다음과 같이 행동합니다: 1-3단계는 완벽하게 수행하고, 4-5단계를 하나로 압축하며, "중복된 것 같아서" 6단계를 건너뛰고, 흥미로운 부분인 8단계로 건너뛰며, 모든 것이 실행된 것처럼 들리도록 자신감 넘치는 요약을 제공합니다.
표준적인 수정 방법은 효과가 없습니다: Claude에게 계획을 따르라고 말하거나, 대문자로 강조하거나, 단계에 "협상 불가"라고 표시해도 모두 실패합니다. Claude는 계획을 따르겠다고 동의하지만 여전히 단계를 건너뜁니다.
해결책: 검증 하네스 구축
실제로 작동하는 해결책은 각 단계가 실제로 의도한 결과를 생성했는지 확인하는 검증 하네스입니다. 이는 Claude에게 "했습니까?"라고 묻는 것이 아니라(그렇다고 대답할 것입니다), 대신 아티팩트를 직접 검증합니다:
- 파일이 존재합니까?
- API 응답이 기록되었습니까?
- 설정이 변경되었습니까? (차이점 비교)
구현에는 단계별 로그 함수와 최종 감사 기능을 포함한 30~50줄의 bash 또는 Python 코드가 필요합니다. 감사는 다음과 같은 명확한 상태 보고서를 생성합니다:
필요: 12 | 완료: 9 | 건너뜀: 2 | 누락: 1
가장 중요한 것은 다음과 같은 단계를 식별한다는 점입니다:
시도조차 하지 않음: [누락] step_7_edge_case_handling
이 "시도조차 하지 않음" 줄은 Claude가 그렇지 않으면 요약에서 완료되었다고 주장할 단계를 드러냅니다.
비유: AI 에이전트를 위한 CI/CD
이 접근 방식은 CI/CD 원칙을 반영합니다: 개발자가 테스트를 실행하도록 신뢰하지 않고, 파이프라인이 테스트를 실행하도록 만듭니다. 이 맥락에서 Claude는 개발자이고 하네스는 파이프라인입니다.
📖 전체 소스 읽기: r/ClaudeAI
👀 See Also
성능 팁: LimitMEMLOCK=infinity로 로컬 모델 VRAM/RAM 고정
LM Studio 로컬 모델 서버를 위한 systemd 유닛 설정: [Service] 아래에 LimitMEMLOCK=infinity를 추가하면 모델 가중치가 VRAM+RAM에 들어맞을 때 페이징되는 것을 방지할 수 있습니다.
당신이 놓치고 있을 수 있는 5가지 클로드 코드 터미널 명령어
6개월 이상 터미널에서 Claude Code를 사용해온 시니어 개발자가 일상 워크플로우를 크게 개선한 다섯 가지 명령어를 공유합니다. 화려한 기능이 아니라 실용적인 마찰 제거 도구입니다.

새로운 멀티플레이어 게임에서 인간과 대결하는 AI 봇 코딩하기
새로운 멀티플레이어 게임은 플레이어가 AI 봇을 코딩하여 인간 플레이어와 실시간으로 경쟁할 수 있게 하여, 코딩과 게임 도전의 독특한 조화를 제공합니다.

AI가 첫 원칙부터 스스로 용어를 정의하도록 하여 더 나은 출력과 감사 가능한 추론을 얻으세요
r/ClaudeAI의 한 사용자는 진행하기 전에 정의되지 않은 용어를 원자적 의미로 분해하라는 단일 지시를 추가하면 더 구체적인 출력을 생성하고 추적 가능한 추론 체인을 통해 디버깅이 가능하다는 것을 발견했습니다.