Anthropic의 클로드 코드 품질 향상을 위한 다중 에이전트 하네스 설계

Anthropic은 장기간 실행되는 코딩 작업에서 Claude의 성능을 향상시키기 위한 하네스 설계 접근법을 설명하는 블로그 게시물을 발표했습니다. 이 방법은 두 가지 구체적인 문제를 해결합니다: 컨텍스트 불안(장기간에 걸친 일관성 상실)과 자기 평가 편향(품질이 낮은 경우에도 Claude가 자신의 작업을 칭찬하는 경향).
다중 에이전트 솔루션
이 솔루션은 GAN(생성적 적대 신경망)에서 영감을 얻어 함께 작동하는 여러 에이전트를 구현합니다. 핵심 구조는 다음과 같습니다:
- 생성자: 코드와 디자인을 생성
- 평가자: 비판적 평가와 피드백 제공
프론트엔드 구현
프론트엔드 개발을 위해 하네스는 일반적인 디자인을 피하고 미학과 창의성을 강조하는 4가지 평가 기준을 사용합니다. 이 과정은 5~15회의 수정을 포함하며, 더 아름답고 독특한 결과물을 만들어냅니다.
풀스택 구현
풀스택 개발을 위해 하네스는 3가지 에이전트를 사용합니다:
- 플래너
- 생성자
- 평가자
성능 비교
이 글은 동일한 게임 개발 요구사항에 대한 결과를 비교합니다:
- 단독 실행: 빠른 실행 속도이지만 게임에 심각한 버그 존재
- 하네스 사용: 더 많은 시간과 비용이 소요되지만, 아름다운 인터페이스, 플레이 가능한 게임, 추가된 AI 지원을 포함해 상당히 높은 품질의 결과물 생성
이 글은 모델이 더 강력해짐에 따라(특히 Opus 4.6을 언급하며) 불필요한 하네스 요소는 제거되어야 한다고 제안합니다.
📖 Read the full source: r/ClaudeAI
👀 See Also

클로드 코드 베스트 프랙티스 GitHub 저장소, 별 5,000개 돌파
'claude-code-best-practice'라는 GitHub 저장소가 5,000개의 스타를 달성했습니다. 이 저장소는 Claude의 도움으로 만들어져 창작자와 커뮤니티의 모범 사례, 팁, 워크플로우를 문서화합니다.

설치 없이 MCP 서버를 테스트할 수 있는 오픈 소스 브라우저 도구
MCP Playground라는 오픈 소스 웹 도구는 개발자가 WebContainers(WASM Node.js 런타임)를 사용하여 브라우저에서 직접 MCP 서버를 테스트할 수 있게 해줍니다. 이 도구는 백엔드 설치 없이 로컬에서 npm 기반 MCP 서버를 실행하고 URL을 통해 원격 서버에 연결할 수 있습니다.

Voygr, 신선한 장소 인텔리전스를 위한 비즈니스 검증 API 출시
Voygr의 비즈니스 검증 API는 여러 데이터 소스를 통합하고 상충되는 신호를 감지하여 기업이 운영 중인지, 폐업했는지, 브랜드를 변경했는지, 유효하지 않은지를 확인합니다. 이 팀은 정확한 장소 데이터와 뉴스, 기사, 이벤트 같은 최신 웹 컨텍스트를 결합한 무한하고 쿼리 가능한 장소 프로필을 구축하고 있습니다.

개발자가 주제나 유튜브 링크로부터 팟캐스트를 생성하는 로컬 AI 연구 에이전트를 구축합니다
한 개발자가 주제나 유튜브 링크를 입력받아 심층 분석 보고서, 대화형 팟캐스트 스크립트, 오디오를 생성하는 완전 로컬 AI 에이전트를 구축했습니다. 이 시스템은 동적으로 연구를 수행하고 통찰을 추출하며 요약을 다듬어 자연스러운 대화를 만들어냅니다.