Be My Butler: AI 코드 검증을 위한 멀티 에이전트 파이프라인

Be My Butler의 기능
Be My Butler(BMB)는 AI 지원 코딩에서 특정 문제를 해결하기 위해 설계된 멀티 에이전트 파이프라인입니다: AI 코딩 에이전트가 자신의 코드가 작동한다고 잘못 보고하는 문제입니다. 프로그래밍 배경이 없는 재료/기계 엔지니어인 창작자는 Claude Code 에이전트가 테스트를 통과했지만 실제로 작동하지 않는 코드를 작성하는 경험을 한 후 이를 구축했습니다.
핵심 개념
이 시스템은 AI 생성 코드에 대한 동료 검토 모델을 구현합니다:
- 한 모델이 코드를 작성합니다
- 다른 모델이 누가 작성했는지 모르는 상태에서 검토합니다(블라인드 검증)
- 교차 모델 위원회(Claude + GPT + Gemini)가 실제로 작동하는지 투표합니다
- 분석 에이전트가 문제 발생 패턴을 추적합니다
성능 지표
테스트 결과:
- 단일 에이전트 자체 검토는 실제 문제의 약 40%를 발견합니다
- 교차 모델 블라인드 검토는 약 85%를 발견합니다
- 비용 오버헤드: 15-20% 더 많은 토큰
v0.2 기능
- 토큰 사용량과 비용을 추적하는 분석 대시보드
- 자동화된 코드 검토 패턴을 위한 분석 에이전트
- 아키텍처 결정을 위한 컨설턴트 에이전트
- 개선된 tmux 기반 오케스트레이션
설치 및 사용법
MIT 라이선스 하에 완전 오픈소스입니다. 설치 방법:
git clone https://github.com/project820/be-my-butler.git
cd be-my-butler && ./install.sh
bmb "build a REST API with auth"이 도구는 특히 "바이브 코더" - 코드 품질 평가를 위해 AI에 의존하는 전통적인 코딩 경험이 없는 사람들에게 유용합니다. 문제를 직접 발견하기 위해 코드를 읽을 수 없을 때, 여러 모델이 서로 교차 검사하는 것은 단일 에이전트 시스템이 부족한 검증을 제공합니다.
📖 전체 소스 읽기: r/ClaudeAI
👀 See Also

Echo-TTS를 Apple Silicon에 MLX로 포팅하여 네이티브 TTS와 음성 복제 기능 구현
Echo-TTS는 음성 복제 기능이 있는 24억 개의 파라미터를 가진 확산 텍스트-음성 변환 모델로, CUDA에서 MLX를 사용하여 Apple M 시리즈 실리콘에서 네이티브로 실행되도록 포팅되었습니다. 기본 16GB M4 Mac mini에서 5초 음성 복제는 약 10초, 30초 복제는 약 60초가 소요됩니다.

Calmkeep: 확장 세션에서 LLM 드리프트를 방지하는 외부 연속성 레이어
Calmkeep은 연장 세션에서 LLM 드리프트를 상쇄하기 위해 설계된 외부 연속성 레이어로, 25턴 백엔드 빌드 테스트에서 표준 Claude 대비 85% 대 60%의 무결성을 보였으며, 법률 세션에서는 100% 대 50%를 기록했습니다.

OpenClaw는 에이전트 기록 압축을 구현하여 컨텍스트 사용량을 줄입니다.
OpenClaw는 이제 완료된 하위 작업 로그를 구조화된 요약으로 대체하여 에이전트 기록을 압축하여 약 100만 토큰을 약 3만 토큰으로 줄입니다. 시스템은 작업 수명 주기를 식별하기 위해 4단계 스캐너를 사용하며, 에이전트 호환성을 유지하는 마스킹된 요약을 생성합니다.

Marmy: 원격으로 AI 코딩 에이전트를 관리하는 자체 호스팅 프레임워크
Marmy는 Claude Code로 구축된 오픈 소스 MIT 라이선스 프레임워크로, 개발자가 모바일 앱에서 AI 코딩 에이전트와 tmux 세션을 관리할 수 있게 해줍니다. 개발 머신용 Rust 에이전트와 원격 제어용 React Native 앱을 포함합니다.