다중 에이전트 하이쿠 시스템, 복잡한 수론 문제에서 클로드 오푸스와 동등한 성능을 15배 낮은 비용으로 달성

실험 설정 및 결과
레딧 사용자가 어려운 정수론 문제에 대해 두 가지 Claude 모델 구성을 비교 테스트했습니다. 이 문제는 홀수 소수 p에 대해 합 1^(p-1) + 2^(p-1) + ... + (p-1)^(p-1)이 -1 (mod p)와 합동임을 증명하는 것으로, 페르마의 소정리와 원시근의 성질을 사용해야 했습니다.
두 가지 구성이 테스트되었습니다:
- 구성 X (Opus 단독): Claude Opus 4.5, max_tokens: 2048, 감사관 없음
- 구성 Y (하이쿠 다중 에이전트): 하이쿠 생성기가 전체 증명을 생성하고, 두 번째 하이쿠 감사관이 모든 단계를 확인하며, 감사관이 문제를 지적하면 두 번의 패스를 거침, max_tokens: 각 호출당 1024
점수 및 성능
두 구성 모두 다음 채점 기준으로 4/4 점수를 받았습니다:
- 페르마의 소정리를 올바르게 적용
- 원시근 논증을 올바르게 처리
- 완전 잉여계에 대한 합산이 유효함
- 합동 결론이 올바르게 도출됨
하이쿠 감사관은 이의 없이 VERIFIED를 반환했습니다. 성능 지표:
- Opus 단독: 약 8.7초, 점수 4/4
- 하이쿠 + 감사관: 약 10.9초, 점수 4/4
비용 분석
경제적 영향은 상당합니다:
- Opus 단독: $0.075/1000 토큰 × 약 800 토큰 = 쿼리당 약 $0.06
- 하이쿠 + 하이쿠: $0.0025/1000 토큰 × 약 1600 토큰 = 쿼리당 약 $0.004
이는 동일한 결과에 대해 약 15배 낮은 비용을 의미합니다. 이 문제는 단순한 증명처럼 훈련 데이터에서 명백하지 않은 '진정으로 어려운' 문제로 설명되었습니다.
출처에 따르면, 페르마의 소정리가 주요 역할을 하는 깔끔한 문제(각 a^(p-1) ≡ 1, (p-1)개의 1의 합, p-1 ≡ -1)에서는 감사관 패턴이 정확성을 확인하기 위해 약 17%의 시간 부담을 추가합니다. 이 패턴은 생성기가 양자화 더듬기나 환각된 대수학으로 실수할 수 있는 문제에서 특히 가치가 있습니다.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

페이즈록: 육아 기법에서 영감을 받은 AI 에이전트 제어 시스템
Phaselock는 AI 코딩 에이전트를 제어하기 위한 네 가지 제어 메커니즘(작업 전 명시적 게이트, 실수에 대한 즉각적 피드백, 제한된 선택지, 기계적 규칙 적용)을 구현한 오픈소스 에이전트 스킬입니다. Claude Code, Cursor, Windsurf 및 훅을 지원하는 모든 도구와 호환됩니다.

bareguard: AI 에이전트용 경량 안전 게이트 — 이제 npm에서 사용 가능
bareguard v1.0은 약 1000줄, 단일 종속성으로 AI 에이전트의 파괴적인 작업(rm -rf, DROP TABLE)을 차단하고 예산 한도를 적용하여 사람이 개입하도록 하는 안전 계층입니다. bare 스위트의 일부로, npm에서 사용 가능합니다.

MetaBot: 오픈소스 브리지, Claude 코드를 텔레그램, Feishu, WeChat에 연결합니다
MetaBot은 Claude Code Agent SDK를 Telegram, Feishu, WeChat과 같은 메시징 플랫폼에 연결하는 오픈소스 TypeScript 브리지입니다. 지속적 메모리, 예약 작업, 다중 에이전트 협업, 도구 호출 실시간 스트리밍을 제공합니다.

BusyDog Desktop: Mac용 P2P 네트워킹을 갖춘 로컬 AI 에이전트
BusyDog Desktop는 Mac에서 Claude를 직접 실행하는 로컬 AI 에이전트로, 파일 읽기/쓰기, 터미널 명령 실행, 브라우저 제어, 그리고 Hyperswarm DHT와 맞춤형 BDP 프로토콜을 사용한 P2P 네트워크를 통해 다른 에이전트와 연결할 수 있습니다.