다중 에이전트 하이쿠 시스템, 복잡한 수론 문제에서 클로드 오푸스와 동등한 성능을 15배 낮은 비용으로 달성

실험 설정 및 결과
레딧 사용자가 어려운 정수론 문제에 대해 두 가지 Claude 모델 구성을 비교 테스트했습니다. 이 문제는 홀수 소수 p에 대해 합 1^(p-1) + 2^(p-1) + ... + (p-1)^(p-1)이 -1 (mod p)와 합동임을 증명하는 것으로, 페르마의 소정리와 원시근의 성질을 사용해야 했습니다.
두 가지 구성이 테스트되었습니다:
- 구성 X (Opus 단독): Claude Opus 4.5, max_tokens: 2048, 감사관 없음
- 구성 Y (하이쿠 다중 에이전트): 하이쿠 생성기가 전체 증명을 생성하고, 두 번째 하이쿠 감사관이 모든 단계를 확인하며, 감사관이 문제를 지적하면 두 번의 패스를 거침, max_tokens: 각 호출당 1024
점수 및 성능
두 구성 모두 다음 채점 기준으로 4/4 점수를 받았습니다:
- 페르마의 소정리를 올바르게 적용
- 원시근 논증을 올바르게 처리
- 완전 잉여계에 대한 합산이 유효함
- 합동 결론이 올바르게 도출됨
하이쿠 감사관은 이의 없이 VERIFIED를 반환했습니다. 성능 지표:
- Opus 단독: 약 8.7초, 점수 4/4
- 하이쿠 + 감사관: 약 10.9초, 점수 4/4
비용 분석
경제적 영향은 상당합니다:
- Opus 단독: $0.075/1000 토큰 × 약 800 토큰 = 쿼리당 약 $0.06
- 하이쿠 + 하이쿠: $0.0025/1000 토큰 × 약 1600 토큰 = 쿼리당 약 $0.004
이는 동일한 결과에 대해 약 15배 낮은 비용을 의미합니다. 이 문제는 단순한 증명처럼 훈련 데이터에서 명백하지 않은 '진정으로 어려운' 문제로 설명되었습니다.
출처에 따르면, 페르마의 소정리가 주요 역할을 하는 깔끔한 문제(각 a^(p-1) ≡ 1, (p-1)개의 1의 합, p-1 ≡ -1)에서는 감사관 패턴이 정확성을 확인하기 위해 약 17%의 시간 부담을 추가합니다. 이 패턴은 생성기가 양자화 더듬기나 환각된 대수학으로 실수할 수 있는 문제에서 특히 가치가 있습니다.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

TEMM1E v3.0.0, AI 에이전트 조정을 위한 군집 지능 도입
TEMM1E v3.0.0는 'Many Tems' 군집 지능을 추가하여 AI 에이전트 작업자들이 LLM 호출 대신 스티그머지 신호를 통해 조율함으로써 복잡한 작업에서 5.86배 빠른 성능과 3.4배 낮은 비용을 달성하며, 조율 토큰을 전혀 사용하지 않습니다.

프로덕션 AI IDE에서 Ollama를 지원하는 다중 제공자 LLM 폴백 체인
Resonant Genesis AI IDE는 Groq, OpenAI, Anthropic, Gemini와 함께 로컬 LLM 지원을 1급 제공자로 통합하여 30개 이상의 마이크로서비스에서 공유된 UnifiedLLMClient 라이브러리와 자동 폴백 체인을 사용합니다.

메타, 뮤즈 스파크 1.2 모델과 함께 뮤즈 코드 출시
메타의 새로운 Muse Code 터미널 코딩 에이전트는 Muse Spark 1.2로 구동되며, 비동기 백그라운드 에이전트, 재생 가능한 런타임, 장기 코딩 기능을 제공합니다.
TextGen (text-generation-webui)가 포터블 빌드로 네이티브 데스크톱 앱이 되다
LM Studio의 오픈소스 대안인 TextGen이 웹 UI에서 설치 없는 데스크톱 앱으로 발전했습니다. Windows, Linux, macOS용 휴대용 빌드, 완전한 프라이버시, 고급 양자화 지원을 제공합니다.