다중 에이전트 AI 시스템 비교: Anthropic의 Harness 대 Agyn의 엔지니어링 조직 모델

Anthropic은 장기 실행 애플리케이션 개발을 위한 하네스 설계를 발표한 반면, Agyn의 팀 기반 자율 소프트웨어 엔지니어링을 위한 다중 에이전트 시스템은 지난달 arXiv에서 오픈소스로 공개되었습니다. 두 접근 방식 모두 '단일 에이전트' 모델을 거부하고 역할 분리, 구조화된 인계, 검토 루프를 갖춘 실제 엔지니어링 팀처럼 작동하도록 AI 에이전트를 구조화합니다.
핵심 아키텍처 차이점
Anthropic의 시스템은 GAN에서 영감을 받은 아키텍처를 사용하며 세 가지 역할(플래너 → 생성기 → 평가자)로 구성됩니다. 평가자는 Playwright를 사용하여 실제 사용자처럼 실행 중인 애플리케이션과 상호작용한 후 구조화된 비평을 생성기로 제공합니다.
Agyn은 네 가지 역할(조정 → 연구 → 구현 → 검토)을 가진 엔지니어링 조직으로 프로세스를 모델링합니다. 에이전트는 격리된 샌드박스에서 작동하며 정의된 계약을 통해 통신합니다.
공통 문제에 대한 공유 솔루션
- 장기 작업에서 모델 일관성 상실: Anthropic은 구조화된 인계 산출물과 함께 컨텍스트 재설정을 사용하는 반면, Agyn은 역할 간 구조화된 인계와 함께 압축을 사용합니다.
- 너무 관대한 자체 평가: 두 시스템 모두 평가를 생성과 분리합니다. Anthropic은 몇 가지 샘플로 보정된 별도의 평가자 에이전트를 사용하는 반면, Agyn은 구현과 분리된 전용 검토 역할을 갖습니다.
- 모호한 '완료' 기준: Anthropic은 작업 시작 전 협상된 스프린트 계약을 사용하는 반면, Agyn은 명시적인 수락 기준과 필요한 테스트를 포함한 작업 명세 단계를 갖습니다.
- 복잡한 작업 분해: Anthropic의 플래너는 한 문장 프롬프트를 전체 명세로 확장하는 반면, Agyn의 연구 에이전트는 구현 시작 전에 문제를 분해하고 명세를 생성합니다.
- 컨텍스트 불안: Anthropic은 깨끗한 상태를 위한 재설정을 사용하는 반면, Agyn은 메모리 계층과 함께 압축을 사용합니다.
Agyn의 독특한 기능
Agyn은 Anthropic의 하네스에 없는 두 가지 기능을 포함합니다:
- 에이전트별 격리된 샌드박스: 각 에이전트는 자체 격리된 파일 및 네트워크 네임스페이스에서 작동하여 병렬 또는 순차 작업 중 공유 상태 충돌을 방지합니다.
- 공유 상태로서의 GitHub: 이 시스템은 인간 팀이 이미 이해하는 GitHub 기본 요소(커밋, 댓글, PR, 리뷰)를 사용하여 사용자 정의 통신 프로토콜 없이도 완전한 감사 로그를 제공합니다.
구현 차이점
Anthropic의 하네스는 Claude Agent SDK와 평가 루프를 위한 Playwright MCP를 사용하여 Claude를 중심으로 긴밀하게 구축되었습니다. 평가자는 점수 매기기 전에 실행 중인 애플리케이션을 탐색합니다.
Agyn은 설계상 모델에 구애받지 않으며 Claude, Codex 및 오픈 웨이트 모델을 지원합니다. 이 시스템은 역할별로 다른 모델을 혼합하는 것을 허용하며, 실제로 모든 작업에 하나의 모델을 사용하는 것보다 성능이 더 우수한 것으로 나타났습니다.
📖 전체 소스 읽기: r/ClaudeAI
👀 See Also

Engram v1.0.0: 로컬 LLM을 위한 지식 그래프 기반 영구 메모리
Engram은 지식 그래프 시스템을 통해 로컬 LLM에 지속적인 메모리를 제공하는 단일 바이너리입니다. Claude Code, Cursor, Windsurf와의 통합을 위한 MCP 서버를 포함하며, 모든 데이터를 단일 .brain 파일에 저장하고 완전히 오프라인에서 실행됩니다.

로컬 딥 리서치 도구 현황: GPT 리서처와 로컬 딥 리서치가 선도, STORM과 랭체인 프로젝트는 정체
2026년 5월 기준 Reddit의 로컬 딥 리서치 프로젝트 설문조사에서 GPT Researcher와 LearningCircuit의 Local Deep Research가 가장 활발하고, STORM과 LangChain의 Open Deep Research는 버려졌거나 반쯤 버려진 것으로 나타났습니다.

DeepSeek Reasonix: 높은 캐싱과 낮은 비용의 네이티브 코딩 에이전트
Reasonix는 DeepSeek 모델을 로컬에서 실행하며 적극적인 캐싱을 통해 API 비용을 절감하는 터미널 기반 AI 코딩 에이전트입니다.

구피LM: 교육 목적으로 처음부터 구축된 9백만 파라미터 규모의 대규모 언어 모델
GuppyLM은 6개의 레이어, 384개의 은닉 차원, 6개의 어텐션 헤드를 가진 기본 트랜스포머 아키텍처를 사용하여 60K개의 합성 대화로 처음부터 학습된 약 9백만 파라미터 언어 모델입니다. 무료 Colab T4 GPU에서 약 5분 동안 학습하며, 물, 음식, 수조 생활에 초점을 맞춘 물고기 성격으로 말합니다.