에이전트 컨텍스트 엔진: 34.2% 정확도 향상과 함께하는 자동화된 에이전트 개선 루프

✍️ OpenClawRadar📅 게시일: March 17, 2026🔗 Source
에이전트 컨텍스트 엔진: 34.2% 정확도 향상과 함께하는 자동화된 에이전트 개선 루프
Ad

에이전트 개선 루프 자동화

한 개발자가 AI 에이전트가 스스로 분석하고 수정하도록 하여 개선 과정 전체를 자동화하는 시스템을 오픈소스로 공개했습니다. 이 도구는 로그를 수동으로 읽고 프롬프트를 조정하며 개선을 기대하는 일반적인 문제를 해결합니다.

5단계 프로세스

자동화된 루프는 다음과 같이 뚜렷한 다섯 단계를 따릅니다:

  • 추적 분석: 무엇이 실패했는지 뿐만 아니라 왜 실패했는지, 일회성 문제인지 시스템적 문제인지, 어떤 범주의 실패인지를 결정하기 위해 추적을 분석합니다. 단순한 오류 목록이 아닌 실패 모드의 구조화된 분석 결과를 출력합니다.
  • 평가 생성: 분석을 검증하고 수정 사항을 측정하기 위한 구체적인 평가를 생성합니다. 일반적인 평가는 특정 실패를 포착하지 못합니다. 추적 데이터가 결정론적 평가에 충분히 구조화되지 않았을 때 LLM-as-a-judge가 대안으로 사용됩니다.
  • 기준 측정: 수정을 가하기 전에 현재 에이전트에 대해 평가를 실행하여 기준선을 설정하고 평가 자체를 검증합니다.
  • 수정 구현: 개발자가 분석과 코드베이스를 검토하여 무엇을 변경할지 결정합니다. 핵심 결정은 수정이 프롬프트에 속하는지, 아니면 주변 코드에 속하는지(예: 하네스가 도구 출력을 제대로 처리하지 못하거나 올바른 컨텍스트를 전달하지 않는 경우)입니다.
  • 검증 및 누적: 수정 후, 평가가 다시 실행되어 개선을 검증하며, 변경 사항은 유지, 롤백 또는 재작업됩니다.
Ad

구현 세부사항

이 솔루션은 자체 분석 에이전트 시스템을 호출하는 하나의 명령으로 이 전체 루프를 종단 간 자동화합니다. 추적 분석은 이 특정 사용 사례에 맞게 조정된 에이전트와 함께 REPL 환경에서 이루어집니다. 이 시스템은 Claude Code에 대한 CLI 접근을 통해 분석을 제공하며, 나머지는 일련의 기술로 처리합니다.

Claude가 코드베이스 내부에 존재할 수 있으므로, 분석을 검증하고 수정 단계(프롬프트 대 코드)에서 최선의 조치 과정을 결정합니다.

결과 및 운영

Tau-2 벤치에서 단 한 번의 반복만 사용하여 벤치마킹한 결과, 첫 번째 시도에서 수동 개입 없이 34.2% 정확도 향상을 달성했습니다. 이 시스템은 개선을 누적하도록 설계되었습니다: 새로운 추적이 새로운 문제를 드러내고, 각 주기에서 새로운 수정으로 이어집니다.

완전히 자율적으로 루프를 돌도록 설정할 수 있습니다. 4단계 전에 수정 사항을 승인하고 싶다면 인간 참여 옵션이 존재하지만, 테스트에서 개발자는 "그냥 진행시켰습니다."

이 도구는 GitHub에서 오픈소스로 공개되었습니다: https://github.com/kayba-ai/agentic-context-engine

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Strale.io는 AI 에이전트를 위한 무료 IBAN 및 이메일 검증 API를 제공하며, 가입이 필요하지 않습니다.
Tools

Strale.io는 AI 에이전트를 위한 무료 IBAN 및 이메일 검증 API를 제공하며, 가입이 필요하지 않습니다.

Strale.io는 IBAN 검증, 이메일 검증, DNS 조회, URL-마크다운 변환, JSON 복구 등 다섯 가지 기능을 포함한 무료 API를 제공합니다. 가입이나 API 키가 필요하지 않으며, Claude나 Cursor 통합을 위한 MCP 서버도 포함되어 있습니다.

OpenClawRadar
177개의 오픈클로 SOUL.md 템플릿을 24개 카테고리로 정리한 모음
Tools

177개의 오픈클로 SOUL.md 템플릿을 24개 카테고리로 정리한 모음

한 개발자가 마케팅, 개발, 비즈니스, 데브옵스, 금융, 크리에이티브, 데이터, 보안, 헬스케어, 법률, 인사, 교육 등 24개 카테고리에 걸쳐 OpenClaw 에이전트용 177개의 즉시 사용 가능한 SOUL.md 템플릿을 컴파일했습니다. 모든 템플릿은 MIT 라이선스로 GitHub에서 이용 가능합니다.

OpenClawRadar
실전 체험: 텐센트 모델, 에이전트 워크플로우에 강하지만 복잡한 코딩에는 약함
Tools

실전 체험: 텐센트 모델, 에이전트 워크플로우에 강하지만 복잡한 코딩에는 약함

텐센트 모델은 에이전트 작업에서 낮은 할루시네이션율로 8/10 점을 받았지만, Notion API 스키마 같은 복잡한 코딩에서는 실패합니다. 백엔드 로직에는 사용하지 마세요.

OpenClawRadar
Mem0 플러그인을 사용한 OpenClaw 메모리 손실 수정
Tools

Mem0 플러그인을 사용한 OpenClaw 메모리 손실 수정

OpenClaw 에이전트는 컨텍스트 압축으로 MEMORY.md와 같은 파일을 다시 쓰면서 기억 상실을 경험합니다. Mem0 플러그인은 자동 회상 및 자동 캡처 기능으로 메모리를 컨텍스트 창 밖으로 이동시켜 이 문제를 해결합니다.

OpenClawRadar