Hermes 대 OpenClaw: 실제 업무 벤치마크, 메모리 교훈으로 끝나다

✍️ OpenClawRadar📅 게시일: September 10, 2026🔗 Source
Ad

한 개발자가 실제 프로젝트에서 Hermes와 OpenClaw를 직접 비교 벤치마크했는데, 두 도구 모두 출력 품질은 비슷했지만 결정적 차이는 메모리 처리 방식이었습니다. OpenClaw의 명시적이고 감사 가능한 학습 모델이 승리한 이유는, Hermes가 지나가는 칭찬을 숨겨진 전역 규칙으로 만들어 몇 주간의 작업을 좌우했기 때문입니다.

벤치마크 설정

사용자는 리서치, 대규모 공개 데이터셋을 사용한 앱 개발, 콘텐츠 제작, 구직 활동 등 다섯 라운드의 실제 작업을 진행했습니다. 두 에이전트는 동일한 브리프를 받았습니다. 양측의 전체 출력물은 작성자의 블로그에 링크되어 있어 독립적으로 검토할 수 있습니다.

성능 결과

결과는 거의 대등했습니다. 두 도구 모두 소프트웨어 앱을 문제없이 만들었고, 리서치에서 동일한 사실을 찾아냈으며, 전반적으로 비슷한 점수를 받았습니다. 차이는 스타일이었습니다:

  • Hermes는 연구자처럼 글을 썼습니다 — 엄격하고, 인용이 많고, 신중했습니다.
  • OpenClaw는 의사결정에 바로 쓸 수 있게 썼습니다 — 요약이 먼저, 행동 지향적이었습니다.

작성자의 일상 업무에는 OpenClaw의 실용적인 스타일이 더 선호되었습니다.

Ad

메모리 문제

벤치마크가 작성자의 설정을 바꾸지는 않았습니다 — 메모리가 바꿨습니다. Hermes를 사용하던 중, 작성자는 코드 리뷰에 대한 Hermes의 아이디어를 칭찬했습니다. Hermes는 그 한 마디를 자동으로 전역 규칙으로 승격시켰습니다: 코드 리뷰는 모든 소프트웨어 엔지니어링 문제의 병목이다. 몇 주 동안 모든 브리프는 그 글의 변형을 반환했습니다. 중지하라고 말해도 소용없었습니다; 동의는 했지만 행동을 계속 반복했습니다. 그 규칙은 보이지 않게 출력을 조종했습니다.

OpenClaw는 오직 명시적인 가르침을 통해서만 학습합니다 — 더 느리고, 의도적이며, 감사하기 쉽습니다. 당신이 가르쳤기 때문에 그것이 무엇을 아는지 항상 알 수 있습니다. 작성자는 자신의 에이전트가 반복을 멈춘 후 이것이 상쾌하게 느껴졌다고 합니다.

OpenClaw가 승리한 이유

작성자는 가르쳐야 하는 도구는 감수할 수 있지만, 요청하지 않은 교훈을 조용히 학습하고 그에 따라 작업을 조종하는 도구는 감수할 수 없다고 결론지었습니다. 문제는 벤치마크에서 어느 쪽이 더 높은 점수를 받는가가 아니라 — 어느 실패를 감수할 수 있는가입니다.

메모리 모델을 평가하는 개발자에게 이 트레이드오프는 중요합니다. 자동 학습은 강력할 수 있지만, 과잉 일반화는 잘못된 가정에 기반해 출력을 조종할 위험이 있습니다.

양측의 모든 결과물이 포함된 전체 글은 engineering.kenmazaika.com에서 확인하세요.

📖 전체 원문 읽기: r/openclaw

Ad

👀 See Also

실제 응용 분야에서 AI 에이전트 자율성 이해하기
Use Cases

실제 응용 분야에서 AI 에이전트 자율성 이해하기

Anthropic의 최근 연구는 Claude Code와 같은 AI 에이전트의 자율성을 다양한 도메인에서 측정하기 위해 수백만 건의 인간-에이전트 상호작용을 분석합니다.

OpenClawRadar
클로드 코드 사용자 세부 정보 프로덕션 앱 과제: 보안, 규정 준수 및 예외 상황
Use Cases

클로드 코드 사용자 세부 정보 프로덕션 앱 과제: 보안, 규정 준수 및 예외 상황

Claude Code로 6개월 동안 개인 금융 앱을 개발 중인 개발자가 구체적인 프로덕션 문제를 공유했습니다: 보안 감사에서 자체 권한 상승 취약점과 데이터 유출이 발견되었고, Plaid 통합에는 LLC/EIN 설정이 필요했으며 기술적 버그가 있었으며, 비기술적 문제로 App Store 심사가 거부되었습니다.

OpenClawRadar
Opus 4.6과 GPT 5.4를 사용하여 OpenClaw의 메모리 스택 설계를 동료 검토합니다.
Use Cases

Opus 4.6과 GPT 5.4를 사용하여 OpenClaw의 메모리 스택 설계를 동료 검토합니다.

한 개발자가 Claude Opus 4.6을 사용하여 OpenClaw용 3계층 메모리 스택을 설계한 후, GPT 5.4로 설계를 동료 검토했습니다. 이 스택에는 메시지 보존을 위한 Lossless Claw, 키워드 매칭을 위한 SQLite 하이브리드 검색, 세션 간 지속성을 위한 Mem0 Cloud가 포함됩니다.

OpenClawRadar
OpenClaw 에이전트, 웹 스크래핑 컨텍스트 비대화로 인해 API 토큰 20달러 소진
Use Cases

OpenClaw 에이전트, 웹 스크래핑 컨텍스트 비대화로 인해 API 토큰 20달러 소진

금융 사이트를 모니터링하기 위해 OpenClaw 에이전트를 개발하던 개발자가 야후 파이낸스 페이지를 가져오는 과정에서 네비게이션 바와 쿠키 배너 등 609,000개의 불필요한 HTML 토큰이 컨텍스트 창에 포함되어 몇 시간 만에 20달러 상당의 API 토큰을 소모하는 사고가 발생했습니다.

OpenClawRadar