Hermes 대 OpenClaw: 실제 업무 벤치마크, 메모리 교훈으로 끝나다
한 개발자가 실제 프로젝트에서 Hermes와 OpenClaw를 직접 비교 벤치마크했는데, 두 도구 모두 출력 품질은 비슷했지만 결정적 차이는 메모리 처리 방식이었습니다. OpenClaw의 명시적이고 감사 가능한 학습 모델이 승리한 이유는, Hermes가 지나가는 칭찬을 숨겨진 전역 규칙으로 만들어 몇 주간의 작업을 좌우했기 때문입니다.
벤치마크 설정
사용자는 리서치, 대규모 공개 데이터셋을 사용한 앱 개발, 콘텐츠 제작, 구직 활동 등 다섯 라운드의 실제 작업을 진행했습니다. 두 에이전트는 동일한 브리프를 받았습니다. 양측의 전체 출력물은 작성자의 블로그에 링크되어 있어 독립적으로 검토할 수 있습니다.
성능 결과
결과는 거의 대등했습니다. 두 도구 모두 소프트웨어 앱을 문제없이 만들었고, 리서치에서 동일한 사실을 찾아냈으며, 전반적으로 비슷한 점수를 받았습니다. 차이는 스타일이었습니다:
- Hermes는 연구자처럼 글을 썼습니다 — 엄격하고, 인용이 많고, 신중했습니다.
- OpenClaw는 의사결정에 바로 쓸 수 있게 썼습니다 — 요약이 먼저, 행동 지향적이었습니다.
작성자의 일상 업무에는 OpenClaw의 실용적인 스타일이 더 선호되었습니다.
메모리 문제
벤치마크가 작성자의 설정을 바꾸지는 않았습니다 — 메모리가 바꿨습니다. Hermes를 사용하던 중, 작성자는 코드 리뷰에 대한 Hermes의 아이디어를 칭찬했습니다. Hermes는 그 한 마디를 자동으로 전역 규칙으로 승격시켰습니다: 코드 리뷰는 모든 소프트웨어 엔지니어링 문제의 병목이다. 몇 주 동안 모든 브리프는 그 글의 변형을 반환했습니다. 중지하라고 말해도 소용없었습니다; 동의는 했지만 행동을 계속 반복했습니다. 그 규칙은 보이지 않게 출력을 조종했습니다.
OpenClaw는 오직 명시적인 가르침을 통해서만 학습합니다 — 더 느리고, 의도적이며, 감사하기 쉽습니다. 당신이 가르쳤기 때문에 그것이 무엇을 아는지 항상 알 수 있습니다. 작성자는 자신의 에이전트가 반복을 멈춘 후 이것이 상쾌하게 느껴졌다고 합니다.
OpenClaw가 승리한 이유
작성자는 가르쳐야 하는 도구는 감수할 수 있지만, 요청하지 않은 교훈을 조용히 학습하고 그에 따라 작업을 조종하는 도구는 감수할 수 없다고 결론지었습니다. 문제는 벤치마크에서 어느 쪽이 더 높은 점수를 받는가가 아니라 — 어느 실패를 감수할 수 있는가입니다.
메모리 모델을 평가하는 개발자에게 이 트레이드오프는 중요합니다. 자동 학습은 강력할 수 있지만, 과잉 일반화는 잘못된 가정에 기반해 출력을 조종할 위험이 있습니다.
양측의 모든 결과물이 포함된 전체 글은 engineering.kenmazaika.com에서 확인하세요.
📖 전체 원문 읽기: r/openclaw
👀 See Also

실제 응용 분야에서 AI 에이전트 자율성 이해하기
Anthropic의 최근 연구는 Claude Code와 같은 AI 에이전트의 자율성을 다양한 도메인에서 측정하기 위해 수백만 건의 인간-에이전트 상호작용을 분석합니다.

클로드 코드 사용자 세부 정보 프로덕션 앱 과제: 보안, 규정 준수 및 예외 상황
Claude Code로 6개월 동안 개인 금융 앱을 개발 중인 개발자가 구체적인 프로덕션 문제를 공유했습니다: 보안 감사에서 자체 권한 상승 취약점과 데이터 유출이 발견되었고, Plaid 통합에는 LLC/EIN 설정이 필요했으며 기술적 버그가 있었으며, 비기술적 문제로 App Store 심사가 거부되었습니다.

Opus 4.6과 GPT 5.4를 사용하여 OpenClaw의 메모리 스택 설계를 동료 검토합니다.
한 개발자가 Claude Opus 4.6을 사용하여 OpenClaw용 3계층 메모리 스택을 설계한 후, GPT 5.4로 설계를 동료 검토했습니다. 이 스택에는 메시지 보존을 위한 Lossless Claw, 키워드 매칭을 위한 SQLite 하이브리드 검색, 세션 간 지속성을 위한 Mem0 Cloud가 포함됩니다.

OpenClaw 에이전트, 웹 스크래핑 컨텍스트 비대화로 인해 API 토큰 20달러 소진
금융 사이트를 모니터링하기 위해 OpenClaw 에이전트를 개발하던 개발자가 야후 파이낸스 페이지를 가져오는 과정에서 네비게이션 바와 쿠키 배너 등 609,000개의 불필요한 HTML 토큰이 컨텍스트 창에 포함되어 몇 시간 만에 20달러 상당의 API 토큰을 소모하는 사고가 발생했습니다.