레딧 사용자가 허미스 AI 에이전트의 자가 학습 기능을 테스트하고 치명적 결함 발견

Hermes vs OpenClaw: 실용적인 비교
1월 29일 빌드부터 OpenClaw를 사용해 온 레딧 사용자가 Hermes AI 에이전트를 테스트하여 자가 학습 능력을 평가했습니다. 사용자는 OpenClaw를 사용하여 수익을 창출하며 이를 주요 도구로 간주합니다.
Hermes의 실제 기능
Hermes는 OpenClaw와의 핵심 차별점으로 '자가 학습'을 내세우지만, 사용자의 테스트에 따르면:
- Hermes는 기계 학습 의미에서 '자가 학습'이 아닙니다
- OpenClaw와 유사하게 마크다운 파일을 메모리로 사용합니다
- '자가 학습'은 수동 작성 없이 자동으로 스킬을 생성하는 것을 의미합니다
- 스킬 = 자동 생성된 마크다운 파일입니다
중요한 문제: 자기 평가 루프
사용자는 Hermes 구현의 주요 문제를 확인했습니다:
- Hermes는 자신의 결과를 평가하는 폐쇄적 학습 루프에서 작동합니다
- 실제 성능과 관계없이 항상 자신이 잘했다고 생각합니다
- 인디애나 DNR 사이트에서 수질 테스트 결과를 가져오는 테스트에서 Hermes는 '모든 것을 뒤섞었지만' 여전히 '훌륭하게 했다고' 생각했습니다
- 사용자가 오류를 수정하기 위해 스킬을 수동으로 편집하면 Hermes의 자기 개선 기능이 해당 편집을 덮어씁니다
안정성 주장에 대한 의문
사용자는 두 도구 간 안정성 비교를 다룹니다:
- Hermes는 총 6번의 릴리즈가 있었습니다
- OpenClaw는 82번의 릴리즈가 있었습니다
- Hermes 릴리즈 중 3개는 '작동조차 하지 않았습니다'
- 사용자는 제한된 릴리즈 기록으로 인해 Hermes가 더 안정적이라는 주장에 반대합니다
현재 상태와 미래
레딧 사용자는 Hermes가 현재 'OpenClaw 사용법을 아는 사람에게는 사용할 수 없다'고 결론지었습니다. 그러나 이 프로젝트가 '놀라운 결과를 낼 수 있다'고 인정하며 개발을 계속 지켜볼 계획입니다.
📖 Read the full source: r/openclaw
👀 See Also

Dirac: 오픈소스 에이전트, TerminalBench 65.2% 기록, 더 저렴하고 개방적
오픈소스 코딩 에이전트 Dirac이 TerminalBench 2.0에서 gemini-3-flash-preview로 65.2%의 점수를 기록하며 Google의 기준선(47.6%)과 기존 최고 클로즈드소스 에이전트 Junie CLI(64.3%)를 모두 능가했습니다. 또한 경쟁사 대비 API 비용을 64.8% 절감합니다.

코드 진화 방법, ARC-AGI-2 벤치마크에서 LLM 성능 3배 향상
연구진은 코드 진화를 통해 오픈 가중치 모델로 ARC-AGI-2 벤치마크에서 2.8배 향상을 달성했으며, 태스크당 $2.67의 비용으로 34% 정확도에 도달했습니다. 동일한 방법으로 Gemini 3.1 Pro는 태스크당 $8.71의 비용으로 95% 정확도를 기록했습니다.

오픈클로가 클로드 CLI의 힘을 받아들일 수 있을까?
r/openclaw에서 OpenClaw가 Claude CLI와 통합될 수 있는지에 대한 주요 통찰력을 탐구해보세요. Claude CLI는 코딩과 자동화 프로세스를 향상시키기 위해 설계된 강력한 AI 도구입니다.

클로드 코드가 코딩 작업을 미스트랄/딥시크에 위임: 5700만 토큰 절약, 비용 90-100% 감소
vibe-skill이라는 Claude Code 스킬이 Claude의 계획 수립 기능은 유지하면서 저수준 코딩을 Mistral 또는 DeepSeek 같은 저렴한 모델에 위임합니다. 10일간 254회 실행 결과 5700만 토큰을 절약하고 90~100%의 비용 절감 효과를 달성했으며, 성공률은 98%입니다.