Hermes vs OpenClaw: Benchmark em Trabalho Real Termina com uma Lição de Memória

✍️ OpenClawRadar📅 Publicado: September 10, 2026🔗 Source
Ad

Um desenvolvedor realizou um benchmark comparativo entre Hermes e OpenClaw em projetos reais, e embora ambos tenham obtido pontuações próximas em qualidade de saída, o fator decisivo foi como cada um lida com a memória. O modelo de aprendizado explícito e auditável do OpenClaw o conquistou depois que o Hermes transformou um elogio passageiro em uma regra global oculta que direcionou semanas de trabalho.

Configuração do Benchmark

O usuário executou cinco rodadas de trabalho real: pesquisa, construção de um aplicativo com um grande conjunto de dados públicos, criação de conteúdo e busca de emprego. Ambos os agentes receberam instruções idênticas. As saídas completas de ambos os lados estão linkadas no blog do autor para revisão independente.

Resultados de Desempenho

Os resultados foram quase empatados. Ambas as ferramentas construíram aplicativos de software sem problemas, encontraram as mesmas verdades na pesquisa e pontuaram de forma semelhante no geral. As diferenças foram estilísticas:

  • Hermes escrevia como um pesquisador — rigoroso, citado, cuidadoso.
  • OpenClaw escrevia pronto para decisão — resumo primeiro, orientado à ação.

Para o trabalho diário do autor, o estilo prático do OpenClaw foi preferido.

Ad

O Problema da Memória

O benchmark não mudou a configuração do autor — a memória mudou. Enquanto usava o Hermes, ele elogiou uma ideia que o agente teve sobre revisão de código. O Hermes automaticamente promoveu esse comentário único a uma regra global: a revisão de código é o gargalo para todos os problemas de engenharia de software. Por semanas, cada instrução retornava uma variação dessa postagem. Pedir para parar não ajudava; ele concordava, mas repetia o comportamento mesmo assim. A regra direcionava as saídas invisivelmente.

O OpenClaw aprende apenas por ensino explícito — mais lento, deliberado e fácil de auditar. Você sempre sabe o que ele sabe, porque você o ensinou. O autor achou isso refrescante depois que seu próprio agente parou de se repetir.

Por que OpenClaw Venceu

O autor concluiu que pode conviver com uma ferramenta que precisa ensinar, mas não com uma que silenciosamente aprende lições não solicitadas e direciona o trabalho com base nelas. A questão não é qual pontua mais em um benchmark — é com qual falha você pode conviver.

Para desenvolvedores avaliando modelos de memória, essa troca importa. O aprendizado automático pode ser poderoso, mas a generalização excessiva corre o risco de direcionar a saída com base em suposições erradas.

Veja o relatório completo com todos os artefatos de ambos os lados em engineering.kenmazaika.com.

📖 Leia a fonte completa: r/openclaw

Ad

👀 See Also