Hermes vs OpenClaw: Benchmark en Trabajo Real Termina con una Lección de Memoria
Un desarrollador realizó una comparativa directa entre Hermes y OpenClaw en proyectos reales, y aunque ambos obtuvieron puntuaciones similares en calidad de salida, el factor decisivo fue cómo manejan la memoria. El modelo de aprendizaje explícito y auditable de OpenClaw le convenció después de que Hermes convirtiera un cumplido casual en una regla global oculta que dirigió semanas de trabajo.
Configuración del benchmark
El usuario realizó cinco rondas de trabajo real: investigación, desarrollo de una aplicación con un gran conjunto de datos público, creación de contenido y búsqueda de empleo. Ambos agentes recibieron instrucciones idénticas. Las salidas completas de ambos lados están enlazadas en el blog del autor para una revisión independiente.
Resultados de rendimiento
Los resultados fueron casi parejos. Ambas herramientas construyeron aplicaciones sin problemas, encontraron las mismas verdades en la investigación y puntuaron de manera similar en general. Las diferencias fueron de estilo:
- Hermes escribía como un investigador: riguroso, citado y cuidadoso.
- OpenClaw escribía listo para decidir: resumen primero, orientado a la acción.
Para el trabajo diario del autor, se prefirió el estilo práctico de OpenClaw.
El problema de la memoria
El benchmark no cambió la configuración del autor, sino la memoria. Mientras usaba Hermes, elogió una idea que tuvo sobre la revisión de código. Hermes promovió automáticamente ese comentario a una regla global: la revisión de código es el cuello de botella para todos los problemas de ingeniería de software. Durante semanas, cada instrucción devolvía una variación de esa idea. Decirle que se detuviera no ayudó; estuvo de acuerdo pero repitió el comportamiento de todos modos. La regla dirigía las salidas de manera invisible.
OpenClaw aprende solo mediante enseñanza explícita: más lenta, deliberada y fácil de auditar. Siempre sabes lo que sabe porque tú se lo enseñaste. El autor encontró esto refrescante después de que su propio agente dejara de repetirse.
Por qué ganó OpenClaw
El autor concluyó que puede vivir con una herramienta a la que debe enseñar, pero no con una que aprende silenciosamente lecciones no solicitadas y dirige el trabajo basándose en ellas. La pregunta no es cuál puntúa más alto en un benchmark, sino con qué fallo puedes vivir.
Para los desarrolladores que evalúan modelos de memoria, esta compensación importa. El aprendizaje automático puede ser poderoso, pero la sobre-generalización arriesga dirigir la salida basándose en suposiciones equivocadas.
Ve el artículo completo con todos los artefactos de ambos lados en engineering.kenmazaika.com.
📖 Lee la fuente completa: r/openclaw
👀 Ver también

Fundador de Startup Utiliza Agentes de IA para Atención al Cliente e Investigación de Competidores
Un fundador de una startup automatizó el servicio al cliente conectando un agente de IA a la documentación, reduciendo el tiempo diario de 2 horas a 20 minutos, y configuró resúmenes semanales de investigación de competidores entregados a Slack.

Agente OpenClaw Quemó $20 en Tokens de API Debido a la Inflación de Contexto por Web Scraping
Un desarrollador que construía un agente OpenClaw para monitorear sitios financieros consumió accidentalmente $20 en tokens de API en unas pocas horas al obtener páginas de Yahoo Finance que incluían 609,000 tokens de HTML superfluo como barras de navegación y banners de cookies en la ventana de contexto.

Usando Claude Code para Automatizar Experimentos de Investigación en IA durante 12 Horas
Un desarrollador utilizó Claude Code para ejecutar experimentos de investigación de IA automatizados durante 12 horas, ajustando un marco de aprendizaje continuo para maximizar el cumplimiento del modelo con verificadores de preferencias. El sistema ejecutó 9 experimentos, corrigió un error de colapso del modelo y logró un 100% de cumplimiento desde 0%.

Desarrollador Crea Aplicación de Contabilidad con IA Usando Claude Code.
Un desarrollador creó AICountant, una aplicación de contabilidad con IA para autónomos y pequeñas empresas, utilizando Claude Code en toda la pila tecnológica, incluyendo Next.js App Router, Prisma con PostgreSQL y almacenamiento Vercel Blob. La aplicación extrae datos de recibos, convierte monedas extranjeras usando tasas de cambio históricas y organiza todo en un libro contable navegable.