Hermes против OpenClaw: бенчмарк на реальной работе закончился уроком о памяти
Один разработчик провел прямое сравнение Hermes и OpenClaw на реальных проектах, и хотя оба показали близкие результаты по качеству вывода, решающим фактором стало то, как каждый обрабатывает память. Явная, проверяемая модель обучения OpenClaw победила после того, как Hermes превратил случайный комплимент в скрытое глобальное правило, которое направляло недели работы.
Настройка теста
Пользователь провел пять раундов реальной работы: исследование, разработка приложения на большом публичном наборе данных, создание контента и поиск работы. Оба агента получили одинаковые брифинги. Полные результаты обеих сторон приведены в блоге автора для независимой проверки.
Результаты производительности
Результаты были почти равными. Оба инструмента без проблем создали программные приложения, нашли одни и те же истины в исследовании и получили схожие общие оценки. Различия были стилистическими:
- Hermes писал как исследователь — строго, со ссылками, осторожно.
- OpenClaw писал готовые к принятию решений тексты — сначала резюме, ориентированные на действия.
Для повседневной работы автора практический стиль OpenClaw оказался предпочтительнее.
Проблема с памятью
Тест не изменил настройки автора — это сделала память. Во время использования Hermes он похвалил идею агента о проверке кода. Hermes автоматически превратил этот единственный комментарий в глобальное правило: проверка кода является узким местом для всех проблем разработки программного обеспечения. Неделями каждый брифинг возвращал вариацию этого утверждения. Просьбы остановиться не помогали: он соглашался, но все равно повторял поведение. Правило незаметно управляло выводами.
OpenClaw учится только через явное обучение — медленнее, обдуманно и легко проверяемо. Вы всегда знаете, что он знает, потому что вы его научили. Автор нашел это освежающим после того, как его собственный агент перестал повторяться.
Почему OpenClaw победил
Автор пришел к выводу, что может жить с инструментом, которому нужно учить, но не с тем, который тихо усваивает незапрошенные уроки и управляет работой на их основе. Вопрос не в том, кто выше по баллам в тесте, а в том, с каким сбоем вы можете жить.
Для разработчиков, оценивающих модели памяти, этот компромисс важен. Автоматическое обучение может быть мощным, но чрезмерное обобщение рискует направить выводы на основе неверных предположений.
Полный отчет со всеми материалами обеих сторон см. на engineering.kenmazaika.com.
📖 Читать полный источник: r/openclaw
👀 Смотрите также

Генерация лидов и автоматизация CRM с OpenClaw

Гибридный RAG для локальной памяти агента с использованием OpenClaw, Ollama и nomic-embed-text
Разработчик реализовал гибридный поиск RAG для памяти AI-агента с использованием OpenClaw с Ollama и nomic-embed-text, сочетая 70% векторного сходства с 30% ключевого соответствия BM25. Настройка работает локально без внешних API и включает дедупликацию MMR и временное затухание весов.

Рабочий процесс Claude MCP автоматизирует повторное вовлечение потенциальных клиентов в LinkedIn с адаптивными ограничениями.
Разработчик создал рабочий процесс с использованием Claude и MCP для автоматического повторного вовлечения старых контактов в LinkedIn, определяя потенциальных клиентов, генерируя контекстные сообщения и адаптивно справляясь с ограничениями платформы. Из 7 целевых потенциальных клиентов 5 сообщений были успешно отправлены, а 2 были пропущены из-за ограничений LinkedIn.

Использование Claude Code и Remotion для создания демонстрационных видео без навыков дизайна
Разработчик отложил запуск своего продукта на несколько месяцев, потому что не мог позволить себе демонстрационные видео стоимостью 300–1000 долларов со сроками выполнения 6–10 недель. За один уикенд он использовал Remotion (фреймворк для генерации видео на основе React) и Claude Code, чтобы создать собственные видео, иллюстрации и компоненты целевой страницы, достигнув тысяч просмотров своих рилов.