Open-Source Benchmark Runner для тестирования агентов OpenClaw на реальных рабочих процессах

Пользователь Reddit опубликовал инструмент с открытым исходным кодом под названием personal_agent_eval (репозиторий: github.com/javiersgjavi/personal_agent_eval) для оценки агентов OpenClaw на реалистичных, неструктурированных рабочих процессах — а не на публичных игрушечных наборах данных.
Рабочий процесс
Определите тестовые примеры как YAML-файлы, содержащие:
- Входные сообщения
- Ожидаемые артефакты
- Критерии оценки
- Детерминированные проверки
- Профили запуска и профили оценки
Исполнитель запускает примеры в реальном экземпляре OpenClaw, сохраняет результаты, оценивает запуски и генерирует отчеты и диаграммы.
Ключевая особенность: импорт реального рабочего пространства
Вы можете импортировать свое реальное рабочее пространство OpenClaw — включая память, навыки, файлы, подсказки и контекст — вместо упрощенной имитации. Агент работает в реальном экземпляре OpenClaw, тестируя именно того агента, которого вы используете ежедневно.
Частные наборы оценки
Автор намеренно не публикует свои частные наборы оценки, чтобы избежать устаревания публичных бенчмарков. Однако репозиторий включает примеры случаев, конфигурации, профили оценки, детерминированные проверки и генерацию диаграмм, чтобы вы могли создать свой собственный частный набор.
SKILL.md для помощи агенту
Файл SKILL.md в репозитории предназначен для того, чтобы дать агенту достаточно контекста для помощи в определении новых тестовых примеров, профилей запуска, критериев оценки и детерминированных проверок — сокращая ручное редактирование.
Пример результатов (частный запуск автора)
Автор поделился сравнением одного запуска (метрика неясна, вероятно, средневзвешенное значение 0-10):
Claude Opus 4.6 - 9.44 GLM 5.1 - 9.31 GPT-5.5 - 9.31 Claude Sonnet 4.6 - 9.25 DeepSeek V4 Flash - 8.61 Gemma 4 31B - 8.39 DeepSeek V4 Pro - 8.28 Kimi K2.6 - 7.97
Интереснее баллов — типы отказов. Некоторые модели хорошо рассуждают, но неловко обращаются с инструментами; более дешевые модели ухудшаются на длинных или требующих состояния задачах; некоторые отказы связаны с поведением модели, другие — с граничными случаями OpenClaw/инструментария, выявленными бенчмарком.
Для кого это
Пользователи OpenClaw, которые запускают агентов для реальной работы и хотят сравнивать модели на своих частных задачах, а не спорить на основе интуиции или общих лидербордов.
📖 Читать полный источник: r/openclaw
👀 Смотрите также

MAGELLAN: Автономная система научных открытий на 15 агентах, построенная на Claude Code
MAGELLAN — это 15-агентная автономная система научных открытий, полностью построенная на Claude Code. Она использует Opus для глубоких рассуждений и Sonnet для структурированных задач, генерируя междисциплинарные гипотезы без участия человека. В 19 сессиях было предложено 260 гипотез, из которых 60% были отсеяны в ходе состязательной проверки.

Результаты A/B-тестирования: хуки oh-my-claudecode демонстрируют минимальное влияние на производительность Claude Code.
Разработчик потратил 7% своих еженедельных Max20 токенов на тестирование хуков oh-my-claudecode с Claude Sonnet 4.6, не обнаружив значительного улучшения качества кода или снижения затрат для задачи кодирования в рамках одной сессии.

Результаты тестирования APEX Benchmark: производительность Qwen 3.5 в реальных задачах программирования
Результаты тестирования APEX показывают производительность моделей Qwen 3.5 на 70 реальных задачах по программированию с GitHub. Версия 397B опускается до 1194 ELO на задачах уровня «мастер», в то время как GLM-4.7 в квантованном виде лидирует среди локальных моделей с 1572 ELO.

Клодигочи: Физическое устройство Тамагочи, которое питается активностью кода Клода
Клодиготчи — это физическое настольное существо, работающее на ESP32 с ЖК-экраном, которое подключается к Claude Code через плагин. Система голода устройства реагирует на активность кодирования, с визуальными состояниями и звуковыми эффектами, которые усиливаются, когда Claude оставляют бездействующим.