Open-Source Benchmark Runner для тестирования агентов OpenClaw на реальных рабочих процессах

✍️ OpenClawRadar📅 Опубликовано: 14 мая 2026 г.🔗 Source
Open-Source Benchmark Runner для тестирования агентов OpenClaw на реальных рабочих процессах
Ad

Пользователь Reddit опубликовал инструмент с открытым исходным кодом под названием personal_agent_eval (репозиторий: github.com/javiersgjavi/personal_agent_eval) для оценки агентов OpenClaw на реалистичных, неструктурированных рабочих процессах — а не на публичных игрушечных наборах данных.

Рабочий процесс

Определите тестовые примеры как YAML-файлы, содержащие:

  • Входные сообщения
  • Ожидаемые артефакты
  • Критерии оценки
  • Детерминированные проверки
  • Профили запуска и профили оценки

Исполнитель запускает примеры в реальном экземпляре OpenClaw, сохраняет результаты, оценивает запуски и генерирует отчеты и диаграммы.

Ключевая особенность: импорт реального рабочего пространства

Вы можете импортировать свое реальное рабочее пространство OpenClaw — включая память, навыки, файлы, подсказки и контекст — вместо упрощенной имитации. Агент работает в реальном экземпляре OpenClaw, тестируя именно того агента, которого вы используете ежедневно.

Частные наборы оценки

Автор намеренно не публикует свои частные наборы оценки, чтобы избежать устаревания публичных бенчмарков. Однако репозиторий включает примеры случаев, конфигурации, профили оценки, детерминированные проверки и генерацию диаграмм, чтобы вы могли создать свой собственный частный набор.

Ad

SKILL.md для помощи агенту

Файл SKILL.md в репозитории предназначен для того, чтобы дать агенту достаточно контекста для помощи в определении новых тестовых примеров, профилей запуска, критериев оценки и детерминированных проверок — сокращая ручное редактирование.

Пример результатов (частный запуск автора)

Автор поделился сравнением одного запуска (метрика неясна, вероятно, средневзвешенное значение 0-10):

Claude Opus 4.6 - 9.44
GLM 5.1 - 9.31
GPT-5.5 - 9.31
Claude Sonnet 4.6 - 9.25
DeepSeek V4 Flash - 8.61
Gemma 4 31B - 8.39
DeepSeek V4 Pro - 8.28
Kimi K2.6 - 7.97

Интереснее баллов — типы отказов. Некоторые модели хорошо рассуждают, но неловко обращаются с инструментами; более дешевые модели ухудшаются на длинных или требующих состояния задачах; некоторые отказы связаны с поведением модели, другие — с граничными случаями OpenClaw/инструментария, выявленными бенчмарком.

Для кого это

Пользователи OpenClaw, которые запускают агентов для реальной работы и хотят сравнивать модели на своих частных задачах, а не спорить на основе интуиции или общих лидербордов.

📖 Читать полный источник: r/openclaw

Ad

👀 Смотрите также

Шесть репозиториев GitHub для разработки кода с Claude
Инструменты

Шесть репозиториев GitHub для разработки кода с Claude

Пользователь Reddit протестировал и поделился шестью репозиториями GitHub, предназначенными для улучшения проектов Claude Code, включая инструменты для структурированной разработки, генерации пользовательского интерфейса, управления задачами, памяти, изучения экосистемы и автоматизации рабочих процессов.

OpenClawRadar
Проблемы в рабочем процессе OpenClaw с несколькими агентами: Зависания, потеря контекста и неэффективное использование токенов
Инструменты

Проблемы в рабочем процессе OpenClaw с несколькими агентами: Зависания, потеря контекста и неэффективное использование токенов

Разработчик сообщает, что многозадачные рабочие процессы OpenClaw часто зависают с бездействующими агентами, наблюдается утечка контекста, несмотря на пользовательскую документацию, и потребляется чрезмерное количество токенов без вывода результатов. В настройке использовались модели Gemini 3 Pro/Codex с оркестратором COO и специализированными агентами задач.

OpenClawRadar
AgentCall: Позвольте Claude Code участвовать в звонках Google Meet, Zoom или Teams в качестве коллеги
Инструменты

AgentCall: Позвольте Claude Code участвовать в звонках Google Meet, Zoom или Teams в качестве коллеги

AgentCall.dev подключает ваш существующий сеанс Claude Code, Codex или Cursor к Google Meet, Teams или Zoom с голосом, демонстрацией экрана и чатом — без захвата рабочего стола, без передачи данных третьим лицам в прямом режиме.

OpenClawRadar
idea-reality-mcp: Сервер MCP проверяет наличие существующих инструментов перед тем, как Claude напишет код
Инструменты

idea-reality-mcp: Сервер MCP проверяет наличие существующих инструментов перед тем, как Claude напишет код

Разработчик создал MCP-сервер под названием idea-reality-mcp, который сканирует репозитории GitHub, обсуждения на Hacker News, npm-пакеты и PyPI перед тем, как Claude напишет любой код, возвращая оценку 'сигнала реальности' от 0 до 100, указывающую на рыночную конкуренцию.

OpenClawRadar