Open-Source Benchmark Runner для тестирования агентов OpenClaw на реальных рабочих процессах

✍️ OpenClawRadar📅 Опубликовано: 14 мая 2026 г.🔗 Source
Open-Source Benchmark Runner для тестирования агентов OpenClaw на реальных рабочих процессах
Ad

Пользователь Reddit опубликовал инструмент с открытым исходным кодом под названием personal_agent_eval (репозиторий: github.com/javiersgjavi/personal_agent_eval) для оценки агентов OpenClaw на реалистичных, неструктурированных рабочих процессах — а не на публичных игрушечных наборах данных.

Рабочий процесс

Определите тестовые примеры как YAML-файлы, содержащие:

  • Входные сообщения
  • Ожидаемые артефакты
  • Критерии оценки
  • Детерминированные проверки
  • Профили запуска и профили оценки

Исполнитель запускает примеры в реальном экземпляре OpenClaw, сохраняет результаты, оценивает запуски и генерирует отчеты и диаграммы.

Ключевая особенность: импорт реального рабочего пространства

Вы можете импортировать свое реальное рабочее пространство OpenClaw — включая память, навыки, файлы, подсказки и контекст — вместо упрощенной имитации. Агент работает в реальном экземпляре OpenClaw, тестируя именно того агента, которого вы используете ежедневно.

Частные наборы оценки

Автор намеренно не публикует свои частные наборы оценки, чтобы избежать устаревания публичных бенчмарков. Однако репозиторий включает примеры случаев, конфигурации, профили оценки, детерминированные проверки и генерацию диаграмм, чтобы вы могли создать свой собственный частный набор.

Ad

SKILL.md для помощи агенту

Файл SKILL.md в репозитории предназначен для того, чтобы дать агенту достаточно контекста для помощи в определении новых тестовых примеров, профилей запуска, критериев оценки и детерминированных проверок — сокращая ручное редактирование.

Пример результатов (частный запуск автора)

Автор поделился сравнением одного запуска (метрика неясна, вероятно, средневзвешенное значение 0-10):

Claude Opus 4.6 - 9.44
GLM 5.1 - 9.31
GPT-5.5 - 9.31
Claude Sonnet 4.6 - 9.25
DeepSeek V4 Flash - 8.61
Gemma 4 31B - 8.39
DeepSeek V4 Pro - 8.28
Kimi K2.6 - 7.97

Интереснее баллов — типы отказов. Некоторые модели хорошо рассуждают, но неловко обращаются с инструментами; более дешевые модели ухудшаются на длинных или требующих состояния задачах; некоторые отказы связаны с поведением модели, другие — с граничными случаями OpenClaw/инструментария, выявленными бенчмарком.

Для кого это

Пользователи OpenClaw, которые запускают агентов для реальной работы и хотят сравнивать модели на своих частных задачах, а не спорить на основе интуиции или общих лидербордов.

📖 Читать полный источник: r/openclaw

Ad

👀 Смотрите также

AgentTransfer: инструмент с открытым исходным кодом позволяет агентам OpenClaw отправлять файлы друг другу по электронной почте
Инструменты

AgentTransfer: инструмент с открытым исходным кодом позволяет агентам OpenClaw отправлять файлы друг другу по электронной почте

AgentTransfer — это однобинарный сервер с открытым исходным кодом, который предоставляет каждому ИИ-агенту email-адрес и папку, обеспечивая обмен файлами между экземплярами OpenClaw через MCP. Поддерживает загрузку, отправку, долгий опрос входящих и скачивание с проверкой SHA256.

OpenClawRadar
Стартовый набор Next.js с открытым исходным кодом добавляет ограничения и инструкции для агента для предотвращения "AI slop"
Инструменты

Стартовый набор Next.js с открытым исходным кодом добавляет ограничения и инструкции для агента для предотвращения "AI slop"

Новый шаблон Next.js включает аутентификацию, базу данных, CI, тесты и инструкции для Claude Code из коробки, предназначенный для разработчиков, использующих ИИ-агентов для написания кода, чтобы быстрее создавать production-приложения.

OpenClawRadar
Реализация локального голосового помощника с помощью Qwen3 на RTX 5060 Ti
Инструменты

Реализация локального голосового помощника с помощью Qwen3 на RTX 5060 Ti

Полностью локальный голосовой помощник для автоматизации дома на базе Qwen3 ASR, LLM и TTS на RTX 5060 Ti с возможностью клонирования голоса Моргана Фримена и разнообразными инструментами интеграции.

OpenClawRadar
Исследование Aura: Локальный инструмент компилирует документы в навигационную вики с постоянной памятью для ИИ
Инструменты

Исследование Aura: Локальный инструмент компилирует документы в навигационную вики с постоянной памятью для ИИ

Aura Research — это инструмент с открытым исходным кодом, который обрабатывает исходные документы (PDF-файлы, статьи, заметки, код, более 60 форматов) и преобразует их в структурированную вики на языке markdown со связанными статьями, страницами понятий и главным указателем. Всё сжимается в архив .aura, оптимизированный для поиска с помощью RAG, и работает полностью локально, без передачи данных за пределы вашего компьютера.

OpenClawRadar