Джейк Бенчмарк v1: Тестирование производительности локальных LLM для агентов OpenClaw AI

✍️ OpenClawRadar📅 Опубликовано: 23 марта 2026 г.🔗 Source
Джейк Бенчмарк v1: Тестирование производительности локальных LLM для агентов OpenClaw AI
Ad

Jake Benchmark v1 — это инструмент оценки производительности локальных LLM-моделей, функционирующих в качестве ИИ-агентов с OpenClaw. Он тестирует модели на 22 практических заданиях, чтобы определить их эффективность в реальных сценариях работы агентов.

Настройка теста и методология

Бенчмарк запускался на Raspberry Pi с Ollama, работающей на видеокарте NVIDIA 3090. Разработчик протестировал 7 различных локальных LLM-моделей, чтобы определить лучшую модель для работы агентов с OpenClaw.

Категории заданий

22 задания охватывали реальные сценарии, включая:

  • Чтение электронных писем и создание задач из них
  • Планирование встреч и проверка на конфликты
  • Обнаружение фишинга (в частности, поддельного письма, выдающего себя за владельца и запрашивающего ключ от биткоин-кошелька)
  • Обработка ошибок

Ключевые результаты

Производительность значительно различалась между моделями:

  • Qwen 27B: Набрал 59,4% — успешно обрабатывал письма, планировал встречи, обнаруживал фишинговые попытки и управлял ошибками
  • Nemotron 30B: Набрал 1,6% — пытался решать задачи, запуская apt-get install git
Ad

Примечательные наблюдения

Тест на фишинг выявил интересное поведение:

  • Лучшая модель сразу отказала в фишинговом запросе
  • Худшая модель трижды прочитала файл с секретами, прежде чем решила не делиться информацией

Функции панели управления

Бенчмарк включает интерактивную панель управления, которая позволяет пользователям:

  • Перейти к любой модели для просмотра полного диалога
  • Увидеть, что именно делала каждая модель во время выполнения заданий
  • Определить, где модели допустили ошибки в своих действиях

Инструмент доступен на GitHub, чтобы разработчики могли проводить собственные оценки и сравнивать производительность локальных LLM-моделей для задач агентов.

📖 Read the full source: r/openclaw

Ad

👀 Смотрите также

Настройка OpenClaw как постоянного ИИ-ассистента
Инструменты

Настройка OpenClaw как постоянного ИИ-ассистента

OpenClaw, настроенный как постоянно действующий AI-ассистент для небольшой команды разработчиков, размещен на сервере Railway, использует Claude в качестве бэкенда и интегрируется с Google Workspace, GitHub и другими сервисами.

OpenClawRadar
boxBot: Интеллектуальная колонка с открытым исходным кодом на базе Claude и Hailo AI
Инструменты

boxBot: Интеллектуальная колонка с открытым исходным кодом на базе Claude и Hailo AI

Разработчик под ником FunScore645 создал умную колонку boxBot, использующую Claude для агентного управления аппаратным обеспечением, Raspberry Pi, ускоритель ИИ Hailo и собственный SDK — проект с открытым исходным кодом на GitHub.

OpenClawRadar
Maggy: Автономная инженерная платформа на Claude Code с межсессионной памятью и P2P-обучением команды
Инструменты

Maggy: Автономная инженерная платформа на Claude Code с межсессионной памятью и P2P-обучением команды

Maggy находится на 4 уровне спектра инструментов AI-кодирования: мультимодельная оркестровка, кросс-сессионная память, процессная аналитика из CI/ревью и P2P командное обучение. Бенчмарки показывают 83% снижение использования Claude при выявлении 7 проблем безопасности, пропущенных однопоточным Claude Code.

OpenClawRadar
Прокси с открытым исходным кодом RelayPlane демонстрирует снижение затрат на 73% благодаря маршрутизации моделей Claude.
Инструменты

Прокси с открытым исходным кодом RelayPlane демонстрирует снижение затрат на 73% благодаря маршрутизации моделей Claude.

RelayPlane, открытый npm-нативный прокси для API Anthropic, продемонстрировал экономию затрат в 73,4% в тестах, направляя запросы к соответствующим моделям Claude в зависимости от сложности. Инструмент снизил стоимость 10 запросов с $0,0323 до $0,0086, одновременно улучшив p50 задержку с 1,55 с до 0,78 с.

OpenClawRadar