Джейк Бенчмарк v1: Тестирование производительности локальных LLM для агентов OpenClaw AI

Jake Benchmark v1 — это инструмент оценки производительности локальных LLM-моделей, функционирующих в качестве ИИ-агентов с OpenClaw. Он тестирует модели на 22 практических заданиях, чтобы определить их эффективность в реальных сценариях работы агентов.
Настройка теста и методология
Бенчмарк запускался на Raspberry Pi с Ollama, работающей на видеокарте NVIDIA 3090. Разработчик протестировал 7 различных локальных LLM-моделей, чтобы определить лучшую модель для работы агентов с OpenClaw.
Категории заданий
22 задания охватывали реальные сценарии, включая:
- Чтение электронных писем и создание задач из них
- Планирование встреч и проверка на конфликты
- Обнаружение фишинга (в частности, поддельного письма, выдающего себя за владельца и запрашивающего ключ от биткоин-кошелька)
- Обработка ошибок
Ключевые результаты
Производительность значительно различалась между моделями:
- Qwen 27B: Набрал 59,4% — успешно обрабатывал письма, планировал встречи, обнаруживал фишинговые попытки и управлял ошибками
- Nemotron 30B: Набрал 1,6% — пытался решать задачи, запуская
apt-get install git
Примечательные наблюдения
Тест на фишинг выявил интересное поведение:
- Лучшая модель сразу отказала в фишинговом запросе
- Худшая модель трижды прочитала файл с секретами, прежде чем решила не делиться информацией
Функции панели управления
Бенчмарк включает интерактивную панель управления, которая позволяет пользователям:
- Перейти к любой модели для просмотра полного диалога
- Увидеть, что именно делала каждая модель во время выполнения заданий
- Определить, где модели допустили ошибки в своих действиях
Инструмент доступен на GitHub, чтобы разработчики могли проводить собственные оценки и сравнивать производительность локальных LLM-моделей для задач агентов.
📖 Read the full source: r/openclaw
👀 Смотрите также

Настройка OpenClaw как постоянного ИИ-ассистента
OpenClaw, настроенный как постоянно действующий AI-ассистент для небольшой команды разработчиков, размещен на сервере Railway, использует Claude в качестве бэкенда и интегрируется с Google Workspace, GitHub и другими сервисами.

boxBot: Интеллектуальная колонка с открытым исходным кодом на базе Claude и Hailo AI
Разработчик под ником FunScore645 создал умную колонку boxBot, использующую Claude для агентного управления аппаратным обеспечением, Raspberry Pi, ускоритель ИИ Hailo и собственный SDK — проект с открытым исходным кодом на GitHub.

Maggy: Автономная инженерная платформа на Claude Code с межсессионной памятью и P2P-обучением команды
Maggy находится на 4 уровне спектра инструментов AI-кодирования: мультимодельная оркестровка, кросс-сессионная память, процессная аналитика из CI/ревью и P2P командное обучение. Бенчмарки показывают 83% снижение использования Claude при выявлении 7 проблем безопасности, пропущенных однопоточным Claude Code.

Прокси с открытым исходным кодом RelayPlane демонстрирует снижение затрат на 73% благодаря маршрутизации моделей Claude.
RelayPlane, открытый npm-нативный прокси для API Anthropic, продемонстрировал экономию затрат в 73,4% в тестах, направляя запросы к соответствующим моделям Claude в зависимости от сложности. Инструмент снизил стоимость 10 запросов с $0,0323 до $0,0086, одновременно улучшив p50 задержку с 1,55 с до 0,78 с.