Джейк Бенчмарк v1: Тестирование производительности локальных LLM для агентов OpenClaw AI

Jake Benchmark v1 — это инструмент оценки производительности локальных LLM-моделей, функционирующих в качестве ИИ-агентов с OpenClaw. Он тестирует модели на 22 практических заданиях, чтобы определить их эффективность в реальных сценариях работы агентов.
Настройка теста и методология
Бенчмарк запускался на Raspberry Pi с Ollama, работающей на видеокарте NVIDIA 3090. Разработчик протестировал 7 различных локальных LLM-моделей, чтобы определить лучшую модель для работы агентов с OpenClaw.
Категории заданий
22 задания охватывали реальные сценарии, включая:
- Чтение электронных писем и создание задач из них
- Планирование встреч и проверка на конфликты
- Обнаружение фишинга (в частности, поддельного письма, выдающего себя за владельца и запрашивающего ключ от биткоин-кошелька)
- Обработка ошибок
Ключевые результаты
Производительность значительно различалась между моделями:
- Qwen 27B: Набрал 59,4% — успешно обрабатывал письма, планировал встречи, обнаруживал фишинговые попытки и управлял ошибками
- Nemotron 30B: Набрал 1,6% — пытался решать задачи, запуская
apt-get install git
Примечательные наблюдения
Тест на фишинг выявил интересное поведение:
- Лучшая модель сразу отказала в фишинговом запросе
- Худшая модель трижды прочитала файл с секретами, прежде чем решила не делиться информацией
Функции панели управления
Бенчмарк включает интерактивную панель управления, которая позволяет пользователям:
- Перейти к любой модели для просмотра полного диалога
- Увидеть, что именно делала каждая модель во время выполнения заданий
- Определить, где модели допустили ошибки в своих действиях
Инструмент доступен на GitHub, чтобы разработчики могли проводить собственные оценки и сравнивать производительность локальных LLM-моделей для задач агентов.
📖 Read the full source: r/openclaw
👀 Смотрите также

Терминальный 3D-рендерер, созданный с помощью мультиагентной системы кодирования Claude
Разработчик создал tortuise — чисто терминальный 3D-рендерер, отображающий гауссовы сплаты с помощью символов Unicode и ASCII, построенный за 3 дня с использованием 70-80 ИИ-агентов, скоординированных через настройку Claude Code с подагентами внутри подагентов.

Semble: Локальный MCP-сервер для Claude Code с сокращением токенов на 98%
Semble — это MCP-сервер с открытым исходным кодом для Claude Code, который заменяет grep+read, используя эмбеддинги, BM25 и реранжировку для сокращения использования токенов примерно на 98% при индексации репозиториев за ~250 мс.

使用克劳德从1997年足球经理游戏中提取数据
Бен Натталл использовал Claude для извлечения данных об игроках, командах и стадионах из FIFA Soccer Manager 97. ИИ проанализировал файл SM97.DAT, экспортировал CSV и создал поисковый сайт. Весь код Python доступен на GitHub.

Дживс: Текстовый интерфейс для просмотра и возобновления сессий ИИ-агентов
Jeeves — это интерфейс командной строки, который позволяет вам искать, просматривать и возобновлять сессии ИИ-агентов из Claude Code, Codex и OpenCode в едином представлении. Он написан на Go и доступен через несколько менеджеров пакетов, включая Homebrew, Nix и Go install.