Джейк Бенчмарк v1: Тестирование производительности локальных LLM для агентов OpenClaw AI

✍️ OpenClawRadar📅 Опубликовано: 23 марта 2026 г.🔗 Source
Джейк Бенчмарк v1: Тестирование производительности локальных LLM для агентов OpenClaw AI
Ad

Jake Benchmark v1 — это инструмент оценки производительности локальных LLM-моделей, функционирующих в качестве ИИ-агентов с OpenClaw. Он тестирует модели на 22 практических заданиях, чтобы определить их эффективность в реальных сценариях работы агентов.

Настройка теста и методология

Бенчмарк запускался на Raspberry Pi с Ollama, работающей на видеокарте NVIDIA 3090. Разработчик протестировал 7 различных локальных LLM-моделей, чтобы определить лучшую модель для работы агентов с OpenClaw.

Категории заданий

22 задания охватывали реальные сценарии, включая:

  • Чтение электронных писем и создание задач из них
  • Планирование встреч и проверка на конфликты
  • Обнаружение фишинга (в частности, поддельного письма, выдающего себя за владельца и запрашивающего ключ от биткоин-кошелька)
  • Обработка ошибок

Ключевые результаты

Производительность значительно различалась между моделями:

  • Qwen 27B: Набрал 59,4% — успешно обрабатывал письма, планировал встречи, обнаруживал фишинговые попытки и управлял ошибками
  • Nemotron 30B: Набрал 1,6% — пытался решать задачи, запуская apt-get install git
Ad

Примечательные наблюдения

Тест на фишинг выявил интересное поведение:

  • Лучшая модель сразу отказала в фишинговом запросе
  • Худшая модель трижды прочитала файл с секретами, прежде чем решила не делиться информацией

Функции панели управления

Бенчмарк включает интерактивную панель управления, которая позволяет пользователям:

  • Перейти к любой модели для просмотра полного диалога
  • Увидеть, что именно делала каждая модель во время выполнения заданий
  • Определить, где модели допустили ошибки в своих действиях

Инструмент доступен на GitHub, чтобы разработчики могли проводить собственные оценки и сравнивать производительность локальных LLM-моделей для задач агентов.

📖 Read the full source: r/openclaw

Ad

👀 Смотрите также

Терминальный 3D-рендерер, созданный с помощью мультиагентной системы кодирования Claude
Инструменты

Терминальный 3D-рендерер, созданный с помощью мультиагентной системы кодирования Claude

Разработчик создал tortuise — чисто терминальный 3D-рендерер, отображающий гауссовы сплаты с помощью символов Unicode и ASCII, построенный за 3 дня с использованием 70-80 ИИ-агентов, скоординированных через настройку Claude Code с подагентами внутри подагентов.

OpenClawRadar
Semble: Локальный MCP-сервер для Claude Code с сокращением токенов на 98%
Инструменты

Semble: Локальный MCP-сервер для Claude Code с сокращением токенов на 98%

Semble — это MCP-сервер с открытым исходным кодом для Claude Code, который заменяет grep+read, используя эмбеддинги, BM25 и реранжировку для сокращения использования токенов примерно на 98% при индексации репозиториев за ~250 мс.

OpenClawRadar
使用克劳德从1997年足球经理游戏中提取数据
Инструменты

使用克劳德从1997年足球经理游戏中提取数据

Бен Натталл использовал Claude для извлечения данных об игроках, командах и стадионах из FIFA Soccer Manager 97. ИИ проанализировал файл SM97.DAT, экспортировал CSV и создал поисковый сайт. Весь код Python доступен на GitHub.

OpenClawRadar
Дживс: Текстовый интерфейс для просмотра и возобновления сессий ИИ-агентов
Инструменты

Дживс: Текстовый интерфейс для просмотра и возобновления сессий ИИ-агентов

Jeeves — это интерфейс командной строки, который позволяет вам искать, просматривать и возобновлять сессии ИИ-агентов из Claude Code, Codex и OpenCode в едином представлении. Он написан на Go и доступен через несколько менеджеров пакетов, включая Homebrew, Nix и Go install.

OpenClawRadar