Бенчмарк OpenClaw демонстрирует, что Qwen3.5:27B превосходит другие локальные LLM в задачах агентов.

✍️ OpenClawRadar📅 Опубликовано: 28 марта 2026 г.🔗 Source
Бенчмарк OpenClaw демонстрирует, что Qwen3.5:27B превосходит другие локальные LLM в задачах агентов.
Ad

Настройка бенчмарка и результаты

Пользователь протестировал 7 локальных моделей на 22 реальных задачах агента с использованием OpenClaw на Raspberry Pi 5 с RTX 3090 под управлением Ollama. Задачи включали чтение электронной почты, планирование встреч, создание задач, обнаружение фишинга, обработку ошибок и автоматизацию браузера.

Победителем с огромным отрывом стала модель qwen3.5:27b-q4_K_M с результатом 59,4%. Занявшая второе место модель (qwen3.5:35b) набрала всего 23,2%. Все остальные модели показали результат ниже 5%.

Ad

Ключевые выводы

  • Квантованная 27B модель превзошла более крупную 35B версию в 2,5 раза
  • Модель 30B заняла последнее место с результатом 1,6%
  • Средний уровень размышлений оказался наиболее эффективным — слишком долгие размышления фактически снижали производительность
  • Ни одна модель не смогла выполнить задачи по автоматизации браузера
  • Основным различием между победителями и аутсайдерами была способность модели находить и использовать инструменты командной строки
  • Большинство моделей не смогли найти даже базовые инструменты, такие как функция электронной почты

Этот бенчмарк предоставляет конкретные данные о том, как различные локальные LLM работают в качестве ИИ-агентов в практических сценариях. Значительный разрыв в производительности между лучшей моделью и остальными указывает на то, что способность находить инструменты является критическим узким местом для локальных LLM-агентов.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Quanta-SDK версии 0.9.2 добавляет MCP-сервер для выполнения квантовых схем через AI-агентов.
Инструменты

Quanta-SDK версии 0.9.2 добавляет MCP-сервер для выполнения квантовых схем через AI-агентов.

Quanta-SDK v0.9.2 теперь включает MCP-сервер (Model Context Protocol), который предоставляет ИИ-агентам, таким как Claude или GPT, инструменты для выполнения и интерпретации квантовых схем. Сервер предлагает более 20 инструментов, включая выполнение схем на оборудовании IBM, интерпретацию результатов, анализ шумов и квантовое ценообразование в финансах.

OpenClawRadar
Гем Rails-AI-Context предоставляет коду Claude полную модель приложения Rails через MCP.
Инструменты

Гем Rails-AI-Context предоставляет коду Claude полную модель приложения Rails через MCP.

Гем rails-ai-context автоматически интроспектирует приложения на Rails и предоставляет 39 инструментов через MCP, позволяя Claude Code запрашивать конкретные детали приложения, такие как схема с зашифрованными столбцами, ассоциации моделей, маршруты, подключения Stimulus и сопоставления Turbo, вместо чтения всех файлов целиком.

OpenClawRadar
Маршрутизатор Manifest добавляет поддержку подписки ZAI для управления моделями OpenClaw.
Инструменты

Маршрутизатор Manifest добавляет поддержку подписки ZAI для управления моделями OpenClaw.

Маршрутизатор Manifest теперь поддерживает подписки ZAI, позволяя всем моделям ZAI появляться в уровнях маршрутизации с автоматическим выбором модели для каждого запроса. Инструмент находится в бета-версии, бесплатный, с открытым исходным кодом и включает панель управления для отслеживания затрат на агента, сообщение и модель.

OpenClawRadar
Tacit: язык программирования, ориентированный на LLM, созданный с помощью Claude Code и Opus 4.7
Инструменты

Tacit: язык программирования, ориентированный на LLM, созданный с помощью Claude Code и Opus 4.7

Tacit — это экспериментальный язык программирования, ориентированный на LLM, созданный и реализованный с помощью Claude Code и Opus 4.7. Он избавляется от человеческих удобств, чтобы минимизировать использование токенов, и поставляется с праймером, который обучает LLM среднего уровня (Sonnet и выше) писать код на Tacit.

OpenClawRadar