Бенчмарк OpenClaw демонстрирует, что Qwen3.5:27B превосходит другие локальные LLM в задачах агентов.

Настройка бенчмарка и результаты
Пользователь протестировал 7 локальных моделей на 22 реальных задачах агента с использованием OpenClaw на Raspberry Pi 5 с RTX 3090 под управлением Ollama. Задачи включали чтение электронной почты, планирование встреч, создание задач, обнаружение фишинга, обработку ошибок и автоматизацию браузера.
Победителем с огромным отрывом стала модель qwen3.5:27b-q4_K_M с результатом 59,4%. Занявшая второе место модель (qwen3.5:35b) набрала всего 23,2%. Все остальные модели показали результат ниже 5%.
Ключевые выводы
- Квантованная 27B модель превзошла более крупную 35B версию в 2,5 раза
- Модель 30B заняла последнее место с результатом 1,6%
- Средний уровень размышлений оказался наиболее эффективным — слишком долгие размышления фактически снижали производительность
- Ни одна модель не смогла выполнить задачи по автоматизации браузера
- Основным различием между победителями и аутсайдерами была способность модели находить и использовать инструменты командной строки
- Большинство моделей не смогли найти даже базовые инструменты, такие как функция электронной почты
Этот бенчмарк предоставляет конкретные данные о том, как различные локальные LLM работают в качестве ИИ-агентов в практических сценариях. Значительный разрыв в производительности между лучшей моделью и остальными указывает на то, что способность находить инструменты является критическим узким местом для локальных LLM-агентов.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Quanta-SDK версии 0.9.2 добавляет MCP-сервер для выполнения квантовых схем через AI-агентов.
Quanta-SDK v0.9.2 теперь включает MCP-сервер (Model Context Protocol), который предоставляет ИИ-агентам, таким как Claude или GPT, инструменты для выполнения и интерпретации квантовых схем. Сервер предлагает более 20 инструментов, включая выполнение схем на оборудовании IBM, интерпретацию результатов, анализ шумов и квантовое ценообразование в финансах.

Гем Rails-AI-Context предоставляет коду Claude полную модель приложения Rails через MCP.
Гем rails-ai-context автоматически интроспектирует приложения на Rails и предоставляет 39 инструментов через MCP, позволяя Claude Code запрашивать конкретные детали приложения, такие как схема с зашифрованными столбцами, ассоциации моделей, маршруты, подключения Stimulus и сопоставления Turbo, вместо чтения всех файлов целиком.

Маршрутизатор Manifest добавляет поддержку подписки ZAI для управления моделями OpenClaw.
Маршрутизатор Manifest теперь поддерживает подписки ZAI, позволяя всем моделям ZAI появляться в уровнях маршрутизации с автоматическим выбором модели для каждого запроса. Инструмент находится в бета-версии, бесплатный, с открытым исходным кодом и включает панель управления для отслеживания затрат на агента, сообщение и модель.

Tacit: язык программирования, ориентированный на LLM, созданный с помощью Claude Code и Opus 4.7
Tacit — это экспериментальный язык программирования, ориентированный на LLM, созданный и реализованный с помощью Claude Code и Opus 4.7. Он избавляется от человеческих удобств, чтобы минимизировать использование токенов, и поставляется с праймером, который обучает LLM среднего уровня (Sonnet и выше) писать код на Tacit.