Результаты тестирования: 6 бюджетных моделей против Claude Sonnet 4.6 в задаче оркестрации OpenClaw

✍️ OpenClawRadar📅 Опубликовано: 17 марта 2026 г.🔗 Source
Результаты тестирования: 6 бюджетных моделей против Claude Sonnet 4.6 в задаче оркестрации OpenClaw
Ad

Разработчик провёл бенчмарк, чтобы найти более дешёвую альтернативу Claude Sonnet 4.6 в качестве основного оркестратора для настройки ИИ-агента программирования OpenClaw. Тест использовал последовательный набор из 5 задач с реальными файлами и инструментами, без подсказок-подсказок.

Задачи набора

  • T1: Вспомнить детали из конкретного файла (открытые пункты в MEMORY.md)
  • T2: Проверить файлы, обнаружить неполноту, перекрёстно сопоставить + расставить приоритеты
  • T3: Выполнить команду оболочки, разобрать и точно отчитаться о выводе
  • T4: Обнаружить задачу на делегирование и корректно передать её
  • T5: Синтезировать результаты в краткое резюме

Результаты бенчмарка

Сырые баллы из 5, со стоимостью за миллион выходных токенов:

  • Claude Sonnet 4.6: 5/5 ($15/M) – Базовый уровень, безупречно справляется со всей операцией
  • o4-mini: 5/5 ($4.40/M) – На 71% дешевле, справился со всеми задачами, но с заметной задержкой в цепочках рассуждений
  • Grok 4.1 Fast: 3/5 ($0.50/M) – Отлично справился с T1/T3/T5, но полностью провалил T2 (прочитал 4 строки лога SMS, объявил "всё чисто")
  • Gemini 2.5 Flash: 1/5 ($2.50/M) – Отлично справился с T1, затем перестал отвечать в середине запроса
  • DeepSeek V3.2: 0/5 ($0.42/M) – Время выполнения 2 секунды, нулевой вывод
  • Llama 4 Maverick: Дисквалифицирован ($0.60/M) – Галлюцинировал содержимое файлов, выдумал фейковые имена видеофайлов с датой 2024 (текущий год — 2026), никогда не вызывал реальные инструменты
Ad

Ключевой вывод: Пробел в суждении

Критической точкой провала была задача T2 на оценку файлов. Моделям нужно было прочитать короткий лог (4 строки: SMS отправлено, готово), понять, что он неполный, переключиться на MEMORY.md, перечислить все открытые пункты по всему рабочему пространству, а затем правильно расставить приоритеты (медицинская встреча 19 марта > сбой cron > и т.д.). Успешными были только Sonnet и o4-mini. Другие модели были описаны как "ленивые или слепые" в этой задаче.

Практическая реализация

Вывод разработчика: Sonnet остаётся основным оркестратором. Grok 4.1 Fast назначается всем суб-агентам (видео-вопросы-ответы, распространение, аналитика) для экономии 97% на ограниченных задачах, таких как "сгенерировать выбор" или "опубликовать твит".

Они также внедрили cron-задачу на 3 часа ночи, которая ищет новые релизы моделей через веб-поиск, автоматически запускает набор задач, генерирует столбчатую диаграмму от лучшего к худшему и отправляет отчёт по электронной почте.

Основной урок: Оркестрация требует суждения о пробелах в файлах, времени делегирования и синтезе — областях, где дешёвые модели стабильно терпят неудачу. Суб-агенты, однако, могут эффективно использовать более дешёвые модели для конкретных, ограниченных задач.

📖 Read the full source: r/openclaw

Ad

👀 Смотрите также

Maestro v1.5.0 добавляет поддержку Claude Code для оркестрации мультиагентных систем.
Инструменты

Maestro v1.5.0 добавляет поддержку Claude Code для оркестрации мультиагентных систем.

Maestro v1.5.0, платформа с открытым исходным кодом для оркестрации нескольких агентов, теперь работает как нативный плагин в Claude Code в дополнение к Gemini CLI. Обновление включает более глубокое проектирование, 42-шаговую основу оркестрации, обеспечение возможностей агентов и усиление безопасности.

OpenClawRadar
🦀
Инструменты

Игла: 26-миллионная модель вызова инструментов, построенная полностью без FFN

Needle — это модель вызова функций с 26 миллионами параметров без MLP, достигающая 6000 токенов/с на префилле и 1200 токенов/с на декоде на потребительских устройствах. Она превосходит FunctionGemma-270M, Qwen-0.6B, Granite-350M и LFM2.5-350M в одношаговом вызове инструментов.

OpenClawRadar
Argyph: Единый MCP-сервер для Claude Code с 19 структурированными инструментами анализа кода
Инструменты

Argyph: Единый MCP-сервер для Claude Code с 19 структурированными инструментами анализа кода

Argyph — это локальный MCP-сервер, который предоставляет Claude Code 19 инструментов: переход к определению, поиск ссылок, графы вызовов, семантический поиск, упаковка репозитория с учётом токенов. Всё это заменяет несколько отдельных MCP-серверов одной установкой. Ключ API не требуется; вся обработка остаётся на вашем компьютере.

OpenClawRadar
agentcontract v0.0.1: Портативный уровень разрешений в формате JSON для ИИ-агентов программирования
Инструменты

agentcontract v0.0.1: Портативный уровень разрешений в формате JSON для ИИ-агентов программирования

agentcontract v0.0.1 представляет портативный JSON-слой разрешений для ИИ-агентов с локальным браузерным интерфейсом для редактирования, проверки и пробного запуска вызовов инструментов.

OpenClawRadar