Результаты тестирования: 6 бюджетных моделей против Claude Sonnet 4.6 в задаче оркестрации OpenClaw

Разработчик провёл бенчмарк, чтобы найти более дешёвую альтернативу Claude Sonnet 4.6 в качестве основного оркестратора для настройки ИИ-агента программирования OpenClaw. Тест использовал последовательный набор из 5 задач с реальными файлами и инструментами, без подсказок-подсказок.
Задачи набора
- T1: Вспомнить детали из конкретного файла (открытые пункты в MEMORY.md)
- T2: Проверить файлы, обнаружить неполноту, перекрёстно сопоставить + расставить приоритеты
- T3: Выполнить команду оболочки, разобрать и точно отчитаться о выводе
- T4: Обнаружить задачу на делегирование и корректно передать её
- T5: Синтезировать результаты в краткое резюме
Результаты бенчмарка
Сырые баллы из 5, со стоимостью за миллион выходных токенов:
- Claude Sonnet 4.6: 5/5 ($15/M) – Базовый уровень, безупречно справляется со всей операцией
- o4-mini: 5/5 ($4.40/M) – На 71% дешевле, справился со всеми задачами, но с заметной задержкой в цепочках рассуждений
- Grok 4.1 Fast: 3/5 ($0.50/M) – Отлично справился с T1/T3/T5, но полностью провалил T2 (прочитал 4 строки лога SMS, объявил "всё чисто")
- Gemini 2.5 Flash: 1/5 ($2.50/M) – Отлично справился с T1, затем перестал отвечать в середине запроса
- DeepSeek V3.2: 0/5 ($0.42/M) – Время выполнения 2 секунды, нулевой вывод
- Llama 4 Maverick: Дисквалифицирован ($0.60/M) – Галлюцинировал содержимое файлов, выдумал фейковые имена видеофайлов с датой 2024 (текущий год — 2026), никогда не вызывал реальные инструменты
Ключевой вывод: Пробел в суждении
Критической точкой провала была задача T2 на оценку файлов. Моделям нужно было прочитать короткий лог (4 строки: SMS отправлено, готово), понять, что он неполный, переключиться на MEMORY.md, перечислить все открытые пункты по всему рабочему пространству, а затем правильно расставить приоритеты (медицинская встреча 19 марта > сбой cron > и т.д.). Успешными были только Sonnet и o4-mini. Другие модели были описаны как "ленивые или слепые" в этой задаче.
Практическая реализация
Вывод разработчика: Sonnet остаётся основным оркестратором. Grok 4.1 Fast назначается всем суб-агентам (видео-вопросы-ответы, распространение, аналитика) для экономии 97% на ограниченных задачах, таких как "сгенерировать выбор" или "опубликовать твит".
Они также внедрили cron-задачу на 3 часа ночи, которая ищет новые релизы моделей через веб-поиск, автоматически запускает набор задач, генерирует столбчатую диаграмму от лучшего к худшему и отправляет отчёт по электронной почте.
Основной урок: Оркестрация требует суждения о пробелах в файлах, времени делегирования и синтезе — областях, где дешёвые модели стабильно терпят неудачу. Суб-агенты, однако, могут эффективно использовать более дешёвые модели для конкретных, ограниченных задач.
📖 Read the full source: r/openclaw
👀 Смотрите также

Экспорт воспоминаний ИИ-агентов с использованием функции импорта Claude
Пользователь Reddit делится промптом для извлечения сохранённых воспоминаний из ИИ-агентов, таких как ChatGPT и Claude, с последующим импортом в OpenClaw. Промпт запрашивает весь сохранённый контекст, включая инструкции, личные данные, проекты, инструменты и предпочтения.

Объявляем о Flyto Indexer: улучшенный ИИ для рефакторинга кода с анализом зависимостей источника.
Flyto Indexer, сервер MCP, строит граф символов вашей кодовой базы, помогая ИИ в умной рефакторинге кода путем анализа зависимостей и точек вызова.

Сервер ZuckerBot MCP позволяет агентам OpenClaw запускать рекламные кампании в Meta Ads.
ZuckerBot — это MCP-сервер, который предоставляет агентам OpenClaw прямой контроль над Meta Ads, позволяя им выполнять полные циклы кампаний без вмешательства человека. Более 50 уникальных агентов уже используют его для сбора рекламы конкурентов, настройки таргетинга, запуска кампаний и корректировки производительности в коде.

Советник: слэш-команда /advisor для Claude Code, запускающая Opus + параллельные исполнители Sonnet
Команда /advisor для Claude Code запускает Opus в роли стратега, координирующего несколько параллельных исполнителей Sonnet, читающих файлы. Обнаружено 6 реальных багов, включая троянский источник bidi-символа.