Bonsai 2 (Qwen 3.8 27B) как резервный вариант OpenClaw: 8 ГБ, 85 ток/с на 5070
Ternary-Bonsai-2-27B от PrismML — это квантованная сборка Qwen3 3.8 27B, которую пользователь r/openclaw запускает локально как резервную модель OpenClaw, когда квоты ChatGPT и Grok исчерпаны. Его утверждение: ~8 ГБ на диске, сохранено 98% качества базовой Qwen3 27B, поддержка текста и зрения.
Цифры из конфигурации
- Скорость вывода: 85 ток/с
- Оборудование: RTX 5070 с 16 ГБ VRAM, 64 ГБ системной памяти
- Объём на диске: ~8 ГБ
- Сохранение качества: заявлено 98% от Qwen3 3.8 27B
Два необходимых GGUF-файла
Файлы берутся из репозитория prism-ml/Ternary-Bonsai-2-27B-gguf на Hugging Face:
Ternary-Bonsai-2-27B-PQ2_0.gguf (текст) Ternary-Bonsai-2-27B-mmproj-Q8_0.gguf (зрение)
Оба нужны, если вы хотите использовать мультимодальный режим — файл mmproj это проектор зрения, файл PQ2_0 — тернаризованные текстовые веса.
Заметки по настройке
Bonsai 2 требует собственного форка llama.cpp от PrismML — в стандартном llama.cpp он не загрузится. Автор поручил GPT настроить форк на отдельной AI-машине, отличной от хоста OpenClaw, с конфигурацией модели:
- Динамическая загрузка при вызове из OpenClaw
- Выгрузка после 10 минут бездействия
- Роль резерва, когда GPT 5.6 и Grok достигают лимитов использования
Что она реально делала
Интересна не скорость в ток/с — интересно агентное поведение. Согласно посту, модель справлялась с веб-поиском через браузер, управлением виртуальной машиной, установкой и использованием нового ПО и запуском существующих рабочих процессов — до такой степени, что автор говорит, что «не может отличить её от фронтирной модели».
Это отчёт одного пользователя, а не бенчмарк, так что заявления о качестве считайте анекдотичными. Практический вывод — шаблон загрузки/выгрузки по простою: локальная 27B остаётся в памяти только когда ваш платный провайдер ограничен по скорости, и это разумный способ не сжигать VRAM постоянно на машине, которая также выполняет другую работу.
Если у вас есть GPU с 16+ ГБ VRAM, пары PQ2_0 + mmproj достаточно малы, чтобы протестировать их на своих агентных задачах, прежде чем решать, подходят ли они вам.
📖 Читать полный источник: r/openclaw
👀 Смотрите также

TREX: ИИ-ревьюер кода от Greptile, который запускает ваш код
TREX — это уровень выполнения кода, встроенный в AI-ревью кода от Greptile. Он запускает код и показывает скриншоты, логи и трассы для ошибок, которые упускает статический анализ.

Разработчик создает сервер MCP для Power Automate с 108 инструментами и кроссплатформенной поддержкой
Разработчик создал сервер Power Automate MCP, расширив его с 12 до 108 инструментов, охватывающих операции CRUD в Dataverse через OData, управление SharePoint через Graph, управление версиями Power Apps, администрирование сред, а также кроссплатформенную поддержку для Windows, macOS и Linux.

Сонарли: Оповещение, сортировка и решение проблем в производстве с использованием искусственного интеллекта
Sonarly подключается к инструментам наблюдаемости для классификации и устранения производственных тревог, уменьшая шум и сосредотачиваясь на критических проблемах.

Vibeyard добавляет доску Канбан для управления несколькими сессиями Claude Code
В открытой IDE Vibeyard теперь есть доска Канбан, позволяющая запускать сессии агента Claude Code прямо с карточек. Карточки автоматически перемещаются в раздел «Готово», когда агент завершает работу.