Bonsai 2 (Qwen 3.8 27B) как резервный вариант OpenClaw: 8 ГБ, 85 ток/с на 5070

✍️ OpenClawRadar📅 Опубликовано: 1 октября 2026 г.🔗 Source
Ad

Ternary-Bonsai-2-27B от PrismML — это квантованная сборка Qwen3 3.8 27B, которую пользователь r/openclaw запускает локально как резервную модель OpenClaw, когда квоты ChatGPT и Grok исчерпаны. Его утверждение: ~8 ГБ на диске, сохранено 98% качества базовой Qwen3 27B, поддержка текста и зрения.

Цифры из конфигурации

  • Скорость вывода: 85 ток/с
  • Оборудование: RTX 5070 с 16 ГБ VRAM, 64 ГБ системной памяти
  • Объём на диске: ~8 ГБ
  • Сохранение качества: заявлено 98% от Qwen3 3.8 27B

Два необходимых GGUF-файла

Файлы берутся из репозитория prism-ml/Ternary-Bonsai-2-27B-gguf на Hugging Face:

Ternary-Bonsai-2-27B-PQ2_0.gguf        (текст)
Ternary-Bonsai-2-27B-mmproj-Q8_0.gguf  (зрение)

Оба нужны, если вы хотите использовать мультимодальный режим — файл mmproj это проектор зрения, файл PQ2_0 — тернаризованные текстовые веса.

Заметки по настройке

Bonsai 2 требует собственного форка llama.cpp от PrismML — в стандартном llama.cpp он не загрузится. Автор поручил GPT настроить форк на отдельной AI-машине, отличной от хоста OpenClaw, с конфигурацией модели:

  • Динамическая загрузка при вызове из OpenClaw
  • Выгрузка после 10 минут бездействия
  • Роль резерва, когда GPT 5.6 и Grok достигают лимитов использования
Ad

Что она реально делала

Интересна не скорость в ток/с — интересно агентное поведение. Согласно посту, модель справлялась с веб-поиском через браузер, управлением виртуальной машиной, установкой и использованием нового ПО и запуском существующих рабочих процессов — до такой степени, что автор говорит, что «не может отличить её от фронтирной модели».

Это отчёт одного пользователя, а не бенчмарк, так что заявления о качестве считайте анекдотичными. Практический вывод — шаблон загрузки/выгрузки по простою: локальная 27B остаётся в памяти только когда ваш платный провайдер ограничен по скорости, и это разумный способ не сжигать VRAM постоянно на машине, которая также выполняет другую работу.

Если у вас есть GPU с 16+ ГБ VRAM, пары PQ2_0 + mmproj достаточно малы, чтобы протестировать их на своих агентных задачах, прежде чем решать, подходят ли они вам.

📖 Читать полный источник: r/openclaw

Ad

👀 Смотрите также

TREX: ИИ-ревьюер кода от Greptile, который запускает ваш код
Инструменты

TREX: ИИ-ревьюер кода от Greptile, который запускает ваш код

TREX — это уровень выполнения кода, встроенный в AI-ревью кода от Greptile. Он запускает код и показывает скриншоты, логи и трассы для ошибок, которые упускает статический анализ.

OpenClawRadar
Разработчик создает сервер MCP для Power Automate с 108 инструментами и кроссплатформенной поддержкой
Инструменты

Разработчик создает сервер MCP для Power Automate с 108 инструментами и кроссплатформенной поддержкой

Разработчик создал сервер Power Automate MCP, расширив его с 12 до 108 инструментов, охватывающих операции CRUD в Dataverse через OData, управление SharePoint через Graph, управление версиями Power Apps, администрирование сред, а также кроссплатформенную поддержку для Windows, macOS и Linux.

OpenClawRadar
Сонарли: Оповещение, сортировка и решение проблем в производстве с использованием искусственного интеллекта
Инструменты

Сонарли: Оповещение, сортировка и решение проблем в производстве с использованием искусственного интеллекта

Sonarly подключается к инструментам наблюдаемости для классификации и устранения производственных тревог, уменьшая шум и сосредотачиваясь на критических проблемах.

OpenClawRadar
Vibeyard добавляет доску Канбан для управления несколькими сессиями Claude Code
Инструменты

Vibeyard добавляет доску Канбан для управления несколькими сессиями Claude Code

В открытой IDE Vibeyard теперь есть доска Канбан, позволяющая запускать сессии агента Claude Code прямо с карточек. Карточки автоматически перемещаются в раздел «Готово», когда агент завершает работу.

OpenClawRadar