Bonsai 27B: Первая модель класса 27B работает на телефоне — показатели тестов и характеристики

✍️ OpenClawRadar📅 Опубликовано: 15 июля 2026 г.🔗 Source
Bonsai 27B: Первая модель класса 27B работает на телефоне — показатели тестов и характеристики
Ad

Компания PrismML выпустила Bonsai 27B — первую модель с 27 миллиардами параметров, которая помещается и работает на телефоне. Основанная на Qwen 3.6 27B, она использует экстремальное низкобитовое квантование — тернарные или бинарные веса — для сжатия модели до 3,9 ГБ (1-битный вариант) или 5,9 ГБ (тернарный вариант) против 54 ГБ в 16-битной точности.

Два варианта: тернарный и 1-битный

  • Тернарный Bonsai 27B: веса из набора {−1, 0, +1} с групповым масштабированием FP16, эффективно 1,71 бита на вес. Размер: 5,9 ГБ. Ориентирован на ноутбуки с полным рассуждением, вызовом инструментов и агентными возможностями.
  • 1-битный Bonsai 27B: бинарные веса {−1, +1}, эффективно 1,125 бита на вес. Размер: 3,9 ГБ. Умещается в память iPhone 17 Pro.

Оба варианта выполняют всю сеть (эмбеддинги, внимание, MLP, LM head) в низкобитовом режиме — без «запасных люков» повышенной точности. Они поддерживают контекст на 262K токенов, мультимодальное зрение (4-битная башня зрения) и спекулятивное декодирование.

Ad

Результаты тестов (режим рассуждения)

По 15 тестам:

  • Математика (GSM8K, MATH-500, AIME25, AIME26): Qwen 3.6 27B 95,3; тернарный 93,4; 1-битный 91,7
  • Программирование (HumanEval+, MBPP+, LiveCodeBench): 88,7 → 86,0 → 81,9
  • Агентность/Вызов инструментов (BFCL v3, TauBench): 80,0 → 74,0 → 66,0
  • Следование инструкциям (IFEval, IFBench): 78,4 → 71,8 → 65,8
  • Знания/STEM (MMLU-Redux, MuSR): 83,1 → 77,0 → 73,4
  • Зрение (MMMU Pro, OCRBench): 72,6 → 65,2 → 59,6
  • В среднем: 85,0 → 80,5 (сохранение 95%) → 76,1 (сохранение 90%)

Математика и программирование страдают меньше всего — это ключевые аспекты для агентных нагрузок. 1-битный вариант объёмом 3,9 ГБ меньше, чем модель с 2 млрд параметров в полной точности, но при этом обеспечивает интеллект уровня 27B.

Почему локальное выполнение важно для агентов

Агентные задачи требуют множества последовательных вызовов модели — каждый со своим контекстом и структурированным выводом. Облачное выполнение означает задержку на шаг, накопление затрат на токены и отправку личных данных (скриншотов, файлов) по сети. Локальное выполнение устраняет эти ограничения. Bonsai 27B обеспечивает на устройстве многошаговые рассуждения, вызовы инструментов и агентные циклы использования компьютера.

Лицензия и доступность

Оба варианта доступны сегодня под лицензией Apache 2.0.

📖 Источник: HN AI Agents

Ad

👀 Смотрите также

Сообщается об утечке исходного кода Claude Code, раскрывающей детали архитектуры агента
Новости

Сообщается об утечке исходного кода Claude Code, раскрывающей детали архитектуры агента

Исходный код Claude Code, ИИ-агента для программирования от Anthropic, по всей видимости, был утечён, содержа полный репозиторий с системными промптами, реализацией цикла агента и инфраструктурой вызова инструментов.

OpenClawRadar
Анализ проблем бенчмаркинга TB2 в задаче db-wal-recovery
Новости

Анализ проблем бенчмаркинга TB2 в задаче db-wal-recovery

Анализ Reddit выявляет проблемы с задачей db-wal-recovery в Terminal Bench 2.0, где агенты могут случайно уничтожить улики, открывая базы данных SQLite, и показывает, как инъекция промптов влияет на результаты лидерборда.

OpenClawRadar
Gemini 3.1 Flash Live: Новая аудиомодель Google с улучшенными показателями и водяными знаками
Новости

Gemini 3.1 Flash Live: Новая аудиомодель Google с улучшенными показателями и водяными знаками

Google выпустила Gemini 3.1 Flash Live — аудиомодель, которая набрала 90,8% на тесте ComplexFuncBench Audio и 36,1% на Audio MultiChallenge от Scale AI. Она доступна через Gemini Live API в Google AI Studio и включает водяной знак SynthID.

OpenClawRadar
Обсуждение на Reddit подчеркивает снижение использования токенов на 68% для ИИ-агентов благодаря изменениям в инфраструктуре.
Новости

Обсуждение на Reddit подчеркивает снижение использования токенов на 68% для ИИ-агентов благодаря изменениям в инфраструктуре.

Пользователь Reddit сообщает о сокращении использования токенов ИИ-агента на 68,5% благодаря переходу со стандартной инфраструктуры на агент-ориентированную ОС с доступом к состоянию в формате JSON, что сократило проверки состояния с ~9 команд оболочки до 1 структурированного вызова.

OpenClawRadar