Bonsai 27B: Первая модель класса 27B работает на телефоне — показатели тестов и характеристики

Компания PrismML выпустила Bonsai 27B — первую модель с 27 миллиардами параметров, которая помещается и работает на телефоне. Основанная на Qwen 3.6 27B, она использует экстремальное низкобитовое квантование — тернарные или бинарные веса — для сжатия модели до 3,9 ГБ (1-битный вариант) или 5,9 ГБ (тернарный вариант) против 54 ГБ в 16-битной точности.
Два варианта: тернарный и 1-битный
- Тернарный Bonsai 27B: веса из набора {−1, 0, +1} с групповым масштабированием FP16, эффективно 1,71 бита на вес. Размер: 5,9 ГБ. Ориентирован на ноутбуки с полным рассуждением, вызовом инструментов и агентными возможностями.
- 1-битный Bonsai 27B: бинарные веса {−1, +1}, эффективно 1,125 бита на вес. Размер: 3,9 ГБ. Умещается в память iPhone 17 Pro.
Оба варианта выполняют всю сеть (эмбеддинги, внимание, MLP, LM head) в низкобитовом режиме — без «запасных люков» повышенной точности. Они поддерживают контекст на 262K токенов, мультимодальное зрение (4-битная башня зрения) и спекулятивное декодирование.
Результаты тестов (режим рассуждения)
По 15 тестам:
- Математика (GSM8K, MATH-500, AIME25, AIME26): Qwen 3.6 27B 95,3; тернарный 93,4; 1-битный 91,7
- Программирование (HumanEval+, MBPP+, LiveCodeBench): 88,7 → 86,0 → 81,9
- Агентность/Вызов инструментов (BFCL v3, TauBench): 80,0 → 74,0 → 66,0
- Следование инструкциям (IFEval, IFBench): 78,4 → 71,8 → 65,8
- Знания/STEM (MMLU-Redux, MuSR): 83,1 → 77,0 → 73,4
- Зрение (MMMU Pro, OCRBench): 72,6 → 65,2 → 59,6
- В среднем: 85,0 → 80,5 (сохранение 95%) → 76,1 (сохранение 90%)
Математика и программирование страдают меньше всего — это ключевые аспекты для агентных нагрузок. 1-битный вариант объёмом 3,9 ГБ меньше, чем модель с 2 млрд параметров в полной точности, но при этом обеспечивает интеллект уровня 27B.
Почему локальное выполнение важно для агентов
Агентные задачи требуют множества последовательных вызовов модели — каждый со своим контекстом и структурированным выводом. Облачное выполнение означает задержку на шаг, накопление затрат на токены и отправку личных данных (скриншотов, файлов) по сети. Локальное выполнение устраняет эти ограничения. Bonsai 27B обеспечивает на устройстве многошаговые рассуждения, вызовы инструментов и агентные циклы использования компьютера.
Лицензия и доступность
Оба варианта доступны сегодня под лицензией Apache 2.0.
📖 Источник: HN AI Agents
👀 Смотрите также

Проблемы с надежностью шлюза OpenClaw: Тихие сбои после 25 дней интенсивного использования
Подробный отчет от пользователя OpenClaw, который запускал более 18 cron-задач с интеграцией Telegram в течение 25 дней, выявил критическую проблему: шлюз переходит в «зомбифицированное» состояние — отображается как работающий, но вся функциональность замирает. Пользователь документирует конкретные проблемы, включая бессрочные блокировки записи сессий, cron-задачи, зависшие в фантомном состоянии выполнения, и тихие сбои при неверных конфигурациях.

Обновления системного промпта Claude Code 2.1.72: новые режимы выполнения и улучшения проверки
Версия Claude Code 2.1.72 представляет новые системные промпты для Авторежима (непрерывное выполнение задач) и Краткого режима (выполнение в стиле Codex), а также значительное расширение возможностей агента-специалиста по верификации с документированными паттернами сбоев и требованиями к структурированному выводу.

Snowflake увольняет сотрудников, занимающихся документацией, после обучения ИИ-замены.
Snowflake подтвердила 'целевые сокращения персонала' в командах технических писателей и документации, по данным источников, затронув примерно 400 человек. Компания в течение 8 месяцев записывала экраны сессий по документации для создания обучающих наборов данных на основе рабочих процессов старших писателей.
Нью-Йорк и Лос-Анджелес вводят строгие запреты на ИИ в школах: как это повлияет на разработчиков и EdTech
Нью-Йорк запретил ИИ в классах K-8, LAUSD ввел годичный мораторий на использование ИИ для всех учащихся. Вот что нужно знать разработчикам образовательных инструментов.