1-битное бонсай-изображение 4B: генерация изображений на устройстве с помощью двоичного/троичного FLUX.2

✍️ OpenClawRadar📅 Опубликовано: 1 июня 2026 г.🔗 Source
1-битное бонсай-изображение 4B: генерация изображений на устройстве с помощью двоичного/троичного FLUX.2
Ad

Компания PrismML выпустила Bonsai Image 4B — семейство компактных моделей генерации изображений на основе FLUX.2 Klein 4B с использованием бинарного и тернарного квантования. Веса диффузионного трансформера представлены в виде {−1, +1} (1-бит) или {−1, 0, +1} (тернарный) с групповыми масштабирующими коэффициентами FP16, что дает 1,125 и 1,71 эффективных бита на вес соответственно.

Ключевые характеристики

  • 1-битный Bonsai Image 4B: размер трансформера 0,93 ГБ (сжатие в 8,3 раза по сравнению с 7,75 ГБ FP16 FLUX.2 Klein 4B). Нагрузка на Apple Silicon (включая сжатый текстовый энкодер + FP16 VAE) составляет 3,42 ГБ.
  • Тернарный Bonsai Image 4B: размер трансформера 1,21 ГБ (сжатие в 6,4 раза). Нагрузка на Apple Silicon составляет 3,88 ГБ.
  • Средняя активная память для генерации 512×512: 1,5 ГБ (1-бит) / 1,96 ГБ (тернарный) против 11,74 ГБ для исходного FLUX.2 Klein 4B.
  • Для 1024×1024: 1,95 ГБ / 2,38 ГБ против 14,39 ГБ.
Ad

Производительность

Модель работает на Apple Silicon (iPhone, iPad, Mac) через низкобитные пути MLX и на графических процессорах CUDA через низкобитные ядра Gemlite. Время генерации:

  • iPhone 17 Pro Max: 9,4 секунды для изображения 512×512
  • Mac M4 Pro: ~6 секунд для изображения 512×512 (до 5,6× быстрее, чем стандартный полный конвейер MFLUX)

Сжатие трансформера достигается за счет бинарных/тернарных слоев (~14× / ~10× сжатие относительно FP16), в то время как небольшой набор чувствительных к точности проекционных слоев (~5%) остается в FP16. Модель оценивается на GenEval, HPSv3 и DPG-Bench по качеству и верности подсказкам.

Для кого это предназначено

Разработчиков, развертывающих генерацию изображений на устройствах (ноутбуки, телефоны, периферийные устройства), которым нужны открытые веса и практический локальный вывод без зависимости от облака.

📖 Источник: HN LLM Tools

Ad

👀 Смотрите также

Почему активирующее управление Anthropic испытывает трудности с генерацией корректного JSON
Новости

Почему активирующее управление Anthropic испытывает трудности с генерацией корректного JSON

Метод активации управления, используемый для безопасности ИИ, не способен генерировать действительный JSON, достигая лишь 24,4% валидности по сравнению с 86,8% у необученной базовой модели.

OpenClawRadar
Claude Code v2.1.203: Основное исправление ошибок с восстановлением фоновых сессий и улучшением производительности
Новости

Claude Code v2.1.203: Основное исправление ошибок с восстановлением фоновых сессий и улучшением производительности

Claude Code v2.1.203 исправляет зависания фоновых сессий на macOS, восстановление после истечения токена, проблемы с наследованием PATH и уменьшает размер бинарного файла на 7 МБ с экономией памяти при запуске.

OpenClawRadar
Исследование ETH Zurich: Избыточный контекст снижает производительность ИИ-агентов для программирования
Новости

Исследование ETH Zurich: Избыточный контекст снижает производительность ИИ-агентов для программирования

Исследование ETH Zurich протестировало четырех кодирующих агентов на 138 реальных задачах GitHub и обнаружило, что контекстные файлы, сгенерированные LLM, снизили успешность выполнения задач на 2-3%, при этом увеличив затраты на вывод на 20%. Контекст, написанный человеком, улучшил успешность лишь примерно на 4% при значительном росте затрат.

OpenClawRadar
ИИ-агенты убивают ревью кода — объяснение проблемы «принципал-агент»
Новости

ИИ-агенты убивают ревью кода — объяснение проблемы «принципал-агент»

Внедрение AI-агентов в традиционный процесс проверки кода удваивает нагрузку на ревью, разрушает сигналы доверия и создает неустойчивый дисбаланс — это проблема принципала-агента в применении к разработке ПО.

OpenClawRadar