Протестированы 1-битные модели Qwen от PrismML Bonsai: генерация 107 токенов в секунду на 8 ГБ видеопамяти.

Модели Bonsai: 1-битное квантование Qwen от PrismML
PrismML выпустила Bonsai — набор 1-битных квантованных версий моделей Qwen3 (8B, 4B и 1.7B параметров). Эти модели используют экстремальное квантование для радикального снижения требований к памяти при сохранении приемлемой производительности для определённых задач.
Результаты тестирования производительности
Тестирование на RTX 4060 с 8 ГБ видеопамяти показало:
- Скорость генерации 107 токенов в секунду
- Обработка промптов >1114 токенов в секунду
- Значительно меньшее использование оперативной памяти по сравнению с моделями с Q4-квантованием
Для сравнения, Qwen 3.5 4B Q4 показала 56 т/с на тех же промптах и том же оборудовании.
Практические последствия
Сниженные требования к памяти позволяют запускать модели с 8B параметров на системах с 8 ГБ видеопамяти. Меньшие модели можно использовать с более длинными контекстными окнами благодаря экономии памяти.
Оценка качества
Первоначальное тестирование было сосредоточено на суммировании текста, где модель показала хорошие результаты. Тестировщик отметил, что не оценивал возможности программирования или использования инструментов.
Технические ограничения
Текущая реализация имеет проблемы с выводом на CPU. При тестировании на мини-ПК без GPU:
- Форк llama.cpp успешно компилируется
- Модель загружается, но зависает при обработке промптов
- Анализ предполагает отсутствие реализации для CPU — вероятно, происходит деквантование в FP32 и попытка обычного вывода, что было бы крайне медленно на CPU
Технический потенциал
1-битные модели могут снизить не только требования к пропускной способности и памяти, но и к вычислительным ресурсам. Умножение матриц на 1-битных матрицах может использовать операции XOR, которые значительно быстрее операций с плавающей запятой. Даже с масштабированием до FP16 после операций XOR возможна значительная экономия вычислений, что потенциально может принести пользу сценариям вывода только на CPU и периферийным вычислениям.
Детали настройки
Тестировщик загрузил:
- Модель Bonsai 8B
- Форк llama.cpp от PrismML
- Тестировал на Windows с CUDA
📖 Прочитать полный источник: r/LocalLLaMA
👀 Смотрите также

Сотрудники Amazon высмеивают ИИ компании в Slack, называя его «Слоппенгеймер»
У сотрудников Amazon есть Slack-канал для мемов, высмеивающих неисправный ИИ-инструмент для кодирования компании: его результаты называют «помоями», а также шутят о неудачных попытках мотивации использования ИИ.
Обнаруженные материалы: ИИ-агенты открывают более 500 новых материалов, но только у одного есть реальный путь синтеза
Discovered Materials (YC P26) использовала передовые LLM для вычислительного поиска более 500 новых полупроводниковых материалов. Только один имеет реальный путь синтеза, что подчеркивает разрыв между лабораторией и производством.

Автоисследование позволяет достичь скорости 20.34 токен/с на Qwen3.5-397B на M5 Max с использованием потоковой передачи с SSD.
Разработчик достиг скорости вывода 20,34 токенов/сек для модели Qwen3.5-397B объемом 209 ГБ на MacBook Pro M5 Max с 128 ГБ оперативной памяти, используя потоковую передачу с SSD и 36 систематических экспериментов. Результат демонстрирует ускорение в 2 раза по сравнению с базовым показателем M5 Max и в 4,67 раза по сравнению с исходным результатом на M3 Max.

ИИ-агенты убивают ревью кода — объяснение проблемы «принципал-агент»
Внедрение AI-агентов в традиционный процесс проверки кода удваивает нагрузку на ревью, разрушает сигналы доверия и создает неустойчивый дисбаланс — это проблема принципала-агента в применении к разработке ПО.