Модель Bonsai 1.7B с троичным представлением достигает 442 T/s на M4 Max благодаря автономно настроенным ядрам Metal

Bonsai 1.7B — тернарная модель от PrismML — была оптимизирована для Apple Silicon с использованием автономно настроенных Metal-ядер. Работу выполнил ata, автономный инженерный агент от Agents2Agents, который в течение 6 часов проводил эволюционный поиск для создания пользовательских GPU-ядер.
Результаты тестов
Измерено относительно исходного llama.cpp на той же версии Bonsai/Q2_0 на M4 Max (один и тот же файл модели, та же конфигурация llama-bench -p 512 -n 128 -r 10 -fa 1 -ngl 99):
- Декодирование (tg128): 311,66 → 442,42 т/с (+42,0%)
- Префилл (pp512): 4250,32 → 4622,63 т/с (+8,8%)
Для контекста: в техническом описании Bonsai 8B сообщается о скорости декодирования MLX-upstream Q2_0 в 235 т/с на Apple Silicon. Эта сборка достигает 442 т/с на варианте 1.7B благодаря пользовательским Metal-ядрам (другой фреймворк, меньшая модель — ориентировочно указывает на резервы в стеке).
Что включено
Сборка представляет собой готовый пакет оптимизированного вывода для M-серии Mac (только arm64). Внутри 358 МБ tar.xz:
chat.sh— интерактивный REPLcomplete.sh— неинтерактивное завершениеbench.sh— воспроизведение тестовserver.sh— HTTP API, совместимый с OpenAI, на :8080Bonsai-1.7B-Q2_0.gguf— файл модели (442 МБ)
Быстрый старт
tar -xJf bonsai-1.7b-ternary-M4Max.tar.xz
cd bonsai-1.7b-ternary-M4Max
./chat.shТехнические детали
Каждое Metal-ядро было создано и настроено ata без участия человека. Работа была сосредоточена на пользовательских GPU-ядрах на уровне matvec / FFN / KV-кэша, специализированных по форме для пути декодирования Bonsai 1.7B Q2_0. Численные результаты совпадают с эталонной сборкой (проверено совпадение top-1 токена). Протестировано на M4 Max; пропорциональный прирост ожидается на M1+.
Ограничения
- Только Apple Silicon (arm64) — нет сборок для Intel Mac или только для CPU.
- Цифры с M4 Max; на M1/M2/M3 будут ниже из-за меньшей пропускной способности памяти.
- Модель квантована до Q2_0 — небольшое отклонение точности от F16.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Анализ Пользовательского соглашения Claude: Хранение данных, ограничение ответственности и прекращение обслуживания
Анализ Пользовательского соглашения Anthropic раскрывает ключевые детали для подписчиков плана Max за $100 в месяц: обучение на данных включено по умолчанию с хранением в течение 5 лет для согласившихся пользователей, ответственность ограничена максимум $600, а услуга может быть прекращена без возврата средств за нарушения.

Результаты исследований по надежности ИИ-агентов и моделям их развития
Совместный исследовательский сеанс с Claude Opus, в ходе которого были проанализированы 15 статей об ИИ-агентах, выявил количественные проблемы надежности: агенты генерируют 2-4 различных последовательности действий за 10 запусков, причем 69% расхождений происходит при первом же решении. Самообучающиеся агенты продемонстрировали снижение уровня отказов по соображениям безопасности с 99,4% до 54,4% благодаря собственному обучению.
各国政府正重金押注人工智能——《经济学人》警告风险
The Economist утверждает, что правительства делают опасную ставку на бум ИИ, рискуя экономическими иsecurity pitfalls. Ключевые опасения: чрезмерная зависимость от технологических гигантов, поспешное регулирование и потенциальное перемещение рабочих мест.

В утечке кода Claude обнаружена скрытая система питомцев: механика гача с ASCII-анимациями.
Анализ утекшего кода Claude Code раскрывает скрытую систему питомцев-компаньонов с 18 видами, уровнями редкости и ASCII-анимациями. Система использует детерминированное хеширование ID пользователей для генерации уникальных питомцев без хранения данных о видах.