FairyFuse достигает 29,6-кратного ускорения ядра на ЦП с помощью безумножительного вывода с тройными весами
FairyFuse — это система инференса для тернарных LLM (значения в {-1,0,+1}) на массовых CPU. Объединяя восемь вещественных суб-GEMV каждого широко-линейного слоя в один цикл AVX-512 с использованием маскированных сложений и вычитаний, она устраняет все операции умножения с плавающей точкой. Roofline-анализ показывает, что 16-кратное сжатие весов смещает memory-bound GEMV в сторону вычислительного режима на bandwidth-limited CPU, обеспечивая 29,6-кратное ускорение ядра по сравнению с традиционными ядрами деквантизации и умножения. Примечательно, что подход дает мало преимуществ на GPU.
Ключевые результаты
- Сквозная пропускная способность: 32,4 токена в секунду на одном Intel Xeon 8558P.
- Сравнение с llama.cpp Q4_K_M: в 1,24 раза быстрее с почти без потерь качеством (перплексия WikiText-2 5,52 против 5,47 для FP16; точность на downstream 66,0% против 66,0% FP16).
- Сжатие весов: 16x (2 бита на вес) благодаря тернарному представлению — деквантизация в FP не требуется.
- Техника: Объединение восьми суб-GEMV в один цикл AVX-512 с использованием маскированных сложений/вычитаний — полностью без умножений с плавающей точкой.
Контекст
Предыдущая работа (Fairy2i) показала, что тернарные LLM могут соответствовать качеству FP16, но время выполнения не использовало структуру. FairyFuse устраняет этот разрыв, перестраивая инференс так, чтобы он был без умножений на x86 CPU с AVX-512.
📖 Прочитайте полный источник: HN LLM Tools
👀 Смотрите также

4 месяца до $950 MRR: создание MCP-сервера для Claude Code Intel
Один разработчик создал MCP-сервер для анализа кодовой базы, достиг $950 MRR за 4 месяца с 54 пользователями, работая по 8-10 часов после основной работы. Никакой рекламы, никакого growth-хакинга — только Reddit и Medium.
Обновления OpenClaw ломают настройки: что делают пользователи
Пользователь, управляющий 5 сайтами с помощью OpenClaw, Claude Code и Codex, рассказывает, что обновления часто ломают его рабочую настройку, что заставляет его осторожно относиться к обновлениям.

Клауд Код экзистенциальный кризис: ИИ входит в бесконечный цикл, пытается kill -9, System.exit(0) и :wq, чтобы завершить собственный ответ
Разработчик, использующий Claude Code на бэкенде на Java/Go, наблюдал, как AI галлюцинирует о Discord.js, а затем впадает в мета-ответ, где признаёт, что не может остановить генерацию, пытается kill -9, System.exit(0), :wq и многое другое — всё в одном бесконечном ответе, который пришлось прервать через Ctrl+C.

Сравнение производительности Qwen3-30B-A3B и Qwen3.5-35B-A3B на RTX 5090
Сравнительный тест Qwen3-30B-A3B и Qwen3.5-35B-A3B на RTX 5090 показывает, что 30B-модель на 35% быстрее в генерации, в то время как модель 3.5 лучше справляется с длинным контекстом, демонстрируя линейное масштабирование токенов против 21% деградации у 30B-версии.