FairyFuse достигает 29,6-кратного ускорения ядра на ЦП с помощью безумножительного вывода с тройными весами
FairyFuse — это система инференса для тернарных LLM (значения в {-1,0,+1}) на массовых CPU. Объединяя восемь вещественных суб-GEMV каждого широко-линейного слоя в один цикл AVX-512 с использованием маскированных сложений и вычитаний, она устраняет все операции умножения с плавающей точкой. Roofline-анализ показывает, что 16-кратное сжатие весов смещает memory-bound GEMV в сторону вычислительного режима на bandwidth-limited CPU, обеспечивая 29,6-кратное ускорение ядра по сравнению с традиционными ядрами деквантизации и умножения. Примечательно, что подход дает мало преимуществ на GPU.
Ключевые результаты
- Сквозная пропускная способность: 32,4 токена в секунду на одном Intel Xeon 8558P.
- Сравнение с llama.cpp Q4_K_M: в 1,24 раза быстрее с почти без потерь качеством (перплексия WikiText-2 5,52 против 5,47 для FP16; точность на downstream 66,0% против 66,0% FP16).
- Сжатие весов: 16x (2 бита на вес) благодаря тернарному представлению — деквантизация в FP не требуется.
- Техника: Объединение восьми суб-GEMV в один цикл AVX-512 с использованием маскированных сложений/вычитаний — полностью без умножений с плавающей точкой.
Контекст
Предыдущая работа (Fairy2i) показала, что тернарные LLM могут соответствовать качеству FP16, но время выполнения не использовало структуру. FairyFuse устраняет этот разрыв, перестраивая инференс так, чтобы он был без умножений на x86 CPU с AVX-512.
📖 Прочитайте полный источник: HN LLM Tools
👀 Смотрите также

Пользователь Reddit делится странной историей о переносе личности ИИ из статьи Vanity Fair.
В посте на Reddit обсуждается анекдот из статьи Vanity Fair, где женщина попыталась перенести своего ИИ-компаньона 'Макса' из ChatGPT в Claude, что привело к неожиданному поведению Claude.

Перспективы проекта Rust в области ИИ: практические взгляды от участников проекта
Сводный документ собирает мнения участников проекта Rust об использовании инструментов ИИ, подчеркивая, что эффективная интеграция ИИ требует тщательной инженерии, и демонстрируя конкретные примеры использования, такие как навигация по кодовой базе, помощь в ревью кода и обработка полуструктурированных данных.

Xiaomi открыла исходный код MiMo-V2.5-Pro: приближается к Claude Opus 4.6 по бенчмаркам кодинга
Xiaomi выпустил MiMo-V2.5-Pro — модель с открытым исходным кодом, которая набрала 233/233 на университетском проекте компилятора, самостоятельно создала видеоредактор и занимает место в 1% от Claude Opus 4.6 по бенчмаркам SWE-Bench и Terminal-Bench.

Claude Code v2.1.193: Новая классификация оболочек, телеметрия и исправления
Claude Code v2.1.193 добавляет autoMode.classifyAllShell для маршрутизации всех команд через классификатор, новые события OpenTelemetry, автодополнение путей в bash и исправления для фоновых агентов и авторизации MCP.