NexQuant: Rust-нативный 3-битный движок KV-кэша для развертывания на периферийных устройствах

NexQuant — это нативный движок на Rust для запуска моделей с большим контекстом на потребительском оборудовании, которое обычно испытывает проблемы с ограничениями памяти. Он позиционируется как готовый к промышленному использованию преемник исследовательского проекта TurboQuant+ Тома Тёрни.
Ключевые технические детали
- Сокращение памяти в 3–5 раз: модели на 14B теперь помещаются в 4 ГБ видеопамяти или унифицированной памяти
- Стабильность только на MSE: заменяет шумные пути QJL на стабильную траекторию только с MSE (пройдено 27/27 логических тестов)
- Интегрированная разреженность (Sparse-V): разреженность интегрирована в цикл декодирования в реальном времени, а не является лишь функцией для тестов
- Префилл без выделения памяти (Zero-Alloc Prefill): написан на 100% безопасном Rust для скорости без проблем с сегментацией прототипов на C++
- Поддержка оборудования: нативная диспетчеризация времени выполнения для Metal, CUDA и Vulkan, с поддержкой бэкендов CPU-AVX2/NEON для старых ноутбуков и Raspberry Pi
Детали реализации
Проект использует преобразования Уолша-Адамара и парсинг GGUF на Rust. Он основан на прорывах Тома Тёрни в PolarQuant/TurboQuant+, которые доказали математическую возможность 3-битных KV-кэшей. В разработке участвовал Claude (Anthropic) в качестве высокоскоростного парного программиста.
Цель — обеспечить, чтобы по мере масштабирования моделей возможность их запуска оставалась локальной и децентрализованной. Команда особенно заинтересована в отзывах о ядрах Vulkan SPIR-V.
📖 Прочитать полный источник: r/LocalLLaMA
👀 Смотрите также

Использование /probe для выявления галлюцинаций ИИ перед написанием кода
Разработчик делится техникой под названием /probe, которая заставляет ИИ-генерируемые планы делать нумерованные утверждения с ожидаемыми значениями, а затем проверяет реальную систему, чтобы выявить расхождения. Метод обнаружил четыре фактические ошибки в описании Claude собственного формата JSONL, которые могли бы вызвать баги в коде.

Rails создан для ИИ: Соглашения, Эффективность токенов и Результаты бенчмарков
Соглашения Rails дают ИИ-агентам карту, сокращая токены и повышая точность. Бенчмарк показывает OPUS-5 с точностью 92.1% и 47k токенов за запуск.

Skillware добавляет prompt_rewriter для детерминированного сжатия токенов в циклах агентов Claude API.
Skillware объединил новый навык prompt_rewriter, который сжимает промпты на 50-80% перед отправкой в Claude API, снижая затраты в агентских циклах при сохранении стабильного поведения благодаря детерминированному сжатию.

Метод квантования JANG повышает производительность MLX для больших моделей
Новый метод квантизации под названием JANG позволяет запускать большие модели, такие как MiniMax-M2.5 и Qwen 3.5, на фреймворке Apple MLX с существенно лучшей производительностью, чем стандартная квантизация MLX, достигая скоростей, близких к нативным, при сохранении точности, сопоставимой с квантизациями более высокого битрейта.