Метод квантования JANG повышает производительность MLX для больших моделей

Разрыв в производительности между квантизациями MLX и GGUF
В источнике обсуждается значительная проблема производительности стандартных методов квантизации MLX для больших языковых моделей. На бенчмарке MMLU (200 вопросов) модель MiniMax-M2.5, квантизированная до 4-бит для MLX, набрала всего 26,5% (53/200), в то время как та же модель, квантизированная методом JANG_2S, набрала 74% (148/200). Метод JANG превзошёл все уровни квантизации MLX (2-бит, 3-бит и 4-бит), которые все показали результат, близкий к случайному угадыванию, примерно 25%.
Конкретные результаты бенчмарков
Детальный разбивка по предметам MMLU показывает, что JANG_2L последовательно превосходит квантизации MLX:
- Абстрактная алгебра: JANG_2L 10/20 против MLX 4-бит 3/20
- Астрономия: JANG_2L 20/20 против MLX 4-бит 7/20
- Колледж CS: JANG_2L 13/20 против MLX 4-бит 4/20
- Биология для старшей школы: JANG_2L 18/20 против MLX 4-бит 4/20
Выявленная основная причина низкой производительности MLX заключается в том, что "MLX генерирует мета-комментарии вместо прямых ответов на этой модели".
Сравнение размеров моделей и производительности
Для модели Qwen 3.5 122B:
- JANG_4K: 86% балл MMLU, размер 69 ГБ
- MLX 4-бит: 85% балл MMLU, размер 64 ГБ
- JANG_2S: 79% балл MMLU, размер 38 ГБ
- MLX 2-бит: 56,5% балл MMLU, размер 36 ГБ
Автор отмечает, что "Люди жертвуют скоростью чипа M ради связности, при этом на MLX нет эквивалента GGUF" и что "Qwen 3.5 на Mac при использовании GGUF также на треть медленнее, чем на MLX".
Проблема генерации кода в MiniMax-M2.5
Из упомянутых бенчмарков: "MiniMax-M2.5 не умеет писать код — 10% на HumanEval+, несмотря на 87% вызова инструментов и 80% логики. Что-то не так с форматом генерации её кода. Отлично подходит для логических рассуждений."
Доступность и реализация
В настоящее время доступен через:
- MLX Studio: https://mlx.studio/ — имеет нативный движок вывода JANG_Q
- Репозиторий: Для самостоятельной установки и квантизации моделей
Метод позволяет запускать такие модели, как MiniMax-M2.5, с "эквивалентом 2-бит MLX, получая результаты тестов, которые ранее на MLX были невозможны".
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Клавдетоп: Мониторинг затрат в реальном времени для сессий работы с кодом в Claude
Claudetop — это инструмент, похожий на htop, который показывает расходы в реальном времени, эффективность кэширования и сравнение моделей для сессий Claude Code. Он предоставляет слэш-команды, такие как /claudetop:stats, и умные уведомления о достижении стоимостных вех и проблемах с эффективностью.

Quanta-SDK версии 0.9.2 добавляет MCP-сервер для выполнения квантовых схем через AI-агентов.
Quanta-SDK v0.9.2 теперь включает MCP-сервер (Model Context Protocol), который предоставляет ИИ-агентам, таким как Claude или GPT, инструменты для выполнения и интерпретации квантовых схем. Сервер предлагает более 20 инструментов, включая выполнение схем на оборудовании IBM, интерпретацию результатов, анализ шумов и квантовое ценообразование в финансах.

CC-Wiki: Превратите сессии Claude Code в общедоступную базу знаний Quartz
CC-Wiki преобразует историю сессий ~/.claude в базу знаний на основе Quartz. Установка одной командой; запуск /cc-wiki внутри сессии Claude Code упаковывает беседу.

TRELLIS.2 Image-to-3D адаптирован для нативной работы на Apple Silicon.
Разработчик портировал 4-миллиардную параметрическую модель TRELLIS.2 от Microsoft для преобразования изображений в 3D, чтобы она работала нативно на Apple Silicon через PyTorch MPS, заменив операции, специфичные для CUDA, на чисто PyTorch-альтернативы. Порт генерирует меши с ~400K вершин из одиночных фотографий примерно за 3,5 минуты на M4 Pro с 24 ГБ памяти.