Qwen 3.6 27B достигает 2.5-кратного ускорения при спекулятивном декодировании MTP на llama.cpp

Пользователь Reddit скомпилировал llama.cpp с ожидающим PR (#22673), который включает Multi-Token Prediction (MTP) для Qwen 3.6 27B. MTP использует встроенные тензорные слои модели для спекулятивного декодирования, обеспечивая 2.5-кратное ускорение — с ~11 ток/с до 28 ток/с на Mac M2 Max 96GB.
Ключевые детали
- Модель: Qwen 3.6 27B (архитектура Qwen2.5-3.0)
- Тестируемое оборудование: Mac M2 Max 96GB
- Результаты: 28 ток/с с MTP (против ~11 ток/с без)
- Поддержка контекста: До 262K токенов с KV-кэшем turbo4 на 48GB Mac
- Квантизации: Предварительно конвертированные GGUF квантизации, загруженные пользователем на
froggeric/Qwen3.6-27B-MTP-GGUF
Инструкции по компиляции
git clone --depth 1 https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/22673/head:mtp-pr && git checkout mtp-pr
cmake -B build -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --target llama-cli llama-serverКоманда сервера
llama-server -m Qwen3.6-27B-Q5_K_M-mtp.gguf \
--mmproj mmproj-Qwen3.6-27B-f16.gguf \
--spec-type mtp --spec-draft-n-max 5 \
--cache-type-k turbo4 --cache-type-v turbo4 \
-c 262144 --temp 0.7 --top-k 20 -ngl 99 --port 8081Три оптимизации вместе:
--spec-type mtp --spec-draft-n-max 5: включает спекулятивное декодирование MTP (в 2.5 раза быстрее)--cache-type-k turbo4 --cache-type-v turbo4: KV-кэш 4.25 бит (вчетверо меньше памяти по сравнению с 16 битами)-c 262144: окно контекста 262K (помещается в 48GB с turbo4)
Рекомендации по оборудованию
Для Apple Silicon и NVIDIA GPU в источнике приведены таблицы квантизаций и KV-кэша для конфигураций с ограниченной памятью (например, IQ2_M на 16GB Apple Silicon с контекстом 48K). Поддержка зрения (mmproj) доступна на конфигурациях от 32GB.
Дополнительные исправления
Пользователь также опубликовал 7 исправлений для шаблонов чата Qwen jinja, которые были сломаны из-за форматирования vLLM. Теперь они совместимы с llama.cpp и другими инструментами.
Примечание: Существующие GGUF файлы на Hugging Face не включают поддержку MTP — их нужно переконвертировать с применённым PR. Пользователь предупреждает, что первоначальные загрузки неполны; проверьте статус репозитория на Hugging Face.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

latexnav: Инструмент на Python для навигации по файлам LaTeX с помощью ИИ и человека
latexnav — это бесплатный инструмент с открытым исходным кодом на Python, который анализирует файлы LaTeX для извлечения структурных элементов, таких как теоремы, определения, разделы, метки, перекрёстные ссылки и зависимости, предоставляя сводки с точными номерами строк, чтобы помочь LLM и людям эффективно ориентироваться в больших рукописях.

Счётчик Claude: Приложение для Android отслеживает лимиты использования Claude с уведомлениями в реальном времени.
Разработчик создал Claude Counter — бесплатное приложение для Android, которое опрашивает API Claude для отображения текущих лимитов сессии и недельного использования. Приложение показывает индикаторы выполнения, предоставляет расширенные уведомления с оставшимся процентом и предупреждает о сбросе лимитов.

Запуск OpenClaw в изолированной микро-ВМ с помощью Void-Box
OpenClaw можно запускать как службу внутри изолированной микро-ВМ с помощью Void-Box — среды выполнения с ограниченными возможностями, которая выполняет рабочие процессы в микро-ВМ KVM, обеспечивая чистую границу выполнения без участия среды выполнения контейнеров.

Улучшение сеансов кода Claude с claude-self-improve.
Claude-self-improve — это инструмент командной строки, который улучшает производительность ИИ Claude Code, анализируя данные сессий и автоматически обновляя файлы памяти.