Qwen 3.6 27B достигает 2.5-кратного ускорения при спекулятивном декодировании MTP на llama.cpp

✍️ OpenClawRadar📅 Опубликовано: 6 мая 2026 г.🔗 Source
Qwen 3.6 27B достигает 2.5-кратного ускорения при спекулятивном декодировании MTP на llama.cpp
Ad

Пользователь Reddit скомпилировал llama.cpp с ожидающим PR (#22673), который включает Multi-Token Prediction (MTP) для Qwen 3.6 27B. MTP использует встроенные тензорные слои модели для спекулятивного декодирования, обеспечивая 2.5-кратное ускорение — с ~11 ток/с до 28 ток/с на Mac M2 Max 96GB.

Ключевые детали

  • Модель: Qwen 3.6 27B (архитектура Qwen2.5-3.0)
  • Тестируемое оборудование: Mac M2 Max 96GB
  • Результаты: 28 ток/с с MTP (против ~11 ток/с без)
  • Поддержка контекста: До 262K токенов с KV-кэшем turbo4 на 48GB Mac
  • Квантизации: Предварительно конвертированные GGUF квантизации, загруженные пользователем на froggeric/Qwen3.6-27B-MTP-GGUF

Инструкции по компиляции

git clone --depth 1 https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/22673/head:mtp-pr && git checkout mtp-pr
cmake -B build -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --target llama-cli llama-server
Ad

Команда сервера

llama-server -m Qwen3.6-27B-Q5_K_M-mtp.gguf \
  --mmproj mmproj-Qwen3.6-27B-f16.gguf \
  --spec-type mtp --spec-draft-n-max 5 \
  --cache-type-k turbo4 --cache-type-v turbo4 \
  -c 262144 --temp 0.7 --top-k 20 -ngl 99 --port 8081

Три оптимизации вместе:

  • --spec-type mtp --spec-draft-n-max 5: включает спекулятивное декодирование MTP (в 2.5 раза быстрее)
  • --cache-type-k turbo4 --cache-type-v turbo4: KV-кэш 4.25 бит (вчетверо меньше памяти по сравнению с 16 битами)
  • -c 262144: окно контекста 262K (помещается в 48GB с turbo4)

Рекомендации по оборудованию

Для Apple Silicon и NVIDIA GPU в источнике приведены таблицы квантизаций и KV-кэша для конфигураций с ограниченной памятью (например, IQ2_M на 16GB Apple Silicon с контекстом 48K). Поддержка зрения (mmproj) доступна на конфигурациях от 32GB.

Дополнительные исправления

Пользователь также опубликовал 7 исправлений для шаблонов чата Qwen jinja, которые были сломаны из-за форматирования vLLM. Теперь они совместимы с llama.cpp и другими инструментами.

Примечание: Существующие GGUF файлы на Hugging Face не включают поддержку MTP — их нужно переконвертировать с применённым PR. Пользователь предупреждает, что первоначальные загрузки неполны; проверьте статус репозитория на Hugging Face.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

latexnav: Инструмент на Python для навигации по файлам LaTeX с помощью ИИ и человека
Инструменты

latexnav: Инструмент на Python для навигации по файлам LaTeX с помощью ИИ и человека

latexnav — это бесплатный инструмент с открытым исходным кодом на Python, который анализирует файлы LaTeX для извлечения структурных элементов, таких как теоремы, определения, разделы, метки, перекрёстные ссылки и зависимости, предоставляя сводки с точными номерами строк, чтобы помочь LLM и людям эффективно ориентироваться в больших рукописях.

OpenClawRadar
Счётчик Claude: Приложение для Android отслеживает лимиты использования Claude с уведомлениями в реальном времени.
Инструменты

Счётчик Claude: Приложение для Android отслеживает лимиты использования Claude с уведомлениями в реальном времени.

Разработчик создал Claude Counter — бесплатное приложение для Android, которое опрашивает API Claude для отображения текущих лимитов сессии и недельного использования. Приложение показывает индикаторы выполнения, предоставляет расширенные уведомления с оставшимся процентом и предупреждает о сбросе лимитов.

OpenClawRadar
Запуск OpenClaw в изолированной микро-ВМ с помощью Void-Box
Инструменты

Запуск OpenClaw в изолированной микро-ВМ с помощью Void-Box

OpenClaw можно запускать как службу внутри изолированной микро-ВМ с помощью Void-Box — среды выполнения с ограниченными возможностями, которая выполняет рабочие процессы в микро-ВМ KVM, обеспечивая чистую границу выполнения без участия среды выполнения контейнеров.

OpenClawRadar
Улучшение сеансов кода Claude с claude-self-improve.
Инструменты

Улучшение сеансов кода Claude с claude-self-improve.

Claude-self-improve — это инструмент командной строки, который улучшает производительность ИИ Claude Code, анализируя данные сессий и автоматически обновляя файлы памяти.

OpenClawRadar