Qwen 3.6 27B достигает 2.5-кратного ускорения при спекулятивном декодировании MTP на llama.cpp

Пользователь Reddit скомпилировал llama.cpp с ожидающим PR (#22673), который включает Multi-Token Prediction (MTP) для Qwen 3.6 27B. MTP использует встроенные тензорные слои модели для спекулятивного декодирования, обеспечивая 2.5-кратное ускорение — с ~11 ток/с до 28 ток/с на Mac M2 Max 96GB.
Ключевые детали
- Модель: Qwen 3.6 27B (архитектура Qwen2.5-3.0)
- Тестируемое оборудование: Mac M2 Max 96GB
- Результаты: 28 ток/с с MTP (против ~11 ток/с без)
- Поддержка контекста: До 262K токенов с KV-кэшем turbo4 на 48GB Mac
- Квантизации: Предварительно конвертированные GGUF квантизации, загруженные пользователем на
froggeric/Qwen3.6-27B-MTP-GGUF
Инструкции по компиляции
git clone --depth 1 https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/22673/head:mtp-pr && git checkout mtp-pr
cmake -B build -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --target llama-cli llama-serverКоманда сервера
llama-server -m Qwen3.6-27B-Q5_K_M-mtp.gguf \
--mmproj mmproj-Qwen3.6-27B-f16.gguf \
--spec-type mtp --spec-draft-n-max 5 \
--cache-type-k turbo4 --cache-type-v turbo4 \
-c 262144 --temp 0.7 --top-k 20 -ngl 99 --port 8081Три оптимизации вместе:
--spec-type mtp --spec-draft-n-max 5: включает спекулятивное декодирование MTP (в 2.5 раза быстрее)--cache-type-k turbo4 --cache-type-v turbo4: KV-кэш 4.25 бит (вчетверо меньше памяти по сравнению с 16 битами)-c 262144: окно контекста 262K (помещается в 48GB с turbo4)
Рекомендации по оборудованию
Для Apple Silicon и NVIDIA GPU в источнике приведены таблицы квантизаций и KV-кэша для конфигураций с ограниченной памятью (например, IQ2_M на 16GB Apple Silicon с контекстом 48K). Поддержка зрения (mmproj) доступна на конфигурациях от 32GB.
Дополнительные исправления
Пользователь также опубликовал 7 исправлений для шаблонов чата Qwen jinja, которые были сломаны из-за форматирования vLLM. Теперь они совместимы с llama.cpp и другими инструментами.
Примечание: Существующие GGUF файлы на Hugging Face не включают поддержку MTP — их нужно переконвертировать с применённым PR. Пользователь предупреждает, что первоначальные загрузки неполны; проверьте статус репозитория на Hugging Face.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Toolport: локальный шлюз для управления MCP-серверами в одном месте для всех приложений
Toolport — это бесплатное десктопное приложение с открытым исходным кодом и локальный шлюз, который централизует конфигурации MCP-серверов, хранит API-ключи в связке ключей ОС и добавляет уровни безопасности для ИИ-агентов.

Агент ClawsifyAI обрабатывает задачи электронной почты, исследования и мозгового штурма
Разработчик тестировал ClawsifyAI, AI-агента в стиле когтевого бота, в течение недели и обнаружил, что он справляется с электронной почтой, исследованиями, рутинной работой и мозговыми штурмами. Агент предоставляет чёткую обратную связь, практические решения и иногда предлагает идеи лучше, чем изначально планировалось.

Орк: Открытый Много-Проектный Оркестратор для ИИ-Агентов в Программировании
Orc — это оркестратор уровня операционной системы, который координирует ИИ-агентов для написания кода в нескольких проектах, используя bash, tmux и git worktrees. Он решает проблемы конфликтов слияния, дублирования работы и накладных расходов на координацию с помощью двухуровневой системы проверки и нулевого расхода токенов на оркестрацию.

VibeIndex.ai: Поисковая платформа для 90K+ AI-навыков, MCP и плагинов с проверкой безопасности
Корейский исследователь ИИ создал vibeindex.ai, доступный для поиска хаб, который индексирует более 90 000 навыков ИИ, серверов MCP и плагинов с ежечасными обновлениями и проверкой безопасности с помощью Cisco Skill Scanner по 17 категориям угроз.