Qwen 3.6 27B с MTP на V100 32GB: 54 т/с через ветку llama.cpp

Пользователь на r/LocalLLaMA сообщает о впечатляющих результатах запуска Qwen 3.6 27B с Multi-Token Prediction (MTP) на модуле V100 32GB SXM через адаптер PCIe. В настройке используется ветка MTP от am17an для llama.cpp и соответствующий GGUF квантизатор MTP. Ключевые характеристики: KV-кэш Q8_0 с лимитом в 200k, работа в качестве бэкенда VS Code Copilot через llama-server.
Производительность
- Без MTP: 29-30 токенов/секунду
- С MTP: 54-55 токенов/секунду (при ограничении мощности 150 Вт)
- После 50k токенов контекста: падает до 40-45 т/с
Ветка: MTP-форк am17an. Сборка и запуск были простыми — "скачал и собрал за один раз" с llama-server, работающим без проблем. Настройка хорошо справляется с вызовами инструментов и под-агентами, а также выдала "очень содержательные рецензии кода и рефакторинг", несмотря на ограничение VRAM (32 ГБ).
Это особенно актуально для разработчиков, запускающих LLM на старом датацентровом оборудовании, таком как V100. MTP фактически удваивает пропускную способность для этой модели, демонстрируя практические преимущества для задач ассистента кодирования.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также
Spine Swarm: Многокомпонентная ИИ-система на визуальном холсте для некодинговых проектов
Spine Swarm — это мультиагентная система, работающая на бесконечном визуальном холсте для выполнения сложных некодирующих проектов, таких как конкурентный анализ, финансовое моделирование, SEO-аудиты, презентации и интерактивные прототипы. Система использует блоки как абстракции поверх AI-моделей, которые можно соединять для передачи контекста между различными типами моделей.

10.33 т/с на Qwen 3.5 35B с ноутбуком за $300: Полный разбор оптимизации
Разработчик достигает 10,33 т/с на Qwen 3.5 35B Q4_K_S на ноутбуке Lenovo Ideapad Slim 3i за $300 с использованием ik_llama.cpp, привязки ядер, спекулятивного декодирования MTP и оптимизации BIOS.

Фемтобот: Эффективный агент на Rust для среды с низкими ресурсами
Femtobot — это легкий AI-агент на основе Rust, разработанный для эффективной работы на малоресурсных машинах, таких как старые Raspberry Pi, с помощью бинарного файла объемом около 10 МБ без крупных зависимостей во время выполнения.

agentcache: Библиотека Python для кэширования префиксов в мультиагентных LLM
agentcache — это библиотека Python, которая позволяет многозадачным LLM-фреймворкам совместно использовать кэшированные префиксы промптов, достигая до 76% попаданий в кэш и сокращая время вывода более чем вдвое в тестах с GPT-4o-mini.