Qwen 3.6 27B с MTP на V100 32GB: 54 т/с через ветку llama.cpp

✍️ OpenClawRadar📅 Опубликовано: 6 мая 2026 г.🔗 Source
Qwen 3.6 27B с MTP на V100 32GB: 54 т/с через ветку llama.cpp
Ad

Пользователь на r/LocalLLaMA сообщает о впечатляющих результатах запуска Qwen 3.6 27B с Multi-Token Prediction (MTP) на модуле V100 32GB SXM через адаптер PCIe. В настройке используется ветка MTP от am17an для llama.cpp и соответствующий GGUF квантизатор MTP. Ключевые характеристики: KV-кэш Q8_0 с лимитом в 200k, работа в качестве бэкенда VS Code Copilot через llama-server.

Производительность

  • Без MTP: 29-30 токенов/секунду
  • С MTP: 54-55 токенов/секунду (при ограничении мощности 150 Вт)
  • После 50k токенов контекста: падает до 40-45 т/с

Ветка: MTP-форк am17an. Сборка и запуск были простыми — "скачал и собрал за один раз" с llama-server, работающим без проблем. Настройка хорошо справляется с вызовами инструментов и под-агентами, а также выдала "очень содержательные рецензии кода и рефакторинг", несмотря на ограничение VRAM (32 ГБ).

Это особенно актуально для разработчиков, запускающих LLM на старом датацентровом оборудовании, таком как V100. MTP фактически удваивает пропускную способность для этой модели, демонстрируя практические преимущества для задач ассистента кодирования.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Clawdwatch: инструмент с открытым исходным кодом для отслеживания полётов в реальном времени, сбора новостей и оповещений (OSINT)
Инструменты

Clawdwatch: инструмент с открытым исходным кодом для отслеживания полётов в реальном времени, сбора новостей и оповещений (OSINT)

Clawdwatch — это CLI-инструмент, который получает данные о полётах в реальном времени из OpenSky Network, собирает новости с Al Jazeera и AP и может отправлять оповещения в Telegram о военных самолётах или аварийных сигналах. Он работает локально после установки через npm и отслеживает более 204 рейсов над Ближним Востоком в реальном времени.

OpenClawRadar
BaseLayer: Открытый Конвейер Поведенческого Сжатия для Систем Памяти ИИ
Инструменты

BaseLayer: Открытый Конвейер Поведенческого Сжатия для Систем Памяти ИИ

BaseLayer — это открытый конвейер, который извлекает убеждения, поведение, противоречия и напряжения из разговоров, дневников и опубликованных текстов, сжимая их в краткое описание идентичности для ИИ-моделей. Он был протестирован на наборах данных от 8 личных дневниковых записей до крупных корпусов, таких как письма акционерам Уоррена Баффета (350 тыс. слов) и инвестиционные меморандумы Говарда Маркса (600 тыс. слов).

OpenClawRadar
🦀
Инструменты

Gigacatalyst: Встройте ИИ-конструктор в ваш SaaS, чтобы пользователи могли создавать собственные рабочие процессы

Gigacatalyst позволяет встроить конструктор приложений на базе ИИ в ваш SaaS. Нетехнические пользователи описывают рабочие процессы на естественном языке, а система генерирует управляемые приложения, используя ваши API, модель данных и дизайн-систему — со встроенными аутентификацией, изоляцией клиентов и управлением версиями.

OpenClawRadar
Phalanx CLI координирует работу нескольких ИИ-агентов для автоматизации циклов ревью кода.
Инструменты

Phalanx CLI координирует работу нескольких ИИ-агентов для автоматизации циклов ревью кода.

Разработчик создал Phalanx — инструмент командной строки, который координирует работу ИИ-агентов от разных провайдеров: Codex занимается написанием кода, Claude Opus выполняет код-ревью, а Claude Sonnet управляет циклом. Вспомогательный инструмент Codebones сжимает репозитории в структурные карты для снижения расхода токенов.

OpenClawRadar