MTP + Unified Memory повышает производительность вывода llama.cpp на 30% на RTX 5090

✍️ OpenClawRadar📅 Опубликовано: 12 мая 2026 г.🔗 Source
Ad

Комбинация GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 с многотокенным прогнозированием (MTP) в llama.cpp дает прирост пропускной способности примерно на 30% — 64 ток/сек против 49 ток/сек на модели Qwen3.6-27B Q8_0. Тест проводился на RTX 5090 в паре с 128 ГБ DDR5 5600 CL36 и Ryzen 9 9950X3D.

Команда и конфигурация

CUDA_VISIBLE_DEVICES=0 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 /home/marcin/llama-server \
    -m /home/marcin/Pobrane/Qwen3.6-27B-Q8_0.gguf \
    --threads 16 \
    -c 262144 -fa on -np 1 \
    --spec-type mtp --spec-draft-n-max 3 \
    --webui-mcp-proxy \
    --chat-template-kwargs '{"preserve_thinking": true}' \
    --host 0.0.0.0 \
    --port 8090 \
    --jinja

Ключевые флаги:

  • GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 — позволяет GPU напрямую обращаться к памяти хоста, минуя CUDA malloc для больших контекстов.
  • --spec-type mtp --spec-draft-n-max 3 — включает спекуляцию с многотокенным прогнозированием с глубиной черновика 3.
  • Qwen3.6-27B-Q8_0.gguf — модель Qwen3.6 с 27B параметрами, квантованная до Q8_0, подготовленная с поддержкой MTP от Unsloth.
  • -c 262144 — окно контекста 256K; -fa on для flash attention.
Ad

Результаты

  • Без MTP (только unified memory): 49 ток/сек
  • С MTP + unified memory: 64 ток/сек
  • Прирост: на 30% выше пропускная способность

Параметр draft-n-max равный 3 означает, что модель предсказывает до 3 токенов вперед, уменьшая накладные расходы на последовательное декодирование. В сочетании с unified memory избегаются дорогие передачи по PCIe между CPU и GPU.

Для кого это

Разработчики, запускающие локальный инференс с большим контекстом на высокопроизводительных потребительских GPU (RTX 5090) с достаточным объемом системной памяти (≥128 ГБ). Подходит для чат-ботов, ассистентов кода или любых задач LLM, чувствительных к задержкам, где поддерживается спекулятивная выборка.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Claude Ops: Панель мониторинга браузера для отслеживания статуса Claude Code в реальном времени и суб-агентов
Инструменты

Claude Ops: Панель мониторинга браузера для отслеживания статуса Claude Code в реальном времени и суб-агентов

Бесплатная локальная панель мониторинга для macOS, которая отслеживает текущий статус сеансов Claude Code, используемый инструмент, порождённые подагенты и отправляет push-уведомления ОС, когда требуется ввод.

OpenClawRadar
AutoDream: 11-хуковая система памяти для Claude Code с функциями безопасности
Инструменты

AutoDream: 11-хуковая система памяти для Claude Code с функциями безопасности

AutoDream — это инструмент с открытым исходным кодом, который добавляет постоянную память проекта и безопасность команд в Claude Code. Он использует 11 хуков на 6 событиях для внедрения контекста, блокировки опасных команд и сохранения работы после операции /compact.

OpenClawRadar
obsidian-mcp: графически-осведомленный MCP-сервер для Claude с 25 инструментами для больших хранилищ
Инструменты

obsidian-mcp: графически-осведомленный MCP-сервер для Claude с 25 инструментами для больших хранилищ

obsidian-mcp — это MCP-сервер, предоставляющий 25 инструментов (включая get_note, traverse_graph, query_dataview, move_note, create_notes), который даёт Клоду граф-ориентированный доступ к вашему хранилищу Obsidian — предотвращая смерть контекстного окна в хранилищах из 5000 заметок. Лицензия MIT, работает с Claude Desktop, Claude Code, Cursor, Cline, Continue, Zed.

OpenClawRadar
Агент-Xray: Инструмент с открытым исходным кодом для отладки сбоев ИИ-агентов на основе журналов трассировки
Инструменты

Агент-Xray: Инструмент с открытым исходным кодом для отладки сбоев ИИ-агентов на основе журналов трассировки

Agent-Xray — это инструмент с открытым исходным кодом под лицензией MIT, который анализирует журналы трассировки ИИ-агентов, классифицируя сбои по категориям, таким как spin, tool_bug и early_abort, и включает режим enforcement для тестирования исправлений на устойчивость к сложным задачам.

OpenClawRadar