MTP + Unified Memory повышает производительность вывода llama.cpp на 30% на RTX 5090
Комбинация GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 с многотокенным прогнозированием (MTP) в llama.cpp дает прирост пропускной способности примерно на 30% — 64 ток/сек против 49 ток/сек на модели Qwen3.6-27B Q8_0. Тест проводился на RTX 5090 в паре с 128 ГБ DDR5 5600 CL36 и Ryzen 9 9950X3D.
Команда и конфигурация
CUDA_VISIBLE_DEVICES=0 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 /home/marcin/llama-server \
-m /home/marcin/Pobrane/Qwen3.6-27B-Q8_0.gguf \
--threads 16 \
-c 262144 -fa on -np 1 \
--spec-type mtp --spec-draft-n-max 3 \
--webui-mcp-proxy \
--chat-template-kwargs '{"preserve_thinking": true}' \
--host 0.0.0.0 \
--port 8090 \
--jinja
Ключевые флаги:
GGML_CUDA_ENABLE_UNIFIED_MEMORY=1— позволяет GPU напрямую обращаться к памяти хоста, минуя CUDA malloc для больших контекстов.--spec-type mtp --spec-draft-n-max 3— включает спекуляцию с многотокенным прогнозированием с глубиной черновика 3.Qwen3.6-27B-Q8_0.gguf— модель Qwen3.6 с 27B параметрами, квантованная до Q8_0, подготовленная с поддержкой MTP от Unsloth.-c 262144— окно контекста 256K;-fa onдля flash attention.
Результаты
- Без MTP (только unified memory): 49 ток/сек
- С MTP + unified memory: 64 ток/сек
- Прирост: на 30% выше пропускная способность
Параметр draft-n-max равный 3 означает, что модель предсказывает до 3 токенов вперед, уменьшая накладные расходы на последовательное декодирование. В сочетании с unified memory избегаются дорогие передачи по PCIe между CPU и GPU.
Для кого это
Разработчики, запускающие локальный инференс с большим контекстом на высокопроизводительных потребительских GPU (RTX 5090) с достаточным объемом системной памяти (≥128 ГБ). Подходит для чат-ботов, ассистентов кода или любых задач LLM, чувствительных к задержкам, где поддерживается спекулятивная выборка.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Разработчик делится более чем 10 MCP-серверами для поселения AI-агентов, репутации и микроплатежей.
Разработчик создал BlindOracle на Claude Code с более чем 100 агентами и разработал 10+ MCP-серверов для расчетов, репутации и микроплатежей. Архитектура включает приватные прогнозы с коммитом-раскрытием, ончейн-оценку, микроплатежи по запросу и верифицируемую аттестацию агентов.

Два паттерна для предотвращения деградации памяти ИИ-агентов: AutoDream и Скептический поиск.
OpenClaw представляет две модели с лицензией MIT для решения проблемы деградации файловой памяти ИИ: AutoDream для ночной консолидации памяти и Skeptical Retrieval для оценки памяти с учетом затухания. Обе работают вместе в самосовершенствующемся цикле, чтобы контекст агента оставался актуальным.

rawq: Локальный CLI-инструмент для семантического поиска кода AI-агента
rawq — это инструмент командной строки с открытым исходным кодом, который помогает ИИ-агентам находить релевантный код с помощью семантического поиска с использованием 33-мегабайтной локальной модели через ONNX runtime и лексического поиска BM25 через tantivy. В тестах ИИ-агенты, использующие rawq, потребляли в 4 раза меньше токенов и выполняли задачи в 2 раза быстрее по сравнению с инструментами слепого чтения/grep.

RunAnywhere RCLI: Голосовой ИИ-конвейер на устройстве для Apple Silicon
RunAnywhere выпустила RCLI, открытый голосовой AI-пайплайн для macOS, который полностью работает на устройствах Apple Silicon, выполняя STT, LLM и TTS. Инструмент использует их проприетарный движок вывода MetalRT и заявляет о значительном повышении производительности по сравнению с существующими решениями.