MTP + Memória Unificada Aumenta Inferência do llama.cpp em 30% na RTX 5090

✍️ OpenClawRadar📅 Publicado: May 12, 2026🔗 Source
Ad

Combinar GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 com a especulação Multi-Token Prediction (MTP) no llama.cpp resulta em uma melhoria de ~30% na taxa de transferência — 64 tok/s vs 49 tok/s em um modelo Qwen3.6-27B Q8_0. O benchmark foi executado em uma RTX 5090 com 128 GB DDR5 5600 CL36 e um Ryzen 9 9950X3D.

Comando e Configuração

CUDA_VISIBLE_DEVICES=0 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 /home/marcin/llama-server \
    -m /home/marcin/Pobrane/Qwen3.6-27B-Q8_0.gguf \
    --threads 16 \
    -c 262144 -fa on -np 1 \
    --spec-type mtp --spec-draft-n-max 3 \
    --webui-mcp-proxy \
    --chat-template-kwargs '{"preserve_thinking": true}' \
    --host 0.0.0.0 \
    --port 8090 \
    --jinja

Flags principais:

  • GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 — permite que a GPU acesse diretamente a memória do host, ignorando o malloc CUDA para contextos grandes.
  • --spec-type mtp --spec-draft-n-max 3 — ativa a especulação Multi-Token Prediction com profundidade de rascunho 3.
  • Qwen3.6-27B-Q8_0.gguf — um modelo Qwen3.6 de 27B parâmetros quantizado para Q8_0, preparado com suporte MTP do Unsloth.
  • -c 262144 — janela de contexto de 256K; -fa on para atenção flash.
Ad

Resultados

  • Sem MTP (apenas memória unificada): 49 tok/s
  • Com MTP + memória unificada: 64 tok/s
  • Ganho: 30% mais taxa de transferência

O draft-n-max de 3 significa que o modelo especula até 3 tokens à frente, reduzindo a sobrecarga de decodificação serial. Combinado com a memória unificada, evita transferências PCIe caras entre a RAM da CPU e da GPU.

Para Quem É

Desenvolvedores executando inferência local com contexto grande em GPUs consumidor de ponta (RTX 5090) com bastante RAM do sistema (≥128 GB). Adequado para chatbots, assistentes de código ou qualquer workload de LLM sensível à latência onde a amostragem especulativa é suportada.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

A ferramenta Claude-context-lint audita a sobrecarga de tokens em projetos Claude Code.
Tools

A ferramenta Claude-context-lint audita a sobrecarga de tokens em projetos Claude Code.

Uma nova ferramenta chamada claude-context-lint analisa projetos do Claude Code para mostrar quanto da janela de contexto é consumida por arquivos CLAUDE.md, habilidades, servidores MCP e prompts do sistema antes da entrada do usuário. A ferramenta fornece recomendações específicas para reduzir o uso de tokens.

OpenClawRadar
Kit de Ferramentas de Loop Ralph de Código Aberto para Claude Code: Agentes Pickle Rick e Mr. Meeseeks
Tools

Kit de Ferramentas de Loop Ralph de Código Aberto para Claude Code: Agentes Pickle Rick e Mr. Meeseeks

Uma extensão de código aberto para Claude Code implementa a técnica Ralph Loop com dois agentes autônomos: Pickle Rick para desenvolvimento orientado por PRD e Mr. Meeseeks para revisão de código. Ambos usam tmux com painéis em tempo real e notificações do macOS.

OpenClawRadar
Agent MCP Studio: Crie sistemas MCP multiagentes inteiramente em um navegador via WASM
Tools

Agent MCP Studio: Crie sistemas MCP multiagentes inteiramente em um navegador via WASM

O Agent MCP Studio permite projetar, orquestrar e exportar sistemas de agentes MCP a partir de um único arquivo HTML estático usando WebAssembly – sem backend, sem Docker, sem servidor.

OpenClawRadar
Sx: Um Gerenciador de Pacotes Open-Source para Habilidades de IA, MCPs e Comandos
Tools

Sx: Um Gerenciador de Pacotes Open-Source para Habilidades de IA, MCPs e Comandos

Sx é um gerenciador de pacotes privado similar ao npm para ativos de IA—skills, configurações MCP, comandos, hooks e agentes—que permite que equipes compartilhem, versionem e escopem configurações de IA em qualquer cliente de IA (Claude Code, Cursor, Copilot, Gemini).

OpenClawRadar