MTP + Memória Unificada Aumenta Inferência do llama.cpp em 30% na RTX 5090

✍️ OpenClawRadar📅 Publicado: May 12, 2026🔗 Source
Ad

Combinar GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 com a especulação Multi-Token Prediction (MTP) no llama.cpp resulta em uma melhoria de ~30% na taxa de transferência — 64 tok/s vs 49 tok/s em um modelo Qwen3.6-27B Q8_0. O benchmark foi executado em uma RTX 5090 com 128 GB DDR5 5600 CL36 e um Ryzen 9 9950X3D.

Comando e Configuração

CUDA_VISIBLE_DEVICES=0 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 /home/marcin/llama-server \
    -m /home/marcin/Pobrane/Qwen3.6-27B-Q8_0.gguf \
    --threads 16 \
    -c 262144 -fa on -np 1 \
    --spec-type mtp --spec-draft-n-max 3 \
    --webui-mcp-proxy \
    --chat-template-kwargs '{"preserve_thinking": true}' \
    --host 0.0.0.0 \
    --port 8090 \
    --jinja

Flags principais:

  • GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 — permite que a GPU acesse diretamente a memória do host, ignorando o malloc CUDA para contextos grandes.
  • --spec-type mtp --spec-draft-n-max 3 — ativa a especulação Multi-Token Prediction com profundidade de rascunho 3.
  • Qwen3.6-27B-Q8_0.gguf — um modelo Qwen3.6 de 27B parâmetros quantizado para Q8_0, preparado com suporte MTP do Unsloth.
  • -c 262144 — janela de contexto de 256K; -fa on para atenção flash.
Ad

Resultados

  • Sem MTP (apenas memória unificada): 49 tok/s
  • Com MTP + memória unificada: 64 tok/s
  • Ganho: 30% mais taxa de transferência

O draft-n-max de 3 significa que o modelo especula até 3 tokens à frente, reduzindo a sobrecarga de decodificação serial. Combinado com a memória unificada, evita transferências PCIe caras entre a RAM da CPU e da GPU.

Para Quem É

Desenvolvedores executando inferência local com contexto grande em GPUs consumidor de ponta (RTX 5090) com bastante RAM do sistema (≥128 GB). Adequado para chatbots, assistentes de código ou qualquer workload de LLM sensível à latência onde a amostragem especulativa é suportada.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Aurelius: Um Framework React Construído com 48 Agentes de Código Claude e Pipeline Figma-para-React
Tools

Aurelius: Um Framework React Construído com 48 Agentes de Código Claude e Pipeline Figma-para-React

Aurelius é um framework React de código aberto que utiliza 48 agentes Claude Code organizados hierarquicamente para construir aplicações React de forma autônoma a partir de designs do Figma. O framework impõe TDD, QA visual com comparação de diferença de pixels e portões de qualidade antes da implantação.

OpenClawRadar
graphify-ts: Servidor MCP local reduz tokens de revisão de PR do Claude Code de 63K para 8,7K
Tools

graphify-ts: Servidor MCP local reduz tokens de revisão de PR do Claude Code de 63K para 8,7K

graphify-ts constrói um grafo de conhecimento local da sua base de código usando árvore sintática tree-sitter + comunidades Louvain + BM25 + rerank opcional ONNX, expondo-o via MCP stdio. Em testes de produção, reduziu os tokens de entrada em 2,6x e a latência em 2,8x para consultas de código, e cortou prompts de revisão de PR de 63K para 8,7K tokens.

OpenClawRadar
OpenClaw Superpoderes: Uma biblioteca de 31 habilidades que abordam pontos críticos de segurança, custo e confiabilidade.
Tools

OpenClaw Superpoderes: Uma biblioteca de 31 habilidades que abordam pontos críticos de segurança, custo e confiabilidade.

Um desenvolvedor lançou o openclaw-superpowers, uma biblioteca de 31 habilidades prontas para uso no OpenClaw. A biblioteca aborda problemas comuns como custos descontrolados de API, vulnerabilidades de segurança e perda de contexto, com instalação via um único comando.

OpenClawRadar
Nova Ferramenta Injeta Instruções no Código do Claude Baseado no Uso de Contexto
Tools

Nova Ferramenta Injeta Instruções no Código do Claude Baseado no Uso de Contexto

Um desenvolvedor criou uma ferramenta que monitora o uso de contexto e injeta instruções personalizadas para evitar desastres de compactação durante tarefas.

OpenClaw Radar