MTP + 통합 메모리가 RTX 5090에서 llama.cpp 추론 성능을 30% 향상시키다

✍️ OpenClawRadar📅 게시일: May 12, 2026🔗 Source
Ad

llama.cpp에서 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1과 MTP(Multi-Token Prediction) 추측을 함께 사용하면 처리량이 약 30% 향상됩니다. Qwen3.6-27B Q8_0 모델 기준 49 tok/sec에서 64 tok/sec로 증가했습니다. 벤치마크는 RTX 5090에 128GB DDR5 5600 CL36 메모리와 Ryzen 9 9950X3D 프로세서를 조합하여 실행했습니다.

명령 및 구성

CUDA_VISIBLE_DEVICES=0 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 /home/marcin/llama-server \
    -m /home/marcin/Pobrane/Qwen3.6-27B-Q8_0.gguf \
    --threads 16 \
    -c 262144 -fa on -np 1 \
    --spec-type mtp --spec-draft-n-max 3 \
    --webui-mcp-proxy \
    --chat-template-kwargs '{"preserve_thinking": true}' \
    --host 0.0.0.0 \
    --port 8090 \
    --jinja

주요 플래그:

  • GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 — GPU가 호스트 메모리에 직접 접근할 수 있도록 하여 큰 컨텍스트에서 CUDA malloc을 우회합니다.
  • --spec-type mtp --spec-draft-n-max 3 — 드래프트 깊이 3으로 다중 토큰 예측 추측을 활성화합니다.
  • Qwen3.6-27B-Q8_0.gguf — Q8_0으로 양자화된 27B 파라미터 Qwen3.6 모델로, Unsloth의 MTP 지원으로 준비되었습니다.
  • -c 262144 — 256K 컨텍스트 윈도우; -fa on은 플래시 어텐션을 활성화합니다.
Ad

결과

  • MTP 미사용 (통합 메모리만): 49 tok/sec
  • MTP + 통합 메모리 사용: 64 tok/sec
  • 향상: 처리량 30% 증가

draft-n-max가 3이므로 모델은 최대 3개의 토큰을 미리 추측하여 순차적 디코딩 오버헤드를 줄입니다. 통합 메모리와 결합하면 CPU와 GPU RAM 간의 비싼 PCIe 전송을 피할 수 있습니다.

대상 사용자

고급 소비자 GPU(RTX 5090)와 충분한 시스템 RAM(≥128GB)으로 대규모 컨텍스트 로컬 추론을 실행하는 개발자. 추측 샘플링을 지원하는 챗봇, 코드 어시스턴트, 또는 지연 시간에 민감한 LLM 워크로드에 적합합니다.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

OpenEvol: 대화 기록을 활용한 LLM의 오프라인 자가 개선 파이프라인
Tools

OpenEvol: 대화 기록을 활용한 LLM의 오프라인 자가 개선 파이프라인

OpenEvol v0.1.1은 수동 라벨링 없이 미세 조정 데이터셋을 생성하기 위해 AI 대화 기록을 자동으로 마이닝하는 오프라인 파이프라인입니다. 초기에는 CPU에서 실행되며 OpenAI 호환 API와 HuggingFace Transformers를 포함한 5가지 교사 백엔드를 지원합니다.

OpenClawRadar
클로드 AI, YC 2026년 봄 모든 스타트업 평가 — 전체 파이프라인 상세
Tools

클로드 AI, YC 2026년 봄 모든 스타트업 평가 — 전체 파이프라인 상세

레딧 사용자가 YC Spring 2026 스타트업을 대상으로 Claude를 실행해 LinkedIn과 언론 기사를 스크랩하고 S~D 등급을 할당했습니다. 대부분의 스타트업이 B나 C 등급을 받았습니다.

OpenClawRadar
Mengram은 OpenClaw 에이전트에 영구 메모리를 추가합니다.
Tools

Mengram은 OpenClaw 에이전트에 영구 메모리를 추가합니다.

멍그램은 오픈클로우 에이전트에게 세션 간 장기 기억을 제공하는 오픈소스 메모리 시스템으로, 에이전트가 재시작할 때 모든 것을 잊어버리는 문제를 해결합니다. 이 시스템은 사건, 개체, 절차적 기억을 제공하며 오래되거나 부정확한 사실을 지능적으로 보관합니다.

OpenClawRadar
팽골린: ZTNA 대안으로서의 오픈소스 아이덴티티 기반 VPN
Tools

팽골린: ZTNA 대안으로서의 오픈소스 아이덴티티 기반 VPN

Pangolin은 신원 기반 원격 접근에 초점을 맞춘 오픈소스 VPN으로, Cloudflare ZTNA, Zscaler, Twingate에 대한 대안을 제공합니다.

OpenClawRadar