MTP + 통합 메모리가 RTX 5090에서 llama.cpp 추론 성능을 30% 향상시키다

✍️ OpenClawRadar📅 게시일: May 12, 2026🔗 Source
Ad

llama.cpp에서 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1과 MTP(Multi-Token Prediction) 추측을 함께 사용하면 처리량이 약 30% 향상됩니다. Qwen3.6-27B Q8_0 모델 기준 49 tok/sec에서 64 tok/sec로 증가했습니다. 벤치마크는 RTX 5090에 128GB DDR5 5600 CL36 메모리와 Ryzen 9 9950X3D 프로세서를 조합하여 실행했습니다.

명령 및 구성

CUDA_VISIBLE_DEVICES=0 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 /home/marcin/llama-server \
    -m /home/marcin/Pobrane/Qwen3.6-27B-Q8_0.gguf \
    --threads 16 \
    -c 262144 -fa on -np 1 \
    --spec-type mtp --spec-draft-n-max 3 \
    --webui-mcp-proxy \
    --chat-template-kwargs '{"preserve_thinking": true}' \
    --host 0.0.0.0 \
    --port 8090 \
    --jinja

주요 플래그:

  • GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 — GPU가 호스트 메모리에 직접 접근할 수 있도록 하여 큰 컨텍스트에서 CUDA malloc을 우회합니다.
  • --spec-type mtp --spec-draft-n-max 3 — 드래프트 깊이 3으로 다중 토큰 예측 추측을 활성화합니다.
  • Qwen3.6-27B-Q8_0.gguf — Q8_0으로 양자화된 27B 파라미터 Qwen3.6 모델로, Unsloth의 MTP 지원으로 준비되었습니다.
  • -c 262144 — 256K 컨텍스트 윈도우; -fa on은 플래시 어텐션을 활성화합니다.
Ad

결과

  • MTP 미사용 (통합 메모리만): 49 tok/sec
  • MTP + 통합 메모리 사용: 64 tok/sec
  • 향상: 처리량 30% 증가

draft-n-max가 3이므로 모델은 최대 3개의 토큰을 미리 추측하여 순차적 디코딩 오버헤드를 줄입니다. 통합 메모리와 결합하면 CPU와 GPU RAM 간의 비싼 PCIe 전송을 피할 수 있습니다.

대상 사용자

고급 소비자 GPU(RTX 5090)와 충분한 시스템 RAM(≥128GB)으로 대규모 컨텍스트 로컬 추론을 실행하는 개발자. 추측 샘플링을 지원하는 챗봇, 코드 어시스턴트, 또는 지연 시간에 민감한 LLM 워크로드에 적합합니다.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

벤치마크 결과: 38가지 실제 업무 워크플로우 작업에서 15개 LLM 평가
Tools

벤치마크 결과: 38가지 실제 업무 워크플로우 작업에서 15개 LLM 평가

한 개발자가 실제 워크플로우에서 38가지 작업을 통해 15개의 클라우드 및 로컬 LLM을 벤치마킹했습니다. 작업에는 CSV 변환, 문자 세기, 모듈러 연산, 형식 준수 등이 포함되었습니다. Claude 3.5 Sonnet과 Opus 모두 100% 점수를 받았지만, Sonnet이 호출당 비용이 3.5배 더 저렴했습니다.

OpenClawRadar
mistral.rs, Gemma 4 12B 지원 추가: 멀티모달, 에이전틱, MTP
Tools

mistral.rs, Gemma 4 12B 지원 추가: 멀티모달, 에이전틱, MTP

mistral.rs가 멀티모달, 에이전틱, MTP 통합으로 Gemma 4 12B를 지원합니다. 한 줄 설치 후 웹 검색, 코드 실행, 내장 UI로 실행 가능합니다.

OpenClawRadar
Gemma4 26B-A4B는 웹 검색 및 이미지 지원으로 빠른 로컬 성능을 제공합니다.
Tools

Gemma4 26B-A4B는 웹 검색 및 이미지 지원으로 빠른 로컬 성능을 제공합니다.

gemma-4-26B-A4B 모델은 RTX 4090에서 초당 약 145 토큰의 성능을 달성하며, 채팅 애플리케이션을 위한 웹 검색 MCP 및 이미지 지원을 포함합니다. 블로그 포스트에서는 Mac과 iPhone에서의 설정 및 크로스 플랫폼 사용법을 상세히 설명합니다.

OpenClawRadar
ACO 시스템: GitHub 이슈에서 병합된 PR까지의 멀티에이전트 AI 파이프라인
Tools

ACO 시스템: GitHub 이슈에서 병합된 PR까지의 멀티에이전트 AI 파이프라인

ACO System은 6개의 특화 AI 에이전트가 GitHub Issue에서 병합된 PR까지 전체 개발 파이프라인을 자율적으로 실행하는 오픈소스 멀티 에이전트 프레임워크입니다. 결정론적 Architect 게이트가 개발자에게 도달하기 전에 잘못된 스토리를 차단합니다.

OpenClawRadar