RTX 5080 16GB: Qwen3.6 35B MoE, 128k 컨텍스트에서 56 tok/s, 그리고 MTP가 도움이 되지 않는 이유

메인라인 llama.cpp 커밋 b9190이 MTP(멀티 토큰 예측)를 병합했습니다. RTX 5080 16GB에서 Qwen3.6 35B MoE를 128k 컨텍스트로 실행한 벤치마크 결과, 명확한 사실이 드러났습니다: 모델이 GPU에 완전히 맞지 않을 때 MTP는 성능을 저하시킵니다.
최적 설정 (MTP 없음)
Qwen3.6-35B-A3B Q4_K_XL --fit-target 1536를 131k 컨텍스트에서 실행하면:
- 초당 56토큰 생성
- 128k 컨텍스트에서 초당 1,584토큰 프롬프트 처리
MTP 플래그는 필요하지 않습니다.
MTP가 16GB에서 35B MoE를 느리게 하는 이유
코딩 에이전트 컨텍스트 길이에서 세 가지 설정을 테스트했습니다:
- 27B IQ3+MTP: 12.45 GB, GPU에 완전 탑재 — 평균 73 tok/s (MTP 도움)
- 35B Q4_K_XL+MTP: ~22 GB, 부분 오프로드 — 평균 74 tok/s (MTP 해로움)
- 35B Q8_0+MTP: ~36 GB, 대량 오프로드 — 평균 46 tok/s
MTP 없이 35B Q4_K_XL은 --fit-target 0에서 97 tok/s (15,815 MiB VRAM) 및 --fit-target 1536에서 86 tok/s (14,269 MiB)를 달성합니다. --fit-target 1536에서 MTP를 활성화하면 속도가 74 tok/s (14,623 MiB)로 떨어지며 — 23% 성능 저하입니다.
근본 원인: MTP의 계산 버퍼가 약 1.5 GB를 예약하여 (--fit-target 1536), 약 3개의 MoE 전문가 레이어를 GPU에서 CPU로 밀어냅니다. MoE 추론은 CPU 바운드 전문가 레이어에 의해 병목이 발생하므로, MTP의 79% 토큰 수락률이 느린 단계별 속도를 보상할 수 없습니다.
27B 모델(GPU에 완전히 맞는 경우)의 경우 --fit-target 0이 MTP 유무와 관계없이 작동하므로 VRAM 패널티가 없으며, MTP가 속도를 ~56에서 73 tok/s로 높입니다.
경험 법칙
MTP는 모델이 GPU에 맞을 때 도움이 됩니다. MTP 계산 버퍼가 더 많은 레이어를 CPU로 강제할 때 해롭습니다. 16GB 카드와 35B MoE에서는 MTP를 건너뛰세요.
전체 테스트 시스템: RTX 5080 16GB, Ryzen 9 9950X, 128GB RAM, llama.cpp b9204 (메인라인). 일반적인 MTP 플래그: -np 1 --fit on -fa on -t 20 --no-mmap --jinja -ctk q8_0 -ctv q8_0 --spec-type draft-mtp --spec-draft-n-max 2.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

우분투 리눅스, 내년부터 로컬 추론을 시작으로 AI 기능 통합 예정
Canonical이 Ubuntu를 위한 다년간의 AI 추진 계획을 발표했습니다. 로컬 추론, 에이전트 워크플로우 및 상황 인식 OS 기능에 초점을 맞추며, 2026년에 걸쳐 기능이 출시됩니다.

Anthropic, 클로드 코드 기능을 프로 구독에서 신규 사용자 대상으로 테스트 중에 제거
Anthropic은 신규 사용자를 대상으로 한 월 20달러 'Pro' 구독 플랜에서 Claude Code 접근을 일시적으로 제거했습니다. 웹사이트 가격 페이지와 지원 문서를 변경한 후 다시 원상복구했습니다. 회사는 이를 '신규 프로슈머 가입자의 2%를 대상으로 한 소규모 테스트'라고 설명했습니다.

중국의 딥시크, 큐원, 문샷: 저렴한 AI 모델이 미국의 우위를 위협하다
블룸버그는 중국 AI 모델인 딥시크(DeepSeek), 큐원(Qwen), 문샷(Moonshot)이 낮은 비용으로 인기를 얻으며 미국 AI 선두 기업들에 도전하고 있다고 보도했습니다.

마이크로소프트 임원, AI 에이전트에 '좌석 기회'로서 소프트웨어 라이센스 필요성 제안
마이크로소프트 임원 라제시 자는 AI 에이전트가 자체 소프트웨어 라이선스가 필요할 수 있으며, 각 에이전트가 기업 시스템에서 '좌석'으로 간주될 수 있다고 제안합니다. 이는 AI가 인간 사용자를 대체하여 라이선스 수를 줄일 것이라는 견해와 대조됩니다.