RTX 5080 16GB: Qwen3.6 35B MoE, 128k 컨텍스트에서 56 tok/s, 그리고 MTP가 도움이 되지 않는 이유

메인라인 llama.cpp 커밋 b9190이 MTP(멀티 토큰 예측)를 병합했습니다. RTX 5080 16GB에서 Qwen3.6 35B MoE를 128k 컨텍스트로 실행한 벤치마크 결과, 명확한 사실이 드러났습니다: 모델이 GPU에 완전히 맞지 않을 때 MTP는 성능을 저하시킵니다.
최적 설정 (MTP 없음)
Qwen3.6-35B-A3B Q4_K_XL --fit-target 1536를 131k 컨텍스트에서 실행하면:
- 초당 56토큰 생성
- 128k 컨텍스트에서 초당 1,584토큰 프롬프트 처리
MTP 플래그는 필요하지 않습니다.
MTP가 16GB에서 35B MoE를 느리게 하는 이유
코딩 에이전트 컨텍스트 길이에서 세 가지 설정을 테스트했습니다:
- 27B IQ3+MTP: 12.45 GB, GPU에 완전 탑재 — 평균 73 tok/s (MTP 도움)
- 35B Q4_K_XL+MTP: ~22 GB, 부분 오프로드 — 평균 74 tok/s (MTP 해로움)
- 35B Q8_0+MTP: ~36 GB, 대량 오프로드 — 평균 46 tok/s
MTP 없이 35B Q4_K_XL은 --fit-target 0에서 97 tok/s (15,815 MiB VRAM) 및 --fit-target 1536에서 86 tok/s (14,269 MiB)를 달성합니다. --fit-target 1536에서 MTP를 활성화하면 속도가 74 tok/s (14,623 MiB)로 떨어지며 — 23% 성능 저하입니다.
근본 원인: MTP의 계산 버퍼가 약 1.5 GB를 예약하여 (--fit-target 1536), 약 3개의 MoE 전문가 레이어를 GPU에서 CPU로 밀어냅니다. MoE 추론은 CPU 바운드 전문가 레이어에 의해 병목이 발생하므로, MTP의 79% 토큰 수락률이 느린 단계별 속도를 보상할 수 없습니다.
27B 모델(GPU에 완전히 맞는 경우)의 경우 --fit-target 0이 MTP 유무와 관계없이 작동하므로 VRAM 패널티가 없으며, MTP가 속도를 ~56에서 73 tok/s로 높입니다.
경험 법칙
MTP는 모델이 GPU에 맞을 때 도움이 됩니다. MTP 계산 버퍼가 더 많은 레이어를 CPU로 강제할 때 해롭습니다. 16GB 카드와 35B MoE에서는 MTP를 건너뛰세요.
전체 테스트 시스템: RTX 5080 16GB, Ryzen 9 9950X, 128GB RAM, llama.cpp b9204 (메인라인). 일반적인 MTP 플래그: -np 1 --fit on -fa on -t 20 --no-mmap --jinja -ctk q8_0 -ctv q8_0 --spec-type draft-mtp --spec-draft-n-max 2.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

클로드 프로 사용자, 인터페이스 및 워크플로우 문제 지속적으로 문서화
장기간 Claude Pro 구독자가 다섯 가지 지속적인 문제를 상세히 설명합니다: 수정 중 파일 파괴, 버전 관리 부재, 컨텍스트 압축 후 기억 상실, 일관성 없는 의사 결정, 무시되는 사용자 선호도. 사용자는 Claude의 선호도 섹션에 명시적 지침이 있음에도 이러한 문제가 발생한다고 보고합니다.

Day 10: Claude Code로 게임 만들기 — 3,200명의 플레이어와 서버 마비
한 명의 개발자가 Claude Code로 멀티플레이어 드래그 레이싱 게임을 만들었습니다. 10일 만에 플레이어 3,200명, 일일 API 요청 10만 건 소진, 게임 프리징 발생. 출시된 기능의 전체 분석 — 실시간 멀티플레이어, 신규 트랙 50개, 세 번째 행성, 코끼리 사냥.

AI 및 데이터 센터로 인해 2026-2027년 미국 전력 수요가 사상 최고치에 도달할 전망
미국 에너지정보청(EIA)은 AI 워크로드 급증과 데이터센터 확장에 힘입어 2026~2027년 전력 소비가 사상 최고치를 기록할 것으로 전망합니다.
Claude Code v2.1.234: GitLab MR 배지, 자동 계속, 보안 강화
Claude Code v2.1.234는 GitLab MR 배지 추가, 사용량 제한 후 자동 재개, Windows NT 네임스페이스 경로 차단을 통한 NTLM 자격 증명 누출 방지 기능을 제공합니다.