Qwen 3.6 27B, llama.cpp에서 MTP 추론적 디코딩으로 2.5배 속도 달성

✍️ OpenClawRadar📅 게시일: May 6, 2026🔗 Source
Qwen 3.6 27B, llama.cpp에서 MTP 추론적 디코딩으로 2.5배 속도 달성
Ad

한 Reddit 사용자가 Qwen 3.6 27B에 대해 MTP(Multi-Token Prediction)를 활성화하는 대기 중인 PR(#22673)과 함께 llama.cpp를 컴파일했습니다. MTP는 모델에 내장된 텐서 레이어를 사용하여 추측 디코딩을 수행하며, Mac M2 Max 96GB에서 약 11 tok/s에서 28 tok/s로 2.5배 속도 향상을 주장합니다.

주요 세부 사항

  • 모델: Qwen 3.6 27B (Qwen2.5-3.0 아키텍처 변형)
  • 테스트 하드웨어: Mac M2 Max 96GB
  • 결과: MTP 사용 시 28 tok/s (미사용 시 약 11 tok/s)
  • 컨텍스트 지원: 48GB Mac에서 turbo4 KV 캐시로 최대 262K 토큰
  • 양자화: 사용자가 froggeric/Qwen3.6-27B-MTP-GGUF에 업로드한 사전 변환 GGUF 양자화 파일

컴파일 지침

git clone --depth 1 https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/22673/head:mtp-pr && git checkout mtp-pr
cmake -B build -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --target llama-cli llama-server
Ad

서버 명령어

llama-server -m Qwen3.6-27B-Q5_K_M-mtp.gguf \
  --mmproj mmproj-Qwen3.6-27B-f16.gguf \
  --spec-type mtp --spec-draft-n-max 5 \
  --cache-type-k turbo4 --cache-type-v turbo4 \
  -c 262144 --temp 0.7 --top-k 20 -ngl 99 --port 8081

세 가지 최적화 조합:

  • --spec-type mtp --spec-draft-n-max 5: MTP 추측 디코딩 활성화 (2.5배 빠름)
  • --cache-type-k turbo4 --cache-type-v turbo4: 4.25비트 KV 캐시 (16비트 대비 메모리 1/4)
  • -c 262144: 262K 컨텍스트 윈도우 (turbo4로 48GB에 적합)

하드웨어 권장 사항

Apple Silicon 및 NVIDIA GPU 양자화/KV 캐시 테이블이 RAM이 제한된 환경(예: 16GB Apple Silicon에서 48K 컨텍스트의 IQ2_M)을 위해 소스에 제공됩니다. 비전(mmproj) 지원은 32GB 이상 구성에서 사용 가능합니다.

추가 수정 사항

사용자는 또한 vLLM 특정 형식 때문에 깨졌던 Qwen jinja 채팅 템플릿에 대한 7가지 수정 사항을 게시했습니다. 이제 llama.cpp 및 다른 도구와 호환됩니다.

참고: Hugging Face의 기존 GGUF 파일에는 MTP 지원이 포함되어 있지 않습니다. PR을 적용하여 다시 변환해야 합니다. 사용자는 초기 업로드가 불완전할 수 있음을 경고합니다. Hugging Face 리포지토리 상태를 확인하세요.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

코딩-플래시카드: Rust, SQLite, Godot, Wolfram 언어를 위한 800개 이상의 Anki 카드
Tools

코딩-플래시카드: Rust, SQLite, Godot, Wolfram 언어를 위한 800개 이상의 Anki 카드

Rust, SQLite, Godot, Wolfram Language를 처음부터 학습할 수 있는 800개 이상의 마크다운 플래시카드, Anki 덱 또는 PDF로 변환하는 스크립트 포함

OpenClawRadar
PowerShell 스크립트로 Windows에서 OpenClaw Docker 설정 자동화
Tools

PowerShell 스크립트로 Windows에서 OpenClaw Docker 설정 자동화

PowerShell 스크립트는 Windows 특유의 네트워킹 문제와 OpenClaw의 Docker 구성을 처리하여, 자동으로 점검, 이미지 가져오기, 설정 안내 및 컨테이너 배포를 수행합니다.

OpenClawRadar
Treck: 웹 연구를 포착하고 Claude를 사용하여 문서를 생성하는 Chrome 확장 프로그램
Tools

Treck: 웹 연구를 포착하고 Claude를 사용하여 문서를 생성하는 Chrome 확장 프로그램

Treck은 웹 리서치를 프로젝트로 캡처하고 Claude를 사용해 문서, 인용문, 공유 가능한 페이지로 변환하는 Chrome 확장 프로그램입니다. 자체 API 키를 사용합니다.

OpenClawRadar
LLM 에이전트가 시각적 피드백을 활용하여 완전한 Godot 4 던전 크롤러를 구축합니다
Tools

LLM 에이전트가 시각적 피드백을 활용하여 완전한 Godot 4 던전 크롤러를 구축합니다

한 개발자가 MCP 도구를 사용해 LLM 에이전트를 Godot 4에 연결하고, 던전 크롤러 FPS를 만들라는 단일 프롬프트를 주었습니다. 에이전트는 게임을 실행하고 스크린샷을 찍어 시각적 문제를 수정하며, 3개의 방, 조명, 전투, 적, 진행 시스템을 갖춘 완전한 프로토타입을 만들었습니다.

OpenClawRadar