MTPLX: 네이티브 MTP 헤드를 사용한 Apple Silicon에서 2.24배 더 빠른 토큰

MTPLX는 Apple Silicon용 추론 엔진으로, 모델에 내장된 다중 토큰 예측(MTP) 헤드를 추측 드래프터로 활용합니다. 핵심 결과: Qwen 3.6 27B 4비트 MLX가 MacBook Pro M5 Max에서 온도 0.6, top_p 0.95, top_k 20 설정(코딩에 권장되는 Qwen의 정확한 설정)으로 28 tok/s에서 63 tok/s로 2.24배 빨라졌습니다.
작동 방식
DFlash나 DDTree와 달리(외부 드래프터 모델이 필요하고 그리디 전용), MTPLX는 모델 자체의 MTP 헤드를 사용합니다. 각 MTP 헤드는 순차적으로 드래프팅하여 토큰별 확률 분포를 생성합니다. 이를 통해 온도와 잔차 보정을 사용한 정확한 리젝션 샘플링이 가능합니다. 외부 드래프터가 없으므로 추가 메모리 사용이 없습니다.
Qwen 3.6 27B(깊이 5까지 MTP 헤드 탑재)의 경우 D2~D5를 스위핑한 결과 최적 깊이는 D3로 나타났습니다. 더 깊은 깊이(D4/D5)는 초기 수용률이 좋았지만 깊은 위치에서 검증 시간이 절약된 토큰보다 더 많이 소요되었습니다.
DFlash / DDTree와의 비교
DFlash MLX는 더 높은 원시 속도를 달성하지만 그리디(온도 0) 샘플링으로 제한되어 실사용에 심각한 제약이 있습니다. DDTree도 동일한 한계를 물려받습니다. 둘 다 외부 드래프터가 필요합니다. MTPLX는 MTP 헤드를 유지하는 모든 모델에서 작동하며 전체 온도 샘플링 추론을 지원합니다.
설치 및 사용법
MTPLX는 다음 명령어를 포함한 완전한 CLI로 제공됩니다:
mtplx start wizard— 안내 설정- 모델 다운로드 및 검사 (4단계 MTP 호환성 감지)
- 구성 가능한 깊이 2~7+
- OpenAI/Anthropic 호환 API 서버, 브라우저 채팅 UI, 터미널 채팅
- 벤치마크 스위트, 건강 진단, 크래시 방지 팬 제어 (유휴 인식 자동 복원)
- 562개 테스트 스위트 포함
엔진은 패치된 MLX 포크 위에 구축되었으며, 커스텀 Metal 커널, 컴파일된 검증 그래프, 혁신 테이프 GDN 롤백, 드래프트 전용 재양자화 LM 헤드를 포함합니다.
대상 사용자
Apple Silicon에서 로컬 LLM을 실행하며, 출력 품질을 희생하지 않고 고처리량, 온도 샘플링 추론이 필요한 개발자(코딩 또는 창작 글쓰기용).
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

Relay CLI 도구는 속도 제한 시 Claude 세션 컨텍스트를 저장합니다.
Relay는 Rust CLI 도구로, Claude의 .jsonl 세션 기록을 디스크에서 읽어와 대화, 도구 호출, 할 일 목록, git 상태, 오류를 포함한 세션의 전체 스냅샷을 생성합니다. 속도 제한이 초기화된 후 세션을 재개하기 위한 컨텍스트 프롬프트를 생성합니다.

클로드-세션: 클로드 코드 기록을 탐색하기 위한 터미널 UI
claude-sessions는 로컬 Claude Code 기록 파일을 스캔하여 개발자들이 과거 세션을 탐색, 검색, 재개할 수 있도록 하는 오픈소스 터미널 UI 도구입니다. Claude Code 자체로 구축되었으며, WASD 탐색, 키워드 검색, 원클릭 세션 재개 기능을 갖추고 있습니다.

rawq: AI 에이전트 시맨틱 코드 검색을 위한 로컬 CLI 도구
rawq는 ONNX 런타임을 통한 시맨틱 검색과 tantivy를 통한 BM25 어휘 검색을 결합한 33MB 로컬 모델을 사용하는 오픈소스 CLI 도구로, AI 에이전트가 관련 코드를 찾는 데 도움을 줍니다. 테스트에서 rawq를 사용한 AI 에이전트는 무작위 read/grep 도구에 비해 4배 적은 토큰을 소비하고 작업을 2배 빠르게 완료했습니다.
NVIDIA SkillEvaluator登陆ClawHub:技能真的更胜一筹吗?
ClawHub가 이제 NVIDIA SkillEvaluator를 통합하여 스킬을 설치하기 전에 에이전트를 개선하는지 보여줍니다. Patrick Erichsen의 평가 보기는 300개 이상의 검증된 스킬에 대해 기준선과 측정된 향상을 비교합니다.