MTPLX: 네이티브 MTP 헤드를 사용한 Apple Silicon에서 2.24배 더 빠른 토큰

✍️ OpenClawRadar📅 게시일: May 5, 2026🔗 Source
MTPLX: 네이티브 MTP 헤드를 사용한 Apple Silicon에서 2.24배 더 빠른 토큰
Ad

MTPLX는 Apple Silicon용 추론 엔진으로, 모델에 내장된 다중 토큰 예측(MTP) 헤드를 추측 드래프터로 활용합니다. 핵심 결과: Qwen 3.6 27B 4비트 MLX가 MacBook Pro M5 Max에서 온도 0.6, top_p 0.95, top_k 20 설정(코딩에 권장되는 Qwen의 정확한 설정)으로 28 tok/s에서 63 tok/s로 2.24배 빨라졌습니다.

작동 방식

DFlash나 DDTree와 달리(외부 드래프터 모델이 필요하고 그리디 전용), MTPLX는 모델 자체의 MTP 헤드를 사용합니다. 각 MTP 헤드는 순차적으로 드래프팅하여 토큰별 확률 분포를 생성합니다. 이를 통해 온도와 잔차 보정을 사용한 정확한 리젝션 샘플링이 가능합니다. 외부 드래프터가 없으므로 추가 메모리 사용이 없습니다.

Qwen 3.6 27B(깊이 5까지 MTP 헤드 탑재)의 경우 D2~D5를 스위핑한 결과 최적 깊이는 D3로 나타났습니다. 더 깊은 깊이(D4/D5)는 초기 수용률이 좋았지만 깊은 위치에서 검증 시간이 절약된 토큰보다 더 많이 소요되었습니다.

DFlash / DDTree와의 비교

DFlash MLX는 더 높은 원시 속도를 달성하지만 그리디(온도 0) 샘플링으로 제한되어 실사용에 심각한 제약이 있습니다. DDTree도 동일한 한계를 물려받습니다. 둘 다 외부 드래프터가 필요합니다. MTPLX는 MTP 헤드를 유지하는 모든 모델에서 작동하며 전체 온도 샘플링 추론을 지원합니다.

Ad

설치 및 사용법

MTPLX는 다음 명령어를 포함한 완전한 CLI로 제공됩니다:

  • mtplx start wizard — 안내 설정
  • 모델 다운로드 및 검사 (4단계 MTP 호환성 감지)
  • 구성 가능한 깊이 2~7+
  • OpenAI/Anthropic 호환 API 서버, 브라우저 채팅 UI, 터미널 채팅
  • 벤치마크 스위트, 건강 진단, 크래시 방지 팬 제어 (유휴 인식 자동 복원)
  • 562개 테스트 스위트 포함

엔진은 패치된 MLX 포크 위에 구축되었으며, 커스텀 Metal 커널, 컴파일된 검증 그래프, 혁신 테이프 GDN 롤백, 드래프트 전용 재양자화 LM 헤드를 포함합니다.

대상 사용자

Apple Silicon에서 로컬 LLM을 실행하며, 출력 품질을 희생하지 않고 고처리량, 온도 샘플링 추론이 필요한 개발자(코딩 또는 창작 글쓰기용).

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

2026 Hermes 에이전트 대안 정리: OpenClaw부터 memU Bot까지 자체 호스팅 옵션
Tools

2026 Hermes 에이전트 대안 정리: OpenClaw부터 memU Bot까지 자체 호스팅 옵션

ClawHub 보안 사태 이후, Hermes를 런칭부터 운영해 온 개발자가 모든 자체 호스팅 및 관리형 대안을 테스트했습니다. 주요 결과: OpenClaw (370k 스타)는 4일 만에 9건의 CVE와 ~20%의 악성 패키지; TrustClaw는 OAuth/샌드박싱으로 재구축; nanobot은 MCP를 지원하는 약 4천 줄의 Python 코드; memU Bot은 독특한 구조화 메모리 제공. 관리형 옵션으로는 Perplexity Computer (19개 모델, 월 $200), Claude Cowork (실제 Mac 앱 실행), KimiClaw (40GB RAG, K2.5 고정, 중국 데이터 법 적용) 등이 있습니다. 전체 내용은 출처에서 확인하세요.

OpenClawRadar
NGX-OS: eBPF와 MCP 통합으로 AI를 위해 구축된 네트워크 운영 체제
Tools

NGX-OS: eBPF와 MCP 통합으로 AI를 위해 구축된 네트워크 운영 체제

NGX-OS는 AI 통합을 위해 처음부터 설계된 네트워크 운영 체제로, eBPF를 사용한 실시간 원격 측정과 MCP를 통해 번역 계층 없이 네트워크 상태 데이터에 직접 접근할 수 있는 LLM 접근을 제공합니다.

OpenClawRadar
Shipwright: Claude Code 기반 오픈소스 프로젝트 관리 도구
Tools

Shipwright: Claude Code 기반 오픈소스 프로젝트 관리 도구

Shipwright는 Claude Code에서 실행되는 오픈소스 프로젝트 관리 도구로, 44가지 스킬, 7개의 전문화된 에이전트, 16개의 워크플로우를 갖추고 있습니다. 이진 품질 게이트와 복구 플레이북을 포함하며, 엔지니어링 작업 시작 전 자격 증명 레지스트리 감사와 자동화 플랫폼 평가에 사용되었습니다.

OpenClawRadar
ScreenMind: 로컬 우선 AI 메모리, 컴퓨터 전체 활동을 인덱싱하다
Tools

ScreenMind: 로컬 우선 AI 메모리, 컴퓨터 전체 활동을 인덱싱하다

ScreenMind는 Gemma 4 E2B를 로컬에서 사용하여 화면, 회의, 음성 메모를 캡처합니다. 4GB 이상의 VRAM에서 Q4 양자화로 실행됩니다. 과거 활동을 검색하고, 이력과 대화하며, MCP를 통해 Claude/Cursor에 연결할 수 있습니다.

OpenClawRadar