MTP 수용률: 50% 임계값이 투기적 디코딩 이점을 결정한다

한 Reddit 사용자가 mlx-vlm을 사용해 Gemma-4(26B, 4비트)에서 MTP(다중 토큰 예측)를 테스트한 결과, 성능이 전적으로 초안 토큰 수락률에 달려 있음을 발견했습니다. M4 Max Studio에서의 측정은 구체적인 임계값을 보여줍니다.
작업별 결과
- 코드 생성: 75 tok/s → 114.8 tok/s (1.53배 빠름) — 수락률: 슬롯의 66%
- 장문 산문: 75 tok/s → 71.1 tok/s (0.95배, 실질적으로 차이 없음) — 수락률: 슬롯의 31%
- JSON 출력: 51.3 tok/s → 25.6 tok/s (0.50배 느림) — 수락률: 슬롯의 8%
임계값은 약 50% 수락률로 보입니다. 그 아래에서는 추론적 디코딩 오버헤드가 이득을 상쇄합니다.
테스트 세부사항: 코드는 "X를 수행하는 파이썬 함수 작성", 장문 산문은 "당나라 시대 화폐에 관한 800단어 에세이 작성", JSON 출력은 항목을 유사성에 따라 그룹화하여 구조화된 출력을 생성하는 것이었습니다.
보너스 팁: 사용자는 Gemma의 JSON 구조 지시사항 준수 능력이 괜찮지만, 구조화된 출력(json_schema)을 활성화하면 약 20%의 오버헤드가 추가된다고 언급합니다. 약간 엉성한 JSON을 허용하고 런타임에 수정하는 것을 권장합니다. mlx-vlm은 어차피 스펙디코딩에서 json_schema를 지원하지 않습니다.
결론: MTP는 로컬 코딩에 유용하지만, 수락률이 낮은 구조화된 작업이나 산문 작업에서는 성능을 저하시킬 수 있습니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

M4 Pro에서 OpenClaw: Browser-Use, Computer-Use, Codex의 한계에 부딪히다
한 사용자가 에이전트가 터미널 루프에 갇히고, 사이트에서 차단되며, Codex 출력이 깨지는 문제를 보고하며, 자동화 브라우저, macOS GUI 제어, 인터럽트 루프에 대한 설정 조정을 찾고 있습니다.

OpenClaw 드리프트 수정: 에이전트 워크플로우를 강화하는 네 가지 운영자 스킬
한 개발자가 네 가지 운영자 스킬(Outcome Guard, Direction Clarifier, Routing Enforcer, Completion Verifier)을 공유해 에이전트가 작업을 조기 완료 처리하거나 표류하는 문제를 해결하는 방법을 소개합니다.

코덱스로 빌드하고, 오픈클로로 실행하는 실용적인 분할 방식
한 개발자가 Codex로 자동화 로직을 구축하고 OpenClaw를 실행 계층으로만 사용함으로써 OpenClaw의 좌절을 극복한 방법과, Apple Messages를 CarPlay를 통해 채팅 인터페이스로 사용하여 Jarvis 같은 어시스턴트에 가까워진 경험을 공유합니다.
cron超时并不证明你的OpenClaw操作失败
크론 작업이 메시지를 보내거나 콘텐츠를 게시한 후 시간 초과되면 OpenClaw는 실행이 오류가 발생했음을 알지만, 공급자가 작업을 수락했는지 여부는 알 수 없습니다. 모호한 시간 초과는 실패가 아닌 알 수 없음으로 처리하십시오.