vllm-mlx 포크는 로컬 AI 코딩 에이전트를 위한 도구 호출 및 프롬프트 캐시 기능을 추가합니다.

한 개발자가 Mac에서 OpenClaw와 같은 AI 코딩 에이전트를 로컬에서 실행하기 위한 여러 문제를 해결한 vllm-mlx의 수정 버전을 공개했습니다. 이 포크는 Apple Silicon용 OpenAI 호환 서버에 작동하는 도구 호출과 프롬프트 캐싱을 추가합니다.
주요 수정사항 및 기능
개발자는 특정 문제를 해결하기 위해 업스트림 vllm-mlx 위에 37개의 커밋을 수행했습니다:
- 도구 호출:
--tool-call-parser hermes플래그 추가 — Qwen3-Coder-Next 도구 호출이 즉시 작동 - MiniMax-M2.5: 스트리밍 및 비스트리밍 도구 호출 파싱 추가, 기능 호출 벤치마크(날씨, 검색, 코드 실행, 다중 도구)에서 4/4 정확도
- 프롬프트 캐시: SimpleEngine에 요청 간 지속적인 KV 캐시 추가 — 동일한 시스템 프롬프트와 대화 기록은 새로운 토큰만 사전 채움
- 추론 분리: 태그 없이 인라인으로 추론을 포함한 MiniMax 출력을 위한 휴리스틱 파서 구축 — 누출률을 60%에서 0%로 감소
성능 개선
33K 토큰 컨텍스트에서 첫 토큰까지의 시간(TTFT)이 캐시 히트 시 28초에서 0.3초로 개선되었습니다. Mac Studio M3 Ultra 256GB 기준 벤치마크:
- Qwen3-Coder-Next 4비트: 42GB RAM, 70 tok/s 디코딩, 1270 tok/s 프리필
- Qwen3-Coder-Next 6비트: 60GB RAM, 65 tok/s 디코딩, 1090-1440 tok/s 프리필
- Qwen3-Coder-Next 8비트: 75GB RAM, ~45 tok/s 디코딩, ~900 tok/s 프리필
- MiniMax-M2.5 4비트: 120GB RAM, 33-38 tok/s 디코딩, 430-500 tok/s 프리필
개발자는 대화형 코딩에 최적의 지점으로 Qwen3-Coder-Next 6비트를 권장하며, 품질이 4비트(가끔 왜곡된 출력 발생)보다 현저히 더 좋다고 언급했습니다.
설치 지침
pip install git+https://github.com/raullenchai/vllm-mlx.git
python -c "from mlx_lm import load; load('lmstudio-community/Qwen3-Coder-Next-MLX-6bit')"
python -m vllm_mlx.server \
--model lmstudio-community/Qwen3-Coder-Next-MLX-6bit \
--tool-call-parser hermes \
--prefill-step-size 8192 \
--kv-bits 8 \
--port 8000
그런 다음 OpenClaw 또는 모든 OpenAI SDK 클라이언트를 http://localhost:8000/v1으로 지정하세요.
하드웨어 요구사항
- Qwen3-Coder-Next 4비트: 42GB — M2 Pro 64GB 이상 필요
- Qwen3-Coder-Next 6비트: 60GB — M2/M3/M4 Max 96GB+ 또는 Ultra 필요
- MiniMax-M2.5: 120GB — Ultra 192GB+ 전용
작동하지 않은 사항
- Qwen3-0.6B를 드래프트 모델로 한 추측 디코딩 — mlx-lm에 Qwen3 관련 알려진 버그 존재(토큰 건너뜀, 이슈 #846)
- OpenClaw용 DeepSeek-R1-Distill-70B — 추론 능력은 뛰어나지만 도구 호출이 불안정함
이 저장소는 1500개 이상의 테스트를 포함하며 Apache 2.0 라이선스로 제공됩니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

프로액티비티 해제: 커뮤니티의 클로봇 혁신 심층 분석
애호가들이 어떻게 창의적인 전략과 커뮤니티 중심의 통찰력을 통해 클로우봇의 적극성을 향상시키고 있는지 알아보세요. r/openclaw에서의 논의와 발견을 살펴봅니다.

Relvy는 OpenRCA 벤치마크에서 Claude의 근본 원인 분석 정확도를 12%포인트 향상시킵니다.
런북을 자동화하는 도구인 Relvy가 근본 원인 분석을 위한 OpenRCA 벤치마크에서 Claude의 정확도를 12% 포인트 향상시켰음을 입증했습니다. 이 결과는 11포인트를 받은 Hacker News 게시물을 통해 공유되었습니다.

VPS에 OpenClaw를 원-커맨드 CLI로 배포하기
한 레딧 사용자가 단일 명령어로 4.99달러/월 VPS에 OpenClaw를 배포하는 CLI를 개발했다고 주장하며, Mac Mini 사용에 비해 비용 효율적인 대안을 제공합니다.

GitHub에서 추적된 가장 큰 5개의 Claude Code SKILL.md 모음 — 자동 새로고침 지원 정렬 가능 표
Claude Code의 상위 5개 스킬 컬렉션 저장소(총 125,000개 스타)를 별점 및 스킬 개수와 함께 정렬 가능한 표로 만들었으며, /workflows:skill-collections 명령어로 자동 새로고침됩니다.