vllm-mlx 포크는 로컬 AI 코딩 에이전트를 위한 도구 호출 및 프롬프트 캐시 기능을 추가합니다.

한 개발자가 Mac에서 OpenClaw와 같은 AI 코딩 에이전트를 로컬에서 실행하기 위한 여러 문제를 해결한 vllm-mlx의 수정 버전을 공개했습니다. 이 포크는 Apple Silicon용 OpenAI 호환 서버에 작동하는 도구 호출과 프롬프트 캐싱을 추가합니다.
주요 수정사항 및 기능
개발자는 특정 문제를 해결하기 위해 업스트림 vllm-mlx 위에 37개의 커밋을 수행했습니다:
- 도구 호출:
--tool-call-parser hermes플래그 추가 — Qwen3-Coder-Next 도구 호출이 즉시 작동 - MiniMax-M2.5: 스트리밍 및 비스트리밍 도구 호출 파싱 추가, 기능 호출 벤치마크(날씨, 검색, 코드 실행, 다중 도구)에서 4/4 정확도
- 프롬프트 캐시: SimpleEngine에 요청 간 지속적인 KV 캐시 추가 — 동일한 시스템 프롬프트와 대화 기록은 새로운 토큰만 사전 채움
- 추론 분리: 태그 없이 인라인으로 추론을 포함한 MiniMax 출력을 위한 휴리스틱 파서 구축 — 누출률을 60%에서 0%로 감소
성능 개선
33K 토큰 컨텍스트에서 첫 토큰까지의 시간(TTFT)이 캐시 히트 시 28초에서 0.3초로 개선되었습니다. Mac Studio M3 Ultra 256GB 기준 벤치마크:
- Qwen3-Coder-Next 4비트: 42GB RAM, 70 tok/s 디코딩, 1270 tok/s 프리필
- Qwen3-Coder-Next 6비트: 60GB RAM, 65 tok/s 디코딩, 1090-1440 tok/s 프리필
- Qwen3-Coder-Next 8비트: 75GB RAM, ~45 tok/s 디코딩, ~900 tok/s 프리필
- MiniMax-M2.5 4비트: 120GB RAM, 33-38 tok/s 디코딩, 430-500 tok/s 프리필
개발자는 대화형 코딩에 최적의 지점으로 Qwen3-Coder-Next 6비트를 권장하며, 품질이 4비트(가끔 왜곡된 출력 발생)보다 현저히 더 좋다고 언급했습니다.
설치 지침
pip install git+https://github.com/raullenchai/vllm-mlx.git
python -c "from mlx_lm import load; load('lmstudio-community/Qwen3-Coder-Next-MLX-6bit')"
python -m vllm_mlx.server \
--model lmstudio-community/Qwen3-Coder-Next-MLX-6bit \
--tool-call-parser hermes \
--prefill-step-size 8192 \
--kv-bits 8 \
--port 8000
그런 다음 OpenClaw 또는 모든 OpenAI SDK 클라이언트를 http://localhost:8000/v1으로 지정하세요.
하드웨어 요구사항
- Qwen3-Coder-Next 4비트: 42GB — M2 Pro 64GB 이상 필요
- Qwen3-Coder-Next 6비트: 60GB — M2/M3/M4 Max 96GB+ 또는 Ultra 필요
- MiniMax-M2.5: 120GB — Ultra 192GB+ 전용
작동하지 않은 사항
- Qwen3-0.6B를 드래프트 모델로 한 추측 디코딩 — mlx-lm에 Qwen3 관련 알려진 버그 존재(토큰 건너뜀, 이슈 #846)
- OpenClaw용 DeepSeek-R1-Distill-70B — 추론 능력은 뛰어나지만 도구 호출이 불안정함
이 저장소는 1500개 이상의 테스트를 포함하며 Apache 2.0 라이선스로 제공됩니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

자율적 클로드 코드 세션을 위한 디스코드 브리지
약 50줄의 bridge.js 스크립트(discord.js v14)가 WebSocket과 로컬 파일 큐를 통해 Discord와 Claude Code 간 실시간 양방향 채팅을 생성하며, 2분 간격 폴링을 마이크로초 단위 파일 읽기로 대체합니다. 27,000줄을 밤새 분석하여 테스트되었습니다.

cc-soul 플러그인은 OpenClaw에 지속적인 메모리와 적응형 페르소나를 추가합니다.
OpenClaw용 cc-soul 플러그인은 세션 간 영구 메모리 저장, 10개의 자동 전환 페르소나, 그리고 수정 사항 학습 기능을 제공합니다. 설치에는 단일 명령어만 필요하며 설정이 전혀 필요하지 않습니다.

코그니소어: PGE 트리니티 아키텍처 기반 로컬-퍼스트 에이전트 OS
Cognithor는 16개의 개발 단계를 거쳐 1년 동안 구축된 완전 로컬 자율 에이전트 OS입니다. PGE 트리니티 아키텍처(Planner → Gatekeeper → Executor), 89% 커버리지의 11,609개 이상의 테스트, Ollama 및 LM Studio를 포함한 16개의 LLM 제공업체를 지원하는 기능을 갖추고 있습니다.

mcp-optimizer는 Claude Code에서 유휴 상태의 MCP 서버로 인한 토큰 낭비를 줄여줍니다.
mcp-optimizer는 Claude Code에서 MCP 서버 사용 시 발생하는 토큰 낭비 문제를 해결하는 플러그인입니다. 이 플러그인은 도구 사용 패턴을 분석하고 최적화된 구성을 생성합니다. 네 가지 유틸리티를 포함하고 있습니다: 서버 상태 점검용 mcp-doctor, 사용 분석용 mcp-audit, 프로젝트별 최적 구성 생성용 mcp-optimize, 그리고 도구를 주문형 Skills로 변환하는 mcp-to-skills입니다.