oMLX는 Apple Silicon을 위해 SSD KV 캐싱을 도입하여 OpenClaw의 응답 시간을 30-90초에서 5초로 단축시켰습니다.

✍️ OpenClawRadar📅 게시일: March 7, 2026🔗 Source
oMLX는 Apple Silicon을 위해 SSD KV 캐싱을 도입하여 OpenClaw의 응답 시간을 30-90초에서 5초로 단축시켰습니다.
Ad

oMLX가 해결하는 문제

OpenClaw를 로컬에서 실행하면 일반적으로 모든 요청에 동일한 대규모 시스템 프롬프트(도구, 기술, 작업 공간 컨텍스트를 포함한 20-30k 토큰)를 전송해야 합니다. Ollama와 LM Studio는 KV 상태를 캐싱하지만, 세션 중간에 컨텍스트가 이동하면 전체 캐시를 무효화하고 처음부터 다시 계산하여 30-90초의 응답 시간이 발생합니다.

oMLX는 KV 캐시 블록을 safetensors 형식으로 SSD에 저장하여 이 문제를 해결합니다. 이전에 본 접두사가 다시 나타나면 재계산 대신 디스크에서 복원되며, 이는 요청과 서버 재시작을 거쳐도 작동합니다. OpenClaw의 시스템 프롬프트는 대부분 정적이므로(타임스탬프와 런타임 메타데이터만 변경됨), SSD 캐싱은 변경된 부분만 재계산된다는 의미입니다.

성능 벤치마크

M3 Ultra 512GB에서 Qwen3.5-122B-A10B-4bit로 테스트:

  • 단일 요청 벤치마크:
    • 1k 컨텍스트: 768 tok/s 프롬프트 처리, 56.6 tok/s 생성, 65.5 GB 피크 메모리
    • 8k 컨텍스트: 940 tok/s 프롬프트 처리, 51.4 tok/s 생성, 69.3 GB 피크 메모리
    • 32k 컨텍스트: 764 tok/s 프롬프트 처리, 42.4 tok/s 생성, 73.4 GB 피크 메모리
  • 연속 배칭 (pp1024/tg128):
    • 1x 배치: 56.6 tok/s, 1.00x 속도 향상
    • 2x 배치: 92.1 tok/s, 1.63x 속도 향상
    • 4x 배치: 135.1 tok/s, 2.39x 속도 향상
    • 8x 배치: 190.2 tok/s, 3.36x 속도 향상
Ad

OpenClaw와 함께 설정하기

  • 릴리스에서 DMG를 다운로드하여 Applications로 드래그
  • 모델 디렉토리를 지정(LM Studio 모델 재사용, 재다운로드 불필요)
  • openclaw.json에 oMLX를 사용자 지정 공급자로 추가
  • 웹 대시보드에서 정확한 구성을 생성 - 터미널 불필요

추가 기능

  • 다중 모델 서빙: LLM + 임베딩 + 리랭커 동시 실행
  • 모든 주요 형식(JSON, Qwen, Gemma, GLM) + MCP에 대한 도구 호출
  • 도구 결과 트리밍 - 과도하게 큰 도구 출력을 잘라냄
  • OpenAI + Anthropic /v1/messages 즉시 호환성
  • 네이티브 macOS 메뉴 바 앱(Electron 아님)
  • Apache 2.0 라이선스, 100% 오픈 소스

📖 전체 소스 읽기: r/openclaw

Ad

👀 See Also

ComfyUI 스킬을 통해 AI 에이전트가 자연어로 이미지 렌더링을 큐에 추가하고 일괄 처리할 수 있습니다
Tools

ComfyUI 스킬을 통해 AI 에이전트가 자연어로 이미지 렌더링을 큐에 추가하고 일괄 처리할 수 있습니다

새로운 오픈소스 스킬을 통해 OpenClaw 에이전트가 ComfyUI 워크플로우를 구성하고, 작업을 제출하며, '이 컨셉을 다양한 시드로 50가지 변형 만들어 줘' 또는 '이 4가지 프롬프트를 1024x1024로 나란히 비교해 줘'와 같은 자연어 명령어로 렌더를 관리할 수 있게 되었습니다.

OpenClawRadar
프롬프트 마스터: 정확한 AI 도구 프롬프트 생성을 위한 Claude 스킬
Tools

프롬프트 마스터: 정확한 AI 도구 프롬프트 생성을 위한 Claude 스킬

Prompt-Master는 Cursor, Claude Code, GPT, Midjourney, Kling, Eleven Labs를 포함한 다양한 AI 도구를 위한 정확한 프롬프트를 작성하는 무료 Claude 스킬입니다. 이 도구는 GitHub에서 600개 이상의 스타를 달성했으며 4000회 이상의 트래픽을 처리하고 있습니다.

OpenClawRadar
🦀
Tools

Mergetrain: 병렬 Claude Code 세션에서 푸시 충돌을 방지하는 로컬 병합 큐

Mergetrain은 여러 Claude Code 세션이 서로의 푸시를 덮어쓰는 문제를 방지하는 로컬 병합 큐입니다. 워크트리, 사전 푸시 훅, 브랜치를 기차로 조립한 후 테스트를 실행하고 원자적으로 푸시하는 단일 러너를 사용합니다.

OpenClawRadar
OpenClaw Memory-Core용 외부 리랭커 플러그인: 오래된 GPU 재활용하기
Tools

OpenClaw Memory-Core용 외부 리랭커 플러그인: 오래된 GPU 재활용하기

OpenClaw용 플러그인이 공개되어 memory-core가 기본 QMD 대신 외부 재순위화를 사용할 수 있게 되었습니다. CPU 성능이 제한된 시스템에서 성능을 개선합니다.

OpenClawRadar