oMLX는 Apple Silicon을 위해 SSD KV 캐싱을 도입하여 OpenClaw의 응답 시간을 30-90초에서 5초로 단축시켰습니다.

✍️ OpenClawRadar📅 게시일: March 7, 2026🔗 Source
oMLX는 Apple Silicon을 위해 SSD KV 캐싱을 도입하여 OpenClaw의 응답 시간을 30-90초에서 5초로 단축시켰습니다.
Ad

oMLX가 해결하는 문제

OpenClaw를 로컬에서 실행하면 일반적으로 모든 요청에 동일한 대규모 시스템 프롬프트(도구, 기술, 작업 공간 컨텍스트를 포함한 20-30k 토큰)를 전송해야 합니다. Ollama와 LM Studio는 KV 상태를 캐싱하지만, 세션 중간에 컨텍스트가 이동하면 전체 캐시를 무효화하고 처음부터 다시 계산하여 30-90초의 응답 시간이 발생합니다.

oMLX는 KV 캐시 블록을 safetensors 형식으로 SSD에 저장하여 이 문제를 해결합니다. 이전에 본 접두사가 다시 나타나면 재계산 대신 디스크에서 복원되며, 이는 요청과 서버 재시작을 거쳐도 작동합니다. OpenClaw의 시스템 프롬프트는 대부분 정적이므로(타임스탬프와 런타임 메타데이터만 변경됨), SSD 캐싱은 변경된 부분만 재계산된다는 의미입니다.

성능 벤치마크

M3 Ultra 512GB에서 Qwen3.5-122B-A10B-4bit로 테스트:

  • 단일 요청 벤치마크:
    • 1k 컨텍스트: 768 tok/s 프롬프트 처리, 56.6 tok/s 생성, 65.5 GB 피크 메모리
    • 8k 컨텍스트: 940 tok/s 프롬프트 처리, 51.4 tok/s 생성, 69.3 GB 피크 메모리
    • 32k 컨텍스트: 764 tok/s 프롬프트 처리, 42.4 tok/s 생성, 73.4 GB 피크 메모리
  • 연속 배칭 (pp1024/tg128):
    • 1x 배치: 56.6 tok/s, 1.00x 속도 향상
    • 2x 배치: 92.1 tok/s, 1.63x 속도 향상
    • 4x 배치: 135.1 tok/s, 2.39x 속도 향상
    • 8x 배치: 190.2 tok/s, 3.36x 속도 향상
Ad

OpenClaw와 함께 설정하기

  • 릴리스에서 DMG를 다운로드하여 Applications로 드래그
  • 모델 디렉토리를 지정(LM Studio 모델 재사용, 재다운로드 불필요)
  • openclaw.json에 oMLX를 사용자 지정 공급자로 추가
  • 웹 대시보드에서 정확한 구성을 생성 - 터미널 불필요

추가 기능

  • 다중 모델 서빙: LLM + 임베딩 + 리랭커 동시 실행
  • 모든 주요 형식(JSON, Qwen, Gemma, GLM) + MCP에 대한 도구 호출
  • 도구 결과 트리밍 - 과도하게 큰 도구 출력을 잘라냄
  • OpenAI + Anthropic /v1/messages 즉시 호환성
  • 네이티브 macOS 메뉴 바 앱(Electron 아님)
  • Apache 2.0 라이선스, 100% 오픈 소스

📖 전체 소스 읽기: r/openclaw

Ad

👀 See Also

SwiftUI와 CSM-1B로 Apple Silicon에서 로컬 음성 AI 어시스턴트 구축하기
Tools

SwiftUI와 CSM-1B로 Apple Silicon에서 로컬 음성 AI 어시스턴트 구축하기

개발자가 mobiGlas를 만들었습니다. 이는 SwiftUI 앱으로, OpenClaw와 연동하여 AirPods을 통한 핸즈프리 대화를 가능하게 하며, 로컬 음성 복제(CSM-1B on M2 Ultra)를 사용하고 클라우드 API가 필요 없습니다.

OpenClawRadar
Logira: AI 에이전트 실행을 위한 eBPF 런타임 감사
Tools

Logira: AI 에이전트 실행을 위한 eBPF 런타임 감사

Logira는 AI 에이전트 실행 중 eBPF를 통해 exec, 파일, 네트워크 이벤트를 기록하는 관찰 전용 Linux CLI 도구로, 실행별 로컬 저장소를 JSONL 및 SQLite 형식으로 제공하며 자격 증명 접근, 지속성 변경, 의심스러운 패턴에 대한 내장 탐지 규칙을 포함합니다.

OpenClawRadar
Memento v1.0: Claude Code용 지속적 메모리 MCP 서버, 17개의 도구 포함
Tools

Memento v1.0: Claude Code용 지속적 메모리 MCP 서버, 17개의 도구 포함

Memento v1.0는 Claude Code용 지속적 메모리 MCP 서버로, 17개의 도구, 하이브리드 검색, 모순 감지 및 시각적 메모리 그래프를 제공합니다. 클라우드 의존성 없이 로컬에서 실행되며 Claude Code, Cursor, Windsurf, OpenCode를 포함한 여러 IDE를 지원합니다.

OpenClawRadar
클로드오브: 클로드 API 사용량을 실시간으로 모니터링하는 크롬 확장 프로그램
Tools

클로드오브: 클로드 API 사용량을 실시간으로 모니터링하는 크롬 확장 프로그램

한 개발자가 ClaudeOrb라는 무료 Chrome 확장 프로그램을 만들었습니다. 이 확장 프로그램은 Claude 세션 사용률, 주간 제한, 카운트다운 타이머, Claude Code 비용, 7일간 지출 추이를 표시합니다. 이 도구는 경고 없이 사용량 제한에 도달한 후 Claude Code를 사용하여 만들어졌습니다.

OpenClawRadar