oMLX는 Apple Silicon을 위해 SSD KV 캐싱을 도입하여 OpenClaw의 응답 시간을 30-90초에서 5초로 단축시켰습니다.

oMLX가 해결하는 문제
OpenClaw를 로컬에서 실행하면 일반적으로 모든 요청에 동일한 대규모 시스템 프롬프트(도구, 기술, 작업 공간 컨텍스트를 포함한 20-30k 토큰)를 전송해야 합니다. Ollama와 LM Studio는 KV 상태를 캐싱하지만, 세션 중간에 컨텍스트가 이동하면 전체 캐시를 무효화하고 처음부터 다시 계산하여 30-90초의 응답 시간이 발생합니다.
oMLX는 KV 캐시 블록을 safetensors 형식으로 SSD에 저장하여 이 문제를 해결합니다. 이전에 본 접두사가 다시 나타나면 재계산 대신 디스크에서 복원되며, 이는 요청과 서버 재시작을 거쳐도 작동합니다. OpenClaw의 시스템 프롬프트는 대부분 정적이므로(타임스탬프와 런타임 메타데이터만 변경됨), SSD 캐싱은 변경된 부분만 재계산된다는 의미입니다.
성능 벤치마크
M3 Ultra 512GB에서 Qwen3.5-122B-A10B-4bit로 테스트:
- 단일 요청 벤치마크:
- 1k 컨텍스트: 768 tok/s 프롬프트 처리, 56.6 tok/s 생성, 65.5 GB 피크 메모리
- 8k 컨텍스트: 940 tok/s 프롬프트 처리, 51.4 tok/s 생성, 69.3 GB 피크 메모리
- 32k 컨텍스트: 764 tok/s 프롬프트 처리, 42.4 tok/s 생성, 73.4 GB 피크 메모리
- 연속 배칭 (pp1024/tg128):
- 1x 배치: 56.6 tok/s, 1.00x 속도 향상
- 2x 배치: 92.1 tok/s, 1.63x 속도 향상
- 4x 배치: 135.1 tok/s, 2.39x 속도 향상
- 8x 배치: 190.2 tok/s, 3.36x 속도 향상
OpenClaw와 함께 설정하기
- 릴리스에서 DMG를 다운로드하여 Applications로 드래그
- 모델 디렉토리를 지정(LM Studio 모델 재사용, 재다운로드 불필요)
- openclaw.json에 oMLX를 사용자 지정 공급자로 추가
- 웹 대시보드에서 정확한 구성을 생성 - 터미널 불필요
추가 기능
- 다중 모델 서빙: LLM + 임베딩 + 리랭커 동시 실행
- 모든 주요 형식(JSON, Qwen, Gemma, GLM) + MCP에 대한 도구 호출
- 도구 결과 트리밍 - 과도하게 큰 도구 출력을 잘라냄
- OpenAI + Anthropic /v1/messages 즉시 호환성
- 네이티브 macOS 메뉴 바 앱(Electron 아님)
- Apache 2.0 라이선스, 100% 오픈 소스
📖 전체 소스 읽기: r/openclaw
👀 See Also

TeamHero v2.6.1: Claude AI 에이전트 관리를 위한 오픈소스 플랫폼
TeamHero v2.6.1는 로컬 우선 오픈소스 플랫폼으로, 자동 조종 모드, 하위 작업 중첩, 흐름 보기, 지속적 메모리 등의 기능을 갖춘 Claude 에이전트 관리 팀을 생성합니다. 이 도구는 Node.js에서 실행되며, 바닐라 HTML/CSS/JS 대시보드를 사용하며 데이터베이스가 필요하지 않습니다.

Google의 HEIR 컴파일러: 동형 암호화를 통한 실용적인 프라이빗 AI
Google이 HEIR(Homomorphic Encryption Intermediate Representation)를 오픈소스로 공개했습니다. HEIR은 개발자가 암호화된 데이터에서 AI 추론을 실행할 수 있게 해주는 컴파일러로, 사기 탐지, 추천 등 다양한 데모를 제공합니다.

ClawControl v1.3.1은 미디어 지원, 음성 받아쓰기 및 Linux 패키징을 추가합니다.
ClawControl v1.3.1은 이미지 공유, 웨이크워드 음성 받아쓰기, 사용량 차트, Linux AppImage/.deb 패키지를 지원하는 크로스 플랫폼 OpenClaw 클라이언트입니다. 이번 릴리스에는 OpenClaw 2.19+ 사용자가 Control UI Allowed Origins를 업데이트해야 하는 보안 업데이트가 포함되어 있습니다.

Benchmark Shows CLI Tool Reduces Claude Code Token Costs by 32% Through Structural Navigation
A developer built a Rust CLI tool that gives Claude Code agents structural navigation commands like 'show me a 180-token summary of this 6,000-token class.' Benchmarking on Sonnet 4.6 across 54 automated runs showed 32% lower cost per task and 67% more code edits per session.