oMLX führt SSD-KV-Caching für Apple Silicon ein und reduziert die Antwortzeiten von OpenClaw von 30-90 Sekunden auf 5 Sekunden.

✍️ OpenClawRadar📅 Veröffentlicht: 7. März 2026🔗 Source
oMLX führt SSD-KV-Caching für Apple Silicon ein und reduziert die Antwortzeiten von OpenClaw von 30-90 Sekunden auf 5 Sekunden.
Ad

Was oMLX löst

OpenClaw lokal auszuführen bedeutet normalerweise, dass bei jeder Anfrage das gleiche riesige System-Prompt (20-30k Token mit Tools, Fähigkeiten, Arbeitsbereichskontext) gesendet wird. Während Ollama und LM Studio den KV-Zustand zwischenspeichern, invalidieren sie den gesamten Cache und berechnen ihn bei Kontextwechseln während einer Sitzung neu, was zu Antwortzeiten von 30-90 Sekunden führt.

oMLX behebt dies, indem KV-Cache-Blöcke im Safetensors-Format auf der SSD gespeichert werden. Wenn ein zuvor gesehenes Präfix zurückkehrt, wird es von der Festplatte wiederhergestellt statt neu berechnet – funktioniert über Anfragen und Server-Neustarts hinweg. Da das System-Prompt von OpenClaw größtenteils statisch ist (nur Zeitstempel und Laufzeit-Metadaten ändern sich), bedeutet SSD-Caching, dass nur geänderte Teile neu berechnet werden.

Leistungsbenchmarks

Getestet mit Qwen3.5-122B-A10B-4bit auf M3 Ultra 512GB:

  • Einzelanfrage-Benchmarks:
    • 1k Kontext: 768 Tok/s Prompt-Verarbeitung, 56,6 Tok/s Generierung, 65,5 GB Spitzenspeicher
    • 8k Kontext: 940 Tok/s Prompt-Verarbeitung, 51,4 Tok/s Generierung, 69,3 GB Spitzenspeicher
    • 32k Kontext: 764 Tok/s Prompt-Verarbeitung, 42,4 Tok/s Generierung, 73,4 GB Spitzenspeicher
  • Kontinuierliches Batching (pp1024/tg128):
    • 1x Batch: 56,6 Tok/s, 1,00x Beschleunigung
    • 2x Batch: 92,1 Tok/s, 1,63x Beschleunigung
    • 4x Batch: 135,1 Tok/s, 2,39x Beschleunigung
    • 8x Batch: 190,2 Tok/s, 3,36x Beschleunigung
Ad

Einrichtung mit OpenClaw

  • Laden Sie die DMG von den Releases herunter und ziehen Sie sie in den Applications-Ordner
  • Richten Sie es auf Ihr Modellverzeichnis (verwendet LM Studio-Modelle, kein erneuter Download nötig)
  • Fügen Sie oMLX als benutzerdefinierten Provider in openclaw.json hinzu
  • Das Web-Dashboard generiert die genaue Konfiguration – kein Terminal erforderlich

Zusätzliche Funktionen

  • Multi-Modell-Serving: LLM + Embedding + Reranker gleichzeitig
  • Tool-Aufrufe für alle gängigen Formate (JSON, Qwen, Gemma, GLM) + MCP
  • Tool-Ergebnis-Trimming – kürzt zu große Tool-Ausgaben
  • OpenAI + Anthropic /v1/messages Drop-in-Kompatibilität
  • Native macOS-Menüleisten-App (kein Electron)
  • Apache 2.0 Lizenz, 100 % Open Source

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch

Lightning MLX: Schnelle lokale KI-Engine für Apple Silicon Agentic Use liefert 220 tok/s auf Qwen 35B-A3B
Werkzeuge

Lightning MLX: Schnelle lokale KI-Engine für Apple Silicon Agentic Use liefert 220 tok/s auf Qwen 35B-A3B

Lightning MLX beansprucht, die schnellste lokale KI-Inferenz auf Apple Silicon zu bieten, optimiert für Coding-Agenten und Tool-Aufrufe. Benchmarks zeigen 40,67 Tok/s auf Qwen3.6-27B und 220,86 Tok/s auf Qwen3.6-35B-A3B von einem MacBook Max M5 (128 GB).

OpenClawRadar
ClawCut Proxy auf GitHub veröffentlicht, um OpenClaw für kleine LLMs zu optimieren
Werkzeuge

ClawCut Proxy auf GitHub veröffentlicht, um OpenClaw für kleine LLMs zu optimieren

ClawCut ist ein experimenteller Proxy, der JSON-Aufrufe manipuliert, injiziert und JSON-Überfluss aus OpenClaw extrahiert, um die kognitive Belastung kleiner Modelle (7B-8B) auf begrenzter Hardware zu reduzieren.

OpenClawRadar
Wissens-Rabe: Eine modellunabhängige Wissensbasis-Plattform, erstellt mit Claude Code
Werkzeuge

Wissens-Rabe: Eine modellunabhängige Wissensbasis-Plattform, erstellt mit Claude Code

Knowledge Raven ist eine Wissensbasis-Plattform, die es jedem MCP-kompatiblen LLM ermöglicht, Unternehmensdokumente zu durchsuchen und zu zitieren. Die gesamte Plattform wurde von einem Einzelgründer mit Claude Code entwickelt und verfügt über ein Python/FastAPI-Backend, eine MCP-Tool-Schicht und eine agentenbasierte RAG-Pipeline.

OpenClawRadar
Benutzerdefinierte Reddit MCP für Claude Desktop/Code auf GitHub geteilt
Werkzeuge

Benutzerdefinierte Reddit MCP für Claude Desktop/Code auf GitHub geteilt

Ein Entwickler hat ein selbst erstelltes Reddit MCP veröffentlicht, das speziell für Claude Desktop und Claude Code entwickelt wurde, um Reddit-Recherchen direkt in den Arbeitsablauf zu integrieren. Das Tool ist auf GitHub dokumentiert und steht kostenlos zur Verfügung.

OpenClawRadar