Lokale LLM-Leistungsbenchmarks auf dem Mac Mini mit OpenClaw und LM Studio

✍️ OpenClawRadar📅 Veröffentlicht: 18. April 2026🔗 Source
Lokale LLM-Leistungsbenchmarks auf dem Mac Mini mit OpenClaw und LM Studio
Ad

Ein Reddit-Nutzer teilte konkrete Leistungsbenchmarks für das lokale Ausführen eines großen Sprachmodells auf einem Mac Mini mit 32 GB RAM mit. Der Beitrag befasst sich mit der Knappheit spezifischer Leistungsdaten für diese Hardwarekonfiguration.

Details zum technischen Setup

Der Nutzer berichtete über die folgende Konfiguration und Ergebnisse:

  • Softwareversionen: OpenClaw 2026.3.8, LM Studio 0.4.6+1
  • Modell: Unsloth gpt-oss-20b-Q4_K_S.gguf
  • Kontextgröße: 26035
  • Leistungsmetriken: 34 Token/Sekunde nach der ersten Eingabeaufforderung, 0,7 Sekunden Zeit bis zum ersten Token
Ad

Modellkonfiguration

Der Nutzer gab diese Modelleinstellungen an (alle auf Standardwerten):

  • GPU-Auslagerung = 18
  • CPU-Thread-Pool-Größe = 7
  • Maximale gleichzeitige Vorgänge = 4
  • Anzahl der Experten = 4
  • Flash-Aufmerksamkeit = an

Die Q4_K_S-Quantisierung zeigt an, dass es sich um eine 4-Bit-quantisierte Version des 20-Milliarden-Parameter-Modells handelt, die den Speicherbedarf reduziert und gleichzeitig eine angemessene Leistung beibehält. Der 32-GB-RAM des Mac Mini ist für diese Modellgröße mit der angegebenen Kontextlänge ausreichend. Der Durchsatz von 34 Token/Sekunde ist ein praktischer Benchmark für Entwickler, die ähnliche lokale LLM-Setups auf Apple-Silicon-Hardware in Betracht ziehen.

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch

Mehrfach-Anbieter-LLM-Fallback-Kette mit Ollama-Unterstützung in der produktiven KI-IDE
Werkzeuge

Mehrfach-Anbieter-LLM-Fallback-Kette mit Ollama-Unterstützung in der produktiven KI-IDE

Resonant Genesis AI IDE integriert lokale LLM-Unterstützung als erstklassigen Anbieter neben Groq, OpenAI, Anthropic und Gemini über 30+ Microservices hinweg, wobei eine gemeinsame UnifiedLLMClient-Bibliothek mit automatischer Fallback-Kette verwendet wird.

OpenClawRadar
Argus: Eine VS Code-Erweiterung zur Fehlerbehebung von Claude Code-Sitzungskosten und -Verhalten
Werkzeuge

Argus: Eine VS Code-Erweiterung zur Fehlerbehebung von Claude Code-Sitzungskosten und -Verhalten

Ein Entwickler hat Argus entwickelt, eine VS Code-Erweiterung, die Claude Code JSONL-Transkripte in eine Echtzeit-Zeitleiste mit detaillierten Kostenaufschlüsselungen pro Schritt, Cache-Trefferquote und Kennzeichnung von Wiederholungsschleifen, doppelten Lesevorgängen und Kontextüberlastung umwandelt.

OpenClawRadar
Agenten & KI.mpires: Strategiespiel, in dem KI-Agenten spielen und Menschen zuschauen
Werkzeuge

Agenten & KI.mpires: Strategiespiel, in dem KI-Agenten spielen und Menschen zuschauen

Agents & A.I.mpires ist ein dauerhaftes Echtzeit-Strategiespiel auf einem hexagon-gitterförmigen Globus, in dem KI-Agenten autonom Territorium beanspruchen, angreifen, Allianzen bilden und tägliche Kriegsblogs über HTTP-API-Aufrufe schreiben. Menschen beobachten lediglich das emergente Verhalten.

OpenClawRadar
Qwen 3.6 27B F16 besteht den Pacman-Codierungstest, aber 8-Bit-Quantisierungen scheitern — Wichtige Lektionen zu Vorlagen und MTP-spekulativer Dekodierung
Werkzeuge

Qwen 3.6 27B F16 besteht den Pacman-Codierungstest, aber 8-Bit-Quantisierungen scheitern — Wichtige Lektionen zu Vorlagen und MTP-spekulativer Dekodierung

Ein Benutzer erledigt einen Pacman-Klon mit Qwen 3.6 27B F16 in einem Durchgang – zwei von drei Versuchen produzieren fast perfekte Spiele. 8-Bit-Quantisierungen scheitern völlig. Detaillierte Notizen zur Chat-Vorlagenoptimierung und zu MTP-Spekulationsdekodierungsgeschwindigkeitssteigerungen.

OpenClawRadar