Lokale LLM-Leistungsbenchmarks auf dem Mac Mini mit OpenClaw und LM Studio

Ein Reddit-Nutzer teilte konkrete Leistungsbenchmarks für das lokale Ausführen eines großen Sprachmodells auf einem Mac Mini mit 32 GB RAM mit. Der Beitrag befasst sich mit der Knappheit spezifischer Leistungsdaten für diese Hardwarekonfiguration.
Details zum technischen Setup
Der Nutzer berichtete über die folgende Konfiguration und Ergebnisse:
- Softwareversionen: OpenClaw 2026.3.8, LM Studio 0.4.6+1
- Modell: Unsloth gpt-oss-20b-Q4_K_S.gguf
- Kontextgröße: 26035
- Leistungsmetriken: 34 Token/Sekunde nach der ersten Eingabeaufforderung, 0,7 Sekunden Zeit bis zum ersten Token
Modellkonfiguration
Der Nutzer gab diese Modelleinstellungen an (alle auf Standardwerten):
- GPU-Auslagerung = 18
- CPU-Thread-Pool-Größe = 7
- Maximale gleichzeitige Vorgänge = 4
- Anzahl der Experten = 4
- Flash-Aufmerksamkeit = an
Die Q4_K_S-Quantisierung zeigt an, dass es sich um eine 4-Bit-quantisierte Version des 20-Milliarden-Parameter-Modells handelt, die den Speicherbedarf reduziert und gleichzeitig eine angemessene Leistung beibehält. Der 32-GB-RAM des Mac Mini ist für diese Modellgröße mit der angegebenen Kontextlänge ausreichend. Der Durchsatz von 34 Token/Sekunde ist ein praktischer Benchmark für Entwickler, die ähnliche lokale LLM-Setups auf Apple-Silicon-Hardware in Betracht ziehen.
📖 Read the full source: r/openclaw
👀 Siehe auch

Mehrfach-Anbieter-LLM-Fallback-Kette mit Ollama-Unterstützung in der produktiven KI-IDE
Resonant Genesis AI IDE integriert lokale LLM-Unterstützung als erstklassigen Anbieter neben Groq, OpenAI, Anthropic und Gemini über 30+ Microservices hinweg, wobei eine gemeinsame UnifiedLLMClient-Bibliothek mit automatischer Fallback-Kette verwendet wird.

Argus: Eine VS Code-Erweiterung zur Fehlerbehebung von Claude Code-Sitzungskosten und -Verhalten
Ein Entwickler hat Argus entwickelt, eine VS Code-Erweiterung, die Claude Code JSONL-Transkripte in eine Echtzeit-Zeitleiste mit detaillierten Kostenaufschlüsselungen pro Schritt, Cache-Trefferquote und Kennzeichnung von Wiederholungsschleifen, doppelten Lesevorgängen und Kontextüberlastung umwandelt.

Agenten & KI.mpires: Strategiespiel, in dem KI-Agenten spielen und Menschen zuschauen
Agents & A.I.mpires ist ein dauerhaftes Echtzeit-Strategiespiel auf einem hexagon-gitterförmigen Globus, in dem KI-Agenten autonom Territorium beanspruchen, angreifen, Allianzen bilden und tägliche Kriegsblogs über HTTP-API-Aufrufe schreiben. Menschen beobachten lediglich das emergente Verhalten.

Qwen 3.6 27B F16 besteht den Pacman-Codierungstest, aber 8-Bit-Quantisierungen scheitern — Wichtige Lektionen zu Vorlagen und MTP-spekulativer Dekodierung
Ein Benutzer erledigt einen Pacman-Klon mit Qwen 3.6 27B F16 in einem Durchgang – zwei von drei Versuchen produzieren fast perfekte Spiele. 8-Bit-Quantisierungen scheitern völlig. Detaillierte Notizen zur Chat-Vorlagenoptimierung und zu MTP-Spekulationsdekodierungsgeschwindigkeitssteigerungen.