Mac Studio lokales LLM-Setup: GLM 5.1, Kimi K2.6 und was beim Codieren mit Claude Code funktioniert

✍️ OpenClawRadar📅 Veröffentlicht: 7. Mai 2026🔗 Source
Mac Studio lokales LLM-Setup: GLM 5.1, Kimi K2.6 und was beim Codieren mit Claude Code funktioniert
Ad

Im r/LocalLLaMA-Subreddit veröffentlichte der Nutzer ezyz sein Mac Studio Lokal-LLM-Setup von Mai 2026, das auf einem M3 Ultra mit 512 GB Unified Memory läuft. Der Beitrag ist ein täglicher Stimmungscheck, keine rigorosen Benchmarks, aber voller praktischer Beobachtungen für alle, die große Modelle lokal für die Programmierung mit Claude Code betreiben.

Aktuelle aktive Modelle und Leistung

GLM 5.1 ist der größte Gewinner. Quantisiert passt es in ~380 GB mit maximalem Kontext und lässt Platz für andere Aufgaben. Die Decode-Geschwindigkeit beträgt ~17 t/s, Prefill ~190 t/s. Der Autor vertraut ihm bei Aufgabenkomplexität bis 6/10 (10 bedeutet 'Brownfield-Legacy-Codebasis + vage Spezifikation') für das Programmieren mit Claude Code. Es bewältigt eigenständige, halbwegs abgegrenzte Probleme konsistent, mit gelegentlicher API-Claude-Unterstützung für Planung oder Bereinigung.

Kimi K2.6 liegt auf dem gleichen Niveau – nicht offensichtlich besser oder schlechter –, ist aber größer. Selbst stark quantisiert benötigt es ~460 GB und lässt wenig Spielraum für andere Experimente. Es ist schneller: Prefill ~220 t/s, Decode ~21 t/s. Der Nachteil ist, dass man es entladen muss, um speicherintensive Experimente durchzuführen.

Minimax 2.7 beeindruckt durch seine Größe und Geschwindigkeit, aber der Autor bewertet es für Entwicklungsarbeit nur mit 3-4/10. Es hat eine unpassende Größe – GLM und Kimi punkten beim Ausliefern von nutzbarem Code, während kleinere Modelle bei Assistenzaufgaben wie 'fasse diese Websuche zusammen' gewinnen. Es bricht zudem schnell die Argumentation für einfache Anfragen ab.

Gemma 4 31B enttäuschte: Die MLX-Unterstützung ist einen Monat nach Veröffentlichung immer noch chaotisch. Das 31B dichte Modell ist nicht viel schneller als die großen MoEs, die offizielle Chat-Vorlage hat mehrere nicht behobene Fehler, und Patches trudeln immer noch ein. Der Autor plant, es erneut zu testen, sobald die MTP/Draft-Unterstützung stabilisiert ist.

Qwen 3.6 35B wurde durch Qwen 3.5 9B für multimodale Aufgaben wie das Übersetzen von Screenshots ersetzt – es ist gut genug und schnell genug und erledigt die Haiku-Hintergrundaufgaben von Claude Code ohne merklichen Unterschied, während es ~14 GB Speicher spart.

Ad

Ausstehender Support und zukünftige Beobachtungen

Weder Deepseek 4 Flash noch Mimo 2.5 sind offiziell in llama.cpp oder mlx-lm gelandet. Der Autor wird die PRs ausprobieren, wenn die Zeit es erlaubt. Er vermutet, dass die Pro-Versionen beider Modelle zu groß und langsam für den M3 Ultra sein werden – GLMs 40B aktive Parameter sind ungefähr seine Geduldgrenze.

Mit Spannung verfolgte Projekte:

  • Exo und tinygrad für Mac + NVIDIA-Clustering und disaggregiertes Prefill
  • Stable Dflash / DDtree / MTP-Unterstützung
  • Neuartige Quantisierungsformate (paroquant, JANGTQ) – siehe llama.cpp PR #21038
  • Lokale Musikgenerierung – Ace Step 1.5 ist 'fast gut', aber die Stimmen sind noch nicht da.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Täglicher 3,5-Stunden-Sprach- + Claude-Workflow: Spezifikationen beim Gehen diktieren, mit Claude Code erstellen
Anwendungsfälle

Täglicher 3,5-Stunden-Sprach- + Claude-Workflow: Spezifikationen beim Gehen diktieren, mit Claude Code erstellen

Ein Entwickler geht mit 3 Hunden 12+ Mal am Tag spazieren (3,5 Stunden) und nutzt dabei Spracheingabe + Claude, um zu brainstormen, zu recherchieren und spec.md-Dateien zu erstellen. Anschließend baut Claude Code basierend auf diesen Spezifikationen.

OpenClawRadar
Einzelgründer baut Nachrichtenanalyse-Plattform mit Claude Code: Lektionen über Skalierung und Fehlerbehebung
Anwendungsfälle

Einzelgründer baut Nachrichtenanalyse-Plattform mit Claude Code: Lektionen über Skalierung und Fehlerbehebung

Ein alleiniger Gründer ohne Informatikstudium hat The Daily Martian aufgebaut, eine Nachrichtenanalyseplattform, die über 40 Nachrichtenquellen analysiert, indem sie Python/FastAPI, PostgreSQL, Redis und React/TypeScript verwendet, hauptsächlich durch Claude Code. Der Entwickler teilt spezifische Herausforderungen wie Kontextverlust, Datenbankverbindungsprobleme und Debugging-Strategien.

OpenClawRadar
Verwendung von Claude Opus 4 zur KI-Orchestrierung auf begrenzter Hardware
Anwendungsfälle

Verwendung von Claude Opus 4 zur KI-Orchestrierung auf begrenzter Hardware

Erforschung von Claude Opus 4 als Denkmaschine auf einem 2014 Mac Mini, Nutzung der Claude API für die Bearbeitung komplexer Orchestrierungsaufgaben.

OpenClawRadar
Mit Claude Code eine Japan-Reiseblog mit KI-generierter Kunst und Videos erstellen
Anwendungsfälle

Mit Claude Code eine Japan-Reiseblog mit KI-generierter Kunst und Videos erstellen

Ein Entwickler dokumentierte seinen Workflow mit Claude Code, um eine vollständige persönliche Essay-Website über Japan zu erstellen, die alles vom Schreiben bis zur visuellen Gestaltung und Bereitstellung umfasste.

OpenClawRadar