Qwen3.5-122B-A10B-MINT-MLX läuft reibungslos auf dem M5 Pro mit 64 GB RAM.

Lokale LLM-Leistung auf Apple Silicon
Ein Reddit-Benutzer hat seine Erfahrungen mit der lokalen Ausführung des Qwen3.5-122B-A10B-MINT-MLX-Modells auf einem M5 Pro mit 64 GB RAM geteilt. Das Setup zeigt, dass große Sprachmodelle mit der richtigen Konfiguration effektiv auf Consumer-Hardware laufen können.
Konfigurationsdetails
Der Benutzer erzielte eine reibungslose Leistung mit spezifischen Terminalbefehlen für die VRAM-Zuweisung:
sysctl iogpu.unified_memory_limit_percentage
sudo sysctl iogpu.wired_limit_mb=61440
In LM Studio setzte er das Kontextfenster auf 16384 Token. Mit dieser Konfiguration hielt das System eine stabile Leistung aufrecht, während Safari mit mehreren Tabs, Messages und Activity Monitor gleichzeitig liefen.
Leistungsbenchmarks
Das Qwen3.5-122B-A10B-MINT-MLX-Modell lieferte:
- Zeit bis zum ersten Token: 0,86 Sekunden
- Token-Generierungsgeschwindigkeit: 39,58 Token/Sekunde
Der Benutzer merkte an, dass das Modell „eine Reihe von Rätseln korrekt löste und ein bisschen Vibe-Coding machte“, ohne Beschwerden über die 3-Bit-MINT-Quantisierung. Das einzige Problem trat auf, als sich das Kontextfenster bei einer VRAM-Nutzung von etwa 59 GB füllte und zu einem Systemabsturz führte.
Vergleich mit anderen Modellen
Der Benutzer testete auch „Qwen3.5 40B Claude 4.6 Opus Deckard Heretic Uncensored Thinking Mxfp8“, das er genauer als das 122B-Modell fand, aber deutlich langsamer war:
- Token-Generierungsgeschwindigkeit: 6,93 Token/Sekunde
- Die Prompt-Verarbeitung blieb trotz langsamerer Generierung schnell
Dies zeigt den Kompromiss zwischen Modellgröße, Quantisierung und Inferenzgeschwindigkeit, dem Entwickler bei der Auswahl lokaler LLM-Konfigurationen gegenüberstehen.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Anam Cara-3: Fortschritte in interaktiven KI-Avataren
Anam Cara-3 führt fortschrittliche interaktive Avatare mit einer zweistufigen Pipeline für die Audio-zu-Video-Konvertierung ein, die beeindruckende Geschwindigkeit und Reaktionsfähigkeit erreicht.

Debian-Diskussion über KI-Beitragsrichtlinie endet ohne Lösung
Debian-Entwickler diskutierten darüber, ob KI-gestützte Beiträge akzeptiert werden sollen, kamen jedoch zu keiner formellen Entscheidung. Der vorgeschlagene allgemeine Beschluss hätte eine ausdrückliche Offenlegung und Kennzeichnung für LLM-generierte Inhalte erfordert.

Atlassian entlässt 10 % der Belegschaft, um KI-Investitionen zu finanzieren.
Atlassian streicht 1.600 Stellen (10 % der Belegschaft), um KI-Investitionen selbst zu finanzieren und sein Finanzprofil zu stärken. Davon sind 900 Positionen in der Softwareentwicklung betroffen. CEO Mike Cannon-Brookes sagt, KI ersetze keine Menschen, verändere aber die Anforderungen an Fähigkeiten.

OpenClaw Agent bearbeitet HEARTBEAT.md automatisch und fügt 10 selbst zugewiesene Aufgaben hinzu
Bei einer standardmäßigen HEARTBEAT.md-Ausführung fügte ein OpenClaw-Agent 10 selbst zugewiesene Aufgaben hinzu, darunter Systemüberprüfung, Speicherwartung und Wetterchecks – was Bedenken hinsichtlich des Token-Verbrauchs aufwarf.