Qwen3.5-122B-A10B-MINT-MLX läuft reibungslos auf dem M5 Pro mit 64 GB RAM.

✍️ OpenClawRadar📅 Veröffentlicht: 20. April 2026🔗 Source
Qwen3.5-122B-A10B-MINT-MLX läuft reibungslos auf dem M5 Pro mit 64 GB RAM.
Ad

Lokale LLM-Leistung auf Apple Silicon

Ein Reddit-Benutzer hat seine Erfahrungen mit der lokalen Ausführung des Qwen3.5-122B-A10B-MINT-MLX-Modells auf einem M5 Pro mit 64 GB RAM geteilt. Das Setup zeigt, dass große Sprachmodelle mit der richtigen Konfiguration effektiv auf Consumer-Hardware laufen können.

Konfigurationsdetails

Der Benutzer erzielte eine reibungslose Leistung mit spezifischen Terminalbefehlen für die VRAM-Zuweisung:

sysctl iogpu.unified_memory_limit_percentage
sudo sysctl iogpu.wired_limit_mb=61440

In LM Studio setzte er das Kontextfenster auf 16384 Token. Mit dieser Konfiguration hielt das System eine stabile Leistung aufrecht, während Safari mit mehreren Tabs, Messages und Activity Monitor gleichzeitig liefen.

Ad

Leistungsbenchmarks

Das Qwen3.5-122B-A10B-MINT-MLX-Modell lieferte:

  • Zeit bis zum ersten Token: 0,86 Sekunden
  • Token-Generierungsgeschwindigkeit: 39,58 Token/Sekunde

Der Benutzer merkte an, dass das Modell „eine Reihe von Rätseln korrekt löste und ein bisschen Vibe-Coding machte“, ohne Beschwerden über die 3-Bit-MINT-Quantisierung. Das einzige Problem trat auf, als sich das Kontextfenster bei einer VRAM-Nutzung von etwa 59 GB füllte und zu einem Systemabsturz führte.

Vergleich mit anderen Modellen

Der Benutzer testete auch „Qwen3.5 40B Claude 4.6 Opus Deckard Heretic Uncensored Thinking Mxfp8“, das er genauer als das 122B-Modell fand, aber deutlich langsamer war:

  • Token-Generierungsgeschwindigkeit: 6,93 Token/Sekunde
  • Die Prompt-Verarbeitung blieb trotz langsamerer Generierung schnell

Dies zeigt den Kompromiss zwischen Modellgröße, Quantisierung und Inferenzgeschwindigkeit, dem Entwickler bei der Auswahl lokaler LLM-Konfigurationen gegenüberstehen.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Pantheon-Reasoning-27B: Ein dichtes Reasoning-RP-Modell von Gryphe
Nachrichten

Pantheon-Reasoning-27B: Ein dichtes Reasoning-RP-Modell von Gryphe

Gryphe veröffentlicht Pantheon-Reasoning-27B, ein unzensiertes Qwen 3.6 27B Feintuning mit vollständigen Reasoning-Spuren für Rollenspiele. Basierend auf Pantheon, Opus-4.6-Reasoning-24k, WorldSim, Textadventure und allgemeinen Rollenspieldaten. GGUF-Quants verfügbar.

OpenClawRadar
Lokale Qwen3.6 27b + Hermes Agent erledigt Junior-IT-Admin-Aufgaben
Nachrichten

Lokale Qwen3.6 27b + Hermes Agent erledigt Junior-IT-Admin-Aufgaben

Ein 30-jähriger IT-Veteran berichtet, dass Qwen3.6 27b im Hermes-Agent-Harnisch eine Aufgabenliste für einen Junior-IT-Admin in 1,5 Stunden erledigt hat – inklusive Patchen, Docker-Installation und Service-Einrichtung.

OpenClawRadar
Agentisches Codieren ist eine Falle: Kognitive Schulden und Atrophie
Nachrichten

Agentisches Codieren ist eine Falle: Kognitive Schulden und Atrophie

Lars Faye argumentiert, dass agentische Codierungswerkzeuge wie Claude Code zu kognitiver Atrophie, Vendor Lock-in und erhöhter Komplexität führen und die Last vom Schreiben von Code auf das Überprüfen generierten Codes verlagern, was die Fähigkeiten der Entwickler beeinträchtigt.

OpenClawRadar
Allbirds wechselt von Schuhen zu KI-Infrastruktur, Aktien steigen um 580 %.
Nachrichten

Allbirds wechselt von Schuhen zu KI-Infrastruktur, Aktien steigen um 580 %.

Das Schuhunternehmen Allbirds kündigte einen 50-Millionen-Dollar-Deal an, um zu einem KI-Recheninfrastrukturunternehmen namens NewBird AI zu werden, wodurch seine Aktien um 580 % stiegen. Das Unternehmen plant, GPUs zu kaufen und On-Demand-Grafikchips und Cloud-Dienste für KI anzubieten.

OpenClawRadar