PinchBench bewertet Qwen und Nemotron auf Mac Studio M3 Ultra: Nemotron Super erreicht 99,2 % beim Coding
PinchBench ist ein Benchmarking-Tool für lokale Modelle von OpenClaw. Ein Entwickler hat Ergebnisse veröffentlicht, die er mit sechs Modellen auf einem Mac Studio M3 Ultra (256 GB RAM, 60-Core-GPU) erzielt hat – bei einer Temperatur von 0,8 und einem Kontextfenster von 200.000 Token, wo dies unterstützt wurde. Die folgende Rangliste stammt direkt aus diesem Beitrag – inklusive der Unterschiede, die vor der Wahl eines Alltagsmodells relevant sind.
Vollständige Ergebnisse
| # | Modell | Festplattengröße | Max. Token-Fenster | Gesamt / Coding |
|---|---|---|---|---|
| 1 | Qwen3.6 35B A3B | 20,4 GB | 262k | 87,9 % / 92,6 % |
| 2 | QWEN3-Coder-next-Q8 | 84,8 GB | 262k | 85,5 % / 97,9 % |
| 3 | Qwen3.5-122B-a10b-uncensored-hauhaucs-aggressive | 78,7 GB | 262k | 83,5 % / 91,7 % |
| 4 | Nemotron-3-super | 86,1 GB | 1,05 Mio. | 78,2 % / 99,2 % |
| 5 | QWEN3.8-flash-next | 95,43 GB | 262k | 71,2 % / 79,2 % |
| 6 | Nemotron-3-nano-30b-a3b-mlx | 33,6 GB | 262k | 65,8 % / 65,1 % |
Der Beitrag listet außerdem ein Dolphin-Mistral-24b-venice-edition-mlx-8b mit 25,1 GB und einem Token-Fenster von 131k, aber die Benchmark-Gesamtzahl ist im Quelltext abgeschnitten. Die Ergebnisse dafür sind in der vorliegenden Form nicht verwendbar.
Was heraussticht
- Qwen3.6 35B A3B gewinnt bei der Ausgewogenheit. Höchste Gesamtpunktzahl (87,9 %) und ein starker Coding-Wert von 92,6 % – bei nur 20,4 GB auf der Festplatte. Es ist außerdem das Alltagsmodell des Autors.
- QWEN3-Coder-next-Q8 ist der Coding-Spezialist. 97,9 % beim Coding, aber nur 85,5 % insgesamt – und 84,8 GB, mehr als das Vierfache des Speicherbedarfs des 35B A3B. Der Autor hatte es vor diesem Test noch nicht verwendet und will es ausprobieren.
- Nemotron-3-super hat den höchsten Coding-Wert mit 99,2 %, aber seine Gesamtpunktzahl von 78,2 % ist die niedrigste der Top vier. Es hat außerdem das größte Kontextfenster im Feld mit 1,05 Mio. Token – viermal so viel wie die Qwen-Modelle.
- Der Abstand zwischen Nemotron Super und Nano ist groß. 99,2 % vs. 65,1 % beim Coding, 78,2 % vs. 65,8 % insgesamt. Nano ist weniger als halb so groß (33,6 GB vs. 86,1 GB), was einen Teil davon erklärt.
- QWEN3.8-flash-next schnitt für seine Größe schlecht ab. Mit 95,43 GB – dem größten getesteten Modell – erreichte es 71,2 % / 79,2 % und lag damit unter Qwen3.5-122B (78,7 GB).
Zwei Einschränkungen des Autors
Erstens gibt er an, keine effektiven Einstellungen für QWEN3.8 auf dem Mac gefunden zu haben, und bittet um funktionierende Einstellungen. Der niedrige Wert für QWEN3.8-flash-next sollte nicht als Modellgrenze interpretiert werden, solange dies nicht geklärt ist.
Zweitens sind alle Zahlen Einzelmaschinen- und Einzeldurchlaufwerte bei Temperatur 0,8 auf M3-Ultra-Hardware. Betrachten Sie die Rangliste als Ausgangspunkt für Ihren eigenen PinchBench-Durchlauf, nicht als endgültiges Urteil – besonders bevor Sie 85–95 GB Festplattenspeicher für einen Download ausgeben.
Für wen das gedacht ist
Für alle, die lokale Modelle in OpenClaw oder ähnlichen Agenten auf Apple Silicon mit ausreichend Unified Memory (64 GB+) ausführen, um 30–120B-Modelle zu laden. Wer 32 GB oder weniger hat, für den ist das 20,4 GB große Qwen3.6 35B A3B die einzige realistische Wahl aus dieser Liste – das zufällig auch der Spitzenreiter ist.
📖 Read the full source: r/openclaw
👀 Siehe auch

Sylve: Eine FreeBSD-Verwaltungsebene für Virtualisierung, Container und Speicher
Sylve ist eine unter BSD-2 lizenzierte Management-Ebene für FreeBSD, die eine einheitliche Steuerung von Bhyve-VMs, FreeBSD-Jails, ZFS-Speicher und Netzwerkfunktionen bietet. Es verwendet ein RAFT-Konsensmodell für Clustering und beinhaltet Samba-Freigabeverwaltung mit ZFS-Snapshot-Automatisierung.

Open-Source-CLI nutzt Claude Haiku zur Automatisierung der Xero-Ausgabenprüfung
Ein Entwickler hat ein Open-Source-Python-CLI-Tool veröffentlicht, das Claude Haiku 4.5 zur Automatisierung der Xero-Ausgabenprüfung nutzt. Das Tool folgt einem 'deterministischen Code-zuerst, dann KI zur Lückenfüllung'-Ansatz und hält die Kosten auf wenige Cent pro Prüflauf.

Echtzeit-Desktop-Overlay zur Überwachung der Nutzungslimits von Claude Code
Das Open-Source-Desktop-Overlay zeigt die Nutzungslimits von Claude Code in Echtzeit an, wodurch die wiederholte Eingabe von '/usage' entfällt.

Claude Workflow-Bibliothek: 10 komplette KI-Workflows für Nicht-Techniker
Ein kostenloses GitHub-Repository bietet 10 komplette KI-Workflows für Claude-Nutzer ohne technischen Hintergrund, darunter Systeme für Studium, Forschung, Schreiben, Business, Content-Erstellung, Entscheidungsfindung, Lernen, Jobsuche, Produktivität und Lebensplanung.