PinchBench bewertet Qwen und Nemotron auf Mac Studio M3 Ultra: Nemotron Super erreicht 99,2 % beim Coding

✍️ OpenClawRadar📅 Veröffentlicht: 24. September 2026🔗 Source
Ad

PinchBench ist ein Benchmarking-Tool für lokale Modelle von OpenClaw. Ein Entwickler hat Ergebnisse veröffentlicht, die er mit sechs Modellen auf einem Mac Studio M3 Ultra (256 GB RAM, 60-Core-GPU) erzielt hat – bei einer Temperatur von 0,8 und einem Kontextfenster von 200.000 Token, wo dies unterstützt wurde. Die folgende Rangliste stammt direkt aus diesem Beitrag – inklusive der Unterschiede, die vor der Wahl eines Alltagsmodells relevant sind.

Vollständige Ergebnisse

#ModellFestplattengrößeMax. Token-FensterGesamt / Coding
1Qwen3.6 35B A3B20,4 GB262k87,9 % / 92,6 %
2QWEN3-Coder-next-Q884,8 GB262k85,5 % / 97,9 %
3Qwen3.5-122B-a10b-uncensored-hauhaucs-aggressive78,7 GB262k83,5 % / 91,7 %
4Nemotron-3-super86,1 GB1,05 Mio.78,2 % / 99,2 %
5QWEN3.8-flash-next95,43 GB262k71,2 % / 79,2 %
6Nemotron-3-nano-30b-a3b-mlx33,6 GB262k65,8 % / 65,1 %

Der Beitrag listet außerdem ein Dolphin-Mistral-24b-venice-edition-mlx-8b mit 25,1 GB und einem Token-Fenster von 131k, aber die Benchmark-Gesamtzahl ist im Quelltext abgeschnitten. Die Ergebnisse dafür sind in der vorliegenden Form nicht verwendbar.

Ad

Was heraussticht

  • Qwen3.6 35B A3B gewinnt bei der Ausgewogenheit. Höchste Gesamtpunktzahl (87,9 %) und ein starker Coding-Wert von 92,6 % – bei nur 20,4 GB auf der Festplatte. Es ist außerdem das Alltagsmodell des Autors.
  • QWEN3-Coder-next-Q8 ist der Coding-Spezialist. 97,9 % beim Coding, aber nur 85,5 % insgesamt – und 84,8 GB, mehr als das Vierfache des Speicherbedarfs des 35B A3B. Der Autor hatte es vor diesem Test noch nicht verwendet und will es ausprobieren.
  • Nemotron-3-super hat den höchsten Coding-Wert mit 99,2 %, aber seine Gesamtpunktzahl von 78,2 % ist die niedrigste der Top vier. Es hat außerdem das größte Kontextfenster im Feld mit 1,05 Mio. Token – viermal so viel wie die Qwen-Modelle.
  • Der Abstand zwischen Nemotron Super und Nano ist groß. 99,2 % vs. 65,1 % beim Coding, 78,2 % vs. 65,8 % insgesamt. Nano ist weniger als halb so groß (33,6 GB vs. 86,1 GB), was einen Teil davon erklärt.
  • QWEN3.8-flash-next schnitt für seine Größe schlecht ab. Mit 95,43 GB – dem größten getesteten Modell – erreichte es 71,2 % / 79,2 % und lag damit unter Qwen3.5-122B (78,7 GB).

Zwei Einschränkungen des Autors

Erstens gibt er an, keine effektiven Einstellungen für QWEN3.8 auf dem Mac gefunden zu haben, und bittet um funktionierende Einstellungen. Der niedrige Wert für QWEN3.8-flash-next sollte nicht als Modellgrenze interpretiert werden, solange dies nicht geklärt ist.

Zweitens sind alle Zahlen Einzelmaschinen- und Einzeldurchlaufwerte bei Temperatur 0,8 auf M3-Ultra-Hardware. Betrachten Sie die Rangliste als Ausgangspunkt für Ihren eigenen PinchBench-Durchlauf, nicht als endgültiges Urteil – besonders bevor Sie 85–95 GB Festplattenspeicher für einen Download ausgeben.

Für wen das gedacht ist

Für alle, die lokale Modelle in OpenClaw oder ähnlichen Agenten auf Apple Silicon mit ausreichend Unified Memory (64 GB+) ausführen, um 30–120B-Modelle zu laden. Wer 32 GB oder weniger hat, für den ist das 20,4 GB große Qwen3.6 35B A3B die einzige realistische Wahl aus dieser Liste – das zufällig auch der Spitzenreiter ist.

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch