PinchBench classe Qwen et Nemotron sur Mac Studio M3 Ultra : Nemotron Super atteint 99,2 % en codage

✍️ OpenClawRadar📅 Publié: September 24, 2026🔗 Source
Ad

PinchBench est un outil de benchmarking de modèles locaux pour OpenClaw. Un développeur a publié les résultats de six modèles exécutés sur un Mac Studio M3 Ultra (256 Go de RAM, GPU 60 cœurs), avec une température de 0,8 et une fenêtre de contexte réglée à 200 000 tokens lorsque le modèle le permettait. Le classement ci-dessous est repris directement de ce post — y compris les écarts qui comptent avant de choisir son modèle quotidien.

Résultats complets

#ModèleTaille sur disqueFenêtre de tokens maxTotal / Codage
1Qwen3.6 35B A3B20,4 Go262k87,9 % / 92,6 %
2QWEN3-Coder-next-Q884,8 Go262k85,5 % / 97,9 %
3Qwen3.5-122B-a10b-uncensored-hauhaucs-aggressive78,7 Go262k83,5 % / 91,7 %
4Nemotron-3-super86,1 Go1,05M78,2 % / 99,2 %
5QWEN3.8-flash-next95,43 Go262k71,2 % / 79,2 %
6Nemotron-3-nano-30b-a3b-mlx33,6 Go262k65,8 % / 65,1 %

Le post mentionne également un Dolphin-Mistral-24b-venice-edition-mlx-8b à 25,1 Go avec une fenêtre de 131k tokens, mais le score total du benchmark est tronqué dans le texte source. Les résultats le concernant ne sont pas exploitables en l'état.

Ad

Ce qui ressort

  • Qwen3.6 35B A3B gagne sur l'équilibre. Meilleur score total (87,9 %) et un solide 92,6 % en codage, pour seulement 20,4 Go sur disque. C'est aussi le modèle quotidien de l'auteur.
  • QWEN3-Coder-next-Q8 est le spécialiste du codage. 97,9 % en codage mais un total plus faible de 85,5 % — et 84,8 Go, soit plus de quatre fois l'empreinte disque du 35B A3B. L'auteur ne l'avait jamais utilisé avant ce test et compte l'essayer.
  • Nemotron-3-super a le meilleur score de codage à 99,2 %, mais son total de 78,2 % est le plus bas du top 4. Il possède aussi la plus grande fenêtre de contexte du panel avec 1,05M tokens — 4x celle des modèles Qwen.
  • L'écart entre Nemotron Super et Nano est important. 99,2 % contre 65,1 % en codage, 78,2 % contre 65,8 % au total. Le Nano fait moins de la moitié de la taille (33,6 Go contre 86,1 Go), ce qui explique une partie de l'écart.
  • QWEN3.8-flash-next est décevant pour sa taille. À 95,43 Go — le plus gros modèle testé — il n'obtient que 71,2 % / 79,2 %, en dessous du Qwen3.5-122B (78,7 Go).

Deux réserves de l'auteur

Premièrement, il indique ne pas avoir trouvé de réglages efficaces pour QWEN3.8 sur Mac et demande des configurations qui fonctionnent. Le faible score de QWEN3.8-flash-next ne doit pas être interprété comme une limite du modèle tant que ce point n'est pas résolu.

Deuxièmement, tous les chiffres proviennent d'une seule machine, d'une seule exécution à température 0,8 sur du matériel M3 Ultra. Considérez ce classement comme un point de départ pour votre propre test PinchBench, pas comme un verdict — surtout avant de consacrer 85 à 95 Go de disque à un téléchargement.

À qui cela s'adresse

À tous ceux qui exécutent des modèles locaux dans OpenClaw ou des agents similaires sur Apple Silicon avec suffisamment de mémoire unifiée (64 Go et plus) pour charger des modèles de 30 à 120B. Si vous disposez de 32 Go ou moins, le Qwen3.6 35B A3B de 20,4 Go est le seul choix réaliste de cette liste — et c'est justement celui qui obtient le meilleur score total.

📖 Lire la source complète : r/openclaw

Ad

👀 See Also

Index de code local pour les agents de codage : résout les imports sans serveur de langage
Tools

Index de code local pour les agents de codage : résout les imports sans serveur de langage

Basemind est un outil Rust sous licence MIT qui indexe le code local et résout les imports sans serveur de langage, prenant en charge la résolution réelle pour JS/TS, Python et Java.

OpenClawRadar
md-redline : outil GUI pour réviser et transférer des documents Markdown à Claude
Tools

md-redline : outil GUI pour réviser et transférer des documents Markdown à Claude

md-redline est un outil open-source qui vous permet d'ouvrir des fichiers markdown dans une interface graphique, de laisser des commentaires en ligne stockés sous forme de marqueurs HTML dans le fichier .md, et de repasser la main à Claude pour les mises à jour. Il fonctionne localement sans nécessiter de compte, de cloud ou de base de données.

OpenClawRadar
Superpouvoirs d'OpenClaw : Une bibliothèque de 31 compétences pour résoudre les problèmes de sécurité, de coût et de fiabilité.
Tools

Superpouvoirs d'OpenClaw : Une bibliothèque de 31 compétences pour résoudre les problèmes de sécurité, de coût et de fiabilité.

Un développeur a publié openclaw-superpowers, une bibliothèque de 31 compétences prêtes à l'emploi pour OpenClaw. La bibliothèque aborde des problèmes courants comme les coûts d'API incontrôlés, les vulnérabilités de sécurité et la perte de contexte, avec une installation via une seule commande.

OpenClawRadar
CLAUDE.md : Un fichier prêt à l'emploi réduit de 63 % les tokens de sortie de Claude
Tools

CLAUDE.md : Un fichier prêt à l'emploi réduit de 63 % les tokens de sortie de Claude

CLAUDE.md est un fichier unique qui réduit la verbosité des réponses de Claude d'environ 63 % sans modification de code. Il cible la flagornerie, la verbosité et le bruit de formatage dans les réponses de Claude.

OpenClawRadar