PinchBench classifica Qwen e Nemotron no Mac Studio M3 Ultra: Nemotron Super atinge 99,2% em codificação
O PinchBench é uma ferramenta de benchmark de modelos locais do OpenClaw. Um desenvolvedor publicou resultados da execução de seis modelos em um Mac Studio M3 Ultra (256 GB de RAM, GPU de 60 núcleos), com temperatura em 0,8 e a janela de contexto definida para 200.000 tokens quando suportado. A classificação abaixo foi retirada diretamente desse post — incluindo as diferenças que você consideraria antes de escolher um modelo para o dia a dia.
Resultados completos
| # | Modelo | Tamanho em disco | Janela máxima de tokens | Total / Programação |
|---|---|---|---|---|
| 1 | Qwen3.6 35B A3B | 20,4 GB | 262k | 87,9% / 92,6% |
| 2 | QWEN3-Coder-next-Q8 | 84,8 GB | 262k | 85,5% / 97,9% |
| 3 | Qwen3.5-122B-a10b-uncensored-hauhaucs-aggressive | 78,7 GB | 262k | 83,5% / 91,7% |
| 4 | Nemotron-3-super | 86,1 GB | 1,05M | 78,2% / 99,2% |
| 5 | QWEN3.8-flash-next | 95,43 GB | 262k | 71,2% / 79,2% |
| 6 | Nemotron-3-nano-30b-a3b-mlx | 33,6 GB | 262k | 65,8% / 65,1% |
O post também lista um Dolphin-Mistral-24b-venice-edition-mlx-8b com 25,1 GB e uma janela de 131k tokens, mas o total do benchmark está truncado no texto original. Os resultados dele não são utilizáveis como estão.
O que se destaca
- O Qwen3.6 35B A3B vence no equilíbrio. Maior pontuação total (87,9%) e uma forte pontuação de 92,6% em programação, com apenas 20,4 GB em disco. Também é o modelo usado diariamente pelo autor.
- O QWEN3-Coder-next-Q8 é o especialista em programação. 97,9% em programação, mas 85,5% no geral — e 84,8 GB, mais de quatro vezes o espaço em disco do 35B A3B. O autor não o havia usado antes deste teste e diz que vai experimentá-lo.
- O Nemotron-3-super tem a maior pontuação em programação, com 99,2%, mas seu total de 78,2% é o mais baixo entre os quatro primeiros. Ele também tem a maior janela de contexto do grupo, com 1,05M tokens — 4x os modelos Qwen.
- A diferença entre Nemotron Super e Nano é grande. 99,2% vs 65,1% em programação, 78,2% vs 65,8% no total. O Nano tem menos da metade do tamanho (33,6 GB vs 86,1 GB), o que explica parte disso.
- O QWEN3.8-flash-next teve desempenho abaixo do esperado para seu tamanho. Com 95,43 GB — o maior modelo testado — ele marcou 71,2% / 79,2%, abaixo do Qwen3.5-122B (78,7 GB).
Duas ressalvas do autor
Primeiro, ele diz que não encontrou configurações eficazes para o QWEN3.8 no Mac e está pedindo configurações que funcionem. A pontuação baixa do QWEN3.8-flash-next não deve ser interpretada como um limite do modelo até que isso seja resolvido.
Segundo, todos os números são de uma única máquina, em uma única execução com temperatura 0,8 no hardware M3 Ultra. Trate a classificação como um ponto de partida para sua própria execução no PinchBench, não como um veredito — especialmente antes de gastar 85-95 GB de disco em um download.
Para quem é isto
Para qualquer pessoa que rode modelos locais no OpenClaw ou agentes similares em Apple Silicon com memória unificada suficiente (64GB+) para carregar modelos de 30-120B. Se você tem 32GB ou menos, o Qwen3.6 35B A3B de 20,4 GB é a única escolha realista desta lista — que, por acaso, é o maior pontuador de qualquer forma.
📖 Leia a fonte completa: r/openclaw
👀 See Also

Pneuma: Um Ambiente de Desktop Gerado por IA Onde o Software Se Materializa a Partir de Descrições
Pneuma é um ambiente de computação desktop onde você descreve o que deseja—um monitor de CPU, jogo, aplicativo de notas ou visualizador de dados—e um programa funcional se materializa em segundos. O sistema gera módulos autônomos em Rust, os compila para WebAssembly e os executa em instâncias sandboxed do Wasmtime com renderização GPU via wgpu.

Ferramenta de Limite de Aprovação para Trabalho no Repositório de Código Claude
Um desenvolvedor criou uma ferramenta de limite de aprovação que adiciona uma etapa de revisão antes da execução local ao usar o Claude Code para trabalhos em repositório. A ferramenta segue um ciclo: veja o plano primeiro, aprove uma vez, deixe a execução acontecer localmente e mantenha a prova depois.

Código Aberto Claude: Habilidades para Conteúdo Personalizado em Mídias Sociais
Um desenvolvedor disponibilizou em código aberto 13 habilidades do Claude Code que ajudam o Claude a escrever conteúdo para mídias sociais com a sua própria voz. As habilidades incluem ferramentas de definição de contexto, estratégia, criação e análise para LinkedIn, Twitter/X, Threads e Bluesky.

Doc Harness: Uma Habilidade de Código do Claude para Manter o Estado do Projeto Entre Sessões
Doc Harness é uma habilidade do Claude Code que cria um sistema de documentação leve com cinco arquivos estruturados para ajudar agentes de IA a manter o contexto do projeto entre sessões. Ele aborda problemas como redefinições de contexto, regras esquecidas e a necessidade de reexplicar projetos para novos agentes.