PinchBench classifica Qwen e Nemotron no Mac Studio M3 Ultra: Nemotron Super atinge 99,2% em codificação

✍️ OpenClawRadar📅 Publicado: September 24, 2026🔗 Source
Ad

O PinchBench é uma ferramenta de benchmark de modelos locais do OpenClaw. Um desenvolvedor publicou resultados da execução de seis modelos em um Mac Studio M3 Ultra (256 GB de RAM, GPU de 60 núcleos), com temperatura em 0,8 e a janela de contexto definida para 200.000 tokens quando suportado. A classificação abaixo foi retirada diretamente desse post — incluindo as diferenças que você consideraria antes de escolher um modelo para o dia a dia.

Resultados completos

#ModeloTamanho em discoJanela máxima de tokensTotal / Programação
1Qwen3.6 35B A3B20,4 GB262k87,9% / 92,6%
2QWEN3-Coder-next-Q884,8 GB262k85,5% / 97,9%
3Qwen3.5-122B-a10b-uncensored-hauhaucs-aggressive78,7 GB262k83,5% / 91,7%
4Nemotron-3-super86,1 GB1,05M78,2% / 99,2%
5QWEN3.8-flash-next95,43 GB262k71,2% / 79,2%
6Nemotron-3-nano-30b-a3b-mlx33,6 GB262k65,8% / 65,1%

O post também lista um Dolphin-Mistral-24b-venice-edition-mlx-8b com 25,1 GB e uma janela de 131k tokens, mas o total do benchmark está truncado no texto original. Os resultados dele não são utilizáveis como estão.

Ad

O que se destaca

  • O Qwen3.6 35B A3B vence no equilíbrio. Maior pontuação total (87,9%) e uma forte pontuação de 92,6% em programação, com apenas 20,4 GB em disco. Também é o modelo usado diariamente pelo autor.
  • O QWEN3-Coder-next-Q8 é o especialista em programação. 97,9% em programação, mas 85,5% no geral — e 84,8 GB, mais de quatro vezes o espaço em disco do 35B A3B. O autor não o havia usado antes deste teste e diz que vai experimentá-lo.
  • O Nemotron-3-super tem a maior pontuação em programação, com 99,2%, mas seu total de 78,2% é o mais baixo entre os quatro primeiros. Ele também tem a maior janela de contexto do grupo, com 1,05M tokens — 4x os modelos Qwen.
  • A diferença entre Nemotron Super e Nano é grande. 99,2% vs 65,1% em programação, 78,2% vs 65,8% no total. O Nano tem menos da metade do tamanho (33,6 GB vs 86,1 GB), o que explica parte disso.
  • O QWEN3.8-flash-next teve desempenho abaixo do esperado para seu tamanho. Com 95,43 GB — o maior modelo testado — ele marcou 71,2% / 79,2%, abaixo do Qwen3.5-122B (78,7 GB).

Duas ressalvas do autor

Primeiro, ele diz que não encontrou configurações eficazes para o QWEN3.8 no Mac e está pedindo configurações que funcionem. A pontuação baixa do QWEN3.8-flash-next não deve ser interpretada como um limite do modelo até que isso seja resolvido.

Segundo, todos os números são de uma única máquina, em uma única execução com temperatura 0,8 no hardware M3 Ultra. Trate a classificação como um ponto de partida para sua própria execução no PinchBench, não como um veredito — especialmente antes de gastar 85-95 GB de disco em um download.

Para quem é isto

Para qualquer pessoa que rode modelos locais no OpenClaw ou agentes similares em Apple Silicon com memória unificada suficiente (64GB+) para carregar modelos de 30-120B. Se você tem 32GB ou menos, o Qwen3.6 35B A3B de 20,4 GB é a única escolha realista desta lista — que, por acaso, é o maior pontuador de qualquer forma.

📖 Leia a fonte completa: r/openclaw

Ad

👀 See Also

Pneuma: Um Ambiente de Desktop Gerado por IA Onde o Software Se Materializa a Partir de Descrições
Tools

Pneuma: Um Ambiente de Desktop Gerado por IA Onde o Software Se Materializa a Partir de Descrições

Pneuma é um ambiente de computação desktop onde você descreve o que deseja—um monitor de CPU, jogo, aplicativo de notas ou visualizador de dados—e um programa funcional se materializa em segundos. O sistema gera módulos autônomos em Rust, os compila para WebAssembly e os executa em instâncias sandboxed do Wasmtime com renderização GPU via wgpu.

OpenClawRadar
Ferramenta de Limite de Aprovação para Trabalho no Repositório de Código Claude
Tools

Ferramenta de Limite de Aprovação para Trabalho no Repositório de Código Claude

Um desenvolvedor criou uma ferramenta de limite de aprovação que adiciona uma etapa de revisão antes da execução local ao usar o Claude Code para trabalhos em repositório. A ferramenta segue um ciclo: veja o plano primeiro, aprove uma vez, deixe a execução acontecer localmente e mantenha a prova depois.

OpenClawRadar
Código Aberto Claude: Habilidades para Conteúdo Personalizado em Mídias Sociais
Tools

Código Aberto Claude: Habilidades para Conteúdo Personalizado em Mídias Sociais

Um desenvolvedor disponibilizou em código aberto 13 habilidades do Claude Code que ajudam o Claude a escrever conteúdo para mídias sociais com a sua própria voz. As habilidades incluem ferramentas de definição de contexto, estratégia, criação e análise para LinkedIn, Twitter/X, Threads e Bluesky.

OpenClawRadar
Doc Harness: Uma Habilidade de Código do Claude para Manter o Estado do Projeto Entre Sessões
Tools

Doc Harness: Uma Habilidade de Código do Claude para Manter o Estado do Projeto Entre Sessões

Doc Harness é uma habilidade do Claude Code que cria um sistema de documentação leve com cinco arquivos estruturados para ajudar agentes de IA a manter o contexto do projeto entre sessões. Ele aborda problemas como redefinições de contexto, regras esquecidas e a necessidade de reexplicar projetos para novos agentes.

OpenClawRadar