PinchBench clasifica Qwen y Nemotron en Mac Studio M3 Ultra: Nemotron Super alcanza 99.2% en codificación

✍️ OpenClawRadar📅 Publicado: 24 de septiembre de 2026🔗 Source
Ad

PinchBench es una herramienta de benchmarking de modelos locales de OpenClaw. Un desarrollador publicó los resultados de ejecutar seis modelos en un Mac Studio M3 Ultra (256 GB de RAM, GPU de 60 núcleos), con temperatura de 0,8 y una ventana de contexto de 200.000 tokens donde era compatible. La clasificación a continuación está tomada directamente de esa publicación, incluidas las diferencias que te importarían antes de elegir un modelo para el día a día.

Resultados completos

#ModeloTamaño en discoVentana máx. de tokensTotal / Código
1Qwen3.6 35B A3B20,4 GB262k87,9 % / 92,6 %
2QWEN3-Coder-next-Q884,8 GB262k85,5 % / 97,9 %
3Qwen3.5-122B-a10b-uncensored-hauhaucs-aggressive78,7 GB262k83,5 % / 91,7 %
4Nemotron-3-super86,1 GB1,05M78,2 % / 99,2 %
5QWEN3.8-flash-next95,43 GB262k71,2 % / 79,2 %
6Nemotron-3-nano-30b-a3b-mlx33,6 GB262k65,8 % / 65,1 %

La publicación también menciona un Dolphin-Mistral-24b-venice-edition-mlx-8b de 25,1 GB con una ventana de 131k tokens, pero el total del benchmark está truncado en el texto original. Sus resultados no son utilizables tal como están escritos.

Ad

Lo más destacado

  • Qwen3.6 35B A3B gana en equilibrio. La puntuación total más alta (87,9 %) y una sólida puntuación en código del 92,6 %, con solo 20,4 GB en disco. También es el modelo que el autor usa a diario.
  • QWEN3-Coder-next-Q8 es el especialista en código. 97,9 % en código pero un 85,5 % general más bajo, y 84,8 GB, más de cuatro veces el espacio en disco del 35B A3B. El autor no lo había usado antes de esta prueba y dice que lo probará.
  • Nemotron-3-super tiene la puntuación de código más alta, con un 99,2 %, pero su total del 78,2 % es el más bajo de los cuatro primeros. También tiene la ventana de contexto más grande de la lista, con 1,05 millones de tokens, 4 veces la de los modelos Qwen.
  • La diferencia entre Nemotron Super y Nano es grande. 99,2 % frente a 65,1 % en código, 78,2 % frente a 65,8 % en total. Nano tiene menos de la mitad del tamaño (33,6 GB frente a 86,1 GB), lo que explica parte de la diferencia.
  • QWEN3.8-flash-next rindió por debajo de lo esperado para su tamaño. Con 95,43 GB, el modelo más grande probado, obtuvo un 71,2 % / 79,2 %, por debajo de Qwen3.5-122B (78,7 GB).

Dos advertencias del autor

Primero, dice que no ha encontrado ajustes efectivos para QWEN3.8 en Mac y pide ajustes que funcionen. La baja puntuación de QWEN3.8-flash-next no debería interpretarse como un límite del modelo hasta que se resuelva eso.

Segundo, todas las cifras son de una sola máquina y una sola ejecución a temperatura 0,8 en hardware M3 Ultra. Toma la clasificación como un punto de partida para tu propia ejecución de PinchBench, no como un veredicto, especialmente antes de gastar 85-95 GB de disco en una descarga.

Para quién es esto

Para cualquiera que ejecute modelos locales en OpenClaw o agentes similares en Apple Silicon con suficiente memoria unificada (64 GB o más) para cargar modelos de 30 a 120B. Si tienes 32 GB o menos, el Qwen3.6 35B A3B de 20,4 GB es la única opción realista de esta lista, que además resulta ser el que obtuvo la mejor puntuación.

📖 Lee la fuente completa: r/openclaw

Ad

👀 Ver también

🦀
Herramientas

Munder Difflin: Dirige una oficina de tus clones de IA

Munder Difflin es un arnés de agentes de código abierto que envuelve sus agentes CLI existentes para ejecutarse 24/7 en su computadora portátil, permitiendo que clones suyos y de sus compañeros colaboren con cifrado de extremo a extremo.

OpenClawRadar
Homebutler: Habilidad OpenClaw para la Gestión de Homelab a través de Telegram
Herramientas

Homebutler: Habilidad OpenClaw para la Gestión de Homelab a través de Telegram

Homebutler es un binario único de Go (~13 MB, sin dependencias) que funciona como una habilidad de OpenClaw para gestionar homelabs desde el chat de Telegram. Monitorea servidores, reinicia contenedores Docker, enciende máquinas, escanea redes y alerta sobre picos de recursos sin sesiones SSH ni inicios de sesión en paneles de control.

OpenClawRadar
docvault: Genera Documentación de API Local para Reducir Alucinaciones de IA
Herramientas

docvault: Genera Documentación de API Local para Reducir Alucinaciones de IA

docvault es una herramienta que genera referencias de API en formato markdown a partir del código fuente para ayudar a Claude y otros LLMs a dejar de alucinar firmas de funciones. Funciona para crates de Rust y paquetes de Python, genera un archivo markdown de dos niveles e incluye un plugin de Claude Code para operación sin intervención manual.

OpenClawRadar
Kontext CLI: Intermediario de Credenciales para Agentes de Codificación con IA
Herramientas

Kontext CLI: Intermediario de Credenciales para Agentes de Codificación con IA

Kontext CLI es un intermediario de credenciales basado en Go que proporciona a los agentes de codificación con IA tokens de acceso de corta duración en lugar de claves API de larga duración. Utiliza el intercambio de tokens RFC 8693, transmite registros de auditoría para cada llamada de herramienta y funciona con Claude Code hoy mismo.

OpenClawRadar