Evaluación comparativa de Nemotron 3 Super 120B con contexto de 1 millón de tokens en M1 Ultra

Prueba Local de Contexto de 1 Millón de Tokens con Nemotron 3 Super
Un usuario de Reddit realizó una prueba de referencia para evaluar la viabilidad de procesar contextos de 1 millón de tokens localmente usando Nemotron 3 Super 120B en un sistema M1 Ultra. La prueba aprovechó la arquitectura híbrida mamba-2 del modelo, que proporciona eficiencia de memoria en longitudes de contexto aumentadas.
Detalles de Hardware y Configuración
La prueba se ejecutó en un M1 Ultra usando llama.cpp con la siguiente configuración:
- Modelo: Nemotron-3-Super-120B-Q4_K.gguf (cuantización Q4_K_M)
- Asignación de contexto: 1 millón de tokens completo
- Uso de VRAM: Aproximadamente 90 GB
- Backend: MTL,BLAS con 1 hilo
- Tamaño de lote unificado: 2048
- Atención flash: Habilitada (fa 1)
- Capas de GPU: 99 (-ngl 99)
Comando de Referencia y Resultados
El usuario ejecutó llama-bench con este comando:
llama-bench -m ~/ml-models/huggingface/ggml-org/Nemotron-3-Super-120B-GGUF/Nemotron-3-Super-120B-Q4_K.gguf -fa 1 -t 1 -ngl 99 -b 2048 -ub 2048 -d 0,10000,20000,30000,40000,50000,60000,70000,80000,90000,100000,150000,200000,250000,1000000Resultados clave de rendimiento del punto de referencia:
- Procesamiento de entrada (pp512) en contexto 0: 255,03 ± 0,36 tokens/segundo
- Generación de tokens (tg128) en contexto 0: 26,72 ± 0,02 tokens/segundo
- Procesamiento de entrada en contexto de 100.000 tokens: 184,99 ± 0,19 tokens/segundo
- Generación de tokens en contexto de 100.000 tokens: 22,37 ± 0,01 tokens/segundo
- Procesamiento de entrada en contexto de 150.000 tokens: 161,60 ± 0,22 tokens/segundo
- Generación de tokens en contexto de 150.000 tokens: 20,58 ± 0,01 tokens/segundo
- Procesamiento de entrada en contexto de 200.000 tokens: 141,87 ± 0,19 tokens/segundo
Los resultados muestran degradación del rendimiento a medida que aumenta la longitud del contexto, con la velocidad de procesamiento de entrada cayendo de 255 t/s en contexto cero a aproximadamente 142 t/s en 200.000 tokens.
Información del Sistema
La inicialización del backend Metal mostró:
- Nombre de GPU: MTL0
- Familia de GPU: MTLGPUFamilyApple7 (1007)
- Tiene memoria unificada: verdadero
- Tiene soporte bfloat: verdadero
- Tamaño máximo recomendado del conjunto de trabajo: 134.217,73 MB
Esta prueba demuestra que el procesamiento local de contextos extremadamente grandes (hasta 1 millón de tokens) es técnicamente posible con hardware Apple Silicon de gama alta y modelos cuantizados, aunque con requisitos de memoria significativos y compensaciones de rendimiento a medida que se expande el contexto.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Spectral: Captura Tráfico de Aplicaciones para Generar Servidores MCP para Agentes OpenClaw
Spectral es una herramienta de código abierto que captura el tráfico de cualquier aplicación, lo analiza con un LLM y genera un servidor MCP funcional, permitiendo que los agentes de OpenClaw llamen a la API real de la aplicación directamente en lugar de depender de la automatización del navegador.

HyperResearch: El conjunto de habilidades de código abierto de Claude Code lo convierte en un agente de investigación profunda
HyperResearch convierte Claude Code en un pipeline de investigación profunda de 16 pasos con almacenamiento persistente de conocimiento, verificación de hechos y sesiones web autenticadas. Instalación de código abierto con un solo comando, supera a OpenAI y Google en DeepResearch Bench.

Weejur: Una Interfaz de Usuario Sencilla para Publicar en GitHub Pages
Weejur es una herramienta gratuita que proporciona una interfaz de usuario simplificada para publicar sitios web a través de GitHub Pages, permitiendo a los usuarios pegar HTML o subir archivos después de iniciar sesión con OAuth.

Clarc v1.0: Sistema Operativo de Flujo de Trabajo para Claude Code con 63 Agentes y 249 Habilidades
Clarc es una capa de complemento para Claude Code que proporciona 63 subagentes especializados, 249 habilidades de dominio y 178 comandos de barra para flujos de trabajo de desarrollo. La instalación se realiza mediante npx con soporte para múltiples editores, incluidos Cursor y OpenCode.