Evaluación comparativa de Nemotron 3 Super 120B con contexto de 1 millón de tokens en M1 Ultra

Prueba Local de Contexto de 1 Millón de Tokens con Nemotron 3 Super
Un usuario de Reddit realizó una prueba de referencia para evaluar la viabilidad de procesar contextos de 1 millón de tokens localmente usando Nemotron 3 Super 120B en un sistema M1 Ultra. La prueba aprovechó la arquitectura híbrida mamba-2 del modelo, que proporciona eficiencia de memoria en longitudes de contexto aumentadas.
Detalles de Hardware y Configuración
La prueba se ejecutó en un M1 Ultra usando llama.cpp con la siguiente configuración:
- Modelo: Nemotron-3-Super-120B-Q4_K.gguf (cuantización Q4_K_M)
- Asignación de contexto: 1 millón de tokens completo
- Uso de VRAM: Aproximadamente 90 GB
- Backend: MTL,BLAS con 1 hilo
- Tamaño de lote unificado: 2048
- Atención flash: Habilitada (fa 1)
- Capas de GPU: 99 (-ngl 99)
Comando de Referencia y Resultados
El usuario ejecutó llama-bench con este comando:
llama-bench -m ~/ml-models/huggingface/ggml-org/Nemotron-3-Super-120B-GGUF/Nemotron-3-Super-120B-Q4_K.gguf -fa 1 -t 1 -ngl 99 -b 2048 -ub 2048 -d 0,10000,20000,30000,40000,50000,60000,70000,80000,90000,100000,150000,200000,250000,1000000Resultados clave de rendimiento del punto de referencia:
- Procesamiento de entrada (pp512) en contexto 0: 255,03 ± 0,36 tokens/segundo
- Generación de tokens (tg128) en contexto 0: 26,72 ± 0,02 tokens/segundo
- Procesamiento de entrada en contexto de 100.000 tokens: 184,99 ± 0,19 tokens/segundo
- Generación de tokens en contexto de 100.000 tokens: 22,37 ± 0,01 tokens/segundo
- Procesamiento de entrada en contexto de 150.000 tokens: 161,60 ± 0,22 tokens/segundo
- Generación de tokens en contexto de 150.000 tokens: 20,58 ± 0,01 tokens/segundo
- Procesamiento de entrada en contexto de 200.000 tokens: 141,87 ± 0,19 tokens/segundo
Los resultados muestran degradación del rendimiento a medida que aumenta la longitud del contexto, con la velocidad de procesamiento de entrada cayendo de 255 t/s en contexto cero a aproximadamente 142 t/s en 200.000 tokens.
Información del Sistema
La inicialización del backend Metal mostró:
- Nombre de GPU: MTL0
- Familia de GPU: MTLGPUFamilyApple7 (1007)
- Tiene memoria unificada: verdadero
- Tiene soporte bfloat: verdadero
- Tamaño máximo recomendado del conjunto de trabajo: 134.217,73 MB
Esta prueba demuestra que el procesamiento local de contextos extremadamente grandes (hasta 1 millón de tokens) es técnicamente posible con hardware Apple Silicon de gama alta y modelos cuantizados, aunque con requisitos de memoria significativos y compensaciones de rendimiento a medida que se expande el contexto.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Sistema de Documentación Autónomo Utilizando Bloques Delimitados para Cero Desviación
Un desarrollador creó un script bash que extrae datos estructurados directamente de los archivos fuente y los inyecta en CLAUDE.md mediante bloques de comentarios HTML delimitados, asegurando que la documentación se mantenga sincronizada con el código sin mantenimiento manual.

Optimizador Gratuito de Sesiones de Claude: Estimador de Tokens, Compresor de Prompts y Planificador de Sesiones
Un desarrollador ha creado una herramienta gratuita sin registro para ayudar a gestionar los límites de uso de Claude con tres funciones: un estimador de tokens para previsualizar el consumo de prompts, un compresor de prompts que reduce los prompts entre un 40-60% eliminando frases de relleno, y un planificador de sesiones que agrupa tareas para minimizar la recarga de contexto.

bunx ccusage muestra $18,450 en créditos quemados — los planes planos absorben el costo
Un usuario en r/ClaudeAI ejecutó bunx ccusage y descubrió $18,450 en créditos usados en mayo — 248M tokens de entrada, 42M tokens de salida, 21.7B con lectura de caché — mientras pagaba solo €400/mes por tarifa plana de Claude Code y Codex.

Claude Skills: 12 Paquetes Estrictos de Reglas de Codificación para TypeScript, Rust, Swift, Go, JS, Postgres y Auditorías.
12 archivos markdown con reglas opinadas y conscientes de la versión para TS, Rust, Swift, Go, JS, Postgres, seguridad, rendimiento, pruebas, revisión de código, estándares de GitHub y commits de git. MIT, gratis, sin registro.