Evaluación comparativa de Nemotron 3 Super 120B con contexto de 1 millón de tokens en M1 Ultra

✍️ OpenClawRadar📅 Publicado: 12 de marzo de 2026🔗 Source
Evaluación comparativa de Nemotron 3 Super 120B con contexto de 1 millón de tokens en M1 Ultra
Ad

Prueba Local de Contexto de 1 Millón de Tokens con Nemotron 3 Super

Un usuario de Reddit realizó una prueba de referencia para evaluar la viabilidad de procesar contextos de 1 millón de tokens localmente usando Nemotron 3 Super 120B en un sistema M1 Ultra. La prueba aprovechó la arquitectura híbrida mamba-2 del modelo, que proporciona eficiencia de memoria en longitudes de contexto aumentadas.

Detalles de Hardware y Configuración

La prueba se ejecutó en un M1 Ultra usando llama.cpp con la siguiente configuración:

  • Modelo: Nemotron-3-Super-120B-Q4_K.gguf (cuantización Q4_K_M)
  • Asignación de contexto: 1 millón de tokens completo
  • Uso de VRAM: Aproximadamente 90 GB
  • Backend: MTL,BLAS con 1 hilo
  • Tamaño de lote unificado: 2048
  • Atención flash: Habilitada (fa 1)
  • Capas de GPU: 99 (-ngl 99)

Comando de Referencia y Resultados

El usuario ejecutó llama-bench con este comando:

llama-bench -m ~/ml-models/huggingface/ggml-org/Nemotron-3-Super-120B-GGUF/Nemotron-3-Super-120B-Q4_K.gguf -fa 1 -t 1 -ngl 99 -b 2048 -ub 2048 -d 0,10000,20000,30000,40000,50000,60000,70000,80000,90000,100000,150000,200000,250000,1000000

Resultados clave de rendimiento del punto de referencia:

  • Procesamiento de entrada (pp512) en contexto 0: 255,03 ± 0,36 tokens/segundo
  • Generación de tokens (tg128) en contexto 0: 26,72 ± 0,02 tokens/segundo
  • Procesamiento de entrada en contexto de 100.000 tokens: 184,99 ± 0,19 tokens/segundo
  • Generación de tokens en contexto de 100.000 tokens: 22,37 ± 0,01 tokens/segundo
  • Procesamiento de entrada en contexto de 150.000 tokens: 161,60 ± 0,22 tokens/segundo
  • Generación de tokens en contexto de 150.000 tokens: 20,58 ± 0,01 tokens/segundo
  • Procesamiento de entrada en contexto de 200.000 tokens: 141,87 ± 0,19 tokens/segundo

Los resultados muestran degradación del rendimiento a medida que aumenta la longitud del contexto, con la velocidad de procesamiento de entrada cayendo de 255 t/s en contexto cero a aproximadamente 142 t/s en 200.000 tokens.

Ad

Información del Sistema

La inicialización del backend Metal mostró:

  • Nombre de GPU: MTL0
  • Familia de GPU: MTLGPUFamilyApple7 (1007)
  • Tiene memoria unificada: verdadero
  • Tiene soporte bfloat: verdadero
  • Tamaño máximo recomendado del conjunto de trabajo: 134.217,73 MB

Esta prueba demuestra que el procesamiento local de contextos extremadamente grandes (hasta 1 millón de tokens) es técnicamente posible con hardware Apple Silicon de gama alta y modelos cuantizados, aunque con requisitos de memoria significativos y compensaciones de rendimiento a medida que se expande el contexto.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Sistema de Documentación Autónomo Utilizando Bloques Delimitados para Cero Desviación
Herramientas

Sistema de Documentación Autónomo Utilizando Bloques Delimitados para Cero Desviación

Un desarrollador creó un script bash que extrae datos estructurados directamente de los archivos fuente y los inyecta en CLAUDE.md mediante bloques de comentarios HTML delimitados, asegurando que la documentación se mantenga sincronizada con el código sin mantenimiento manual.

OpenClawRadar
Optimizador Gratuito de Sesiones de Claude: Estimador de Tokens, Compresor de Prompts y Planificador de Sesiones
Herramientas

Optimizador Gratuito de Sesiones de Claude: Estimador de Tokens, Compresor de Prompts y Planificador de Sesiones

Un desarrollador ha creado una herramienta gratuita sin registro para ayudar a gestionar los límites de uso de Claude con tres funciones: un estimador de tokens para previsualizar el consumo de prompts, un compresor de prompts que reduce los prompts entre un 40-60% eliminando frases de relleno, y un planificador de sesiones que agrupa tareas para minimizar la recarga de contexto.

OpenClawRadar
bunx ccusage muestra $18,450 en créditos quemados — los planes planos absorben el costo
Herramientas

bunx ccusage muestra $18,450 en créditos quemados — los planes planos absorben el costo

Un usuario en r/ClaudeAI ejecutó bunx ccusage y descubrió $18,450 en créditos usados en mayo — 248M tokens de entrada, 42M tokens de salida, 21.7B con lectura de caché — mientras pagaba solo €400/mes por tarifa plana de Claude Code y Codex.

OpenClawRadar
Claude Skills: 12 Paquetes Estrictos de Reglas de Codificación para TypeScript, Rust, Swift, Go, JS, Postgres y Auditorías.
Herramientas

Claude Skills: 12 Paquetes Estrictos de Reglas de Codificación para TypeScript, Rust, Swift, Go, JS, Postgres y Auditorías.

12 archivos markdown con reglas opinadas y conscientes de la versión para TS, Rust, Swift, Go, JS, Postgres, seguridad, rendimiento, pruebas, revisión de código, estándares de GitHub y commits de git. MIT, gratis, sin registro.

OpenClawRadar