Benchmarking do Nemotron 3 Super 120B com contexto de 1 milhão de tokens no M1 Ultra

✍️ OpenClawRadar📅 Publicado: March 12, 2026🔗 Source
Benchmarking do Nemotron 3 Super 120B com contexto de 1 milhão de tokens no M1 Ultra
Ad

Teste Local de Contexto de 1 Milhão de Tokens com o Nemotron 3 Super

Um usuário do Reddit conduziu um teste de benchmark para avaliar a viabilidade de processar contextos de 1 milhão de tokens localmente usando o Nemotron 3 Super 120B em um sistema M1 Ultra. O teste aproveitou a arquitetura híbrida mamba-2 do modelo, que oferece eficiência de memória em comprimentos de contexto aumentados.

Detalhes de Hardware e Configuração

O teste foi executado em um M1 Ultra usando llama.cpp com a seguinte configuração:

  • Modelo: Nemotron-3-Super-120B-Q4_K.gguf (quantização Q4_K_M)
  • Alocação de contexto: Total de 1 milhão de tokens
  • Uso de VRAM: Aproximadamente 90 GB
  • Backend: MTL,BLAS com 1 thread
  • Tamanho de lote unificado: 2048
  • Atenção flash: Habilitada (fa 1)
  • Camadas GPU: 99 (-ngl 99)

Comando de Benchmark e Resultados

O usuário executou o llama-bench com este comando:

llama-bench -m ~/ml-models/huggingface/ggml-org/Nemotron-3-Super-120B-GGUF/Nemotron-3-Super-120B-Q4_K.gguf -fa 1 -t 1 -ngl 99 -b 2048 -ub 2048 -d 0,10000,20000,30000,40000,50000,60000,70000,80000,90000,100000,150000,200000,250000,1000000

Principais resultados de desempenho do benchmark:

  • Processamento de prompt (pp512) em contexto 0: 255,03 ± 0,36 tokens/segundo
  • Geração de tokens (tg128) em contexto 0: 26,72 ± 0,02 tokens/segundo
  • Processamento de prompt em contexto de 100.000 tokens: 184,99 ± 0,19 tokens/segundo
  • Geração de tokens em contexto de 100.000 tokens: 22,37 ± 0,01 tokens/segundo
  • Processamento de prompt em contexto de 150.000 tokens: 161,60 ± 0,22 tokens/segundo
  • Geração de tokens em contexto de 150.000 tokens: 20,58 ± 0,01 tokens/segundo
  • Processamento de prompt em contexto de 200.000 tokens: 141,87 ± 0,19 tokens/segundo

Os resultados mostram degradação de desempenho à medida que o comprimento do contexto aumenta, com a velocidade de processamento de prompt caindo de 255 t/s em contexto zero para aproximadamente 142 t/s em 200.000 tokens.

Ad

Informações do Sistema

A inicialização do backend Metal mostrou:

  • Nome da GPU: MTL0
  • Família da GPU: MTLGPUFamilyApple7 (1007)
  • Tem memória unificada: verdadeiro
  • Tem suporte a bfloat: verdadeiro
  • Tamanho máximo recomendado do conjunto de trabalho: 134.217,73 MB

Este teste demonstra que o processamento local de contextos extremamente grandes (até 1 milhão de tokens) é tecnicamente possível com hardware Apple Silicon de alta performance e modelos quantizados, embora com requisitos de memória significativos e compensações de desempenho à medida que o contexto se expande.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Preços do Modelo OpenRouter e Análise de Inteligência por Dólar
Tools

Preços do Modelo OpenRouter e Análise de Inteligência por Dólar

Um usuário do Reddit compilou os preços da API do OpenRouter para 16 modelos de IA e calculou os valores de inteligência por dólar, identificando o MiMo-V2-Flash como o melhor custo-benefício a US$ 0,09/M de tokens e o GPT-5.4 como o mais inteligente a US$ 2,50/M de tokens.

OpenClawRadar
Corrigindo os Pontos Cegos do OpenClaw: Construindo um Sitemap para Buscar Todos os Blogs da Anthropic
Tools

Corrigindo os Pontos Cegos do OpenClaw: Construindo um Sitemap para Buscar Todos os Blogs da Anthropic

A ferramenta de navegador do OpenClaw não descobre todos os blogs da Anthropic porque eles estão hospedados em múltiplas URLs. Um usuário corrigiu isso alimentando um sitemap gerado e depois empacotou a solução como uma skill compartilhável.

OpenClawRadar
docvault: Gere Documentação de API Local para Reduzir Alucinações de IA
Tools

docvault: Gere Documentação de API Local para Reduzir Alucinações de IA

docvault é uma ferramenta que gera referências de API em markdown a partir do código-fonte para ajudar Claude e outros LLMs a parar de alucinar assinaturas de funções. Funciona para crates Rust e pacotes Python, gera um arquivo markdown de dois níveis e inclui um plugin Claude Code para operação sem intervenção manual.

OpenClawRadar
Comparação no mundo real: Opus 4.6 vs MiMo-V2-Pro vs GLM-5 na configuração OpenClaw
Tools

Comparação no mundo real: Opus 4.6 vs MiMo-V2-Pro vs GLM-5 na configuração OpenClaw

Um desenvolvedor testou três modelos de IA em tarefas práticas, incluindo tradução de expressões idiomáticas turcas, codificação em Python, raciocínio espacial e automação de navegador. O MiMo-V2-Pro superou o Opus 4.6 em tarefas de codificação e custou 20 vezes menos, enquanto o Opus manteve vantagens na compreensão de idiomas não ingleses.

OpenClawRadar