Benchmarking do Nemotron 3 Super 120B com contexto de 1 milhão de tokens no M1 Ultra

Teste Local de Contexto de 1 Milhão de Tokens com o Nemotron 3 Super
Um usuário do Reddit conduziu um teste de benchmark para avaliar a viabilidade de processar contextos de 1 milhão de tokens localmente usando o Nemotron 3 Super 120B em um sistema M1 Ultra. O teste aproveitou a arquitetura híbrida mamba-2 do modelo, que oferece eficiência de memória em comprimentos de contexto aumentados.
Detalhes de Hardware e Configuração
O teste foi executado em um M1 Ultra usando llama.cpp com a seguinte configuração:
- Modelo: Nemotron-3-Super-120B-Q4_K.gguf (quantização Q4_K_M)
- Alocação de contexto: Total de 1 milhão de tokens
- Uso de VRAM: Aproximadamente 90 GB
- Backend: MTL,BLAS com 1 thread
- Tamanho de lote unificado: 2048
- Atenção flash: Habilitada (fa 1)
- Camadas GPU: 99 (-ngl 99)
Comando de Benchmark e Resultados
O usuário executou o llama-bench com este comando:
llama-bench -m ~/ml-models/huggingface/ggml-org/Nemotron-3-Super-120B-GGUF/Nemotron-3-Super-120B-Q4_K.gguf -fa 1 -t 1 -ngl 99 -b 2048 -ub 2048 -d 0,10000,20000,30000,40000,50000,60000,70000,80000,90000,100000,150000,200000,250000,1000000Principais resultados de desempenho do benchmark:
- Processamento de prompt (pp512) em contexto 0: 255,03 ± 0,36 tokens/segundo
- Geração de tokens (tg128) em contexto 0: 26,72 ± 0,02 tokens/segundo
- Processamento de prompt em contexto de 100.000 tokens: 184,99 ± 0,19 tokens/segundo
- Geração de tokens em contexto de 100.000 tokens: 22,37 ± 0,01 tokens/segundo
- Processamento de prompt em contexto de 150.000 tokens: 161,60 ± 0,22 tokens/segundo
- Geração de tokens em contexto de 150.000 tokens: 20,58 ± 0,01 tokens/segundo
- Processamento de prompt em contexto de 200.000 tokens: 141,87 ± 0,19 tokens/segundo
Os resultados mostram degradação de desempenho à medida que o comprimento do contexto aumenta, com a velocidade de processamento de prompt caindo de 255 t/s em contexto zero para aproximadamente 142 t/s em 200.000 tokens.
Informações do Sistema
A inicialização do backend Metal mostrou:
- Nome da GPU: MTL0
- Família da GPU: MTLGPUFamilyApple7 (1007)
- Tem memória unificada: verdadeiro
- Tem suporte a bfloat: verdadeiro
- Tamanho máximo recomendado do conjunto de trabalho: 134.217,73 MB
Este teste demonstra que o processamento local de contextos extremamente grandes (até 1 milhão de tokens) é tecnicamente possível com hardware Apple Silicon de alta performance e modelos quantizados, embora com requisitos de memória significativos e compensações de desempenho à medida que o contexto se expande.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Preços do Modelo OpenRouter e Análise de Inteligência por Dólar
Um usuário do Reddit compilou os preços da API do OpenRouter para 16 modelos de IA e calculou os valores de inteligência por dólar, identificando o MiMo-V2-Flash como o melhor custo-benefício a US$ 0,09/M de tokens e o GPT-5.4 como o mais inteligente a US$ 2,50/M de tokens.

Corrigindo os Pontos Cegos do OpenClaw: Construindo um Sitemap para Buscar Todos os Blogs da Anthropic
A ferramenta de navegador do OpenClaw não descobre todos os blogs da Anthropic porque eles estão hospedados em múltiplas URLs. Um usuário corrigiu isso alimentando um sitemap gerado e depois empacotou a solução como uma skill compartilhável.

docvault: Gere Documentação de API Local para Reduzir Alucinações de IA
docvault é uma ferramenta que gera referências de API em markdown a partir do código-fonte para ajudar Claude e outros LLMs a parar de alucinar assinaturas de funções. Funciona para crates Rust e pacotes Python, gera um arquivo markdown de dois níveis e inclui um plugin Claude Code para operação sem intervenção manual.

Comparação no mundo real: Opus 4.6 vs MiMo-V2-Pro vs GLM-5 na configuração OpenClaw
Um desenvolvedor testou três modelos de IA em tarefas práticas, incluindo tradução de expressões idiomáticas turcas, codificação em Python, raciocínio espacial e automação de navegador. O MiMo-V2-Pro superou o Opus 4.6 em tarefas de codificação e custou 20 vezes menos, enquanto o Opus manteve vantagens na compreensão de idiomas não ingleses.