NVIDIA Lança Nemotron-3-Ultra-550B: 55B Parâmetros Ativos, 1M de Contexto, Híbrido LatentMoE

✍️ OpenClawRadar📅 Publicado: June 4, 2026🔗 Source
NVIDIA Lança Nemotron-3-Ultra-550B: 55B Parâmetros Ativos, 1M de Contexto, Híbrido LatentMoE
Ad

A NVIDIA lançou o Nemotron-3-Ultra-550B-A55B-BF16, um LLM de última geração com 550B parâmetros totais e 55B ativos. O modelo usa uma arquitetura híbrida Latent Mixture-of-Experts (LatentMoE) que intercala camadas Mamba-2, MoE e atenção, além de Previsão de Múltiplos Tokens (MTP) para geração mais rápida. O comprimento do contexto chega a até 1M tokens.

Ad

Principais Especificações

  • Arquitetura: LatentMoE híbrido – Mamba-2 + MoE + Attention + MTP
  • Parâmetros: 550B total / 55B ativos
  • Contexto: Até 1M tokens
  • GPU mínima: 8x GB200/B200/GB300/B300, 16x H100, 8x H200
  • Idiomas: Inglês, Francês, Espanhol, Italiano, Alemão, Japonês, Coreano, Hindi, Português Brasileiro, Chinês
  • Raciocínio: Configurável on/off via template de chat (enable_thinking=True/False)
  • Licença: OpenMDW License Agreement v1.1

O modelo é construído para raciocínio de ponta, fluxos de trabalho agentivos complexos, análise de contexto longo, uso de ferramentas, raciocínio multilíngue e RAG de alto risco. É treinado com receita de pré-treinamento NVFP4 para eficiência computacional. Pesos abertos, dados de treinamento e receitas estão incluídos sob a licença OpenMDW. Para inferência local, você precisará de pelo menos 8x H200 ou equivalente.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also