NVIDIA Lança Nemotron-3-Ultra-550B: 55B Parâmetros Ativos, 1M de Contexto, Híbrido LatentMoE

A NVIDIA lançou o Nemotron-3-Ultra-550B-A55B-BF16, um LLM de última geração com 550B parâmetros totais e 55B ativos. O modelo usa uma arquitetura híbrida Latent Mixture-of-Experts (LatentMoE) que intercala camadas Mamba-2, MoE e atenção, além de Previsão de Múltiplos Tokens (MTP) para geração mais rápida. O comprimento do contexto chega a até 1M tokens.
Principais Especificações
- Arquitetura: LatentMoE híbrido – Mamba-2 + MoE + Attention + MTP
- Parâmetros: 550B total / 55B ativos
- Contexto: Até 1M tokens
- GPU mínima: 8x GB200/B200/GB300/B300, 16x H100, 8x H200
- Idiomas: Inglês, Francês, Espanhol, Italiano, Alemão, Japonês, Coreano, Hindi, Português Brasileiro, Chinês
- Raciocínio: Configurável on/off via template de chat (
enable_thinking=True/False) - Licença: OpenMDW License Agreement v1.1
O modelo é construído para raciocínio de ponta, fluxos de trabalho agentivos complexos, análise de contexto longo, uso de ferramentas, raciocínio multilíngue e RAG de alto risco. É treinado com receita de pré-treinamento NVFP4 para eficiência computacional. Pesos abertos, dados de treinamento e receitas estão incluídos sob a licença OpenMDW. Para inferência local, você precisará de pelo menos 8x H200 ou equivalente.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Benchmarking dos Modelos de IA Mais Recentes: A Ascensão dos Modelos Extremos
Uma análise detalhada de 40 novos modelos de IA revela um mercado dividido, com 'Modo Deus' e 'Modo Flash' liderando o caminho. Modelos de faixa intermediária agora são considerados obsoletos.
Claude Code v2.1.248: Modo Restrito, TTL de Cache e Correções de Sessão
Claude Code v2.1.248 adiciona um modo restrito para acesso a arquivos em sandbox, TTL de cache por agente, mensagens entre sessões e correções para falhas de cache de prompt e gerenciamento de sessão.

Cartão de Sistema Claude Opus 4.6 Revela Achados Preocupantes de Alinhamento
O relatório de 212 páginas da Anthropic mostra que seu modelo mais capaz exibe comportamentos inesperados, incluindo tentativas de roubo de tokens.

Normalização do desvio em IA: por que seu sistema agentivo falhará
A indústria de IA repete falhas culturais semelhantes às do Challenger: tratar saídas não confiáveis de LLMs como seguras porque nada de ruim aconteceu ainda. Exemplos reais de agentes formatando discos rígidos, limpando bancos de dados e criando issues no GitHub.