NVIDIA lanza Nemotron-3-Ultra-550B: 55B parámetros activos, 1M de contexto, híbrido LatentMoE

✍️ OpenClawRadar📅 Publicado: 4 de junio de 2026🔗 Source
NVIDIA lanza Nemotron-3-Ultra-550B: 55B parámetros activos, 1M de contexto, híbrido LatentMoE
Ad

NVIDIA lanzó Nemotron-3-Ultra-550B-A55B-BF16, un LLM de escala fronteriza con 550B parámetros totales y 55B activos. El modelo utiliza una arquitectura híbrida Latent Mixture-of-Experts (LatentMoE) que intercala capas de Mamba-2, MoE y atención, además de Multi-Token Prediction (MTP) para una generación más rápida. La longitud de contexto alcanza hasta 1M de tokens.

Ad

Especificaciones clave

  • Arquitectura: LatentMoE híbrido – Mamba-2 + MoE + Attention + MTP
  • Parámetros: 550B totales / 55B activos
  • Contexto: Hasta 1M de tokens
  • GPU mínima: 8x GB200/B200/GB300/B300, 16x H100, 8x H200
  • Idiomas: Inglés, francés, español, italiano, alemán, japonés, coreano, hindi, portugués de Brasil, chino
  • Razonamiento: Configurable on/off mediante plantilla de chat (enable_thinking=True/False)
  • Licencia: OpenMDW License Agreement v1.1

El modelo está diseñado para razonamiento de frontera, flujos de trabajo agentivos complejos, análisis de contexto largo, uso de herramientas, razonamiento multilingüe y RAG de alto riesgo. Está entrenado con la receta de preentrenamiento NVFP4 para eficiencia computacional. Se incluyen pesos abiertos, datos de entrenamiento y recetas bajo la licencia OpenMDW. Para inferencia local, necesitarás al menos 8x H200 o equivalente.

📖 Lee la fuente completa: r/LocalLLaMA

Ad

👀 Ver también