NVIDIA lanza Nemotron-3-Ultra-550B: 55B parámetros activos, 1M de contexto, híbrido LatentMoE

NVIDIA lanzó Nemotron-3-Ultra-550B-A55B-BF16, un LLM de escala fronteriza con 550B parámetros totales y 55B activos. El modelo utiliza una arquitectura híbrida Latent Mixture-of-Experts (LatentMoE) que intercala capas de Mamba-2, MoE y atención, además de Multi-Token Prediction (MTP) para una generación más rápida. La longitud de contexto alcanza hasta 1M de tokens.
Especificaciones clave
- Arquitectura: LatentMoE híbrido – Mamba-2 + MoE + Attention + MTP
- Parámetros: 550B totales / 55B activos
- Contexto: Hasta 1M de tokens
- GPU mínima: 8x GB200/B200/GB300/B300, 16x H100, 8x H200
- Idiomas: Inglés, francés, español, italiano, alemán, japonés, coreano, hindi, portugués de Brasil, chino
- Razonamiento: Configurable on/off mediante plantilla de chat (
enable_thinking=True/False) - Licencia: OpenMDW License Agreement v1.1
El modelo está diseñado para razonamiento de frontera, flujos de trabajo agentivos complejos, análisis de contexto largo, uso de herramientas, razonamiento multilingüe y RAG de alto riesgo. Está entrenado con la receta de preentrenamiento NVFP4 para eficiencia computacional. Se incluyen pesos abiertos, datos de entrenamiento y recetas bajo la licencia OpenMDW. Para inferencia local, necesitarás al menos 8x H200 o equivalente.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

La eficiencia de tokens como un acto de rechazo: Por qué las empresas de IA quieren que seas derrochador
Los proveedores de LLM se benefician de la dependencia. La eficiencia de tokens es un acto de rechazo. No generes lo que no leerás.

Enfermeras de Kaiser afirman que la vigilancia con IA degrada la atención al paciente antes de las negociaciones contractuales
Enfermeras de Kaiser reportan que herramientas de IA monitorean la duración de llamadas, predicen la productividad y califican la empatía, presionándolas a apresurar las consultas. Una llamada de un paciente suicida que superó los 15 minutos provocó críticas de la gerencia.

Nuevo tutor de IA logra un tamaño del efecto de 0.71-1.30 DE en un curso de Dartmouth
Un nuevo tutor de IA para un curso introductorio de informática en Dartmouth mostró ganancias de aprendizaje de 0.71 a 1.30 desviaciones estándar en comparación con un grupo de control.

El Efecto Casa Embrujada: Cinco Modos de Falla en el Código Generado por IA
El análisis de las experiencias de los desarrolladores con Claude AI revela un patrón consistente: ganancias iniciales de productividad de 10x seguidas de una deuda técnica acumulativa. La fuente identifica cinco modos de falla específicos, incluyendo dependencias ocultas y parálisis por ventana de contexto.