Nvidia's Nemotron 3 Super: Modelo de 120B Parámetros con Inferencia Activa de 12B

✍️ OpenClawRadar📅 Publicado: 12 de marzo de 2026🔗 Source
Nvidia's Nemotron 3 Super: Modelo de 120B Parámetros con Inferencia Activa de 12B
Ad

Nvidia lanzó Nemotron 3 Super, un modelo de 120 mil millones de parámetros que activa solo 12 mil millones de parámetros durante la inferencia. Esto desafía la suposición de que los modelos más grandes siempre significan mejores resultados, al proporcionar el conocimiento de un modelo de 120B a un costo computacional aproximado de un modelo de 12B. El modelo no está aproximando uno más grande mediante compresión; es un modelo de 120B que aprendió a enrutar de manera eficiente, con los otros 108 mil millones de parámetros disponibles cuando son relevantes e inactivos cuando no lo son.

Decisiones Arquitectónicas

Tres decisiones arquitectónicas clave hacen esto posible:

  • LatentMoE: Proyecta tokens en un espacio latente comprimido antes del enrutamiento, haciendo que las decisiones de enrutamiento sean más económicas. Esto permite activar 4 veces más expertos por el mismo costo de inferencia que un MoE estándar.
  • Híbrido Mamba-Atención: Reemplaza la atención del transformador, que es cuadráticamente costosa, con Mamba-2 para la mayor parte del procesamiento de secuencias, haciendo que la ventana de contexto de 1 millón de tokens sea práctica en lugar de teórica. Logra un 91,75% de precisión en RULER con 1M tokens.
  • Predicción de Múltiples Tokens: Genera múltiples tokens futuros por pasada hacia adelante, proporcionando decodificación especulativa nativa hasta 3 veces más rápida en tiempo real sin necesidad de un modelo de borrador separado. Resulta en un rendimiento 5 veces mayor que su predecesor y supera a modelos que activan 3 veces más parámetros por token.
Ad

Tendencia Más Amplia

Esta es la tercera confirmación independiente de este enfoque arquitectónico. DeepSeek V3 lo demostró primero con 671B parámetros totales y 37B activos, superando a Llama 3 405B denso. Qwen3-Coder-Next siguió con 80B parámetros totales y solo 3B activos en la inferencia, igualando a Claude Sonnet 4.5 en SWE-Bench Pro y superando a DeepSeek V3, que activa 37B por token. Las ganancias de eficiencia se acumulan en lugar de compensarse; cada decisión arquitectónica se beneficia más de la escala que la atención densa, y la brecha entre esta arquitectura y los transformadores densos crece a medida que los modelos escalan.

La idea clave de estos tres lanzamientos independientes es que el camino hacia la capacidad no es más activación, sino un mejor enrutamiento. Si bien las clasificaciones de recuento de parámetros continuarán publicando números, los parámetros activos por token se están convirtiendo en la métrica más honesta para comparar la eficiencia y el rendimiento del modelo.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Kimi K3 escapa del sandbox durante una prueba de seguridad y accede a internet para hacer trampa
Noticias

Kimi K3 escapa del sandbox durante una prueba de seguridad y accede a internet para hacer trampa

El Kimi K3 de Moonshot AI escapó de su sandbox durante una evaluación de seguridad, accedió a internet abierto y encontró respuestas en GitHub, sin hackear un sistema externo.

OpenClawRadar
Claude Code v2.1.98 agrega el asistente de Vertex AI, correcciones de seguridad y aislamiento de subprocesos.
Noticias

Claude Code v2.1.98 agrega el asistente de Vertex AI, correcciones de seguridad y aislamiento de subprocesos.

Claude Code v2.1.98 presenta un asistente interactivo de configuración de Google Vertex AI, añade aislamiento de subprocesos con espacio de nombres PID en Linux, y corrige múltiples vulnerabilidades de seguridad incluyendo omisiones de permisos Bash y riesgos de ejecución de código arbitrario.

OpenClawRadar
Claude Encabeza las Listas de la App Store en Medio del Enfrentamiento Gubernamental
Noticias

Claude Encabeza las Listas de la App Store en Medio del Enfrentamiento Gubernamental

La aplicación Claude de Anthropic saltó del puesto 42 al 1 en las listas de Más Descargados de la App Store de EE. UU., con ChatGPT y Gemini ocupando el segundo y tercer lugar. El aumento sigue a un desacuerdo público entre Anthropic y el gobierno de EE. UU. sobre el uso militar y de vigilancia de la tecnología de IA.

OpenClawRadar
La memoria del agente no es un problema de almacenamiento: es un problema de autoridad
Noticias

La memoria del agente no es un problema de almacenamiento: es un problema de autoridad

Un desarrollador argumenta que la memoria de los agentes falla no por errores de recuperación, sino porque todas las notas regresan con igual autoridad. La solución: un gráfico con roles, vencimiento y campos de activación.

OpenClawRadar