NVIDIA veröffentlicht Nemotron-3-Ultra-550B: 55B aktive Parameter, 1M Kontext, LatentMoE Hybrid

✍️ OpenClawRadar📅 Veröffentlicht: 4. Juni 2026🔗 Source
NVIDIA veröffentlicht Nemotron-3-Ultra-550B: 55B aktive Parameter, 1M Kontext, LatentMoE Hybrid
Ad

NVIDIA hat Nemotron-3-Ultra-550B-A55B-BF16 veröffentlicht, ein bahnbrechendes LLM mit insgesamt 550B Parametern und 55B aktiven Parametern. Das Modell nutzt eine hybride Latent Mixture-of-Experts (LatentMoE)-Architektur, die Mamba-2-, MoE- und Attention-Layer sowie Multi-Token Prediction (MTP) für schnellere Generierung kombiniert. Die Kontextlänge beträgt bis zu 1M Token.

Ad

Wichtige Spezifikationen

  • Architektur: LatentMoE-Hybrid – Mamba-2 + MoE + Attention + MTP
  • Parameter: 550B gesamt / 55B aktiv
  • Kontext: Bis zu 1M Token
  • Min. GPU: 8x GB200/B200/GB300/B300, 16x H100, 8x H200
  • Sprachen: Englisch, Französisch, Spanisch, Italienisch, Deutsch, Japanisch, Koreanisch, Hindi, brasilianisches Portugiesisch, Chinesisch
  • Reasoning: Konfigurierbar ein/aus via Chat-Vorlage (enable_thinking=True/False)
  • Lizenz: OpenMDW License Agreement v1.1

Das Modell ist für anspruchsvolles Reasoning, komplexe agentische Workflows, Langkontext-Analysen, Tool-Nutzung, mehrsprachiges Reasoning und hochriskante RAG-Anwendungen konzipiert. Es wurde mit der NVFP4-Pre-Training-Methode für Recheneffizienz trainiert. Offene Gewichte, Trainingsdaten und Rezepte sind unter der OpenMDW-Lizenz enthalten. Für die lokale Inferenz benötigen Sie mindestens 8x H200 oder Vergleichbares.

📖 Zum vollständigen Quelltext: r/LocalLLaMA

Ad

👀 Siehe auch