NVIDIA veröffentlicht Nemotron-3-Ultra-550B: 55B aktive Parameter, 1M Kontext, LatentMoE Hybrid

NVIDIA hat Nemotron-3-Ultra-550B-A55B-BF16 veröffentlicht, ein bahnbrechendes LLM mit insgesamt 550B Parametern und 55B aktiven Parametern. Das Modell nutzt eine hybride Latent Mixture-of-Experts (LatentMoE)-Architektur, die Mamba-2-, MoE- und Attention-Layer sowie Multi-Token Prediction (MTP) für schnellere Generierung kombiniert. Die Kontextlänge beträgt bis zu 1M Token.
Wichtige Spezifikationen
- Architektur: LatentMoE-Hybrid – Mamba-2 + MoE + Attention + MTP
- Parameter: 550B gesamt / 55B aktiv
- Kontext: Bis zu 1M Token
- Min. GPU: 8x GB200/B200/GB300/B300, 16x H100, 8x H200
- Sprachen: Englisch, Französisch, Spanisch, Italienisch, Deutsch, Japanisch, Koreanisch, Hindi, brasilianisches Portugiesisch, Chinesisch
- Reasoning: Konfigurierbar ein/aus via Chat-Vorlage (
enable_thinking=True/False) - Lizenz: OpenMDW License Agreement v1.1
Das Modell ist für anspruchsvolles Reasoning, komplexe agentische Workflows, Langkontext-Analysen, Tool-Nutzung, mehrsprachiges Reasoning und hochriskante RAG-Anwendungen konzipiert. Es wurde mit der NVFP4-Pre-Training-Methode für Recheneffizienz trainiert. Offene Gewichte, Trainingsdaten und Rezepte sind unter der OpenMDW-Lizenz enthalten. Für die lokale Inferenz benötigen Sie mindestens 8x H200 oder Vergleichbares.
📖 Zum vollständigen Quelltext: r/LocalLLaMA
👀 Siehe auch

Claude Code entwickelt sich zu einem Engineering-Betriebssystem und nicht nur zu einem KI-Code-Chat
Eine Reddit-Diskussion argumentiert, dass Claude Code sich immer weniger wie ein KI-Chat zum Programmieren und immer mehr wie ein Engineering-Betriebssystem mit Planung, Code-Review, Cloud-Agenten und autonomen Arbeitsabläufen anfühlt.

RTX 4090 vs H100 für das Feinabstimmen von Llama-3-8B: Ein Kosten-Leistungs-Vergleich
Ein Entwickler testete das Feinabstimmen von Llama-3-8B sowohl auf einer RTX 4090 als auch auf gemieteten H100-Instanzen. Das 4090-Setup kostete 2.000 US-Dollar im Voraus und dauerte 24 Stunden, während die H100-Miete etwa 80 US-Dollar kostete und in 4 Stunden abgeschlossen war.

Warum Die Open-Source-Architektur von OpenClaw Wichtig Ist

Claude MAX Plan beinhaltet jetzt ein 1-Million-Token-Kontextfenster ohne Aufpreis
Der Claude MAX-Plan wurde automatisch auf ein 1-Millionen-Token-Kontextfenster erweitert, ohne zusätzliche API-Nutzungsgebühren, wobei Nutzer über deutlich reduzierten Token-Verbrauch und den Wegfall des Kontextfenster-Managements berichten.