Nvidias Nemotron 3 Super: 120-Milliarden-Parameter-Modell mit 12 Milliarden aktiven Inferenzparametern

✍️ OpenClawRadar📅 Veröffentlicht: 12. März 2026🔗 Source
Nvidias Nemotron 3 Super: 120-Milliarden-Parameter-Modell mit 12 Milliarden aktiven Inferenzparametern
Ad

Nvidia hat Nemotron 3 Super veröffentlicht, ein Modell mit 120 Milliarden Parametern, das während der Inferenz nur 12 Milliarden Parameter aktiviert. Dies stellt die Annahme in Frage, dass größere Modelle immer bessere Ergebnisse liefern, indem es das Wissen eines 120-Milliarden-Modells zu etwa den Rechenkosten eines 12-Milliarden-Modells bietet. Das Modell approximiert kein größeres Modell durch Kompression – es ist ein 120-Milliarden-Modell, das gelernt hat, effizient zu routen, wobei die anderen 108 Milliarden Parameter verfügbar sind, wenn sie relevant sind, und inaktiv, wenn nicht.

Architekturentscheidungen

Drei wichtige Architekturentscheidungen machen dies möglich:

  • LatentMoE: Projiziert Tokens in einen komprimierten latenten Raum vor dem Routing, wodurch Routing-Entscheidungen günstiger werden. Dies ermöglicht die Aktivierung von 4x mehr Experten für die gleichen Inferenzkosten wie bei Standard-MoE.
  • Hybrid Mamba-Attention: Ersetzt die quadratisch teure Transformer-Attention durch Mamba-2 für die meiste Sequenzverarbeitung, wodurch das 1-Millionen-Token-Kontextfenster praktisch statt theoretisch wird. Erreicht 91,75 % Genauigkeit auf RULER bei 1M Tokens.
  • Multi-Token-Vorhersage: Generiert mehrere zukünftige Tokens pro Vorwärtsdurchlauf und bietet native spekulative Decodierung mit bis zu 3x schnellerer Echtzeit-Inferenz ohne separates Draft-Modell. Führt zu 5x höherem Durchsatz als sein Vorgänger und übertrifft Modelle, die 3x mehr Parameter pro Token aktivieren.
Ad

Breiterer Trend

Dies ist die dritte unabhängige Bestätigung dieses Architekturansatzes. DeepSeek V3 demonstrierte dies zuerst mit 671 Milliarden Gesamtparametern und 37 Milliarden aktiven, wobei es Llama 3 405B dicht übertraf. Qwen3-Coder-Next folgte mit 80 Milliarden Gesamtparametern und nur 3 Milliarden aktiven bei der Inferenz, was Claude Sonnet 4.5 auf SWE-Bench Pro entsprach und DeepSeek V3 übertraf, das 37 Milliarden pro Token aktiviert. Die Effizienzgewinne verstärken sich gegenseitig statt sich abzutauschen – jede Architekturentscheidung profitiert mehr von der Skalierung als dichte Attention, und die Lücke zwischen dieser Architektur und dichten Transformern wächst mit der Skalierung der Modelle.

Die zentrale Erkenntnis aus diesen drei unabhängigen Veröffentlichungen ist, dass der Weg zu Fähigkeiten nicht mehr Aktivierung ist – sondern besseres Routing. Während Parameterzahlen-Ranglisten weiterhin Zahlen veröffentlichen, werden aktive Parameter pro Token zur ehrlicheren Metrik für den Vergleich von Modelleffizienz und -leistung.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Diagnose von operationellem Drift und Aufgabenamnesie in OpenClaw mit Gemini 2.5 Flash auf Proxmox
Nachrichten

Diagnose von operationellem Drift und Aufgabenamnesie in OpenClaw mit Gemini 2.5 Flash auf Proxmox

OpenClaw-Nutzer berichten von Problemen mit persistierenden Workflows auf einer Proxmox-VM und nennen operationale Drift sowie Aufgabenamnesie. Obwohl die Leistung bei einmaligen Aufgaben stabil ist, hat das Gemini 2.5 Flash-Modell in diesem Setup Schwierigkeiten mit Automatisierung und Speicher.

OpenClawRadar
Analyse der Astroturfing-Kampagne von OpenClaw und des $CLAWD Token Pumps
Nachrichten

Analyse der Astroturfing-Kampagne von OpenClaw und des $CLAWD Token Pumps

Eine Reddit-Untersuchung enthüllt, dass das virale Wachstum von OpenClaw Ende Januar durch eine rekursive Astroturfing-Kampagne mit etwa 400 Bot-Instanzen angetrieben wurde, die Hype erzeugte, um den $CLAWD-Token auf eine Marktkapitalisierung von 16 Millionen US-Dollar zu treiben, bevor er um 90 % abstürzte.

OpenClawRadar
🦀
Nachrichten

Parameter Golf: OpenAIs KI-gestütztes ML-Forschungsexperiment

OpenAI veranstaltete Parameter Golf, einen Wettbewerb mit über 1.000 Teilnehmern und mehr als 2.000 Einsendungen, der KI-gestütztes maschinelles Lernen, Codierungsagenten, Quantisierung und neuartiges Modelldesign unter strengen Auflagen testete.

OpenClawRadar
Lokale vs. Cloud-Modelle: Qwen-3.6-27B, Gemma-4-31B, Claude Haiku, Codex-Spark bei schwerer Code-Generierung
Nachrichten

Lokale vs. Cloud-Modelle: Qwen-3.6-27B, Gemma-4-31B, Claude Haiku, Codex-Spark bei schwerer Code-Generierung

Ein Benutzer testete Qwen-3.6-27B (q4_k_m) lokal auf einer RTX 5080 gegen die API-basierten Modelle Gemma-4-31B, Claude Haiku 4.5 und Codex-Spark bei einer komplexen Code-Aufgabe. Nur Codex-Spark lieferte vollständigen Code (aber mit Importfehlern); alle anderen scheiterten teilweise. Kosten: Gemma verbrauchte 0,112 $ für 803k Eingabe-Tokens.

OpenClawRadar