Nvidia Nemotron 3 Super : un modèle de 120 milliards de paramètres avec une inférence active de 12 milliards

✍️ OpenClawRadar📅 Publié: March 12, 2026🔗 Source
Nvidia Nemotron 3 Super : un modèle de 120 milliards de paramètres avec une inférence active de 12 milliards
Ad

Nvidia a dévoilé le Nemotron 3 Super, un modèle de 120 milliards de paramètres qui n'en active que 12 milliards lors de l'inférence. Cela remet en question l'idée selon laquelle des modèles plus grands produisent toujours de meilleurs résultats, en offrant les connaissances d'un modèle de 120 milliards pour un coût de calcul proche de celui d'un modèle de 12 milliards. Le modèle n'approxime pas un modèle plus grand par compression : c'est un modèle de 120 milliards qui a appris à router efficacement, les 108 milliards de paramètres restants étant disponibles quand c'est pertinent et inactifs quand ce n'est pas le cas.

Choix architecturaux

Trois décisions architecturales clés rendent cela possible :

  • LatentMoE : Projette les tokens dans un espace latent compressé avant le routage, ce qui rend les décisions de routage moins coûteuses. Cela permet d'activer 4 fois plus d'experts pour le même coût d'inférence qu'un MoE standard.
  • Hybrid Mamba-Attention : Remplace l'attention transformer, coûteuse de manière quadratique, par Mamba-2 pour la plupart des traitements de séquences, rendant la fenêtre de contexte d'un million de tokens pratique plutôt que théorique. Atteint une précision de 91,75 % sur RULER à 1 million de tokens.
  • Prédiction multi-tokens : Génère plusieurs tokens futurs par passe avant, offrant un décodage spéculatif natif jusqu'à 3 fois plus rapide en temps réel sans nécessiter de modèle de brouillon séparé. Résulte en un débit 5 fois supérieur à son prédécesseur et surpasse les modèles activant 3 fois plus de paramètres par token.
Ad

Tendance plus large

Il s'agit de la troisième confirmation indépendante de cette approche architecturale. DeepSeek V3 l'a d'abord démontré avec 671 milliards de paramètres totaux et 37 milliards actifs, surpassant le dense Llama 3 405B. Qwen3-Coder-Next a suivi avec 80 milliards de paramètres totaux et seulement 3 milliards actifs lors de l'inférence, égalant Claude Sonnet 4.5 sur SWE-Bench Pro et surpassant DeepSeek V3 qui active 37 milliards par token. Les gains d'efficacité se cumulent plutôt que de se compenser : chaque décision architecturale bénéficie davantage de l'échelle que l'attention dense, et l'écart entre cette architecture et les transformeurs denses s'accroît à mesure que les modèles évoluent.

L'idée clé de ces trois publications indépendantes est que la voie vers les capacités ne passe pas par plus d'activation, mais par un meilleur routage. Alors que les classements de nombre de paramètres continueront de publier des chiffres, les paramètres actifs par token deviennent une métrique plus honnête pour comparer l'efficacité et les performances des modèles.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

LeMario : Entraîner un modèle du monde JEPA sur Super Mario Bros — Guide technique et rétrospective
News

LeMario : Entraîner un modèle du monde JEPA sur Super Mario Bros — Guide technique et rétrospective

Benjamin Bai reproduit l'architecture JEPA de LeWorldModel à partir de zéro et l'entraîne sur Super Mario Bros. Le modèle prédit des futurs à cinq pas mais échoue dans la planification à long terme — un post-mortem technique détaillé.

OpenClawRadar
DeepSeek v4 Flash sur Mac Studio : un LLM local détecte de vrais bugs dans le code du compilateur
News

DeepSeek v4 Flash sur Mac Studio : un LLM local détecte de vrais bugs dans le code du compilateur

Un développeur partage que DeepSeek v4 Flash fonctionnant sur un Mac Studio de 128 Go identifie avec succès des bugs valides dans une base de code de compilateur, une tâche impossible avec les LLM locaux il y a 5 mois.

OpenClawRadar
Claude-Code v2.1.94 ajoute la prise en charge de Mantle et corrige des bugs critiques.
News

Claude-Code v2.1.94 ajoute la prise en charge de Mantle et corrige des bugs critiques.

Claude-Code v2.1.94 introduit la prise en charge d'Amazon Bedrock via Mantle avec la variable d'environnement CLAUDE_CODE_USE_MANTLE=1, modifie le niveau d'effort par défaut à élevé pour la plupart des utilisateurs, et corrige plus de 15 bogues incluant la gestion des limites de débit, les problèmes de connexion sur macOS et les problèmes du système de plugins.

OpenClawRadar
Glomz Octagon : Révisions de code multi-agents – 179 agents, 1 333 révisions et l'effet de réseau
News

Glomz Octagon : Révisions de code multi-agents – 179 agents, 1 333 révisions et l'effet de réseau

Glomz.com a mené une expérience où 179 agents IA se sont inscrits, ont soumis 433 soumissions de code et généré 1 333 révisions dans une arène « Octagon ». L'effet de réseau « cascade de révisions » est réel — les soumissions avec 3 à 5 révisions initiales ont attiré plus d'agents, la meilleure soumission recevant 21 révisions.

OpenClawRadar