NVIDIA、Nemotron-3-Ultra-550Bをリリース:550億のアクティブパラメータ、100万トークンのコンテキスト、LatentMoEハイブリッド

NVIDIAはNemotron-3-Ultra-550B-A55B-BF16をリリースしました。これは、総パラメータ550B、アクティブパラメータ55Bのフロンティア級LLMです。このモデルは、Mamba-2、MoE、アテンション層をインターリーブし、さらにマルチトークン予測(MTP)による高速生成を実現する、ハイブリッドLatentMixture-of-Experts(LatentMoE)アーキテクチャを採用しています。コンテキスト長は最大100万トークンです。
主な仕様
- アーキテクチャ: LatentMoEハイブリッド – Mamba-2 + MoE + Attention + MTP
- パラメータ: 合計550B / アクティブ55B
- コンテキスト: 最大100万トークン
- 最低GPU: 8x GB200/B200/GB300/B300、16x H100、8x H200
- 対応言語: 英語、フランス語、スペイン語、イタリア語、ドイツ語、日本語、韓国語、ヒンディー語、ブラジルポルトガル語、中国語
- 推論: チャットテンプレートでオン/オフ設定可能(
enable_thinking=True/False) - ライセンス: OpenMDW License Agreement v1.1
このモデルは、最先端の推論、複雑なエージェントワークフロー、長文コンテキスト分析、ツール使用、多言語推論、重要度の高いRAG向けに構築されています。計算効率のためにNVFP4事前学習レシピでトレーニングされています。オープンウェイト、トレーニングデータ、レシピはOpenMDWライセンスで提供されます。ローカル推論には、少なくとも8x H200または同等のGPUが必要です。
📖 全文ソース: r/LocalLLaMA
👀 See Also

Claude 4.6 Opusは最小限の入力からLinuxのlist.hを再現できる
ユーザーが、Claude 4.6 Opusに最初の43行を入力し温度を0に設定すると、Linuxのlist.hヘッダーファイルとほぼ同一のコピーを生成できることを実証し、オープンソースコードで学習したAIモデルのGPLライセンスへの影響について疑問を提起しました。
AIコーディングツールが初心者開発者のスキル習得を妨げている
JetBrainsの調査によると、AIコーディングアシスタントを多用する初心者開発者は計画を省略し「能力の錯覚」を得る一方、AIを無視した開発者の方が優れたパフォーマンスを発揮した。完全な分析。

LLM空間推論テスト:SokobanベンチマークでChatGPT、Qwen3.7-max、Gemini 3.5-thinkingがリード
カスタム倉庫番ベンチマークで、LLMのゼロショット空間推論を厳格なフォーマットでテスト。ChatGPT、Qwen3.7-max、Gemini 3.5-thinkingのみ合格。Gemini 3.5-flashやQwen3.7-plusなどは不正な移動やデッドロックで失敗。

プロンプトベンチマークでの実行性能において、Claude Sonnet 4.6がOpus 4.6を上回る
RedditユーザーがSonnet 4.6とOpus 4.6の両方に複雑なプロンプトを提出したところ、創造性と隠された要件の観点からSonnetモデルの方が優れた応答を生成した。