NvidiaのNemotron 3 Super:1200億パラメーターモデル、推論時は120億パラメーターを活用

Nvidiaは、推論時に120億のパラメータのみを活性化する1200億パラメータモデル「Nemotron 3 Super」を発表しました。これは、約12Bモデルの計算コストで120Bモデルの知識を提供することで、大きなモデルが常に優れた結果をもたらすという前提に挑戦しています。このモデルは圧縮によって大きなモデルを近似しているのではなく、関連する場合に他の1080億のパラメータを利用可能にし、不要な場合はアイドル状態にする効率的なルーティングを学習した120Bモデルです。
アーキテクチャの決定
これを可能にする3つの重要なアーキテクチャ上の決定があります:
- LatentMoE: ルーティング前にトークンを圧縮された潜在空間に投影し、ルーティング決定をより安価にします。これにより、標準的なMoEと同じ推論コストで4倍の専門家を活性化できます。
- ハイブリッドMamba-Attention: 二次的に高価なトランスフォーマーアテンションの大部分をMamba-2に置き換え、100万トークンのコンテキストウィンドウを理論的ではなく実用的なものにします。100万トークンでRULERの91.75%の精度を達成します。
- マルチトークン予測: 1回のフォワードパスで複数の将来トークンを生成し、別のドラフトモデルを必要とせずに最大3倍速い実時間推論を可能にするネイティブな投機的デコードを提供します。これにより、前身モデルよりも5倍高いスループットを実現し、トークンあたり3倍以上のパラメータを活性化するモデルを上回ります。
より広範なトレンド
これは、このアーキテクチャアプローチの3つ目の独立した確認です。DeepSeek V3は、合計671Bパラメータと37B活性化パラメータでこれを初めて実証し、Llama 3 405B denseを上回りました。Qwen3-Coder-Nextは、合計80Bパラメータと推論時にわずか3Bの活性化パラメータで続き、SWE-Bench ProでClaude Sonnet 4.5と同等の性能を発揮し、トークンあたり37Bを活性化するDeepSeek V3を上回りました。効率性の向上はトレードオフではなく複合的なものであり、各アーキテクチャ上の決定は、密なアテンションよりもスケールからより多くの恩恵を受け、このアーキテクチャと密なトランスフォーマーの間のギャップはモデルがスケールするにつれて拡大します。
これら3つの独立したリリースから得られる重要な洞察は、能力への道はより多くの活性化ではなく、より良いルーティングにあるということです。パラメータ数のリーダーボードは引き続き数値を公開しますが、トークンあたりの活性化パラメータは、モデルの効率性と性能を比較するためのより誠実な指標になりつつあります。
📖 Read the full source: r/LocalLLaMA
👀 See Also

オープンクローオーバーナイトテスト:AI自動化における飛躍的進歩
オープンクロー・オーバーナイトテストは、AIを活用したコーディングエージェントの可能性を示し、夜間処理をシームレスな自動化へと変革します。r/openclawコミュニティからの主なポイントや議論を探ってみましょう。

Claude APIの利用データが、Maxプランユーザーへの新制限の影響を示す
Claude Max 20xのユーザーが報告したところによると、新たな制限が導入された後、API相当の日次使用量が約210ドル/日から約52ドル/日に低下し、SonnetやCodexの使用を含む大幅なワークフローの変更が必要となった。

主要AIモデルに対するQwen 3.5モデルのベンチマーク比較
ベンチマーク比較ウェブサイトには、Qwen 3.5モデル(122B、35B、27B、397B)とGPT-5.2、Claude 4.5 Opus、Gemini-3 Proなどのモデルを比較した検証済みスコアと対戦形式のインフォグラフィックが掲載されています。

OpenClaw開発者、Driftwatch V3ビルド中にコンテキスト圧縮の問題を報告
OpenClawの開発者がDriftwatch V3ビルドのスプリント2〜4を完了しましたが、コンテキスト圧縮の問題によりAIエージェントのメモリがセッション中に消去され、スプリントの要約を使用した手動介入による進捗の復元が必要となりました。