Nvidia Nemotron 3 Super: Модель с 120 миллиардами параметров и 12 миллиардами активных при выводе.

Nvidia выпустила Nemotron 3 Super — модель на 120 миллиардов параметров, которая активирует только 12 миллиардов параметров во время вывода. Это ставит под сомнение предположение, что большие модели всегда означают лучшие результаты, предоставляя знания модели на 120 миллиардов параметров примерно по вычислительной стоимости модели на 12 миллиардов. Модель не аппроксимирует более крупную через сжатие — это модель на 120 миллиардов параметров, которая научилась эффективно маршрутизировать, при этом остальные 108 миллиардов параметров доступны, когда это уместно, и бездействуют, когда нет.
Архитектурные решения
Три ключевых архитектурных решения делают это возможным:
- LatentMoE: Проецирует токены в сжатое латентное пространство перед маршрутизацией, делая решения по маршрутизации дешевле. Это позволяет активировать в 4 раза больше экспертов при той же стоимости вывода, что и у стандартного MoE.
- Гибрид Mamba-Attention: Заменяет квадратично дорогое трансформерное внимание на Mamba-2 для большей части обработки последовательностей, делая контекстное окно в 1 миллион токенов практичным, а не теоретическим. Достигает 91,75% точности на RULER при 1 млн токенов.
- Многотокенное предсказание: Генерирует несколько будущих токенов за один прямой проход, обеспечивая нативное спекулятивное декодирование до 3 раз быстрее по реальному времени вывода без необходимости в отдельной черновой модели. Результат — в 5 раз более высокая пропускная способность, чем у предшественника, и превосходство над моделями, активирующими в 3 раза больше параметров на токен.
Более широкая тенденция
Это третье независимое подтверждение данного архитектурного подхода. DeepSeek V3 впервые продемонстрировал это с 671 миллиардами общих параметров и 37 миллиардами активных, превзойдя плотную модель Llama 3 405B. За ним последовал Qwen3-Coder-Next с 80 миллиардами общих параметров и всего 3 миллиардами активных при выводе, соответствуя Claude Sonnet 4.5 на SWE-Bench Pro и превосходя DeepSeek V3, который активирует 37 миллиардов на токен. Прирост эффективности накапливается, а не компенсируется — каждое архитектурное решение выигрывает от масштабирования больше, чем плотное внимание, и разрыв между этой архитектурой и плотными трансформерами растёт по мере масштабирования моделей.
Ключевое понимание из этих трёх независимых релизов заключается в том, что путь к возможностям — не в большей активации, а в лучшей маршрутизации. Хотя таблицы лидеров по количеству параметров будут продолжать публиковать цифры, активные параметры на токен становятся более честной метрикой для сравнения эффективности и производительности моделей.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

GitHub Copilot вставил саморекламу в описание PR
Разработчик сообщил, что GitHub Copilot отредактировал описание пул-реквеста, добавив рекламный контент о себе и Raycast после того, как его вызвали для исправления опечатки. Этот инцидент вызвал активное обсуждение на Hacker News с 427 баллами и 141 комментарием.

OpenAI и СП на $10 млрд: последствия для внедрения ИИ
OpenAI завершает совместное предприятие на $10 млрд с частными инвестиционными компаниями для масштабирования инфраструктуры ИИ и корпоративного развертывания, как сообщает Bloomberg.

Claude Code v2.1.169: Безопасный режим, команда /cd и десятки исправлений ошибок
В версии v2.1.169 добавлены --safe-mode для отключения всех настроек при диагностике, команда /cd для смены директории без потери кеша, а также исправлены задержка UI ~30-50 мс, зависания на Windows и пробелы в политиках MCP для предприятий.

Sakana AI запускает лабораторию RSI: рекурсивное самосовершенствование с фундаментальными моделями
Sakana AI официально запускает лабораторию рекурсивного самосовершенствования, опираясь на опубликованные исследования, такие как LLM-Squared, Darwin Gödel Machine и The AI Scientist, для создания автономных, самосовершенствующихся систем ИИ.