Бенчмаркинг Nemotron 3 Super 120B с контекстом в 1 миллион токенов на M1 Ultra.

✍️ OpenClawRadar📅 Опубликовано: 12 марта 2026 г.🔗 Source
Бенчмаркинг Nemotron 3 Super 120B с контекстом в 1 миллион токенов на M1 Ultra.
Ad

Локальное тестирование контекста в 1 миллион токенов с Nemotron 3 Super

Пользователь Reddit провёл бенчмарк-тест, чтобы оценить возможность локальной обработки контекста в 1 миллион токенов с использованием Nemotron 3 Super 120B на системе M1 Ultra. Тест использовал гибридную архитектуру mamba-2 модели, которая обеспечивает эффективность использования памяти при увеличенных длинах контекста.

Детали аппаратного обеспечения и настройки

Тест проводился на M1 Ultra с использованием llama.cpp со следующей конфигурацией:

  • Модель: Nemotron-3-Super-120B-Q4_K.gguf (квантование Q4_K_M)
  • Выделение контекста: Полные 1 миллион токенов
  • Использование видеопамяти: Примерно 90 ГБ
  • Бэкенд: MTL,BLAS с 1 потоком
  • Единый размер батча: 2048
  • Flash attention: Включён (fa 1)
  • GPU слои: 99 (-ngl 99)

Команда бенчмарка и результаты

Пользователь запустил llama-bench с этой командой:

llama-bench -m ~/ml-models/huggingface/ggml-org/Nemotron-3-Super-120B-GGUF/Nemotron-3-Super-120B-Q4_K.gguf -fa 1 -t 1 -ngl 99 -b 2048 -ub 2048 -d 0,10000,20000,30000,40000,50000,60000,70000,80000,90000,100000,150000,200000,250000,1000000

Ключевые результаты производительности из бенчмарка:

  • Обработка промпта (pp512) при контексте 0: 255,03 ± 0,36 токенов/секунду
  • Генерация токенов (tg128) при контексте 0: 26,72 ± 0,02 токенов/секунду
  • Обработка промпта при контексте 100 000 токенов: 184,99 ± 0,19 токенов/секунду
  • Генерация токенов при контексте 100 000 токенов: 22,37 ± 0,01 токенов/секунду
  • Обработка промпта при контексте 150 000 токенов: 161,60 ± 0,22 токенов/секунду
  • Генерация токенов при контексте 150 000 токенов: 20,58 ± 0,01 токенов/секунду
  • Обработка промпта при контексте 200 000 токенов: 141,87 ± 0,19 токенов/секунду

Результаты показывают снижение производительности по мере увеличения длины контекста, при этом скорость обработки промпта падает с 255 т/с при нулевом контексте до примерно 142 т/с при 200 000 токенах.

Ad

Информация о системе

Инициализация Metal бэкенда показала:

  • Название GPU: MTL0
  • Семейство GPU: MTLGPUFamilyApple7 (1007)
  • Имеет унифицированную память: true
  • Поддерживает bfloat: true
  • Рекомендуемый максимальный размер рабочего набора: 134 217,73 МБ

Этот тест демонстрирует, что локальная обработка чрезвычайно больших контекстов (до 1 миллиона токенов) технически возможна с использованием высокопроизводительного аппаратного обеспечения Apple Silicon и квантованных моделей, хотя и требует значительных ресурсов памяти и приводит к компромиссам в производительности по мере расширения контекста.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Система антител: внешний сторожевой таймер для агентов OpenClaw
Инструменты

Система антител: внешний сторожевой таймер для агентов OpenClaw

Система Antibody — это система мониторинга с открытым исходным кодом, которая работает на отдельной машине и отслеживает агентов OpenClaw через SSH, реализуя многоуровневые реакции от обнаружения до восстановления сервиса. Она спроектирована так, чтобы переживать сбои, которые выводят из строя основного агента.

OpenClawRadar
Использование нескольких сеансов Claude Code параллельно с Git Worktrees
Инструменты

Использование нескольких сеансов Claude Code параллельно с Git Worktrees

Разработчик рассказывает, как использовать git worktrees для запуска нескольких сессий Claude Code на отдельных ветках без stash и переключения контекста. Просматривайте diff, сливайте ветки и двигайтесь дальше.

OpenClawRadar
Beacon: Открытая телеметрия конечных точек для локальных ИИ-агентов
Инструменты

Beacon: Открытая телеметрия конечных точек для локальных ИИ-агентов

Beacon захватывает активность локальных AI-агентов (Claude Code, Codex CLI, Cursor и др.) и нормализует ее в события конечных точек для инспекции или пересылки в SIEM через Wazuh, Elastic, Splunk HEC.

OpenClawRadar
Плагин OpenClaw Agent Relay исправляет доставку сообщений в Telegram в многокомпонентных системах.
Инструменты

Плагин OpenClaw Agent Relay исправляет доставку сообщений в Telegram в многокомпонентных системах.

Плагин openclaw-agent-relay решает постоянную проблему, когда ответы sessions_send отправляются в webchat вместо Telegram, используя WebSocket RPC шлюза для запуска ходов агента с deliver:true, устраняя необходимость в обходных решениях, таких как явные инструменты сообщений или шаги announce.

OpenClawRadar