Запуск MiniMax M2.7 Q8_0 128K на 2x3090 с разгрузкой CPU – реальные бенчмарки и конфигурация

✍️ OpenClawRadar📅 Опубликовано: 17 мая 2026 г.🔗 Source
Запуск MiniMax M2.7 Q8_0 128K на 2x3090 с разгрузкой CPU – реальные бенчмарки и конфигурация
Ad

В недавнем посте на r/LocalLLaMA пользователь делится опытом запуска модели MiniMax M2.7 (в квантовании Q8_0) с контекстом 128K на конфигурации с двумя 3090, 256 ГБ DDR4 и бывшим в употреблении процессором 10900X. Ключевая задача: запуск большой модели MoE с неквантованным KV-кэшем на относительно слабом для своего класса оборудовании.

Производительность

Пользователь сообщает:

  • Обработка промпта: ~50 токенов в секунду
  • Генерация токенов: ~10 токенов в секунду
  • Описано как «очень медленно, но приемлемо для рабочих процессов агентов кодирования»

Конфигурация

Они используют ik-llama-cuda (форк llama.cpp) со следующими флагами (из конфигурации NixOS):

${ik-llama-cuda}/bin/llama-server \
  -m ${modelPath} \
  --host 0.0.0.0 \
  --port ${toString cfg.port} \
  -c ${toString cfg.contextLength} \
  -ngl 999 \
  --cpu-moe \
  -sm graph \
  -fa on \
  -t 16 \
  -tb 16 \
  -b 4096 \
  -ub 4096 \
  -np 1 \
  -muge \
  -ger \
  --jinja \
  --metrics \
  --temp 1.0 \
  --top-p 0.95 \
  --top-k 40 \
  --min-p 0.01

Примечательные флаги:

  • --cpu-moe – выгрузка вычислений экспертов MoE на CPU
  • -sm graph – включает графовое планирование
  • -fa on – flash attention
  • -t 16 / -tb 16 – 16 потоков для вычислений и пакетной обработки соответственно
  • -b 4096 / -ub 4096 – размер пакета и подпакета
  • -muge – загрузка экспертов с учётом использования памяти (предположительно)
  • -ger – маршрутизация экспертов на GPU

Ad

Контекст и мотивация

Пользователь сообщает, что Q8_0 был выбран для уменьшения «странного поведения», наблюдаемого при более низких квантованиях. Они отмечают, что черновая модель для спекулятивного декодирования для M2.7 не была выпущена, что могло бы повысить скорость. Их в первую очередь интересует точность, а не скорость, при условии, что генерация не занимает «буквально весь день».

Вывод для разработчиков

Это практический пример для всех, кто запускает большие модели MoE на многопроцессорных конфигурациях с системной памятью. Подход --cpu-moe позволяет масштабировать контекст далеко за пределы VRAM, хотя и с уменьшенной скоростью. Для рабочих процессов агентов кодирования, где задержка не критична, такой компромисс может быть приемлем.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Сделайте OpenClaw умнее: проверяйте ложные предпосылки с помощью навыка проверки направления
Советы

Сделайте OpenClaw умнее: проверяйте ложные предпосылки с помощью навыка проверки направления

Новый навык для OpenClaw добавляет в AGENTS.md правила проверки решений, заставляя агента оспаривать предположения пользователя перед дорогостоящими или необратимыми изменениями.

OpenClawRadar
Перехват TLS антивирусом нарушает соединение Claude Desktop; обход с помощью исключений антивируса
Советы

Перехват TLS антивирусом нарушает соединение Claude Desktop; обход с помощью исключений антивируса

Проверка TLS антивирусом на bridge.claudeusercontent.com вызывает ошибку «Claude in Chrome is not connected» в Cowork (настольный компаньон Claude). Решение: добавьте *.claudeusercontent.com и *.anthropic.com в исключения HTTPS-сканирования антивируса. Node.js с флагом --use-system-ca предотвратил бы эту проблему.

OpenClawRadar
Сторожевой шлюз отката конфигураций: объединение проверок работоспособности с автоматическим откатом
Советы

Сторожевой шлюз отката конфигураций: объединение проверок работоспособности с автоматическим откатом

Пользователь Reddit предлагает сторожевой механизм, который перезапускает шлюз OpenClaw при отказе порта и автоматически откатывает конфигурацию после 5 неудачных запусков, предотвращая циклы перезагрузки из-за некорректных настроек.

OpenClawRadar
Настройка Клода на ведение оппозиционных дебатов без уступок: 5 работающих изменений промпта
Советы

Настройка Клода на ведение оппозиционных дебатов без уступок: 5 работающих изменений промпта

Пять конкретных техник инжиниринга промптов, чтобы предотвратить уклонение, угодничество и выдумывание со стороны Claude при выступлении в роли оппонента в дебатах, основанные на создании sparwithai.com.

OpenClawRadar