Qwen 3.5 122B MoE на уровне 35 т/с на одном 3090 с ik_llama.cpp MTP

✍️ OpenClawRadar📅 Опубликовано: 6 июня 2026 г.🔗 Source
Qwen 3.5 122B MoE на уровне 35 т/с на одном 3090 с ik_llama.cpp MTP
Ad

Разработчик, использующий полностью локальный стек вывода на одном ПК, сообщает о достижении скорости 35 токенов/с на Qwen 3.5 122B MoE с использованием всего одной 3090, причем ключевым фактором стал форк llama.cpp, исправляющий MTP (Multi-Token Prediction) для выгруженных экспертов.

Конфигурация оборудования

  • Процессор AMD 9900X
  • 192 ГБ DDR5-5200 RAM (названная «секретным оружием»)
  • Две 3090 (Ti + обычная), без NVLink

Карта 1 запускает рабочего: Qwen3.5-122B-A10B с использованием Unsloth IQ3_S MTP GGUF и контекстом 204K. 75% экспертных слоев выгружены на CPU с помощью хирургических флагов -ot. Карта 2 запускает решатель: Qwen3.6-35B-A3B Q4_K_XL с MTP на скорости 135 т/с, контекст 262K.

Дополнительные экземпляры только на CPU обрабатывают фоновые задачи: Dialectic (35B heretic Q8), Scribe-Logos (Gemma4 19B), Moonshot (Gemma4 2B) — всего ~19 ГБ ОЗУ.

Ad

Результаты ik_llama.cpp

В стандартном llama.cpp MTP оценивает экспертов каждого предполагаемого токена последовательно через DDR5, что на контенте для рассуждений фактически ухудшает производительность — накладные расходы на черновик перевешивают ускорение принятия. Форк ik реализует слитые MoE операции, которые пакетно читают экспертов для предполагаемых токенов, превращая прирост MTP с +4% в +20%. Разработчик сообщает о 35 т/с декодирования на модели 122B с одной 3090 при использовании этого форка.

Если вы выгружаете экспертов на RAM на любой MoE-модели, попробуйте ik_llama.cpp, прежде чем отказаться от MTP.

Общая стоимость сборки

  • ~$1600 за RAM
  • ~$1600 за две 3090
  • ~$400 за всё остальное
  • Эксплуатационные расходы: только электричество

📖 Читать полный источник: r/openclaw

Ad

👀 Смотрите также

Как избежать непредвиденных расходов в OpenRouter при автоматизации OpenClaw
Гайды

Как избежать непредвиденных расходов в OpenRouter при автоматизации OpenClaw

Команда разработчиков случайно потратила $750 за 3 дня на OpenRouter, используя по умолчанию Claude Sonnet 4.6 ($3/млн токенов) для всех автоматизированных задач. Они сократили расходы на 97%, изменив модели по умолчанию, зафиксировав cron-задачи и подзадачи на более дешёвых вариантах и оставив дорогие модели только для важной работы.

OpenClawRadar
Правила SOUL.md дрейфуют в длинных сессиях ИИ-агентов и как это исправить
Гайды

Правила SOUL.md дрейфуют в длинных сессиях ИИ-агентов и как это исправить

Правила SOUL.md отлично работают первые 10-15 сообщений, но начинают отклоняться примерно на 20-30 сообщении, поскольку контекст разговора перекрывает начальный системный промпт. Решение — активнее использовать /new для сброса сессий перед каждой новой задачей.

OpenClawRadar
Для создания 9 навыков Клода в Solo Studio: укладка инструкций для реальной работы
Гайды

Для создания 9 навыков Клода в Solo Studio: укладка инструкций для реальной работы

Один разработчик создал девять навыков Claude для видеопроизводства, аналитики, SEO, финансового моделирования и других задач. Ключевая идея: пишите навыки как инструкции для опытного коллеги, а не как документацию. Навыки срабатывают автоматически и комбинируются при пересечении задач.

OpenClawRadar
Как получить ранний доступ к GPT-5.4 на OpenClaw через Dev Channel
Гайды

Как получить ранний доступ к GPT-5.4 на OpenClaw через Dev Channel

Dev-канал OpenClaw в настоящее время предоставляет доступ к GPT-5.4 до его стабильного релиза. Пользователям необходимо переключить свой шлюз на dev-канал с помощью определённой команды и перезапустить его, чтобы модель появилась в их списке.

OpenClawRadar