Qwen 3.5 122B MoE на уровне 35 т/с на одном 3090 с ik_llama.cpp MTP

✍️ OpenClawRadar📅 Опубликовано: 6 июня 2026 г.🔗 Source
Qwen 3.5 122B MoE на уровне 35 т/с на одном 3090 с ik_llama.cpp MTP
Ad

Разработчик, использующий полностью локальный стек вывода на одном ПК, сообщает о достижении скорости 35 токенов/с на Qwen 3.5 122B MoE с использованием всего одной 3090, причем ключевым фактором стал форк llama.cpp, исправляющий MTP (Multi-Token Prediction) для выгруженных экспертов.

Конфигурация оборудования

  • Процессор AMD 9900X
  • 192 ГБ DDR5-5200 RAM (названная «секретным оружием»)
  • Две 3090 (Ti + обычная), без NVLink

Карта 1 запускает рабочего: Qwen3.5-122B-A10B с использованием Unsloth IQ3_S MTP GGUF и контекстом 204K. 75% экспертных слоев выгружены на CPU с помощью хирургических флагов -ot. Карта 2 запускает решатель: Qwen3.6-35B-A3B Q4_K_XL с MTP на скорости 135 т/с, контекст 262K.

Дополнительные экземпляры только на CPU обрабатывают фоновые задачи: Dialectic (35B heretic Q8), Scribe-Logos (Gemma4 19B), Moonshot (Gemma4 2B) — всего ~19 ГБ ОЗУ.

Ad

Результаты ik_llama.cpp

В стандартном llama.cpp MTP оценивает экспертов каждого предполагаемого токена последовательно через DDR5, что на контенте для рассуждений фактически ухудшает производительность — накладные расходы на черновик перевешивают ускорение принятия. Форк ik реализует слитые MoE операции, которые пакетно читают экспертов для предполагаемых токенов, превращая прирост MTP с +4% в +20%. Разработчик сообщает о 35 т/с декодирования на модели 122B с одной 3090 при использовании этого форка.

Если вы выгружаете экспертов на RAM на любой MoE-модели, попробуйте ik_llama.cpp, прежде чем отказаться от MTP.

Общая стоимость сборки

  • ~$1600 за RAM
  • ~$1600 за две 3090
  • ~$400 за всё остальное
  • Эксплуатационные расходы: только электричество

📖 Читать полный источник: r/openclaw

Ad

👀 Смотрите также

Как устранить проблемы с настройкой OpenClaw: проблемы с многоагентным взаимодействием и ответами модели
Гайды

Как устранить проблемы с настройкой OpenClaw: проблемы с многоагентным взаимодействием и ответами модели

Пытаетесь настроить OpenClaw? Узнайте о распространенных проблемах с многоагентными конфигурациями и неработоспособными моделями, а также о том, как их решить.

OpenClawRadar
Экономичная настройка мультиагента OpenClaw с использованием моделей подписки
Гайды

Экономичная настройка мультиагента OpenClaw с использованием моделей подписки

Пользователь Reddit описывает маршрутизацию всех операций мультиагентной системы OpenClaw через существующие подписки Anthropic Pro Max за $200 и ChatGPT OpenAI Codex за $200 вместо прямых вызовов API, используя более дешёвые модели Anthropic для простых агентов и более сложные модели для других задач.

OpenClawRadar
Трехуровневая архитектура памяти для постоянного контекста агента OpenClaw
Гайды

Трехуровневая архитектура памяти для постоянного контекста агента OpenClaw

Разработчик создал трехслойную систему памяти на основе инфраструктуры OpenClaw, чтобы предотвратить запуск агентов без контекста в начале каждой сессии. Архитектура включает L1 (рабочие файлы, внедряемые на каждом шаге), L2 (семантический поиск по памяти) и L3 (справочные документы, открываемые по требованию).

OpenClawRadar
OpenClaw 2026.3.7 ломает вызовы инструментов Kimi, откат до версии 2026.3.2 исправляет регрессию.
Гайды

OpenClaw 2026.3.7 ломает вызовы инструментов Kimi, откат до версии 2026.3.2 исправляет регрессию.

В версии OpenClaw 2026.3.7 обнаружена регрессия, при которой провайдер Kimi API выводит сырой XML <function_calls> вместо выполнения инструментов. Решение — откатиться до версии 2026.3.2 и восстановить совместимый конфигурационный файл.

OpenClawRadar