Qwen 3.5 122B MoE на уровне 35 т/с на одном 3090 с ik_llama.cpp MTP

Разработчик, использующий полностью локальный стек вывода на одном ПК, сообщает о достижении скорости 35 токенов/с на Qwen 3.5 122B MoE с использованием всего одной 3090, причем ключевым фактором стал форк llama.cpp, исправляющий MTP (Multi-Token Prediction) для выгруженных экспертов.
Конфигурация оборудования
- Процессор AMD 9900X
- 192 ГБ DDR5-5200 RAM (названная «секретным оружием»)
- Две 3090 (Ti + обычная), без NVLink
Карта 1 запускает рабочего: Qwen3.5-122B-A10B с использованием Unsloth IQ3_S MTP GGUF и контекстом 204K. 75% экспертных слоев выгружены на CPU с помощью хирургических флагов -ot. Карта 2 запускает решатель: Qwen3.6-35B-A3B Q4_K_XL с MTP на скорости 135 т/с, контекст 262K.
Дополнительные экземпляры только на CPU обрабатывают фоновые задачи: Dialectic (35B heretic Q8), Scribe-Logos (Gemma4 19B), Moonshot (Gemma4 2B) — всего ~19 ГБ ОЗУ.
Результаты ik_llama.cpp
В стандартном llama.cpp MTP оценивает экспертов каждого предполагаемого токена последовательно через DDR5, что на контенте для рассуждений фактически ухудшает производительность — накладные расходы на черновик перевешивают ускорение принятия. Форк ik реализует слитые MoE операции, которые пакетно читают экспертов для предполагаемых токенов, превращая прирост MTP с +4% в +20%. Разработчик сообщает о 35 т/с декодирования на модели 122B с одной 3090 при использовании этого форка.
Если вы выгружаете экспертов на RAM на любой MoE-модели, попробуйте ik_llama.cpp, прежде чем отказаться от MTP.
Общая стоимость сборки
- ~$1600 за RAM
- ~$1600 за две 3090
- ~$400 за всё остальное
- Эксплуатационные расходы: только электричество
📖 Читать полный источник: r/openclaw
👀 Смотрите также

Как устранить проблемы с настройкой OpenClaw: проблемы с многоагентным взаимодействием и ответами модели
Пытаетесь настроить OpenClaw? Узнайте о распространенных проблемах с многоагентными конфигурациями и неработоспособными моделями, а также о том, как их решить.

Экономичная настройка мультиагента OpenClaw с использованием моделей подписки
Пользователь Reddit описывает маршрутизацию всех операций мультиагентной системы OpenClaw через существующие подписки Anthropic Pro Max за $200 и ChatGPT OpenAI Codex за $200 вместо прямых вызовов API, используя более дешёвые модели Anthropic для простых агентов и более сложные модели для других задач.

Трехуровневая архитектура памяти для постоянного контекста агента OpenClaw
Разработчик создал трехслойную систему памяти на основе инфраструктуры OpenClaw, чтобы предотвратить запуск агентов без контекста в начале каждой сессии. Архитектура включает L1 (рабочие файлы, внедряемые на каждом шаге), L2 (семантический поиск по памяти) и L3 (справочные документы, открываемые по требованию).

OpenClaw 2026.3.7 ломает вызовы инструментов Kimi, откат до версии 2026.3.2 исправляет регрессию.
В версии OpenClaw 2026.3.7 обнаружена регрессия, при которой провайдер Kimi API выводит сырой XML <function_calls> вместо выполнения инструментов. Решение — откатиться до версии 2026.3.2 и восстановить совместимый конфигурационный файл.