12GB VRAM 基准测试:在 RTX 4070 Super 上运行 Qwen 3.6 和 Gemma 4 模型

Пользователь Reddit опубликовал бенчмарки скорости для запуска нескольких больших MoE-моделей на 12 ГБ RTX 4070 Super (с +10% разгоном) в связке с процессором AMD 9800X3D и 64 ГБ DDR5-6000 RAM. Пользователь выводит изображение на встроенное видео iGPU, чтобы сэкономить VRAM, отмечая штраф производительности около 10% в противном случае. Настройка использует CUDA 13.1 и последнюю версию llama.cpp со следующей конфигурацией оборудования:
n-gpu-layers = 999
threads = 8
threads-batch = 16
batch-size = 4096
ubatch-size = 4096
ctx-size = 65536
flash-attn = true
Результаты бенчмарков
Пользователь протестировал четыре модели с помощью квантов Unsloth GGUF в VS Code с Cline и KiloCode (проблем с вызовом инструментов не было). Все измерения приведены в токенах в секунду (tgs) и обработке в секунду (pps).
- Qwen3.6-35B-A3B-GGUF Q6_K_XL: 40 tgs, 2100 pps
- Qwen3.6-27B-IQ3_XXS: 16 tgs, 1000 pps
- Gemma 4 26B-A4B-it-UD-Q8: 26 tgs, 2150 pps
- Gemma-4-31B-it-IQ3_XXS: 13-16 tgs, 650 pps
Примечательные детали конфигурации
Пользователь поделился конфигурациями отдельных моделей с конкретными настройками. Ключевые моменты:
- Для Qwen3.6-35B-A3B:
n-cpu-moe = 35(выгрузка 35 экспертов MoE на CPU),cache-type-k = q8_0,cache-type-v = q8_0,swa-full = true,cache-reuse = 512, размер контекста 131072, рассуждения включены с бюджетом 8096. - Для Gemma 4 26B:
n-cpu-moe = 27, контекст 102400,fit = onсfit-target = 256иfit-ctx = 32768. - Для Gemma 4 31B: используется спекулятивное декодирование с
ngram-mod(spec-type = ngram-mod),n-gpu-layers = 58(частичная выгрузка на GPU),cache-type-k = q4_0,no-kv-offload = true. - Во всех моделях используется
flash-attn = trueиno-mmproj-offload = true.
Предпочтительной моделью пользователя для веб-разработки является Qwen3.6-35B-A3B, он хвалит её качество без проблем с вызовом инструментов в расширениях VS Code.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

AGENTS.md Правильно: Повышение точности на 25% — или падение на 30%
Компания Augment Code провела соревновательное тестирование файлов AGENTS.md: лучшие из них дают эффект, сопоставимый с обновлением модели с Haiku до Opus; худшие — ухудшают результат. Таблицы решений, процедурные рабочие процессы и прогрессивное раскрытие информации оказались наиболее эффективными.

Как получить и продлить кредиты API Anthropic с помощью маршрутизатора Manifest
В посте на Reddit описаны шаги по получению до $200 бесплатных кредитов API Anthropic и настройке роутера Manifest для автоматического перенаправления запросов к более дешёвым моделям, таким как Haiku, для простых задач, что продлевает срок действия кредитов с одного месяца до нескольких.

6 шаблонов, которые действительно активируют файлы навыков Claude Code
Протестировав более 2300 файлов навыков, разработчик выявил 6 закономерностей, определяющих, загрузится ли навык Claude Code, когда это необходимо – включая конкретный язык триггеров, одну возможность на файл и списки «когда не использовать».

Как перенести OpenClaw и Hermes между машинами с помощью SSH-самомиграции
Пользователь перенес OpenClaw и Hermes из WSL2 Ubuntu на ноутбуке в экземпляр EVO-X2 с WSL2 Ubuntu 2604, позволив инструментам самостоятельно выполнить SSH-миграцию.