Запуск Qwen3.6-35B-A3B с ~190k контекстом на 8 ГБ VRAM + 32 ГБ ОЗУ – Настройка и бенчмарки

✍️ OpenClawRadar📅 Опубликовано: 10 мая 2026 г.🔗 Source
Запуск Qwen3.6-35B-A3B с ~190k контекстом на 8 ГБ VRAM + 32 ГБ ОЗУ – Настройка и бенчмарки
Ad

Пользователь Reddit опубликовал подробную настройку для запуска моделей Qwen3.6-35B-A3B GGUF с контекстом ~190k на ноутбуке с 8 ГБ VRAM (RTX 4060) и 32 ГБ DDR5 RAM. Он сообщает о 37-43 ток/с сразу после установки, а с доработками — до ~51 ток/с.

Оборудование и модели

  • GPU: RTX 4060 8 ГБ VRAM
  • RAM: 32 ГБ DDR5 5600 МГц
  • ОС: Linux (производительность лучше, чем на Windows)
  • Протестированные модели (Q5 квант):
    • mudler/Qwen3.6-35B-A3B-APEX-GGUF — от ~40 ток/с до 37 ток/с
    • hesamation/Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF — от ~43 ток/с до 37 ток/с

Ключевая конфигурация

Используя форк llama.cpp с поддержкой TurboQuant (turboquant_plus), пользователь запускает llama-server со следующими флагами:

--model "<путь>" \
--host 0.0.0.0 \
--port 8085 \
--ctx-size 192640 \
--n-gpu-layers 430 \
--n-cpu-moe 35 \
--cache-type-k "turbo4" \
--cache-type-v "turbo4" \
--flash-attn on \
--batch-size 2048 \
--parallel 1 \
--no-mmap \
--mlock \
--ubatch-size 512 \
--threads 6 \
--cont-batching \
--timeout 300 \
--temp 0.2 \
--top-p 0.95 \
--min-p 0.05 \
--top-k 20 \
--metrics \
--chat-template-kwargs '{"preserve_thinking": true}'

Чтобы повысить скорость до ~51 ток/с, отрегулируйте три флага: --ctx-size 192640, --n-gpu-layers 430, --n-cpu-moe 35 (корректируйте в зависимости от стабильности/памяти).

Ad

Ограничения

  • Квантование Q4 заметно хуже для длинных контекстов по сравнению с Q5.
  • --no-mmap + --mlock уменьшает заикания и замедления.
  • TurboQuant KV cache критически важен при больших размерах контекста.
  • Высокая пропускная способность RAM (DDR5) важна для таких скоростей.
  • Linux значительно превосходит Windows для этой задачи.

Для кого это

Разработчики, запускающие локальные LLM с очень длинными контекстами (170k+ токенов) на потребительском оборудовании, особенно с 8-12 ГБ VRAM и быстрой системной RAM.

📖 Источник: r/LocalLLaMA

Ad

👀 Смотрите также

Руководство по настройке Claude Code LSP: Понимание структуры кода
Гайды

Руководство по настройке Claude Code LSP: Понимание структуры кода

В посте на Reddit рассказывается, как настроить Claude Code для использования Language Server Protocol для структурного понимания кода вместо текстового сопоставления, что сокращает время запросов с 30-60 секунд до ~50 мс с такими функциями, как переход к определению, поиск ссылок и иерархия вызовов.

OpenClawRadar
Запуск OmniCoder-9B локально с деталями конфигурации llama.cpp
Гайды

Запуск OmniCoder-9B локально с деталями конфигурации llama.cpp

Разработчик достиг среднего результата 96,7% на HumanEval с моделью OmniCoder-9B на среднем по мощности оборудовании, используя специфичные флаги llama.cpp, включая --reasoning-budget 0 для отключения цепочек рассуждений. Настройка использовала квантованную модель Q6_K, работающую на RTX 3080 с 10 ГБ видеопамяти.

OpenClawRadar
Оптимизация затрат OpenClaw: пять настроек для непрерывного использования агента
Гайды

Оптимизация затрат OpenClaw: пять настроек для непрерывного использования агента

Разработчик, запустивший OpenClaw на Raspberry Pi в непрерывном режиме, определил пять настроек конфигурации, которые значительно снизили затраты на агента за счет оптимизации на стоимость, а не на стандартные возможности.

OpenClawRadar
Клод против GPT для академического письма PhD: Сохранение технического смысла в разделах методов
Гайды

Клод против GPT для академического письма PhD: Сохранение технического смысла в разделах методов

Докторант сравнивает Claude и GPT при доработке статей по компьютерному зрению/совместному проектированию аппаратного обеспечения, обнаружив, что Claude более надежно сохраняет технический смысл и структуру аргументов, тогда как GPT иногда чрезмерно упрощает утверждения.

OpenClawRadar