Запуск Qwen3.6-35B-A3B с ~190k контекстом на 8 ГБ VRAM + 32 ГБ ОЗУ – Настройка и бенчмарки

Пользователь Reddit опубликовал подробную настройку для запуска моделей Qwen3.6-35B-A3B GGUF с контекстом ~190k на ноутбуке с 8 ГБ VRAM (RTX 4060) и 32 ГБ DDR5 RAM. Он сообщает о 37-43 ток/с сразу после установки, а с доработками — до ~51 ток/с.
Оборудование и модели
- GPU: RTX 4060 8 ГБ VRAM
- RAM: 32 ГБ DDR5 5600 МГц
- ОС: Linux (производительность лучше, чем на Windows)
- Протестированные модели (Q5 квант):
mudler/Qwen3.6-35B-A3B-APEX-GGUF— от ~40 ток/с до 37 ток/сhesamation/Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF— от ~43 ток/с до 37 ток/с
Ключевая конфигурация
Используя форк llama.cpp с поддержкой TurboQuant (turboquant_plus), пользователь запускает llama-server со следующими флагами:
--model "<путь>" \
--host 0.0.0.0 \
--port 8085 \
--ctx-size 192640 \
--n-gpu-layers 430 \
--n-cpu-moe 35 \
--cache-type-k "turbo4" \
--cache-type-v "turbo4" \
--flash-attn on \
--batch-size 2048 \
--parallel 1 \
--no-mmap \
--mlock \
--ubatch-size 512 \
--threads 6 \
--cont-batching \
--timeout 300 \
--temp 0.2 \
--top-p 0.95 \
--min-p 0.05 \
--top-k 20 \
--metrics \
--chat-template-kwargs '{"preserve_thinking": true}'
Чтобы повысить скорость до ~51 ток/с, отрегулируйте три флага: --ctx-size 192640, --n-gpu-layers 430, --n-cpu-moe 35 (корректируйте в зависимости от стабильности/памяти).
Ограничения
- Квантование Q4 заметно хуже для длинных контекстов по сравнению с Q5.
--no-mmap+--mlockуменьшает заикания и замедления.- TurboQuant KV cache критически важен при больших размерах контекста.
- Высокая пропускная способность RAM (DDR5) важна для таких скоростей.
- Linux значительно превосходит Windows для этой задачи.
Для кого это
Разработчики, запускающие локальные LLM с очень длинными контекстами (170k+ токенов) на потребительском оборудовании, особенно с 8-12 ГБ VRAM и быстрой системной RAM.
📖 Источник: r/LocalLLaMA
👀 Смотрите также

OpenClaw 102: Обновленные рекомендации по настройке для безопасности и эффективности
Пользователь Reddit делится обновленными рекомендациями по настройке OpenClaw, включая шифрование API-ключей с помощью скриптов Windows PowerShell, защиту от инъекций промптов в AGENTS.md, использование Tailscale для удаленного доступа и правила против зацикливания для предотвращения повторяющихся сбоев.

Как безопасно запускать нативные инструменты llama.cpp (exec_shell_command) с мульти-песочницей на Linux
Практическое руководство по включению нативных инструментов llama.cpp, особенно exec_shell_command, и их запуску в нескольких песочницах (Firejail + крошечная Alpine VM) для безопасного получения веб-содержимого и выполнения команд через веб-интерфейс llama-server.

Opus 4.7 испортил 40% запросов; исправлением стало структурирование CLAUDE.md и навыков
После того как Opus 4.7 ухудшил ~40% промптов в 6 настройках, фракционный руководитель по ИИ исправил это, заменив ad-hoc промпты структурированными файлами Skill, иерархическим CLAUDE.md и отдельными файлами памяти — сократив использование токенов на 22% и количество итераций с 3–4 до 1–2.

Практический глоссарий терминов ИИ-агентов (Harness, Scaffold, Agent и т.д.)
Глоссарий из блога Hugging Face, объясняющий распространенные термины AI-агентов, такие как Harness, Scaffold и Agent, с простыми определениями и реальными примерами.