Запуск Qwen3.6 27B и 35B на 6 ГБ VRAM с ik_llama: практические конфигурации и бенчмарки

Пользователь Reddit сообщает об успешном запуске моделей Qwen3.6 27B и 35B A3B на старом игровом ноутбуке с RTX 2060 Mobile (6 ГБ VRAM) и 32 ГБ ОЗУ с использованием ik_llama и llama.cpp. Ключевые оптимизации включают двойное спекулятивное декодирование с MTP и ngram, --fit и --mtp-requantize-output-tensor, а также переупаковку выходного тензора. Ниже приведены точные конфиги и наблюдаемые скорости.
Конфиг для Qwen3.6 27B (Q3_K_XL)
export GGML_CUDA_GRAPHS=1
./llama-server \
-m /mnt/second-ssd/lib/llama.cpp/models/Qwen3.6-27B-MTP-UD-Q3_K_XL.gguf \
-c 16000 \
-b 512 -ub 512 \
--fit --fit-margin 3076 \
-fa on \
-np 1 \
-ctk q4_0 -ctv q4_0 \
--mtp-requantize-output-tensor q4_0 \
-khad -vhad -rtr \
--threads 6 --threads-batch 8 \
--slot-save-path ./slots \
--prompt-cache "prompt.cache" \
--port 8888 --host 0.0.0.0 \
--spec-stage ngram-mod:n_max=64,n_min=2,spec-ngram-size-n=16 \
--spec-stage mtp:n_max=1,draft-p-min=0.0 \
--temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
--jinja \
--chat-template-kwargs '{"preserve_thinking": true}' \
--reasoning on
Конфиг для Qwen3.6 35B A3B (IQ4_XS, дистиллят Claude Opus)
export GGML_CUDA_GRAPHS=1
./llama-server \
-m /mnt/second-ssd/lib/llama.cpp/models/lordx64-Claude-4.7-Opus-Reasoning-Distilled-Qwen3.6-35B-A3B-MTP-IQ4_XS.gguf \
-c 80000 \
-b 1024 -ub 1024 \
--fit --fit-margin 2048 \
-fa on \
-np 1 \
-ctk q8_0 -ctv q4_0 \
--mtp-requantize-output-tensor q4_0 \
-khad -vhad -rtr \
--threads 6 --threads-batch 8 \
--slot-save-path ./slots \
--prompt-cache "prompt.cache" \
--mlock --no-mmap \
--port 8888 --host 0.0.0.0 \
--spec-stage ngram-mod:n_max=64,n_min=2,spec-ngram-size-n=16 \
--spec-stage mtp:n_max=3,draft-p-min=0.0 \
--temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
--jinja \
--chat-template-kwargs '{"preserve_thinking": true}' \
--reasoning on
Показатели производительности
- 27B: префилл ~100 т/с, первый токен до 4 т/с, ~1 т/с при контексте 10k
- 35B A3B: префилл ~40 т/с, первый токен до 15 т/с, стабильные ~11 т/с при контексте 10k
Пользователь отмечает, что 27B стал пригоден для рассуждений о файлах до 1000 строк (занимает минуты, но полезно), а дистиллят 35B Opus выдаёт стабильные 11 т/с. Он использует их для генерации mermaid-диаграмм, изображений, markdown и PDF в рабочих процессах little-coder или агентного кодинга.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Чек-лист настройки OpenClaw: шесть важных шагов для новых пользователей
В посте на Reddit описаны шесть важных шагов настройки для пользователей OpenClaw: сменить модель по умолчанию с Opus на Sonnet для снижения затрат, заблокировать хост шлюза на 127.0.0.1 для безопасности, создать SOUL.md для личности агента, избегать установки навыков вначале, не создавать несколько агентов и использовать команду /new для управления контекстом беседы.

Qwen3.5-397B MoE работает на 14 ГБ ОЗУ с помощью постраничной загрузки экспертов на M1 Ultra
Движок Paged MoE держит в памяти только 20 экспертов, а остальные подгружает с SSD, запуская модель 397B размером 209GB на Mac Studio с 64GB памяти, достигая 1,59 ток/с и пикового использования RAM 14GB. Включает бенчмарки меньших моделей.

Соединитель Todoist удален из Claude, требуется настройка вручную.
Официальный коннектор Todoist больше не доступен в Claude. Пользователи могут добавить Todoist как пользовательский коннектор, используя MCP URL https://ai.todoist.net/mcp, но для этого требуется подписка Claude Pro или Max.

Сократите затраты на токены на 95% с помощью семи техник оптимизации OpenClaw
Подробное руководство, описывающее семь методов снижения потребления токенов AI-агентами на 95%+, включая древовидные загрузочные файлы, автосжатие AI, перенос задач на локальную модель и фоновые задачи CPU по расписанию.