Запуск Qwen3.6 27B и 35B на 6 ГБ VRAM с ik_llama: практические конфигурации и бенчмарки

✍️ OpenClawRadar📅 Опубликовано: 17 мая 2026 г.🔗 Source
Запуск Qwen3.6 27B и 35B на 6 ГБ VRAM с ik_llama: практические конфигурации и бенчмарки
Ad

Пользователь Reddit сообщает об успешном запуске моделей Qwen3.6 27B и 35B A3B на старом игровом ноутбуке с RTX 2060 Mobile (6 ГБ VRAM) и 32 ГБ ОЗУ с использованием ik_llama и llama.cpp. Ключевые оптимизации включают двойное спекулятивное декодирование с MTP и ngram, --fit и --mtp-requantize-output-tensor, а также переупаковку выходного тензора. Ниже приведены точные конфиги и наблюдаемые скорости.

Конфиг для Qwen3.6 27B (Q3_K_XL)

export GGML_CUDA_GRAPHS=1
./llama-server \
  -m /mnt/second-ssd/lib/llama.cpp/models/Qwen3.6-27B-MTP-UD-Q3_K_XL.gguf \
  -c 16000 \
  -b 512 -ub 512 \
  --fit --fit-margin 3076 \
  -fa on \
  -np 1 \
  -ctk q4_0 -ctv q4_0 \
  --mtp-requantize-output-tensor q4_0 \
  -khad -vhad -rtr \
  --threads 6 --threads-batch 8 \
  --slot-save-path ./slots \
  --prompt-cache "prompt.cache" \
  --port 8888 --host 0.0.0.0 \
  --spec-stage ngram-mod:n_max=64,n_min=2,spec-ngram-size-n=16 \
  --spec-stage mtp:n_max=1,draft-p-min=0.0 \
  --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
  --jinja \
  --chat-template-kwargs '{"preserve_thinking": true}' \
  --reasoning on
Ad

Конфиг для Qwen3.6 35B A3B (IQ4_XS, дистиллят Claude Opus)

export GGML_CUDA_GRAPHS=1
./llama-server \
  -m /mnt/second-ssd/lib/llama.cpp/models/lordx64-Claude-4.7-Opus-Reasoning-Distilled-Qwen3.6-35B-A3B-MTP-IQ4_XS.gguf \
  -c 80000 \
  -b 1024 -ub 1024 \
  --fit --fit-margin 2048 \
  -fa on \
  -np 1 \
  -ctk q8_0 -ctv q4_0 \
  --mtp-requantize-output-tensor q4_0 \
  -khad -vhad -rtr \
  --threads 6 --threads-batch 8 \
  --slot-save-path ./slots \
  --prompt-cache "prompt.cache" \
  --mlock --no-mmap \
  --port 8888 --host 0.0.0.0 \
  --spec-stage ngram-mod:n_max=64,n_min=2,spec-ngram-size-n=16 \
  --spec-stage mtp:n_max=3,draft-p-min=0.0 \
  --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
  --jinja \
  --chat-template-kwargs '{"preserve_thinking": true}' \
  --reasoning on

Показатели производительности

  • 27B: префилл ~100 т/с, первый токен до 4 т/с, ~1 т/с при контексте 10k
  • 35B A3B: префилл ~40 т/с, первый токен до 15 т/с, стабильные ~11 т/с при контексте 10k

Пользователь отмечает, что 27B стал пригоден для рассуждений о файлах до 1000 строк (занимает минуты, но полезно), а дистиллят 35B Opus выдаёт стабильные 11 т/с. Он использует их для генерации mermaid-диаграмм, изображений, markdown и PDF в рабочих процессах little-coder или агентного кодинга.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Чек-лист настройки OpenClaw: шесть важных шагов для новых пользователей
Гайды

Чек-лист настройки OpenClaw: шесть важных шагов для новых пользователей

В посте на Reddit описаны шесть важных шагов настройки для пользователей OpenClaw: сменить модель по умолчанию с Opus на Sonnet для снижения затрат, заблокировать хост шлюза на 127.0.0.1 для безопасности, создать SOUL.md для личности агента, избегать установки навыков вначале, не создавать несколько агентов и использовать команду /new для управления контекстом беседы.

OpenClawRadar
Qwen3.5-397B MoE работает на 14 ГБ ОЗУ с помощью постраничной загрузки экспертов на M1 Ultra
Гайды

Qwen3.5-397B MoE работает на 14 ГБ ОЗУ с помощью постраничной загрузки экспертов на M1 Ultra

Движок Paged MoE держит в памяти только 20 экспертов, а остальные подгружает с SSD, запуская модель 397B размером 209GB на Mac Studio с 64GB памяти, достигая 1,59 ток/с и пикового использования RAM 14GB. Включает бенчмарки меньших моделей.

OpenClawRadar
Соединитель Todoist удален из Claude, требуется настройка вручную.
Гайды

Соединитель Todoist удален из Claude, требуется настройка вручную.

Официальный коннектор Todoist больше не доступен в Claude. Пользователи могут добавить Todoist как пользовательский коннектор, используя MCP URL https://ai.todoist.net/mcp, но для этого требуется подписка Claude Pro или Max.

OpenClawRadar
Сократите затраты на токены на 95% с помощью семи техник оптимизации OpenClaw
Гайды

Сократите затраты на токены на 95% с помощью семи техник оптимизации OpenClaw

Подробное руководство, описывающее семь методов снижения потребления токенов AI-агентами на 95%+, включая древовидные загрузочные файлы, автосжатие AI, перенос задач на локальную модель и фоновые задачи CPU по расписанию.

OpenClawRadar