Оптимизация Qwen 3.6 27B/35B на RTX 3090: флаги, квантование и автоматическая маршрутизация

✍️ OpenClawRadar📅 Опубликовано: 5 мая 2026 г.🔗 Source
Оптимизация Qwen 3.6 27B/35B на RTX 3090: флаги, квантование и автоматическая маршрутизация
Ad

Разработчик, запускающий модели Qwen 3.6 локально на RTX 3090 (24 ГБ VRAM), Ryzen 5700X, 64 ГБ RAM, Windows 11, сталкивается с проблемами производительности и надежности. Он использует llama-server с пользовательскими флагами и ищет советы по выбору кванта, пропускной способности и автоматической маршрутизации моделей.

Команды и квантизации

35B (UD Q4_K_M):

llama-server.exe -m "path\Qwen3.6-35B-A3B-UD-Q4_K_M.gguf" -ngl 99 -c 131072 -np 2 -fa on -ctk f16 -ctv f16 -b 2048 -ub 512 -t 8 --mlock -rea on --reasoning-budget 2048 --reasoning-format deepseek --jinja --metrics --slots --port 8081 --host 0.0.0.0

27B (UD Q4_K_XL):

llama-server.exe -m "path\Qwen3.6-27B-UD-Q4_K_XL.gguf" -ngl 99 -c 196608 -np 1 -fa on -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 -t 8 --no-mmap -rea on --reasoning-budget -1 --reasoning-format deepseek --jinja --metrics --slots --port 8081 --host 0.0.0.0
Ad

Сообщаемые проблемы

  • 35B слишком медленная – даже простые итеративные задачи кажутся непригодными для использования.
  • 27B быстрее, но ненадежна – вывод кода ломается; простые задачи могут занимать 20–30 минут.
  • Ручное переключение моделей – нужно убить сервер, вставить новую команду, перезагрузить модель.

Конкретные вопросы

  • Оптимальны ли флаги? (например, размер контекста, размер пакета, тип кэша)
  • Какой квант/модель дает лучший баланс скорости и точности кодирования на 24 ГБ VRAM?
  • Как автоматически переключать модели по запросу или держать несколько моделей в памяти и маршрутизировать?

Контекст

Пользователь запускает Hermes agent на Raspberry Pi 5 для сбора данных и автоматизации, а локальное кодирование — через OpenCode/QwenCode. Он хочет настройку, не требующую ручных перезапусков сервера.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Доступ к USB-веб-камерам в WSL2 для локального обнаружения движения
Гайды

Доступ к USB-веб-камерам в WSL2 для локального обнаружения движения

Разработчик делится опытом использования usbipd-win для передачи USB-вебкамер из Windows в WSL2, что позволяет реализовать локальное обнаружение движения с помощью OpenCV без зависимости от облачных сервисов.

OpenClawRadar
Создание пользовательской системы глоссария хинди с помощью Claude: от 76% до 92% точности за 10 месяцев
Гайды

Создание пользовательской системы глоссария хинди с помощью Claude: от 76% до 92% точности за 10 месяцев

Инженер из Бангалора создал собственную систему глоссариев для Claude, повысив точность хинди-лексики с 76% до 92%. Наиболее эффективными оказались термины с примерами в контексте.

OpenClawRadar
Экспорт истории ChatGPT в систему памяти OpenClaw
Гайды

Экспорт истории ChatGPT в систему памяти OpenClaw

Пользователь Reddit делится процессом экспорта многолетней истории разговоров ChatGPT и импорта её в систему памяти OpenClaw с помощью инструмента ai-chat-md-export, что позволяет локальным ИИ-агентам получать доступ к историческому контексту.

OpenClawRadar
Системная архитектура для Vibe Coders: руководство старшего инженера
Гайды

Системная архитектура для Vibe Coders: руководство старшего инженера

Инженер с 10-летним стажем делится подходом к созданию приложений с Claude Code: начинайте с системного уровня, а не с кода. Рассматриваются четыре компонента — фронтенд, бэкенд, база данных и связующая инфраструктура — с углубленным разбором последней: API, хостинг, деплой, секреты и безопасность.

OpenClawRadar