Qwen3.6 27B和35B在vLLM上的调优结果:单块Radeon R9700的性能测试
В посте на r/LocalLLaMA рассказывается, как запустить Qwen3.6 27B (плотную) и 35B (MoE) на одной видеокарте Radeon AI Pro R9700 с помощью vLLM Radiance через Podman. Автор делится своей точной конфигурацией и результатами бенчмарков, которые особенно полезны для пользователей GPU от AMD.
Настройка и ключевые отличия
Они используют контейнер stilldeadcode/vllm-radiance:0.5.8, который поставляется с эталонной конфигурацией, оптимизированной для весов FP8 на двух R9700 с тензорным параллелизмом (TP=2). Для одной карты с весами INT4 требуются следующие изменения:
--tensor-parallel-size 1(нет второй карты)--gpu-memory-utilization 0.98(в эталоне было 0.90–0.97)num_speculative_tokens=4на 27B — проверено 2/3/4/8, 4 выигрывает на 17–48% по сравнению с 8 на всех глубинах
Веса — это Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). 35B в FP8 просто не помещается на 32 ГБ карте при полезной длине контекста.
Критическое исправление: tokenizer.json
В репозитории Avesed INT4 поставляется tokenizer.json с truncation.max_length равным 512 и padding как Fixed(512) — вероятно, из калибровки. Это ломает работу с изображениями выше ~672px. Исправление: установите оба значения в null.
Результаты бенчмарков
35B-A3B MoE (пул KV токенов = 440,241)
| Глубина | Префилл, ток/с | Декодирование, ток/с |
|---|---|---|
| 4k | ~7,800 | 61.4 |
| 16k | ~7,700 | 60.1 |
| 50k | ~6,040 | 57.0 |
| 78k | ~5,120 | 54.7 |
| 100k | ~4,580 | 52.9 |
| 150k | ~3,690 | 49.5 |
27B dense, MTP spec=4 (пул KV токенов = 212,147)
| Глубина | Префилл, ток/с | Декодирование, ток/с | Средняя принятая длина |
|---|---|---|---|
| 4k | ~1,288 | 59.6 | 4.4 |
| 16k | ~1,345 | 62.3 | 4.6 |
| 50k | ~1,207 | 59.6 | 4.5 |
| 100k | ~1,027 | 53.7 | 4.5 |
Примечательно: 35B MoE достигает гораздо большей пропускной способности префилла (до 7.8 тыс. ток/с против 1.3 тыс.), но скорость декодирования примерно одинакова. Спекулятивное декодирование MTP на 27B дает среднюю принятую длину около 4.5 токенов.
Это практичная конфигурация для пользователей AMD, у которых нет двух GPU и которые хотят запускать эти модели локально. Автор готов предоставить стартовые скрипты по запросу.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Baton: Десктопное приложение для управления несколькими ИИ-агентами программирования
Baton — это настольное приложение, которое помогает разработчикам управлять несколькими ИИ-агентами для программирования в изолированных рабочих пространствах. Оно предоставляет реальные терминальные сессии, изоляцию git worktree и мониторинг состояния для агентов, таких как Claude Code, Codex CLI, OpenCode и Gemini CLI.

Сервер базы знаний с открытым исходным кодом и координатор мультиагентных систем для постоянной памяти искусственного интеллекта
Разработчик создал пользовательский MCP-сервер на частном VPS, чтобы обеспечить Claude, Codex и Gemini постоянной памятью между сессиями, с сервером базы знаний, который загружает хранилища Obsidian, и мультиагентным оркестратором Daniel для отказоустойчивости.

Models.dev: Открытая база данных спецификаций, цен и возможностей AI-моделей
Models.dev — это открытая база данных спецификаций, цен и возможностей моделей ИИ, поддерживаемая сообществом. Она предоставляет API и определения на основе TOML для провайдеров и моделей.

Трепан: Локальный аудитор безопасности VS Code для кода, созданного ИИ
Trepan — это расширение с открытым исходным кодом для VS Code, которое выступает в роли защитника безопасности для предложений кода, сгенерированных ИИ. Оно использует Ollama для проведения локальных проверок безопасности на соответствие правилам конкретного проекта в файле .trepan/system_rules.md.