Qwen3.6 27B和35B在vLLM上的调优结果:单块Radeon R9700的性能测试
В посте на r/LocalLLaMA рассказывается, как запустить Qwen3.6 27B (плотную) и 35B (MoE) на одной видеокарте Radeon AI Pro R9700 с помощью vLLM Radiance через Podman. Автор делится своей точной конфигурацией и результатами бенчмарков, которые особенно полезны для пользователей GPU от AMD.
Настройка и ключевые отличия
Они используют контейнер stilldeadcode/vllm-radiance:0.5.8, который поставляется с эталонной конфигурацией, оптимизированной для весов FP8 на двух R9700 с тензорным параллелизмом (TP=2). Для одной карты с весами INT4 требуются следующие изменения:
--tensor-parallel-size 1(нет второй карты)--gpu-memory-utilization 0.98(в эталоне было 0.90–0.97)num_speculative_tokens=4на 27B — проверено 2/3/4/8, 4 выигрывает на 17–48% по сравнению с 8 на всех глубинах
Веса — это Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). 35B в FP8 просто не помещается на 32 ГБ карте при полезной длине контекста.
Критическое исправление: tokenizer.json
В репозитории Avesed INT4 поставляется tokenizer.json с truncation.max_length равным 512 и padding как Fixed(512) — вероятно, из калибровки. Это ломает работу с изображениями выше ~672px. Исправление: установите оба значения в null.
Результаты бенчмарков
35B-A3B MoE (пул KV токенов = 440,241)
| Глубина | Префилл, ток/с | Декодирование, ток/с |
|---|---|---|
| 4k | ~7,800 | 61.4 |
| 16k | ~7,700 | 60.1 |
| 50k | ~6,040 | 57.0 |
| 78k | ~5,120 | 54.7 |
| 100k | ~4,580 | 52.9 |
| 150k | ~3,690 | 49.5 |
27B dense, MTP spec=4 (пул KV токенов = 212,147)
| Глубина | Префилл, ток/с | Декодирование, ток/с | Средняя принятая длина |
|---|---|---|---|
| 4k | ~1,288 | 59.6 | 4.4 |
| 16k | ~1,345 | 62.3 | 4.6 |
| 50k | ~1,207 | 59.6 | 4.5 |
| 100k | ~1,027 | 53.7 | 4.5 |
Примечательно: 35B MoE достигает гораздо большей пропускной способности префилла (до 7.8 тыс. ток/с против 1.3 тыс.), но скорость декодирования примерно одинакова. Спекулятивное декодирование MTP на 27B дает среднюю принятую длину около 4.5 токенов.
Это практичная конфигурация для пользователей AMD, у которых нет двух GPU и которые хотят запускать эти модели локально. Автор готов предоставить стартовые скрипты по запросу.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Новичковая сборка для живого режима: ваш первый агент OpenClaw
Ведущие The Clawcast проводят прямую трансляцию для новичков 8 июля, показывая, как настроить агента OpenClaw без навыков программирования. Присоединяйтесь в Discord или смотрите запись на OpenClawYT.

dead-letter: Локальный конвертер .eml в .md с CLI, веб-интерфейсом и MCP-сервером
dead-letter нормализует экспорт электронной почты в Markdown с YAML front matter, настраиваемый. Он предлагает четыре режима доступа: CLI, библиотека Python, веб-интерфейс и сервер MCP для прямой интеграции с Claude Desktop, Claude Code и Codex.

Локальный инструмент визуализирует данные сессии кода Claude
Скрипт на Python считывает данные сессий Claude Code, хранящиеся локально в ~/.claude/, и создаёт визуализацию с прокруткой с помощью диаграмм D3.js, показывающую ежедневную активность, распределение по проектам, использование инструментов и тепловые карты ритма программирования.

Совместим ли я с OpenAI: Инструмент и документация для единых API-сигнатур
Новый инструмент и страница документации документируют совместимость с OpenAI среди открытых AI-движков, таких как vLLM и llama.cpp, включая официальные и неофициальные сигнатуры.