Qwen3.6 27B和35B在vLLM上的调优结果:单块Radeon R9700的性能测试

✍️ OpenClawRadar📅 Опубликовано: 9 августа 2026 г.🔗 Source
Ad

В посте на r/LocalLLaMA рассказывается, как запустить Qwen3.6 27B (плотную) и 35B (MoE) на одной видеокарте Radeon AI Pro R9700 с помощью vLLM Radiance через Podman. Автор делится своей точной конфигурацией и результатами бенчмарков, которые особенно полезны для пользователей GPU от AMD.

Настройка и ключевые отличия

Они используют контейнер stilldeadcode/vllm-radiance:0.5.8, который поставляется с эталонной конфигурацией, оптимизированной для весов FP8 на двух R9700 с тензорным параллелизмом (TP=2). Для одной карты с весами INT4 требуются следующие изменения:

  • --tensor-parallel-size 1 (нет второй карты)
  • --gpu-memory-utilization 0.98 (в эталоне было 0.90–0.97)
  • num_speculative_tokens=4 на 27B — проверено 2/3/4/8, 4 выигрывает на 17–48% по сравнению с 8 на всех глубинах

Веса — это Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). 35B в FP8 просто не помещается на 32 ГБ карте при полезной длине контекста.

Критическое исправление: tokenizer.json

В репозитории Avesed INT4 поставляется tokenizer.json с truncation.max_length равным 512 и padding как Fixed(512) — вероятно, из калибровки. Это ломает работу с изображениями выше ~672px. Исправление: установите оба значения в null.

Ad

Результаты бенчмарков

35B-A3B MoE (пул KV токенов = 440,241)

ГлубинаПрефилл, ток/сДекодирование, ток/с
4k~7,80061.4
16k~7,70060.1
50k~6,04057.0
78k~5,12054.7
100k~4,58052.9
150k~3,69049.5

27B dense, MTP spec=4 (пул KV токенов = 212,147)

ГлубинаПрефилл, ток/сДекодирование, ток/сСредняя принятая длина
4k~1,28859.64.4
16k~1,34562.34.6
50k~1,20759.64.5
100k~1,02753.74.5

Примечательно: 35B MoE достигает гораздо большей пропускной способности префилла (до 7.8 тыс. ток/с против 1.3 тыс.), но скорость декодирования примерно одинакова. Спекулятивное декодирование MTP на 27B дает среднюю принятую длину около 4.5 токенов.

Это практичная конфигурация для пользователей AMD, у которых нет двух GPU и которые хотят запускать эти модели локально. Автор готов предоставить стартовые скрипты по запросу.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Новичковая сборка для живого режима: ваш первый агент OpenClaw
Инструменты

Новичковая сборка для живого режима: ваш первый агент OpenClaw

Ведущие The Clawcast проводят прямую трансляцию для новичков 8 июля, показывая, как настроить агента OpenClaw без навыков программирования. Присоединяйтесь в Discord или смотрите запись на OpenClawYT.

OpenClawRadar
dead-letter: Локальный конвертер .eml в .md с CLI, веб-интерфейсом и MCP-сервером
Инструменты

dead-letter: Локальный конвертер .eml в .md с CLI, веб-интерфейсом и MCP-сервером

dead-letter нормализует экспорт электронной почты в Markdown с YAML front matter, настраиваемый. Он предлагает четыре режима доступа: CLI, библиотека Python, веб-интерфейс и сервер MCP для прямой интеграции с Claude Desktop, Claude Code и Codex.

OpenClawRadar
Локальный инструмент визуализирует данные сессии кода Claude
Инструменты

Локальный инструмент визуализирует данные сессии кода Claude

Скрипт на Python считывает данные сессий Claude Code, хранящиеся локально в ~/.claude/, и создаёт визуализацию с прокруткой с помощью диаграмм D3.js, показывающую ежедневную активность, распределение по проектам, использование инструментов и тепловые карты ритма программирования.

OpenClawRadar
Совместим ли я с OpenAI: Инструмент и документация для единых API-сигнатур
Инструменты

Совместим ли я с OpenAI: Инструмент и документация для единых API-сигнатур

Новый инструмент и страница документации документируют совместимость с OpenAI среди открытых AI-движков, таких как vLLM и llama.cpp, включая официальные и неофициальные сигнатуры.

OpenClawRadar