Qwen3.6 27B和35B在vLLM上的调优结果:单块Radeon R9700的性能测试
В посте на r/LocalLLaMA рассказывается, как запустить Qwen3.6 27B (плотную) и 35B (MoE) на одной видеокарте Radeon AI Pro R9700 с помощью vLLM Radiance через Podman. Автор делится своей точной конфигурацией и результатами бенчмарков, которые особенно полезны для пользователей GPU от AMD.
Настройка и ключевые отличия
Они используют контейнер stilldeadcode/vllm-radiance:0.5.8, который поставляется с эталонной конфигурацией, оптимизированной для весов FP8 на двух R9700 с тензорным параллелизмом (TP=2). Для одной карты с весами INT4 требуются следующие изменения:
--tensor-parallel-size 1(нет второй карты)--gpu-memory-utilization 0.98(в эталоне было 0.90–0.97)num_speculative_tokens=4на 27B — проверено 2/3/4/8, 4 выигрывает на 17–48% по сравнению с 8 на всех глубинах
Веса — это Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). 35B в FP8 просто не помещается на 32 ГБ карте при полезной длине контекста.
Критическое исправление: tokenizer.json
В репозитории Avesed INT4 поставляется tokenizer.json с truncation.max_length равным 512 и padding как Fixed(512) — вероятно, из калибровки. Это ломает работу с изображениями выше ~672px. Исправление: установите оба значения в null.
Результаты бенчмарков
35B-A3B MoE (пул KV токенов = 440,241)
| Глубина | Префилл, ток/с | Декодирование, ток/с |
|---|---|---|
| 4k | ~7,800 | 61.4 |
| 16k | ~7,700 | 60.1 |
| 50k | ~6,040 | 57.0 |
| 78k | ~5,120 | 54.7 |
| 100k | ~4,580 | 52.9 |
| 150k | ~3,690 | 49.5 |
27B dense, MTP spec=4 (пул KV токенов = 212,147)
| Глубина | Префилл, ток/с | Декодирование, ток/с | Средняя принятая длина |
|---|---|---|---|
| 4k | ~1,288 | 59.6 | 4.4 |
| 16k | ~1,345 | 62.3 | 4.6 |
| 50k | ~1,207 | 59.6 | 4.5 |
| 100k | ~1,027 | 53.7 | 4.5 |
Примечательно: 35B MoE достигает гораздо большей пропускной способности префилла (до 7.8 тыс. ток/с против 1.3 тыс.), но скорость декодирования примерно одинакова. Спекулятивное декодирование MTP на 27B дает среднюю принятую длину около 4.5 токенов.
Это практичная конфигурация для пользователей AMD, у которых нет двух GPU и которые хотят запускать эти модели локально. Автор готов предоставить стартовые скрипты по запросу.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Claude добавляет функцию импорта памяти для миграции от других поставщиков ИИ
Claude теперь позволяет пользователям импортировать контекст и предпочтения из других AI-провайдеров через процесс копирования-вставки. Функция памяти доступна на всех платных тарифах и помогает сохранять историю диалогов при переходе между платформами.

Сообщество выпустило патч, добавляющий поддержку языков с письмом справа налево в Claude Desktop для Windows.
Разработчик создал патч, добавляющий правильную поддержку языков с письмом справа налево в Claude Desktop для Windows, исправляя некорректное отображение для иврита, арабского и других RTL-языков. Патч внедряет логику определения RTL в рендерер Electron-приложения и включает функции резервного копирования и восстановления.

Клод-Контроль: Мобильное Удаленное Управление для Сессий Клод Кода
Claude-control — это инструмент с открытым исходным кодом, который позволяет управлять сессиями Claude Code с телефона через HTTPS и WebSocket. Он запускает Claude Code в реальном PTY внутри tmux, обнаруживает запросы разрешений и отправляет push-уведомления с кнопками «Разрешить»/«Запретить».

Фазовое удержание: Система управления ИИ-агентами, вдохновлённая методами воспитания детей
Phaselock — это открытый исходный код навыка агента, который реализует четыре механизма контроля для ИИ-агентов, занимающихся программированием: явные шлюзы перед действием, немедленная обратная связь об ошибках, ограниченный выбор и механическое применение правил. Работает с Claude Code, Cursor, Windsurf и любыми инструментами, поддерживающими хуки.