Qwen 3.6 27B при 52.8 tps TG на AMD MI50s: полная точность, без MTP, без квантизации

Пользователь Reddit опубликовал результаты бенчмарка для запуска Qwen3.6-27B (полная точность, без квантизации) на восьми AMD MI50 (GPU 2018 года) с использованием кастомного форка vllm. Система достигает 52.8 токенов в секунду (tps) для генерации текста и 1569 tps для обработки промптов при TP8, без MTP и без оптимизаций flash attention, которые могут замедлять большие промпты.
Ключевые детали
- Оборудование: 8x AMD MI50, PCIe (свитч PCIe пока не используется)
- Движок: vllm fork v0.20.1 с ROCm 7.2.1 – github.com/ai-infos/vllm-gfx906-mobydick
- Модель:
Qwen/Qwen3.6-27B(HuggingFace полная точность FP16) - Квантизация: Нет – полная точность FP16
- MTP: Отключён (медленнее для больших промптов)
- Flash attention: Не используется (triton-based AMD flash attention также медленнее для больших промптов)
- Промпт: Одиночный инференс с промптами на 1К и 15К токенов (в бенчмарке использовалось 10К входных, 1К выходных токенов)
Результаты бенчмарка
Успешные запросы: 4 Всего входных токенов: 40000 Всего сгенерированных токенов: 4000 Пропускная способность выходных токенов (tok/s): 32.91 Пиковая пропускная способность выходных токенов (tok/s): 56.00 Общая пропускная способность токенов (tok/s): 362.03 Среднее время TTFT (мс): 32874.56 Среднее время TPOT (мс): 88.66 Среднее время ITL (мс): 88.66
Примечание: Пользователь сообщает о 52.8 tps TG для одиночного инференса с промптом на 15К; бенчмарк показывает совокупные результаты по 4 запросам с 10К входных токенов каждый. С TP2 модель также помещается и работает со скоростью около 34 tps TG.
Команды настройки (Docker + vllm serve)
docker run -it --name vllm-gfx906-mobydick \
-v /llm:/llm --network host \
--device=/dev/kfd --device=/dev/dri \
--group-add video --group-add $(getent group render | cut -d: -f3) \
--ipc=host \
aiinfos/vllm-gfx906-mobydick:v0.20.1rc0.x-rocm7.2.1-pytorch2.11.0 \
FLASH_ATTENTION_TRITON_AMD_ENABLE="TRUE" VLLM_LOGGING_LEVEL=DEBUG vllm serve \
/llm/models/Qwen3.6-27B \
--served-model-name Qwen3.6-27B \
--dtype float16 \
--max-model-len auto \
--max-num-batched-tokens 8192 \
--block-size 64 \
--gpu-memory-utilization 0.98 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--mm-processor-cache-gb 1 \
--limit-mm-per-prompt.image 1 --limit-mm-per-prompt.video 1 \
--skip-mm-profiling \
--default-chat-template-kwargs '{"min_p": 0.0, "presence_penalty": 0.0, "repetition_penalty": 1.0}' \
--tensor-parallel-size 8 \
--host 0.0.0.0 --port 8000 2>&1 | tee log.txt
Для кого это
Разработчикам, использующим агентные инструменты для кодирования (например, Claude Code, Hermes) на оборудовании AMD, особенно с большими промптами и требованиями к полной точности.
Пользователь отмечает, что возможны дальнейшие улучшения с использованием PCIe свитчей (меньшая задержка), более оптимизированных flash attention/MTP для ROCm/gfx906 и обновлённых стеков ПО.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

CEO, которые считают, что ИИ заменит их сотрудников, просто плохие руководители
Генеральный директор Box Аарон Леви объясняет «ИИ-психоз» — когда руководители, оторванные от реальной работы, видят демонстрации успешных сценариев и переоценивают агентные инструменты вроде Claude Code, игнорируя последний этап внедрения в производство.

Бенчмарк Claude Code выявил слепое пятно у ИИ-судей: ошибки в пайплайне ошибочно приписываются возможностям модели.
Автономный бенчмарк, запущенный Claude Code (Opus 4.6), изначально объявил, что MiniMax 'не может выполнить задачу' из-за ошибки конфигурации песочницы, а затем исправил вердикт после изучения логов демона. Этот инцидент показывает, как ИИ-судьи могут с уверенностью приписывать проблемы инфраструктуры слабостям модели.

错误:Claude Code Telegram插件中MCP通知静默丢失——通过文件轮询和tmux注入的解决方案
Плагин Telegram для Claude Code работает корректно, но входящие сообщения молча теряются, поскольку Claude Code игнорирует MCP-уведомления на stdio-транспорте. В качестве обходного решения используется опрос файлов и tmux send-keys с задержкой 5–9 с.

Databricks сокращает затраты на ИИ-кодирование на 70%: гибкость моделей, открытый исходный код и граница эффективности
Databricks сократила расходы на ИИ-кодинг на 70%, быстро внедрив эффективные open-source модели, создав внутренние бенчмарки и обеспечив гибкость моделей. Ключевые рычаги: запуск GLM и отказ от Opus 5.0 из-за регресса затрат.