Qwen 3.6 27B a 52.8 tps TG en AMD MI50s: Precisión completa, sin MTP, sin cuantización

Un usuario de Reddit ha publicado resultados de evaluación para ejecutar Qwen3.6-27B (precisión completa, sin cuantización) en ocho AMD MI50 (GPUs de 2018) usando un fork personalizado de vllm. El sistema logra 52.8 tokens por segundo (tps) para generación de texto y 1569 tps para procesamiento de prompts con TP8, sin MTP y sin optimizaciones de flash attention que puedan ralentizar prompts grandes.
Detalles Clave
- Hardware: 8x AMD MI50, PCIe (sin switch PCIe utilizado aún)
- Motor: vllm fork v0.20.1 con ROCm 7.2.1 – github.com/ai-infos/vllm-gfx906-mobydick
- Modelo:
Qwen/Qwen3.6-27B(HuggingFace precisión completa FP16) - Cuantización: Ninguna – precisión FP16 completa
- MTP: Deshabilitado (más lento para prompts grandes)
- Flash attention: No utilizado (el flash attention AMD basado en triton también es más lento para prompts grandes)
- Prompt: Inferencia única con prompts de 1K y 15K tokens (evaluación utilizó 10K entrada, 1K salida)
Resultados de la Evaluación
Solicitudes exitosas: 4 Total tokens de entrada: 40000 Total tokens generados: 4000 Rendimiento de tokens de salida (tok/s): 32.91 Rendimiento máximo de tokens de salida (tok/s): 56.00 Rendimiento total de tokens (tok/s): 362.03 TTFT media (ms): 32874.56 TPOT media (ms): 88.66 ITL media (ms): 88.66
Nota: El usuario reporta 52.8 tps TG para inferencia única con prompt de 15K; la evaluación muestra resultados agregados sobre 4 solicitudes con 10K entrada cada una. Con TP2, el modelo también cabe y funciona a ~34 tps TG.
Comandos de Configuración (Docker + vllm serve)
docker run -it --name vllm-gfx906-mobydick \
-v /llm:/llm --network host \
--device=/dev/kfd --device=/dev/dri \
--group-add video --group-add $(getent group render | cut -d: -f3) \
--ipc=host \
aiinfos/vllm-gfx906-mobydick:v0.20.1rc0.x-rocm7.2.1-pytorch2.11.0 \
FLASH_ATTENTION_TRITON_AMD_ENABLE="TRUE" VLLM_LOGGING_LEVEL=DEBUG vllm serve \
/llm/models/Qwen3.6-27B \
--served-model-name Qwen3.6-27B \
--dtype float16 \
--max-model-len auto \
--max-num-batched-tokens 8192 \
--block-size 64 \
--gpu-memory-utilization 0.98 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--mm-processor-cache-gb 1 \
--limit-mm-per-prompt.image 1 --limit-mm-per-prompt.video 1 \
--skip-mm-profiling \
--default-chat-template-kwargs '{"min_p": 0.0, "presence_penalty": 0.0, "repetition_penalty": 1.0}' \
--tensor-parallel-size 8 \
--host 0.0.0.0 --port 8000 2>&1 | tee log.txt
Para Quién es
Desarrolladores que ejecutan herramientas de codificación agente (ej., Claude Code, Hermes) en hardware AMD, especialmente con prompts grandes y requisitos de precisión completa.
El usuario señala que son posibles mejoras adicionales con switches PCIe (menor latencia), flash attention/MTP más optimizados para ROCm/gfx906 y stacks de software actualizados.
📖 Lea la fuente completa: r/LocalLLaMA
👀 Ver también

Puertas de Atención: El Desafío del Olvido Selectivo en los Sistemas de Memoria de IA
Un desarrollador que construye un sistema de memoria de cinco capas para un bot OpenClaw identifica una limitación clave: los enfoques actuales se centran en la recuperación, pero carecen de mecanismos para suprimir información irrelevante durante tareas enfocadas, similar al filtro atencional humano.

GLM-5.1 Lanzado con Rendimiento de Codificación Igualando a Claude Opus 4.5
El modelo GLM-5.1 de Zhipu AI ya está disponible para todos los usuarios del Plan de Codificación, logrando 77.8 puntos en SWE-bench-Verified y 56.2 puntos en Terminal Bench 2.0. El modelo cuenta con una ventana de contexto de 200K, una salida máxima de 128K y 744B parámetros con 40B activados.

Alto funcionario gubernamental de IA desconoce los LLM locales: relato de un desarrollador
Un desarrollador de LLM local informa que un alto líder gubernamental de IA no sabía por qué las empresas elegirían LLM locales sobre APIs en la nube, a pesar de comprender los conceptos técnicos básicos.

Las startups informan gastar más en computación de IA que en salarios humanos.
Startups de IA como Swan AI reportan facturas mensuales de computación de IA que superan los $113k, con CEOs que describen esto como 'tokenmaxxing', donde el gasto en IA reemplaza los presupuestos tradicionales de personal.