Qwen 3.6 27B a 52.8 tps TG en AMD MI50s: Precisión completa, sin MTP, sin cuantización

✍️ OpenClawRadar📅 Publicado: 14 de mayo de 2026🔗 Source
Qwen 3.6 27B a 52.8 tps TG en AMD MI50s: Precisión completa, sin MTP, sin cuantización
Ad

Un usuario de Reddit ha publicado resultados de evaluación para ejecutar Qwen3.6-27B (precisión completa, sin cuantización) en ocho AMD MI50 (GPUs de 2018) usando un fork personalizado de vllm. El sistema logra 52.8 tokens por segundo (tps) para generación de texto y 1569 tps para procesamiento de prompts con TP8, sin MTP y sin optimizaciones de flash attention que puedan ralentizar prompts grandes.

Detalles Clave

  • Hardware: 8x AMD MI50, PCIe (sin switch PCIe utilizado aún)
  • Motor: vllm fork v0.20.1 con ROCm 7.2.1 – github.com/ai-infos/vllm-gfx906-mobydick
  • Modelo: Qwen/Qwen3.6-27B (HuggingFace precisión completa FP16)
  • Cuantización: Ninguna – precisión FP16 completa
  • MTP: Deshabilitado (más lento para prompts grandes)
  • Flash attention: No utilizado (el flash attention AMD basado en triton también es más lento para prompts grandes)
  • Prompt: Inferencia única con prompts de 1K y 15K tokens (evaluación utilizó 10K entrada, 1K salida)

Resultados de la Evaluación

Solicitudes exitosas: 4
Total tokens de entrada: 40000
Total tokens generados: 4000
Rendimiento de tokens de salida (tok/s): 32.91
Rendimiento máximo de tokens de salida (tok/s): 56.00
Rendimiento total de tokens (tok/s): 362.03
TTFT media (ms): 32874.56
TPOT media (ms): 88.66
ITL media (ms): 88.66

Nota: El usuario reporta 52.8 tps TG para inferencia única con prompt de 15K; la evaluación muestra resultados agregados sobre 4 solicitudes con 10K entrada cada una. Con TP2, el modelo también cabe y funciona a ~34 tps TG.

Ad

Comandos de Configuración (Docker + vllm serve)

docker run -it --name vllm-gfx906-mobydick \
  -v /llm:/llm --network host \
  --device=/dev/kfd --device=/dev/dri \
  --group-add video --group-add $(getent group render | cut -d: -f3) \
  --ipc=host \
  aiinfos/vllm-gfx906-mobydick:v0.20.1rc0.x-rocm7.2.1-pytorch2.11.0 \
  FLASH_ATTENTION_TRITON_AMD_ENABLE="TRUE" VLLM_LOGGING_LEVEL=DEBUG vllm serve \
  /llm/models/Qwen3.6-27B \
  --served-model-name Qwen3.6-27B \
  --dtype float16 \
  --max-model-len auto \
  --max-num-batched-tokens 8192 \
  --block-size 64 \
  --gpu-memory-utilization 0.98 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder \
  --reasoning-parser qwen3 \
  --mm-processor-cache-gb 1 \
  --limit-mm-per-prompt.image 1 --limit-mm-per-prompt.video 1 \
  --skip-mm-profiling \
  --default-chat-template-kwargs '{"min_p": 0.0, "presence_penalty": 0.0, "repetition_penalty": 1.0}' \
  --tensor-parallel-size 8 \
  --host 0.0.0.0 --port 8000 2>&1 | tee log.txt

Para Quién es

Desarrolladores que ejecutan herramientas de codificación agente (ej., Claude Code, Hermes) en hardware AMD, especialmente con prompts grandes y requisitos de precisión completa.

El usuario señala que son posibles mejoras adicionales con switches PCIe (menor latencia), flash attention/MTP más optimizados para ROCm/gfx906 y stacks de software actualizados.

📖 Lea la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Puertas de Atención: El Desafío del Olvido Selectivo en los Sistemas de Memoria de IA
Noticias

Puertas de Atención: El Desafío del Olvido Selectivo en los Sistemas de Memoria de IA

Un desarrollador que construye un sistema de memoria de cinco capas para un bot OpenClaw identifica una limitación clave: los enfoques actuales se centran en la recuperación, pero carecen de mecanismos para suprimir información irrelevante durante tareas enfocadas, similar al filtro atencional humano.

OpenClawRadar
GLM-5.1 Lanzado con Rendimiento de Codificación Igualando a Claude Opus 4.5
Noticias

GLM-5.1 Lanzado con Rendimiento de Codificación Igualando a Claude Opus 4.5

El modelo GLM-5.1 de Zhipu AI ya está disponible para todos los usuarios del Plan de Codificación, logrando 77.8 puntos en SWE-bench-Verified y 56.2 puntos en Terminal Bench 2.0. El modelo cuenta con una ventana de contexto de 200K, una salida máxima de 128K y 744B parámetros con 40B activados.

OpenClawRadar
Alto funcionario gubernamental de IA desconoce los LLM locales: relato de un desarrollador
Noticias

Alto funcionario gubernamental de IA desconoce los LLM locales: relato de un desarrollador

Un desarrollador de LLM local informa que un alto líder gubernamental de IA no sabía por qué las empresas elegirían LLM locales sobre APIs en la nube, a pesar de comprender los conceptos técnicos básicos.

OpenClawRadar
Las startups informan gastar más en computación de IA que en salarios humanos.
Noticias

Las startups informan gastar más en computación de IA que en salarios humanos.

Startups de IA como Swan AI reportan facturas mensuales de computación de IA que superan los $113k, con CEOs que describen esto como 'tokenmaxxing', donde el gasto en IA reemplaza los presupuestos tradicionales de personal.

OpenClawRadar