Qwen3.6 27B y 35B en vLLM: Resultados de ajuste con una sola Radeon R9700

✍️ OpenClawRadar📅 Publicado: 9 de agosto de 2026🔗 Source
Ad

Una publicación en r/LocalLLaMA detalla cómo ejecutar Qwen3.6 27B (denso) y 35B (MoE) en una sola Radeon AI Pro R9700 usando vLLM Radiance mediante Podman. El autor comparte su configuración exacta y resultados de benchmark, que son particularmente útiles para usuarios de GPU AMD.

Configuración y diferencias clave

Utilizan el contenedor stilldeadcode/vllm-radiance:0.5.8, que incluye una configuración de referencia para pesos FP8 en dos R9700 con paralelismo tensorial (TP=2). Para una sola tarjeta con pesos INT4, se necesitan los siguientes cambios:

  • --tensor-parallel-size 1 (sin segunda tarjeta)
  • --gpu-memory-utilization 0.98 (la referencia era 0.90–0.97)
  • num_speculative_tokens=4 en el 27B — probado con 2/3/4/8, siendo 4 el ganador por 17–48% sobre 8 en todas las profundidades

Los pesos son Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). El 35B en FP8 simplemente no cabe en una tarjeta de 32GB a longitudes de contexto útiles.

Corrección crítica: tokenizer.json

El repositorio INT4 de Avesed incluye un tokenizer.json con truncation.max_length establecido en 512 y padding como Fixed(512) — probablemente de la calibración. Esto rompe la visión por encima de ~672px. La solución: establecer ambos a null.

Ad

Resultados de Benchmark

35B-A3B MoE (pool de tokens KV = 440,241)

ProfundidadPrefill tok/sDecode tok/s
4k~7,80061.4
16k~7,70060.1
50k~6,04057.0
78k~5,12054.7
100k~4,58052.9
150k~3,69049.5

27B denso, MTP spec=4 (pool de tokens KV = 212,147)

ProfundidadPrefill tok/sDecode tok/sLongitud media aceptada
4k~1,28859.64.4
16k~1,34562.34.6
50k~1,20759.64.5
100k~1,02753.74.5

Notable: el MoE 35B logra un rendimiento de prefill mucho mayor (hasta 7.8k tok/s vs 1.3k) pero velocidades de decode similares. La especulación MTP del 27B ofrece una longitud aceptada de ~4.5 tokens.

Esta es una configuración práctica para usuarios de AMD que no tienen doble GPU y quieren ejecutar estos modelos localmente. El autor está dispuesto a proporcionar scripts de inicio si se le solicitan.

📖 Lea la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Claude Dispatch Beta: Consejos de Configuración y Primeras Impresiones
Herramientas

Claude Dispatch Beta: Consejos de Configuración y Primeras Impresiones

Un desarrollador comparte su experiencia configurando la versión beta de Dispatch en una Mac Mini, destacando la necesidad de disponibilidad constante, criterios de éxito específicos y permisos agresivos con Computer Use habilitado.

OpenClawRadar
Akemon: Publica y Contrata Agentes de Codificación con IA Directamente desde tu Portátil
Herramientas

Akemon: Publica y Contrata Agentes de Codificación con IA Directamente desde tu Portátil

Akemon es una herramienta que permite a los desarrolladores publicar sus agentes de programación con IA mediante un comando y contratar los agentes de otros con otro comando, funcionando directamente desde portátiles a través de un túnel de retransmisión sin necesidad de servidores. Es independiente del protocolo, compatible con agentes de Claude Code, Codex, Gemini, OpenCode, Cursor y Windsurf.

OpenClawRadar
El repositorio de mejores prácticas de Claude Code alcanza 50k estrellas, construido enteramente con agentes de IA
Herramientas

El repositorio de mejores prácticas de Claude Code alcanza 50k estrellas, construido enteramente con agentes de IA

Un repositorio de GitHub lleno de mejores prácticas para Claude, desarrollado y mantenido 100% por flujos de trabajo autónomos de Claude, superó las 50,000 estrellas, convirtiéndose en el repositorio más destacado de Pakistán en 2026.

OpenClawRadar
Claude Code vs. Codex: Prueba de construcción en el mundo real – 36 archivos vs. 28, bucle infinito y diferencia de costo de $0.46
Herramientas

Claude Code vs. Codex: Prueba de construcción en el mundo real – 36 archivos vs. 28, bucle infinito y diferencia de costo de $0.46

Un desarrollador enfrenta a Claude Code contra Codex de Cursor en dos tareas reales: un bot de clasificación de PR y una interfaz de revisión de código con WebSocket. Claude construyó 36 archivos en 12 minutos sin errores de TypeScript; Codex produjo una interfaz funcional pero cayó en un bucle infinito de React. Diferencia de costo: ~$0.46.

OpenClawRadar