Qwen3.6 27B y 35B en vLLM: Resultados de ajuste con una sola Radeon R9700

✍️ OpenClawRadar📅 Publicado: 9 de agosto de 2026🔗 Source
Ad

Una publicación en r/LocalLLaMA detalla cómo ejecutar Qwen3.6 27B (denso) y 35B (MoE) en una sola Radeon AI Pro R9700 usando vLLM Radiance mediante Podman. El autor comparte su configuración exacta y resultados de benchmark, que son particularmente útiles para usuarios de GPU AMD.

Configuración y diferencias clave

Utilizan el contenedor stilldeadcode/vllm-radiance:0.5.8, que incluye una configuración de referencia para pesos FP8 en dos R9700 con paralelismo tensorial (TP=2). Para una sola tarjeta con pesos INT4, se necesitan los siguientes cambios:

  • --tensor-parallel-size 1 (sin segunda tarjeta)
  • --gpu-memory-utilization 0.98 (la referencia era 0.90–0.97)
  • num_speculative_tokens=4 en el 27B — probado con 2/3/4/8, siendo 4 el ganador por 17–48% sobre 8 en todas las profundidades

Los pesos son Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). El 35B en FP8 simplemente no cabe en una tarjeta de 32GB a longitudes de contexto útiles.

Corrección crítica: tokenizer.json

El repositorio INT4 de Avesed incluye un tokenizer.json con truncation.max_length establecido en 512 y padding como Fixed(512) — probablemente de la calibración. Esto rompe la visión por encima de ~672px. La solución: establecer ambos a null.

Ad

Resultados de Benchmark

35B-A3B MoE (pool de tokens KV = 440,241)

ProfundidadPrefill tok/sDecode tok/s
4k~7,80061.4
16k~7,70060.1
50k~6,04057.0
78k~5,12054.7
100k~4,58052.9
150k~3,69049.5

27B denso, MTP spec=4 (pool de tokens KV = 212,147)

ProfundidadPrefill tok/sDecode tok/sLongitud media aceptada
4k~1,28859.64.4
16k~1,34562.34.6
50k~1,20759.64.5
100k~1,02753.74.5

Notable: el MoE 35B logra un rendimiento de prefill mucho mayor (hasta 7.8k tok/s vs 1.3k) pero velocidades de decode similares. La especulación MTP del 27B ofrece una longitud aceptada de ~4.5 tokens.

Esta es una configuración práctica para usuarios de AMD que no tienen doble GPU y quieren ejecutar estos modelos localmente. El autor está dispuesto a proporcionar scripts de inicio si se le solicitan.

📖 Lea la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Ejecutando Claude Code sin conexión en un M3 Pro con Qwen3.6: 4 soluciones que lo hicieron funcionar
Herramientas

Ejecutando Claude Code sin conexión en un M3 Pro con Qwen3.6: 4 soluciones que lo hicieron funcionar

Cuatro ajustes de variables de entorno hacen que Claude Code funcione completamente sin conexión en un M3 Pro con Qwen3.6 (MoE, ~3B activos), completando un ciclo de incidente SRE desde la investigación hasta el PR sin que ningún dato salga de la máquina.

OpenClawRadar
El Servidor MCP de Savecraft Proporciona a Claude Datos Precisos de Magic: The Gathering
Herramientas

El Servidor MCP de Savecraft Proporciona a Claude Datos Precisos de Magic: The Gathering

Savecraft es un servidor MCP de código abierto que analiza localmente el Player.log de MTG Arena, sincroniza el estado del juego y le da a Claude acceso a 12 módulos de referencia experta basados en datos reales de Magic: The Gathering. La herramienta evita que Claude alucine nombres de cartas y reglas al proporcionar acceso a datos reales de Arena, recomendaciones de draft de 17Lands y la base de datos completa de Scryfall.

OpenClawRadar
Infraestructura de Agentes de IA: AgentMail, AgentLine, AgentCard, Daytona y más
Herramientas

Infraestructura de Agentes de IA: AgentMail, AgentLine, AgentCard, Daytona y más

Una publicación de Reddit enumera empresas que construyen primitivas específicas para agentes: AgentMail (correo electrónico), AgentLine (teléfono), AgentCard (pagos), Daytona/E2B (computadoras), Browserbase/Browser Use/Hyperbrowser (navegadores), Firecrawl (rastreo), Mem0 (memoria), Composio (herramientas SaaS).

OpenClawRadar
🦀
Herramientas

Mesh LLM: Computación de IA Distribuida en Iroh – Ejecuta LLMs en Tus Propias GPUs

Mesh LLM agrupa las GPUs que ya tienes en varias máquinas y las expone como una API compatible con OpenAI. Distribuye modelos localmente, mediante enrutamiento entre pares o como un pipeline a través de varios nodos utilizando el transporte QUIC de iroh.

OpenClawRadar