Qwen3.6 27B y 35B en vLLM: Resultados de ajuste con una sola Radeon R9700
Una publicación en r/LocalLLaMA detalla cómo ejecutar Qwen3.6 27B (denso) y 35B (MoE) en una sola Radeon AI Pro R9700 usando vLLM Radiance mediante Podman. El autor comparte su configuración exacta y resultados de benchmark, que son particularmente útiles para usuarios de GPU AMD.
Configuración y diferencias clave
Utilizan el contenedor stilldeadcode/vllm-radiance:0.5.8, que incluye una configuración de referencia para pesos FP8 en dos R9700 con paralelismo tensorial (TP=2). Para una sola tarjeta con pesos INT4, se necesitan los siguientes cambios:
--tensor-parallel-size 1(sin segunda tarjeta)--gpu-memory-utilization 0.98(la referencia era 0.90–0.97)num_speculative_tokens=4en el 27B — probado con 2/3/4/8, siendo 4 el ganador por 17–48% sobre 8 en todas las profundidades
Los pesos son Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). El 35B en FP8 simplemente no cabe en una tarjeta de 32GB a longitudes de contexto útiles.
Corrección crítica: tokenizer.json
El repositorio INT4 de Avesed incluye un tokenizer.json con truncation.max_length establecido en 512 y padding como Fixed(512) — probablemente de la calibración. Esto rompe la visión por encima de ~672px. La solución: establecer ambos a null.
Resultados de Benchmark
35B-A3B MoE (pool de tokens KV = 440,241)
| Profundidad | Prefill tok/s | Decode tok/s |
|---|---|---|
| 4k | ~7,800 | 61.4 |
| 16k | ~7,700 | 60.1 |
| 50k | ~6,040 | 57.0 |
| 78k | ~5,120 | 54.7 |
| 100k | ~4,580 | 52.9 |
| 150k | ~3,690 | 49.5 |
27B denso, MTP spec=4 (pool de tokens KV = 212,147)
| Profundidad | Prefill tok/s | Decode tok/s | Longitud media aceptada |
|---|---|---|---|
| 4k | ~1,288 | 59.6 | 4.4 |
| 16k | ~1,345 | 62.3 | 4.6 |
| 50k | ~1,207 | 59.6 | 4.5 |
| 100k | ~1,027 | 53.7 | 4.5 |
Notable: el MoE 35B logra un rendimiento de prefill mucho mayor (hasta 7.8k tok/s vs 1.3k) pero velocidades de decode similares. La especulación MTP del 27B ofrece una longitud aceptada de ~4.5 tokens.
Esta es una configuración práctica para usuarios de AMD que no tienen doble GPU y quieren ejecutar estos modelos localmente. El autor está dispuesto a proporcionar scripts de inicio si se le solicitan.
📖 Lea la fuente completa: r/LocalLLaMA
👀 Ver también

Ejecutando Claude Code sin conexión en un M3 Pro con Qwen3.6: 4 soluciones que lo hicieron funcionar
Cuatro ajustes de variables de entorno hacen que Claude Code funcione completamente sin conexión en un M3 Pro con Qwen3.6 (MoE, ~3B activos), completando un ciclo de incidente SRE desde la investigación hasta el PR sin que ningún dato salga de la máquina.

El Servidor MCP de Savecraft Proporciona a Claude Datos Precisos de Magic: The Gathering
Savecraft es un servidor MCP de código abierto que analiza localmente el Player.log de MTG Arena, sincroniza el estado del juego y le da a Claude acceso a 12 módulos de referencia experta basados en datos reales de Magic: The Gathering. La herramienta evita que Claude alucine nombres de cartas y reglas al proporcionar acceso a datos reales de Arena, recomendaciones de draft de 17Lands y la base de datos completa de Scryfall.

Infraestructura de Agentes de IA: AgentMail, AgentLine, AgentCard, Daytona y más
Una publicación de Reddit enumera empresas que construyen primitivas específicas para agentes: AgentMail (correo electrónico), AgentLine (teléfono), AgentCard (pagos), Daytona/E2B (computadoras), Browserbase/Browser Use/Hyperbrowser (navegadores), Firecrawl (rastreo), Mem0 (memoria), Composio (herramientas SaaS).
Mesh LLM: Computación de IA Distribuida en Iroh – Ejecuta LLMs en Tus Propias GPUs
Mesh LLM agrupa las GPUs que ya tienes en varias máquinas y las expone como una API compatible con OpenAI. Distribuye modelos localmente, mediante enrutamiento entre pares o como un pipeline a través de varios nodos utilizando el transporte QUIC de iroh.