Qwen3.6 27B y 35B en vLLM: Resultados de ajuste con una sola Radeon R9700
Una publicación en r/LocalLLaMA detalla cómo ejecutar Qwen3.6 27B (denso) y 35B (MoE) en una sola Radeon AI Pro R9700 usando vLLM Radiance mediante Podman. El autor comparte su configuración exacta y resultados de benchmark, que son particularmente útiles para usuarios de GPU AMD.
Configuración y diferencias clave
Utilizan el contenedor stilldeadcode/vllm-radiance:0.5.8, que incluye una configuración de referencia para pesos FP8 en dos R9700 con paralelismo tensorial (TP=2). Para una sola tarjeta con pesos INT4, se necesitan los siguientes cambios:
--tensor-parallel-size 1(sin segunda tarjeta)--gpu-memory-utilization 0.98(la referencia era 0.90–0.97)num_speculative_tokens=4en el 27B — probado con 2/3/4/8, siendo 4 el ganador por 17–48% sobre 8 en todas las profundidades
Los pesos son Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). El 35B en FP8 simplemente no cabe en una tarjeta de 32GB a longitudes de contexto útiles.
Corrección crítica: tokenizer.json
El repositorio INT4 de Avesed incluye un tokenizer.json con truncation.max_length establecido en 512 y padding como Fixed(512) — probablemente de la calibración. Esto rompe la visión por encima de ~672px. La solución: establecer ambos a null.
Resultados de Benchmark
35B-A3B MoE (pool de tokens KV = 440,241)
| Profundidad | Prefill tok/s | Decode tok/s |
|---|---|---|
| 4k | ~7,800 | 61.4 |
| 16k | ~7,700 | 60.1 |
| 50k | ~6,040 | 57.0 |
| 78k | ~5,120 | 54.7 |
| 100k | ~4,580 | 52.9 |
| 150k | ~3,690 | 49.5 |
27B denso, MTP spec=4 (pool de tokens KV = 212,147)
| Profundidad | Prefill tok/s | Decode tok/s | Longitud media aceptada |
|---|---|---|---|
| 4k | ~1,288 | 59.6 | 4.4 |
| 16k | ~1,345 | 62.3 | 4.6 |
| 50k | ~1,207 | 59.6 | 4.5 |
| 100k | ~1,027 | 53.7 | 4.5 |
Notable: el MoE 35B logra un rendimiento de prefill mucho mayor (hasta 7.8k tok/s vs 1.3k) pero velocidades de decode similares. La especulación MTP del 27B ofrece una longitud aceptada de ~4.5 tokens.
Esta es una configuración práctica para usuarios de AMD que no tienen doble GPU y quieren ejecutar estos modelos localmente. El autor está dispuesto a proporcionar scripts de inicio si se le solicitan.
📖 Lea la fuente completa: r/LocalLLaMA
👀 Ver también

Claude Dispatch Beta: Consejos de Configuración y Primeras Impresiones
Un desarrollador comparte su experiencia configurando la versión beta de Dispatch en una Mac Mini, destacando la necesidad de disponibilidad constante, criterios de éxito específicos y permisos agresivos con Computer Use habilitado.

Akemon: Publica y Contrata Agentes de Codificación con IA Directamente desde tu Portátil
Akemon es una herramienta que permite a los desarrolladores publicar sus agentes de programación con IA mediante un comando y contratar los agentes de otros con otro comando, funcionando directamente desde portátiles a través de un túnel de retransmisión sin necesidad de servidores. Es independiente del protocolo, compatible con agentes de Claude Code, Codex, Gemini, OpenCode, Cursor y Windsurf.

El repositorio de mejores prácticas de Claude Code alcanza 50k estrellas, construido enteramente con agentes de IA
Un repositorio de GitHub lleno de mejores prácticas para Claude, desarrollado y mantenido 100% por flujos de trabajo autónomos de Claude, superó las 50,000 estrellas, convirtiéndose en el repositorio más destacado de Pakistán en 2026.

Claude Code vs. Codex: Prueba de construcción en el mundo real – 36 archivos vs. 28, bucle infinito y diferencia de costo de $0.46
Un desarrollador enfrenta a Claude Code contra Codex de Cursor en dos tareas reales: un bot de clasificación de PR y una interfaz de revisión de código con WebSocket. Claude construyó 36 archivos en 12 minutos sin errores de TypeScript; Codex produjo una interfaz funcional pero cayó en un bucle infinito de React. Diferencia de costo: ~$0.46.