Qwen3.6 27B y 35B en vLLM: Resultados de ajuste con una sola Radeon R9700
Una publicación en r/LocalLLaMA detalla cómo ejecutar Qwen3.6 27B (denso) y 35B (MoE) en una sola Radeon AI Pro R9700 usando vLLM Radiance mediante Podman. El autor comparte su configuración exacta y resultados de benchmark, que son particularmente útiles para usuarios de GPU AMD.
Configuración y diferencias clave
Utilizan el contenedor stilldeadcode/vllm-radiance:0.5.8, que incluye una configuración de referencia para pesos FP8 en dos R9700 con paralelismo tensorial (TP=2). Para una sola tarjeta con pesos INT4, se necesitan los siguientes cambios:
--tensor-parallel-size 1(sin segunda tarjeta)--gpu-memory-utilization 0.98(la referencia era 0.90–0.97)num_speculative_tokens=4en el 27B — probado con 2/3/4/8, siendo 4 el ganador por 17–48% sobre 8 en todas las profundidades
Los pesos son Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). El 35B en FP8 simplemente no cabe en una tarjeta de 32GB a longitudes de contexto útiles.
Corrección crítica: tokenizer.json
El repositorio INT4 de Avesed incluye un tokenizer.json con truncation.max_length establecido en 512 y padding como Fixed(512) — probablemente de la calibración. Esto rompe la visión por encima de ~672px. La solución: establecer ambos a null.
Resultados de Benchmark
35B-A3B MoE (pool de tokens KV = 440,241)
| Profundidad | Prefill tok/s | Decode tok/s |
|---|---|---|
| 4k | ~7,800 | 61.4 |
| 16k | ~7,700 | 60.1 |
| 50k | ~6,040 | 57.0 |
| 78k | ~5,120 | 54.7 |
| 100k | ~4,580 | 52.9 |
| 150k | ~3,690 | 49.5 |
27B denso, MTP spec=4 (pool de tokens KV = 212,147)
| Profundidad | Prefill tok/s | Decode tok/s | Longitud media aceptada |
|---|---|---|---|
| 4k | ~1,288 | 59.6 | 4.4 |
| 16k | ~1,345 | 62.3 | 4.6 |
| 50k | ~1,207 | 59.6 | 4.5 |
| 100k | ~1,027 | 53.7 | 4.5 |
Notable: el MoE 35B logra un rendimiento de prefill mucho mayor (hasta 7.8k tok/s vs 1.3k) pero velocidades de decode similares. La especulación MTP del 27B ofrece una longitud aceptada de ~4.5 tokens.
Esta es una configuración práctica para usuarios de AMD que no tienen doble GPU y quieren ejecutar estos modelos localmente. El autor está dispuesto a proporcionar scripts de inicio si se le solicitan.
📖 Lea la fuente completa: r/LocalLLaMA
👀 Ver también

Storybloq: Un rastreador de proyectos para Claude Code con aplicación Mac, CLI y MCP
Storybloq es un rastreador de proyectos gratuito y de código abierto que vive en .story/ dentro de tu repositorio. Incluye una aplicación para Mac (App Store), una CLI y un servidor MCP para exponer tickets, incidencias y transferencias de sesión a Claude Code.

Phaselock: Un Sistema de Control de Agentes de IA Inspirado en Técnicas de Crianza
Phaselock es una Habilidad de Agente de código abierto que implementa cuatro mecanismos de control para agentes de codificación de IA: compuertas explícitas antes de la acción, retroalimentación inmediata sobre errores, opciones restringidas y aplicación mecánica de reglas. Funciona con Claude Code, Cursor, Windsurf y cualquier herramienta que admita hooks.

Por qué los agentes de codificación de IA producen basura después de 20 turnos: Ceguera al contexto
Una auditoría profunda de los registros de API revela que Cursor y Claude Code no se están volviendo más tontos, sino que se asfixian en ventanas de contexto infladas con ruido, causando destrucción arquitectónica.

Kreuzberg v4.7.0 añade inteligencia de código para 248 idiomas y una extracción de markdown mejorada.
Kreuzberg v4.7.0, una biblioteca de inteligencia de documentos con núcleo en Rust, ahora admite la extracción de código para 248 formatos mediante tree-sitter y ha mejorado significativamente la calidad de markdown con puntuaciones Structural F1 superiores al 80% en 23 formatos.