Qwen3.6 27B y 35B en vLLM: Resultados de ajuste con una sola Radeon R9700

✍️ OpenClawRadar📅 Publicado: 9 de agosto de 2026🔗 Source
Ad

Una publicación en r/LocalLLaMA detalla cómo ejecutar Qwen3.6 27B (denso) y 35B (MoE) en una sola Radeon AI Pro R9700 usando vLLM Radiance mediante Podman. El autor comparte su configuración exacta y resultados de benchmark, que son particularmente útiles para usuarios de GPU AMD.

Configuración y diferencias clave

Utilizan el contenedor stilldeadcode/vllm-radiance:0.5.8, que incluye una configuración de referencia para pesos FP8 en dos R9700 con paralelismo tensorial (TP=2). Para una sola tarjeta con pesos INT4, se necesitan los siguientes cambios:

  • --tensor-parallel-size 1 (sin segunda tarjeta)
  • --gpu-memory-utilization 0.98 (la referencia era 0.90–0.97)
  • num_speculative_tokens=4 en el 27B — probado con 2/3/4/8, siendo 4 el ganador por 17–48% sobre 8 en todas las profundidades

Los pesos son Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). El 35B en FP8 simplemente no cabe en una tarjeta de 32GB a longitudes de contexto útiles.

Corrección crítica: tokenizer.json

El repositorio INT4 de Avesed incluye un tokenizer.json con truncation.max_length establecido en 512 y padding como Fixed(512) — probablemente de la calibración. Esto rompe la visión por encima de ~672px. La solución: establecer ambos a null.

Ad

Resultados de Benchmark

35B-A3B MoE (pool de tokens KV = 440,241)

ProfundidadPrefill tok/sDecode tok/s
4k~7,80061.4
16k~7,70060.1
50k~6,04057.0
78k~5,12054.7
100k~4,58052.9
150k~3,69049.5

27B denso, MTP spec=4 (pool de tokens KV = 212,147)

ProfundidadPrefill tok/sDecode tok/sLongitud media aceptada
4k~1,28859.64.4
16k~1,34562.34.6
50k~1,20759.64.5
100k~1,02753.74.5

Notable: el MoE 35B logra un rendimiento de prefill mucho mayor (hasta 7.8k tok/s vs 1.3k) pero velocidades de decode similares. La especulación MTP del 27B ofrece una longitud aceptada de ~4.5 tokens.

Esta es una configuración práctica para usuarios de AMD que no tienen doble GPU y quieren ejecutar estos modelos localmente. El autor está dispuesto a proporcionar scripts de inicio si se le solicitan.

📖 Lea la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Storybloq: Un rastreador de proyectos para Claude Code con aplicación Mac, CLI y MCP
Herramientas

Storybloq: Un rastreador de proyectos para Claude Code con aplicación Mac, CLI y MCP

Storybloq es un rastreador de proyectos gratuito y de código abierto que vive en .story/ dentro de tu repositorio. Incluye una aplicación para Mac (App Store), una CLI y un servidor MCP para exponer tickets, incidencias y transferencias de sesión a Claude Code.

OpenClawRadar
Phaselock: Un Sistema de Control de Agentes de IA Inspirado en Técnicas de Crianza
Herramientas

Phaselock: Un Sistema de Control de Agentes de IA Inspirado en Técnicas de Crianza

Phaselock es una Habilidad de Agente de código abierto que implementa cuatro mecanismos de control para agentes de codificación de IA: compuertas explícitas antes de la acción, retroalimentación inmediata sobre errores, opciones restringidas y aplicación mecánica de reglas. Funciona con Claude Code, Cursor, Windsurf y cualquier herramienta que admita hooks.

OpenClawRadar
Por qué los agentes de codificación de IA producen basura después de 20 turnos: Ceguera al contexto
Herramientas

Por qué los agentes de codificación de IA producen basura después de 20 turnos: Ceguera al contexto

Una auditoría profunda de los registros de API revela que Cursor y Claude Code no se están volviendo más tontos, sino que se asfixian en ventanas de contexto infladas con ruido, causando destrucción arquitectónica.

OpenClawRadar
Kreuzberg v4.7.0 añade inteligencia de código para 248 idiomas y una extracción de markdown mejorada.
Herramientas

Kreuzberg v4.7.0 añade inteligencia de código para 248 idiomas y una extracción de markdown mejorada.

Kreuzberg v4.7.0, una biblioteca de inteligencia de documentos con núcleo en Rust, ahora admite la extracción de código para 248 formatos mediante tree-sitter y ha mejorado significativamente la calidad de markdown con puntuaciones Structural F1 superiores al 80% en 23 formatos.

OpenClawRadar