Qwen3.6 27B e 35B no vLLM: Resultados de ajuste em uma única Radeon R9700

✍️ OpenClawRadar📅 Publicado: August 9, 2026🔗 Source
Ad

Um post no r/LocalLLaMA detalha como executar Qwen3.6 27B (denso) e 35B (MoE) em uma única Radeon AI Pro R9700 usando vLLM Radiance via Podman. O autor compartilha sua configuração exata e resultados de benchmark, que são particularmente úteis para usuários de GPUs AMD.

Configuração e Principais Diferenças

Eles usam o contêiner stilldeadcode/vllm-radiance:0.5.8, que vem com uma configuração de referência ajustada para pesos FP8 em R9700 duplas com paralelismo de tensor (TP=2). Para uma única placa com pesos INT4, as seguintes alterações são necessárias:

  • --tensor-parallel-size 1 (sem segunda placa)
  • --gpu-memory-utilization 0.98 (a referência era 0.90–0.97)
  • num_speculative_tokens=4 no 27B — testado em escada 2/3/4/8, com 4 vencendo por 17–48% sobre 8 em todas as profundidades

Os pesos são Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). O 35B em FP8 simplesmente não cabe em uma placa de 32GB em comprimentos de contexto úteis.

Correção Crítica: tokenizer.json

O repositório INT4 da Avesed vem com um tokenizer.json com truncation.max_length definido como 512 e padding como Fixed(512) — provavelmente da calibração. Isso quebra a visão acima de ~672px. A correção: defina ambos para null.

Ad

Resultados de Benchmark

35B-A3B MoE (tokens do pool KV = 440.241)

ProfundidadePrefill tok/sDecode tok/s
4k~7.80061,4
16k~7.70060,1
50k~6.04057,0
78k~5.12054,7
100k~4.58052,9
150k~3.69049,5

27B denso, MTP spec=4 (tokens do pool KV = 212.147)

ProfundidadePrefill tok/sDecode tok/sComprimento médio aceito
4k~1.28859,64,4
16k~1.34562,34,6
50k~1.20759,64,5
100k~1.02753,74,5

Notável: o 35B MoE atinge throughput de prefill muito maior (até 7,8k tok/s vs 1,3k), mas velocidades de decodificação semelhantes. A especulação MTP do 27B entrega um comprimento aceito de ~4,5 tokens.

Esta é uma configuração prática para usuários AMD que não têm GPUs duplas e desejam executar esses modelos localmente. O autor está disposto a fornecer scripts de inicialização sob solicitação.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Architect CLI: Ferramenta de código aberto para orquestrar agentes de IA headless em CI/CD
Tools

Architect CLI: Ferramenta de código aberto para orquestrar agentes de IA headless em CI/CD

Architect é uma ferramenta CLI de código aberto projetada para agentes de IA autônomos em pipelines de CI/CD, apresentando o Ralph Loop para ciclos de teste e repetição, guardrails determinísticos, definições de pipeline em YAML e suporte para múltiplos LLMs via LiteLLM.

OpenClawRadar
codebase-md: Ferramenta gera automaticamente CLAUDE.md com manutenção de git hook
Tools

codebase-md: Ferramenta gera automaticamente CLAUDE.md com manutenção de git hook

codebase-md v0.1.0 analisa projetos para gerar arquivos CLAUDE.md com detecção de arquitetura, verificações de saúde de dependências e insights do git. Inclui hooks do git para manter a documentação atualizada e suporta outras ferramentas de codificação de IA com arquivos de configuração adicionais.

OpenClawRadar
Claude-IDE-Bridge Agora Funciona em Servidores Remotos para Desenvolvimento Assistido por IA
Tools

Claude-IDE-Bridge Agora Funciona em Servidores Remotos para Desenvolvimento Assistido por IA

A ferramenta Claude-IDE-Bridge agora conecta a IA Claude a ambientes de desenvolvimento remotos em VPS ou máquinas na nuvem, permitindo acesso a diagnósticos em tempo real, arquivos abertos e falhas de testes de qualquer dispositivo.

OpenClawRadar
Desenvolvedor Cria Compilador Scheme para WASM Usando IA em 4 Dias
Tools

Desenvolvedor Cria Compilador Scheme para WASM Usando IA em 4 Dias

Um desenvolvedor criou o Puppy Scheme, um compilador Scheme que gera código WebAssembly, em cerca de 4 dias com assistência de IA. O compilador suporta 73% dos padrões R5RS e R7RS, utiliza WASM GC e alcançou melhorias no tempo de compilação de 3½ minutos para 11 segundos durante a noite.

OpenClawRadar