Qwen3.6 27B e 35B no vLLM: Resultados de ajuste em uma única Radeon R9700
Um post no r/LocalLLaMA detalha como executar Qwen3.6 27B (denso) e 35B (MoE) em uma única Radeon AI Pro R9700 usando vLLM Radiance via Podman. O autor compartilha sua configuração exata e resultados de benchmark, que são particularmente úteis para usuários de GPUs AMD.
Configuração e Principais Diferenças
Eles usam o contêiner stilldeadcode/vllm-radiance:0.5.8, que vem com uma configuração de referência ajustada para pesos FP8 em R9700 duplas com paralelismo de tensor (TP=2). Para uma única placa com pesos INT4, as seguintes alterações são necessárias:
--tensor-parallel-size 1(sem segunda placa)--gpu-memory-utilization 0.98(a referência era 0.90–0.97)num_speculative_tokens=4no 27B — testado em escada 2/3/4/8, com 4 vencendo por 17–48% sobre 8 em todas as profundidades
Os pesos são Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). O 35B em FP8 simplesmente não cabe em uma placa de 32GB em comprimentos de contexto úteis.
Correção Crítica: tokenizer.json
O repositório INT4 da Avesed vem com um tokenizer.json com truncation.max_length definido como 512 e padding como Fixed(512) — provavelmente da calibração. Isso quebra a visão acima de ~672px. A correção: defina ambos para null.
Resultados de Benchmark
35B-A3B MoE (tokens do pool KV = 440.241)
| Profundidade | Prefill tok/s | Decode tok/s |
|---|---|---|
| 4k | ~7.800 | 61,4 |
| 16k | ~7.700 | 60,1 |
| 50k | ~6.040 | 57,0 |
| 78k | ~5.120 | 54,7 |
| 100k | ~4.580 | 52,9 |
| 150k | ~3.690 | 49,5 |
27B denso, MTP spec=4 (tokens do pool KV = 212.147)
| Profundidade | Prefill tok/s | Decode tok/s | Comprimento médio aceito |
|---|---|---|---|
| 4k | ~1.288 | 59,6 | 4,4 |
| 16k | ~1.345 | 62,3 | 4,6 |
| 50k | ~1.207 | 59,6 | 4,5 |
| 100k | ~1.027 | 53,7 | 4,5 |
Notável: o 35B MoE atinge throughput de prefill muito maior (até 7,8k tok/s vs 1,3k), mas velocidades de decodificação semelhantes. A especulação MTP do 27B entrega um comprimento aceito de ~4,5 tokens.
Esta é uma configuração prática para usuários AMD que não têm GPUs duplas e desejam executar esses modelos localmente. O autor está disposto a fornecer scripts de inicialização sob solicitação.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Architect CLI: Ferramenta de código aberto para orquestrar agentes de IA headless em CI/CD
Architect é uma ferramenta CLI de código aberto projetada para agentes de IA autônomos em pipelines de CI/CD, apresentando o Ralph Loop para ciclos de teste e repetição, guardrails determinísticos, definições de pipeline em YAML e suporte para múltiplos LLMs via LiteLLM.

codebase-md: Ferramenta gera automaticamente CLAUDE.md com manutenção de git hook
codebase-md v0.1.0 analisa projetos para gerar arquivos CLAUDE.md com detecção de arquitetura, verificações de saúde de dependências e insights do git. Inclui hooks do git para manter a documentação atualizada e suporta outras ferramentas de codificação de IA com arquivos de configuração adicionais.

Claude-IDE-Bridge Agora Funciona em Servidores Remotos para Desenvolvimento Assistido por IA
A ferramenta Claude-IDE-Bridge agora conecta a IA Claude a ambientes de desenvolvimento remotos em VPS ou máquinas na nuvem, permitindo acesso a diagnósticos em tempo real, arquivos abertos e falhas de testes de qualquer dispositivo.

Desenvolvedor Cria Compilador Scheme para WASM Usando IA em 4 Dias
Um desenvolvedor criou o Puppy Scheme, um compilador Scheme que gera código WebAssembly, em cerca de 4 dias com assistência de IA. O compilador suporta 73% dos padrões R5RS e R7RS, utiliza WASM GC e alcançou melhorias no tempo de compilação de 3½ minutos para 11 segundos durante a noite.