Qwen3.6 27B e 35B no vLLM: Resultados de ajuste em uma única Radeon R9700

✍️ OpenClawRadar📅 Publicado: August 9, 2026🔗 Source
Ad

Um post no r/LocalLLaMA detalha como executar Qwen3.6 27B (denso) e 35B (MoE) em uma única Radeon AI Pro R9700 usando vLLM Radiance via Podman. O autor compartilha sua configuração exata e resultados de benchmark, que são particularmente úteis para usuários de GPUs AMD.

Configuração e Principais Diferenças

Eles usam o contêiner stilldeadcode/vllm-radiance:0.5.8, que vem com uma configuração de referência ajustada para pesos FP8 em R9700 duplas com paralelismo de tensor (TP=2). Para uma única placa com pesos INT4, as seguintes alterações são necessárias:

  • --tensor-parallel-size 1 (sem segunda placa)
  • --gpu-memory-utilization 0.98 (a referência era 0.90–0.97)
  • num_speculative_tokens=4 no 27B — testado em escada 2/3/4/8, com 4 vencendo por 17–48% sobre 8 em todas as profundidades

Os pesos são Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). O 35B em FP8 simplesmente não cabe em uma placa de 32GB em comprimentos de contexto úteis.

Correção Crítica: tokenizer.json

O repositório INT4 da Avesed vem com um tokenizer.json com truncation.max_length definido como 512 e padding como Fixed(512) — provavelmente da calibração. Isso quebra a visão acima de ~672px. A correção: defina ambos para null.

Ad

Resultados de Benchmark

35B-A3B MoE (tokens do pool KV = 440.241)

ProfundidadePrefill tok/sDecode tok/s
4k~7.80061,4
16k~7.70060,1
50k~6.04057,0
78k~5.12054,7
100k~4.58052,9
150k~3.69049,5

27B denso, MTP spec=4 (tokens do pool KV = 212.147)

ProfundidadePrefill tok/sDecode tok/sComprimento médio aceito
4k~1.28859,64,4
16k~1.34562,34,6
50k~1.20759,64,5
100k~1.02753,74,5

Notável: o 35B MoE atinge throughput de prefill muito maior (até 7,8k tok/s vs 1,3k), mas velocidades de decodificação semelhantes. A especulação MTP do 27B entrega um comprimento aceito de ~4,5 tokens.

Esta é uma configuração prática para usuários AMD que não têm GPUs duplas e desejam executar esses modelos localmente. O autor está disposto a fornecer scripts de inicialização sob solicitação.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Backend Personalizado do llama.cpp Descarrega Multiplicação de Matrizes LLM para NPU AMD XDNA2 no Ryzen AI MAX 385
Tools

Backend Personalizado do llama.cpp Descarrega Multiplicação de Matrizes LLM para NPU AMD XDNA2 no Ryzen AI MAX 385

Um desenvolvedor criou um backend personalizado para llama.cpp que despacha operações GEMM diretamente para o NPU AMD XDNA2 no Ryzen AI MAX 385 (Strix Halo), alcançando 43,7 t/s de decodificação com 0,947 J/tok usando o Meta-Llama-3.1-8B-Instruct Q4_K_M. O caminho de decodificação do NPU economiza cerca de 10W em comparação com apenas Vulkan, mantendo a mesma taxa de decodificação.

OpenClawRadar
A Gema Rails-AI-Context Fornece ao Claude Código com o Modelo Completo do App Rails via MCP
Tools

A Gema Rails-AI-Context Fornece ao Claude Código com o Modelo Completo do App Rails via MCP

A gem rails-ai-context realiza auto-introspecção de aplicações Rails e expõe 39 ferramentas via MCP, permitindo que o Claude Code consulte detalhes específicos do app como esquema com colunas criptografadas, associações de modelos, rotas, configurações Stimulus e mapeamentos Turbo, em vez de ler arquivos inteiros.

OpenClawRadar
ClawVibe: Um Assistente de Voz Mãos-Livres para iOS para Agentes de IA com STT/TTS no Dispositivo
Tools

ClawVibe: Um Assistente de Voz Mãos-Livres para iOS para Agentes de IA com STT/TTS no Dispositivo

ClawVibe é um aplicativo iOS nativo que oferece interação por voz com agentes de IA durante deslocamentos, sem usar as mãos. Ele utiliza reconhecimento de fala e TTS no dispositivo, suporta CarPlay e inclui biometria de voz para filtrar ruídos de fundo. Apenas texto é enviado pela rede.

OpenClawRadar
Ajuste Fino do Qwen 14B para Autocompletar do Discord
Tools

Ajuste Fino do Qwen 14B para Autocompletar do Discord

Um desenvolvedor ajustou o modelo Qwen 14B usando seu conjunto de dados de mensagens do Discord para criar uma ferramenta de autocompletar.

OpenClawRadar