Qwen3.6 27B e 35B no vLLM: Resultados de ajuste em uma única Radeon R9700

✍️ OpenClawRadar📅 Publicado: August 9, 2026🔗 Source
Ad

Um post no r/LocalLLaMA detalha como executar Qwen3.6 27B (denso) e 35B (MoE) em uma única Radeon AI Pro R9700 usando vLLM Radiance via Podman. O autor compartilha sua configuração exata e resultados de benchmark, que são particularmente úteis para usuários de GPUs AMD.

Configuração e Principais Diferenças

Eles usam o contêiner stilldeadcode/vllm-radiance:0.5.8, que vem com uma configuração de referência ajustada para pesos FP8 em R9700 duplas com paralelismo de tensor (TP=2). Para uma única placa com pesos INT4, as seguintes alterações são necessárias:

  • --tensor-parallel-size 1 (sem segunda placa)
  • --gpu-memory-utilization 0.98 (a referência era 0.90–0.97)
  • num_speculative_tokens=4 no 27B — testado em escada 2/3/4/8, com 4 vencendo por 17–48% sobre 8 em todas as profundidades

Os pesos são Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). O 35B em FP8 simplesmente não cabe em uma placa de 32GB em comprimentos de contexto úteis.

Correção Crítica: tokenizer.json

O repositório INT4 da Avesed vem com um tokenizer.json com truncation.max_length definido como 512 e padding como Fixed(512) — provavelmente da calibração. Isso quebra a visão acima de ~672px. A correção: defina ambos para null.

Ad

Resultados de Benchmark

35B-A3B MoE (tokens do pool KV = 440.241)

ProfundidadePrefill tok/sDecode tok/s
4k~7.80061,4
16k~7.70060,1
50k~6.04057,0
78k~5.12054,7
100k~4.58052,9
150k~3.69049,5

27B denso, MTP spec=4 (tokens do pool KV = 212.147)

ProfundidadePrefill tok/sDecode tok/sComprimento médio aceito
4k~1.28859,64,4
16k~1.34562,34,6
50k~1.20759,64,5
100k~1.02753,74,5

Notável: o 35B MoE atinge throughput de prefill muito maior (até 7,8k tok/s vs 1,3k), mas velocidades de decodificação semelhantes. A especulação MTP do 27B entrega um comprimento aceito de ~4,5 tokens.

Esta é uma configuração prática para usuários AMD que não têm GPUs duplas e desejam executar esses modelos localmente. O autor está disposto a fornecer scripts de inicialização sob solicitação.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Resultados de Benchmark: 6 Modelos de Baixo Custo vs. Claude Sonnet 4.6 para Orquestração OpenClaw
Tools

Resultados de Benchmark: 6 Modelos de Baixo Custo vs. Claude Sonnet 4.6 para Orquestração OpenClaw

Um desenvolvedor testou seis modelos de IA mais baratos contra o Claude Sonnet 4.6 como orquestrador principal em uma configuração OpenClaw. Apenas o o4-mini igualou a pontuação perfeita do Sonnet, enquanto os outros falharam em tarefas críticas de julgamento, como inspeção de arquivos e delegação.

OpenClawRadar
Apresentando Swarmhook: Webhooks Gratuitos e de Código Aberto para Seu Bot
Tools

Apresentando Swarmhook: Webhooks Gratuitos e de Código Aberto para Seu Bot

O Swarmhook.com oferece webhooks gratuitos e de código aberto para gerenciar eventos de seus bots de forma eficaz, simplificando a automação e as capacidades de resposta.

OpenClawRadar
Mengram AI: Ferramenta de Memória Automática para Sessões de Código do Claude
Tools

Mengram AI: Ferramenta de Memória Automática para Sessões de Código do Claude

O Mengram AI mantém automaticamente o contexto entre sessões do Claude Code carregando perfis cognitivos, injetando contexto relevante do passado nos prompts e salvando novos conhecimentos. Ele armazena memória semântica, episódica e procedural que evolui com base em falhas.

OpenClawRadar
Complexidade Temporal MCP: Ferramenta de Análise Estática Fornece Complexidade Big-O para Agentes de IA de Codificação
Tools

Complexidade Temporal MCP: Ferramenta de Análise Estática Fornece Complexidade Big-O para Agentes de IA de Codificação

Time Complexity MCP é um servidor MCP de código aberto que realiza análise estática de código para detectar complexidade Big-O, alimentando os resultados diretamente para agentes de IA de codificação como Claude Code ou Copilot sem consumo de tokens. Ele suporta JavaScript, TypeScript, Python, Java, Kotlin e Dart.

OpenClawRadar