Qwen3.6 27B e 35B no vLLM: Resultados de ajuste em uma única Radeon R9700
Um post no r/LocalLLaMA detalha como executar Qwen3.6 27B (denso) e 35B (MoE) em uma única Radeon AI Pro R9700 usando vLLM Radiance via Podman. O autor compartilha sua configuração exata e resultados de benchmark, que são particularmente úteis para usuários de GPUs AMD.
Configuração e Principais Diferenças
Eles usam o contêiner stilldeadcode/vllm-radiance:0.5.8, que vem com uma configuração de referência ajustada para pesos FP8 em R9700 duplas com paralelismo de tensor (TP=2). Para uma única placa com pesos INT4, as seguintes alterações são necessárias:
--tensor-parallel-size 1(sem segunda placa)--gpu-memory-utilization 0.98(a referência era 0.90–0.97)num_speculative_tokens=4no 27B — testado em escada 2/3/4/8, com 4 vencendo por 17–48% sobre 8 em todas as profundidades
Os pesos são Avesed/Qwen3.6-{27B,35B}-INT4-W4A16 (compressed-tensors, group_size 32). O 35B em FP8 simplesmente não cabe em uma placa de 32GB em comprimentos de contexto úteis.
Correção Crítica: tokenizer.json
O repositório INT4 da Avesed vem com um tokenizer.json com truncation.max_length definido como 512 e padding como Fixed(512) — provavelmente da calibração. Isso quebra a visão acima de ~672px. A correção: defina ambos para null.
Resultados de Benchmark
35B-A3B MoE (tokens do pool KV = 440.241)
| Profundidade | Prefill tok/s | Decode tok/s |
|---|---|---|
| 4k | ~7.800 | 61,4 |
| 16k | ~7.700 | 60,1 |
| 50k | ~6.040 | 57,0 |
| 78k | ~5.120 | 54,7 |
| 100k | ~4.580 | 52,9 |
| 150k | ~3.690 | 49,5 |
27B denso, MTP spec=4 (tokens do pool KV = 212.147)
| Profundidade | Prefill tok/s | Decode tok/s | Comprimento médio aceito |
|---|---|---|---|
| 4k | ~1.288 | 59,6 | 4,4 |
| 16k | ~1.345 | 62,3 | 4,6 |
| 50k | ~1.207 | 59,6 | 4,5 |
| 100k | ~1.027 | 53,7 | 4,5 |
Notável: o 35B MoE atinge throughput de prefill muito maior (até 7,8k tok/s vs 1,3k), mas velocidades de decodificação semelhantes. A especulação MTP do 27B entrega um comprimento aceito de ~4,5 tokens.
Esta é uma configuração prática para usuários AMD que não têm GPUs duplas e desejam executar esses modelos localmente. O autor está disposto a fornecer scripts de inicialização sob solicitação.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Resultados de Benchmark: 6 Modelos de Baixo Custo vs. Claude Sonnet 4.6 para Orquestração OpenClaw
Um desenvolvedor testou seis modelos de IA mais baratos contra o Claude Sonnet 4.6 como orquestrador principal em uma configuração OpenClaw. Apenas o o4-mini igualou a pontuação perfeita do Sonnet, enquanto os outros falharam em tarefas críticas de julgamento, como inspeção de arquivos e delegação.

Apresentando Swarmhook: Webhooks Gratuitos e de Código Aberto para Seu Bot
O Swarmhook.com oferece webhooks gratuitos e de código aberto para gerenciar eventos de seus bots de forma eficaz, simplificando a automação e as capacidades de resposta.

Mengram AI: Ferramenta de Memória Automática para Sessões de Código do Claude
O Mengram AI mantém automaticamente o contexto entre sessões do Claude Code carregando perfis cognitivos, injetando contexto relevante do passado nos prompts e salvando novos conhecimentos. Ele armazena memória semântica, episódica e procedural que evolui com base em falhas.

Complexidade Temporal MCP: Ferramenta de Análise Estática Fornece Complexidade Big-O para Agentes de IA de Codificação
Time Complexity MCP é um servidor MCP de código aberto que realiza análise estática de código para detectar complexidade Big-O, alimentando os resultados diretamente para agentes de IA de codificação como Claude Code ou Copilot sem consumo de tokens. Ele suporta JavaScript, TypeScript, Python, Java, Kotlin e Dart.