Benchmarks de desempenho do Qwen3.5-27B-FP8 com agentes OpenClaw

✍️ OpenClawRadar📅 Publicado: February 28, 2026🔗 Source
Benchmarks de desempenho do Qwen3.5-27B-FP8 com agentes OpenClaw
Ad

Benchmarks de desempenho de testes da comunidade

Os testes da comunidade foram conduzidos usando uma única GPU RTX 4090 modificada com 48GB de VRAM. Os modelos oficiais Qwen3.5-35B-A3B-FP8 e Qwen3.5-27B-FP8 foram testados com comprimento de contexto de 256K.

Recomendações de frameworks

SGLang é recomendado como o único framework que suporta totalmente o cache de prefixo, que é essencial para a arquitetura de atenção híbrida do Qwen3.5.

  • Para contexto de 100K: O pré-preenchimento inicial leva cerca de 10 segundos
  • Com cache: O pré-preenchimento cai para 200ms
  • Resultado: Latência do primeiro token muito baixa e saída extremamente rápida

Métricas de desempenho do modelo

  • Qwen3.5-35B-A3B-FP8: Começou em 120 tokens/segundo, decaiu para 80 tokens/segundo
  • Qwen3.5-27B-FP8: Começou em 20 tokens/segundo, decaiu levemente para 18 tokens/segundo
Ad

Escalonamento do agente OpenClaw

O OpenClaw pode executar equipes de agentes com seis agentes simultaneamente, e a velocidade escala para atingir 120 tokens/segundo. O testador observou surpresa com esse comportamento de escalonamento.

A desvantagem mencionada é que o desempenho de thread única é lento com essa configuração.

Notas de otimização MTP

Ativar MTP (Previsão de Múltiplos Tokens) para o modelo 27B-FP8 pode aumentar significativamente as velocidades de geração de solicitação única:

  • Em um único NVIDIA H100: Mantém 100 tokens/segundo com janela de contexto de 20K
  • Velocidade de pré-preenchimento para 64K tokens: Menos de 1 segundo

Observação importante: MTP entra em conflito com o cache de prefixo e é muito intensivo em VRAM. Usuários com RTX 4090 devem começar com uma configuração num-steps mais baixa.

📖 Leia a fonte completa: r/openclaw

Ad

👀 See Also

Novos Créditos de Assinatura Claude da Anthropic: SDK de Agente e claude -p Ganham Pool Separado com Limite a Partir de 15 de Junho
News

Novos Créditos de Assinatura Claude da Anthropic: SDK de Agente e claude -p Ganham Pool Separado com Limite a Partir de 15 de Junho

A partir de 15 de junho, assinantes do Claude recebem um crédito mensal separado para uso do Agent SDK e claude -p: US$ 200/mês para Max 20x, US$ 100 para Max 5x, US$ 20 para Pro. O uso é interrompido quando o crédito acaba, a menos que a cobrança extra seja ativada. O uso interativo do Claude Code e do chat permanece no pool da assinatura.

OpenClawRadar
Bug de Cobrança da API da Anthropic: Modelo Sonnet Cobrado com Tarifas do Opus
News

Bug de Cobrança da API da Anthropic: Modelo Sonnet Cobrado com Tarifas do Opus

Um usuário descobriu que a API da Anthropic está cobrando incorretamente o modelo claude-sonnet-4-6 com as tarifas do Opus, apesar de retornar a string correta do modelo. O bug foi identificado através da análise de dados brutos de eventos que mostram uma discrepância de custo.

OpenClawRadar
Claude Code v2.1.149: Detalhamento de Uso, Correções de Permissão e Navegação por Teclado
News

Claude Code v2.1.149: Detalhamento de Uso, Correções de Permissão e Navegação por Teclado

Claude Code v2.1.149 adiciona detalhamento de uso por categoria, visualização de diff rolável por teclado, checkboxes de listas de tarefas GFM e corrige várias burlas de permissão e problemas de sandbox.

OpenClawRadar
Revolucione o Monitoramento de API em Todos os Provedores com onWatch
News

Revolucione o Monitoramento de API em Todos os Provedores com onWatch

Descubra como o onWatch, uma nova e poderosa ferramenta, simplifica o monitoramento do uso da sua cota de API de IA em vários provedores, garantindo que você permaneça dentro dos limites e otimize a alocação de recursos.

OpenClawRadar