Benchmarks de desempenho do Qwen3.5-27B-FP8 com agentes OpenClaw

Benchmarks de desempenho de testes da comunidade
Os testes da comunidade foram conduzidos usando uma única GPU RTX 4090 modificada com 48GB de VRAM. Os modelos oficiais Qwen3.5-35B-A3B-FP8 e Qwen3.5-27B-FP8 foram testados com comprimento de contexto de 256K.
Recomendações de frameworks
SGLang é recomendado como o único framework que suporta totalmente o cache de prefixo, que é essencial para a arquitetura de atenção híbrida do Qwen3.5.
- Para contexto de 100K: O pré-preenchimento inicial leva cerca de 10 segundos
- Com cache: O pré-preenchimento cai para 200ms
- Resultado: Latência do primeiro token muito baixa e saída extremamente rápida
Métricas de desempenho do modelo
- Qwen3.5-35B-A3B-FP8: Começou em 120 tokens/segundo, decaiu para 80 tokens/segundo
- Qwen3.5-27B-FP8: Começou em 20 tokens/segundo, decaiu levemente para 18 tokens/segundo
Escalonamento do agente OpenClaw
O OpenClaw pode executar equipes de agentes com seis agentes simultaneamente, e a velocidade escala para atingir 120 tokens/segundo. O testador observou surpresa com esse comportamento de escalonamento.
A desvantagem mencionada é que o desempenho de thread única é lento com essa configuração.
Notas de otimização MTP
Ativar MTP (Previsão de Múltiplos Tokens) para o modelo 27B-FP8 pode aumentar significativamente as velocidades de geração de solicitação única:
- Em um único NVIDIA H100: Mantém 100 tokens/segundo com janela de contexto de 20K
- Velocidade de pré-preenchimento para 64K tokens: Menos de 1 segundo
Observação importante: MTP entra em conflito com o cache de prefixo e é muito intensivo em VRAM. Usuários com RTX 4090 devem começar com uma configuração num-steps mais baixa.
📖 Leia a fonte completa: r/openclaw
👀 See Also

Novos Créditos de Assinatura Claude da Anthropic: SDK de Agente e claude -p Ganham Pool Separado com Limite a Partir de 15 de Junho
A partir de 15 de junho, assinantes do Claude recebem um crédito mensal separado para uso do Agent SDK e claude -p: US$ 200/mês para Max 20x, US$ 100 para Max 5x, US$ 20 para Pro. O uso é interrompido quando o crédito acaba, a menos que a cobrança extra seja ativada. O uso interativo do Claude Code e do chat permanece no pool da assinatura.

Bug de Cobrança da API da Anthropic: Modelo Sonnet Cobrado com Tarifas do Opus
Um usuário descobriu que a API da Anthropic está cobrando incorretamente o modelo claude-sonnet-4-6 com as tarifas do Opus, apesar de retornar a string correta do modelo. O bug foi identificado através da análise de dados brutos de eventos que mostram uma discrepância de custo.

Claude Code v2.1.149: Detalhamento de Uso, Correções de Permissão e Navegação por Teclado
Claude Code v2.1.149 adiciona detalhamento de uso por categoria, visualização de diff rolável por teclado, checkboxes de listas de tarefas GFM e corrige várias burlas de permissão e problemas de sandbox.

Revolucione o Monitoramento de API em Todos os Provedores com onWatch
Descubra como o onWatch, uma nova e poderosa ferramenta, simplifica o monitoramento do uso da sua cota de API de IA em vários provedores, garantindo que você permaneça dentro dos limites e otimize a alocação de recursos.