Benchmarks de desempenho do Qwen3.5-27B-FP8 com agentes OpenClaw

✍️ OpenClawRadar📅 Publicado: February 28, 2026🔗 Source
Benchmarks de desempenho do Qwen3.5-27B-FP8 com agentes OpenClaw
Ad

Benchmarks de desempenho de testes da comunidade

Os testes da comunidade foram conduzidos usando uma única GPU RTX 4090 modificada com 48GB de VRAM. Os modelos oficiais Qwen3.5-35B-A3B-FP8 e Qwen3.5-27B-FP8 foram testados com comprimento de contexto de 256K.

Recomendações de frameworks

SGLang é recomendado como o único framework que suporta totalmente o cache de prefixo, que é essencial para a arquitetura de atenção híbrida do Qwen3.5.

  • Para contexto de 100K: O pré-preenchimento inicial leva cerca de 10 segundos
  • Com cache: O pré-preenchimento cai para 200ms
  • Resultado: Latência do primeiro token muito baixa e saída extremamente rápida

Métricas de desempenho do modelo

  • Qwen3.5-35B-A3B-FP8: Começou em 120 tokens/segundo, decaiu para 80 tokens/segundo
  • Qwen3.5-27B-FP8: Começou em 20 tokens/segundo, decaiu levemente para 18 tokens/segundo
Ad

Escalonamento do agente OpenClaw

O OpenClaw pode executar equipes de agentes com seis agentes simultaneamente, e a velocidade escala para atingir 120 tokens/segundo. O testador observou surpresa com esse comportamento de escalonamento.

A desvantagem mencionada é que o desempenho de thread única é lento com essa configuração.

Notas de otimização MTP

Ativar MTP (Previsão de Múltiplos Tokens) para o modelo 27B-FP8 pode aumentar significativamente as velocidades de geração de solicitação única:

  • Em um único NVIDIA H100: Mantém 100 tokens/segundo com janela de contexto de 20K
  • Velocidade de pré-preenchimento para 64K tokens: Menos de 1 segundo

Observação importante: MTP entra em conflito com o cache de prefixo e é muito intensivo em VRAM. Usuários com RTX 4090 devem começar com uma configuração num-steps mais baixa.

📖 Leia a fonte completa: r/openclaw

Ad

👀 See Also

Claude supera Gemini, ChatGPT e Grok em desafio de codificação Python em tempo real
News

Claude supera Gemini, ChatGPT e Grok em desafio de codificação Python em tempo real

Um desenvolvedor testou Claude, Gemini, ChatGPT e Grok em um torneio de programação Python em tempo real, onde bots gerados por IA competiram para encontrar palavras em uma grade de letras 15×15. Claude venceu de forma decisiva.

OpenClawRadar
🦀
News

Stripe se aproxima de acordo de US$ 7 bilhões para adquirir a empresa de IA OpenRouter

A Stripe está próxima de adquirir a startup de IA OpenRouter por mais de US$ 7 bilhões, segundo a Bloomberg. O acordo sinaliza uma grande consolidação no espaço de infraestrutura de IA.

OpenClawRadar
Modo Automático do Claude Code Torna-se Padrão: Por Que a Anthropic Parou de Confiar nos Humanos
News

Modo Automático do Claude Code Torna-se Padrão: Por Que a Anthropic Parou de Confiar nos Humanos

O Auto Mode do Claude Code, que executa tarefas agênticas com intervenção humana mínima, está se tornando o padrão devido à crença de que a supervisão humana desacelera os fluxos de trabalho e introduz erros.

OpenClawRadar
Autoresearch Impulsiona Qwen3.5-397B para 20,34 tok/s no M5 Max via Transmissão SSD
News

Autoresearch Impulsiona Qwen3.5-397B para 20,34 tok/s no M5 Max via Transmissão SSD

Um desenvolvedor alcançou velocidade de inferência de 20,34 tokens/segundo para o modelo Qwen3.5-397B de 209GB em um MacBook Pro M5 Max com 128GB de RAM usando streaming de SSD e 36 experimentos sistemáticos. O resultado representa uma aceleração de 2x em relação à linha de base do M5 Max e 4,67x em relação ao resultado original do M3 Max.

OpenClawRadar