Evaluaciones de rendimiento de Qwen3.5-27B-FP8 con agentes OpenClaw

✍️ OpenClawRadar📅 Publicado: 28 de febrero de 2026🔗 Source
Evaluaciones de rendimiento de Qwen3.5-27B-FP8 con agentes OpenClaw
Ad

Benchmarks de rendimiento de pruebas comunitarias

Las pruebas comunitarias se realizaron utilizando una única GPU RTX 4090 modificada con 48 GB de VRAM. Se probaron los modelos oficiales Qwen3.5-35B-A3B-FP8 y Qwen3.5-27B-FP8 con una longitud de contexto de 256K.

Recomendaciones de frameworks

Se recomienda SGLang como el único framework que soporta completamente el caché de prefijo, lo cual es esencial para la arquitectura de atención híbrida de Qwen3.5.

  • Para contexto de 100K: El prellenado en frío toma unos 10 segundos
  • Con caché: El prellenado se reduce a 200 ms
  • Resultado: Latencia del primer token muy baja y salida extremadamente rápida

Métricas de rendimiento del modelo

  • Qwen3.5-35B-A3B-FP8: Comenzó a 120 tokens/segundo, decayó a 80 tokens/segundo
  • Qwen3.5-27B-FP8: Comenzó a 20 tokens/segundo, decayó ligeramente a 18 tokens/segundo
Ad

Escalado de agentes OpenClaw

OpenClaw puede ejecutar equipos de agentes con seis agentes simultáneamente, y la velocidad escala hasta alcanzar 120 tokens/segundo. El probador notó sorpresa por este comportamiento de escalado.

La desventaja mencionada es que el rendimiento de un solo hilo es lento con esta configuración.

Notas de optimización MTP

Habilitar MTP (Predicción de Múltiples Tokens) para el modelo 27B-FP8 puede aumentar significativamente las velocidades de generación de una sola solicitud:

  • En una sola NVIDIA H100: Mantiene 100 tokens/segundo con ventana de contexto de 20K
  • Velocidad de prellenado para 64K tokens: Menos de 1 segundo

Advertencia importante: MTP entra en conflicto con el caché de prefijo y es muy intensivo en VRAM. Los usuarios con RTX 4090 deben comenzar con una configuración num-steps más baja.

📖 Leer la fuente completa: r/openclaw

Ad

👀 Ver también