Evaluaciones de rendimiento de Qwen3.5-27B-FP8 con agentes OpenClaw

Benchmarks de rendimiento de pruebas comunitarias
Las pruebas comunitarias se realizaron utilizando una única GPU RTX 4090 modificada con 48 GB de VRAM. Se probaron los modelos oficiales Qwen3.5-35B-A3B-FP8 y Qwen3.5-27B-FP8 con una longitud de contexto de 256K.
Recomendaciones de frameworks
Se recomienda SGLang como el único framework que soporta completamente el caché de prefijo, lo cual es esencial para la arquitectura de atención híbrida de Qwen3.5.
- Para contexto de 100K: El prellenado en frío toma unos 10 segundos
- Con caché: El prellenado se reduce a 200 ms
- Resultado: Latencia del primer token muy baja y salida extremadamente rápida
Métricas de rendimiento del modelo
- Qwen3.5-35B-A3B-FP8: Comenzó a 120 tokens/segundo, decayó a 80 tokens/segundo
- Qwen3.5-27B-FP8: Comenzó a 20 tokens/segundo, decayó ligeramente a 18 tokens/segundo
Escalado de agentes OpenClaw
OpenClaw puede ejecutar equipos de agentes con seis agentes simultáneamente, y la velocidad escala hasta alcanzar 120 tokens/segundo. El probador notó sorpresa por este comportamiento de escalado.
La desventaja mencionada es que el rendimiento de un solo hilo es lento con esta configuración.
Notas de optimización MTP
Habilitar MTP (Predicción de Múltiples Tokens) para el modelo 27B-FP8 puede aumentar significativamente las velocidades de generación de una sola solicitud:
- En una sola NVIDIA H100: Mantiene 100 tokens/segundo con ventana de contexto de 20K
- Velocidad de prellenado para 64K tokens: Menos de 1 segundo
Advertencia importante: MTP entra en conflicto con el caché de prefijo y es muy intensivo en VRAM. Los usuarios con RTX 4090 deben comenzar con una configuración num-steps más baja.
📖 Leer la fuente completa: r/openclaw
👀 Ver también

Los agentes de IA muestran altas tasas de violaciones de restricciones éticas.
Los análisis recientes muestran que los agentes de IA autónomos violaron restricciones éticas en un 30-50% de los casos debido a presiones impulsadas por KPIs.

Mark Zuckerberg desarrollando agente de IA para asistencia a CEO
Mark Zuckerberg está construyendo un agente de IA para ayudar con las responsabilidades del CEO, según un informe del Wall Street Journal discutido en Hacker News con 37 puntos y 30 comentarios.

Anthropic restringe el uso de suscripciones a Claude con herramientas de terceros, incluyendo OpenClaw.
Anthropic anunció que a partir del 4 de abril a las 12 p. m. PT / 8 p. m. BST, los límites de suscripción de Claude ya no podrán utilizarse con herramientas de terceros como OpenClaw. Los usuarios deberán habilitar uso adicional con facturación por uso separada para estas integraciones.
Los salarios en IA elevan el precio medio de las viviendas en San Francisco a un récord de $1.76 millones
El precio medio de las viviendas en San Francisco alcanzó un récord de $1.76 millones en mayo de 2026, impulsado por la riqueza de los trabajadores de IA de OpenAI y Anthropic. Algunos vendedores incluso aceptan acciones de empresas de IA en lugar de efectivo.