Resultados de Evaluación de los Modelos Qwen3.5 con Contexto de 2K a 400K en RTX 4090

✍️ OpenClawRadar📅 Publicado: 7 de marzo de 2026🔗 Source
Resultados de Evaluación de los Modelos Qwen3.5 con Contexto de 2K a 400K en RTX 4090
Ad

Pruebas de Rendimiento de Qwen3.5 en RTX 4090

Un desarrollador compartió resultados de puntos de referencia para modelos Qwen3.5 ejecutándose en una GPU RTX 4090, probando ventanas de contexto desde 2,048 hasta 400,000 tokens. Las pruebas originalmente estaban planeadas para un contexto de 262k pero se extendieron a 400k usando yarn y otros métodos.

Modelos Probados

Se evaluaron las siguientes variantes del modelo Qwen3.5:

  • Qwen3.5-0.8B-Q4_K_M
  • Qwen3.5-0.8B-bf16
  • Qwen3.5-2B-Q4_K_M
  • Qwen3.5-2B-bf16
  • Qwen3.5-4B-Q4_K_M
  • Qwen3.5-4B-bf16
  • Qwen3.5-9B-Q4_K_M
  • Qwen3.5-9B-bf16
  • Qwen3.5-27B-Q4_K_M
  • Qwen3.5-35B-A3B-Q4_K_M

Ventanas de Contexto Probadas

Los modelos fueron evaluados en estas longitudes de contexto específicas: 2048, 4096, 8192, 32768, 65536, 98304, 131072, 196608, 262144, 327680, 360448, 393216 y 400000 tokens.

Metodología de Pruebas

El script de puntos de referencia se configuró para lograr la mejor velocidad posible en tokens/segundo usando configuraciones NGL con caché KV de 8 bits y 4 bits. El desarrollador notó que aunque el tiempo inicial hasta el primer token (TTFT) parece largo, la columna Warm TTFT Avg (s) muestra un mejor rendimiento una vez que se carga la caché KV. El contexto se cargó completamente en la primera interacción intencionalmente.

Para probar las capacidades de contexto, se les dio a los modelos un mensaje de una oración para resumir registros, seguido de 2k a 400k tokens de datos de registro. El desarrollador reportó algunas discrepancias pero un rendimiento general satisfactorio.

Ad

Estado Actual y Próximos Pasos

Tres modelos fallaron durante las pruebas y están siendo sometidos a pruebas de descarga KV: Qwen3.5-4B-bf16, Qwen3.5-27B-Q4_K_M y Qwen3.5-35B-A3B-Q4_K_M. El desarrollador tuvo que reiniciar estas pruebas después de que un problema con el script desperdició 24 horas de tiempo de ejecución.

Una vez que se completen las pruebas de descarga de VRAM, el desarrollador planea comparar los resultados con modelos fundamentales y ha guardado las salidas para análisis. El desarrollador expresó sorpresa particular por el rendimiento de los modelos densos de 9B y 27B.

El desarrollador está buscando aportes de la comunidad sobre qué modelos comparar y qué metodología de calificación usar para la evaluación.

📖 Leer la fuente completa: r/openclaw

Ad

👀 Ver también

Créditos del Creador de OpenClaw
Ingeniero de Código Claude
En medio de la Prohibición de Suscripción de Anthropic
Noticias

Créditos del Creador de OpenClaw Ingeniero de Código Claude En medio de la Prohibición de Suscripción de Anthropic

Peter Steinberger, creador del cliente de código abierto Claude Code OpenClaw, reconoció públicamente a Boris Cherny de Anthropic por trabajar para suavizar el impacto de la prohibición de Anthropic sobre el uso basado en suscripción de clientes de terceros. Cherny respondió señalando que ha enviado solicitudes de extracción (PRs) para mejorar la eficiencia del caché de prompts específicamente para OpenClaw.

OpenClawRadar
Métodos de Monetización de Agentes Probados: Resultado Más Rápido en 80 Segundos
Noticias

Métodos de Monetización de Agentes Probados: Resultado Más Rápido en 80 Segundos

Los reporteros de OpenClaw probaron múltiples métodos de monetización para agentes, incluyendo billeteras autosoberanas, mercados de predicción, cultivo de rendimiento DeFi, caza de recompensas y micropagos. El resultado más rápido fue 80 segundos desde cero hasta una billetera Nano financiada mediante MCP, sin claves API, SDK ni configuración humana.

OpenClawRadar
Error no documentado encontrado en el código de la computadora de guía del Apolo 11 utilizando IA y lenguaje de especificación
Noticias

Error no documentado encontrado en el código de la computadora de guía del Apolo 11 utilizando IA y lenguaje de especificación

Investigadores descubrieron un error de bloqueo de recursos en el código de control del giroscopio del Apollo Guidance Computer que había pasado desapercibido durante 57 años, utilizando Claude AI y el lenguaje de especificación Allium para analizar 130,000 líneas de código ensamblador.

OpenClawRadar
El Pentágono establece el viernes como fecha límite para que Anthropic abandone las normas de ética en IA.
Noticias

El Pentágono establece el viernes como fecha límite para que Anthropic abandone las normas de ética en IA.

El Pentágono le ha dado a Anthropic hasta el viernes para que abandone sus normas de ética en IA, según un informe de Politico. El artículo recibió 15 puntos y 3 comentarios en Hacker News.

OpenClawRadar