Modelos locales Qwen 3.6 vs modelos fronterizos en una primitiva de codificación: animación de Canvas HTML en un solo archivo

Un usuario de Reddit realizó una comparación directa entre modelos cuantificados locales y modelos fronterizos basados en web para un primitivo de codificación específico: generar un único archivo HTML con una animación de canvas de página completa que muestra un automóvil de perfil conduciendo con desplazamiento de paralaje, ruedas girando e iluminación cinematográfica.
El Prompt
El prompt exacto pedía un solo archivo HTML sin bibliotecas, un canvas de página completa, animación realista de un automóvil de perfil, paisajes de paralaje en capas, ruedas girando, movimiento sutil del cuerpo, bucle suave y cielo/iluminación cohesivos.
Modelos Probados
Fronterizos (basados en web vía Perplexity, tok/s no medido):
- Claude Sonnet 4.6 Thinking (usó internet para razonar)
- Gemini 3.1 Pro Thinking
- GPT 5.4 Thinking
- Kimi k2.6 Thinking
Locales (Ryzen 5 5600, 24 GB DDR4-3200, RX 5700 XT 8GB):
- Qwen3.5 9B Q4_K_M — ~50 tok/s
- Qwen3.6-27B (Claude-opus-reasoning-distilled) Q4_K_M — 2.65 tok/s
- Qwen3.6-27B Q4_K_M — 2.70 tok/s
- Qwen3.6-31B A3B Q4_K_M — 12.13 tok/s
- Gemma-4-31b-it — 1.91 tok/s
- Qwen3.5 4B Q8 — 60 tok/s (usó internet para razonar)
- Qwen3.5 4B Q4_K_M — 80 tok/s (usó internet para razonar)
Resultados y Clasificación Subjetiva
La clasificación para esta tarea específica:
- Kimi k2.6 Thinking — resultado visual general más limpio
- Qwen3.6-27B Q4_K_M (local) — más fuerte de lo esperado; buen paralaje y sensación de carretera
- Qwen3.6-27B Claude-opus-reasoning-distilled — tercero cercano
El modelo local de 27B cuantificado produjo un movimiento y capas más naturales que algunos resultados fronterizos para este primitivo visual específico. El usuario señaló que esperaba que los modelos fronterizos superaran más claramente a los cuantificados locales.
El usuario solo cambió las etiquetas HTML <title> para rastrear qué modelo generó qué archivo. Los resultados se comparten en el hilo junto con capturas de pantalla/GIF de las animaciones en ejecución.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también
Degradación de atención de Opus 4.7: puntuaciones MRCR caen del 92% al 59% en contexto de 256k
Opus 4.7 muestra una caída significativa en la recuperación según la prueba MRCR v2 de 8 agujas: del 91,9 % al 59,2 % en contexto de 256k, y del 78,3 % al 32,2 % en 1M. Anthropic está retirando MRCR en favor de Graphwalks, pero la degradación coincide con los informes de los usuarios.

Errores Elevados en Claude Opus 4.7: Actualización de Estado y Qué Esperar
Claude Opus 4.7 está experimentando errores elevados a partir del 2026-05-19T15:21Z. Consulta status.claude.com para ver el progreso y las resoluciones.

Estado Actual de los LLM Chinos: Líderes del Mercado, Modelos Abiertos y Modelos de Negocio
Un análisis de Reddit detalla el panorama de los LLM chinos, identificando a Doubao de ByteDance como el líder del mercado propietario y a DeepSeek como el más innovador, mientras describe los modelos de negocio de los principales actores y los 'Seis Tigres Pequeños de IA' centrados en modelos de pesos abiertos.

"Evaluación de los Últimos Modelos de IA: El Auge de los Modelos Extremos"
Un análisis detallado de 40 nuevos modelos de IA revela un mercado dividido con 'Modo Dios' y 'Modo Flash' a la cabeza. Los modelos de gama media ahora se consideran obsoletos.