Título del artículo: Código Abierto vs Modelos Frontera: Benchmark de Escena de Coche en Lienzo de Archivo Único

✍️ OpenClawRadar📅 Publicado: 17 de mayo de 2026🔗 Source
Título del artículo: Código Abierto vs Modelos Frontera: Benchmark de Escena de Coche en Lienzo de Archivo Único
Ad

Un desarrollador ejecutó el mismo prompt de Canvas en un solo archivo en 12 modelos para comparar las capacidades de modelos de código abierto y fronterizos en una escena realista de un coche en movimiento vista lateral. La tarea: un archivo HTML independiente, sin librerías, sin recursos externos, con paisaje de paralaje, ruedas giratorias, sutil movimiento del cuerpo, iluminación cinematográfica y bucle continuo. El banco de pruebas es OpenCodeOrchestra, y los resultados están en vivo en oco-canvas-car-scene-compare.

Modelos probados

Cada modelo se ejecutó en un Orchestrator aislado con la configuración de pensamiento/esfuerzo más alta disponible. La lista incluye GPT-5.5 xhigh, GPT-5.4 xhigh, Claude Opus 4.7 (máximo esfuerzo), Claude Opus 4.6 (máximo esfuerzo), Claude Sonnet 4.6 (alto esfuerzo), Kimi K2.6, DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.1, MiniMax M2.7, Qwen 3.6 Plus y Grok 4.3. No se midieron tokens por segundo ni tiempo de generación.

Ad

Conclusiones clave

  • Algunos modelos utilizaron internamente modelos auditores; otros no.
  • Ganadores claros y resultados ambiguos son visibles en la galería.
  • MiMo V2.5 Pro fue excluido debido a problemas de facturación con la suscripción OpenCode Go.

La página de la galería permite la comparación lado a lado de la salida de cada modelo. El código fuente está en GitHub en AidenGeunGeun/oco-canvas-car-scene-compare.

📖 Lea la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

El Ping-Pong de la IA: cuando cada respuesta es una captura de ChatGPT
Noticias

El Ping-Pong de la IA: cuando cada respuesta es una captura de ChatGPT

Desarrolladores informan estar inundados de respuestas generadas por IA, de colegas, jefes e incluso comentaristas de GitHub, que ignoran el contexto y hacen perder tiempo. La discusión en HN captura una frustración creciente.

OpenClawRadar
Qwen 3 8B supera a modelos más grandes en evaluaciones ciegas por pares en tareas difíciles.
Noticias

Qwen 3 8B supera a modelos más grandes en evaluaciones ciegas por pares en tareas difíciles.

En una evaluación ciega por pares de 10 modelos de lenguaje pequeños en 13 tareas difíciles de nivel frontera, Qwen 3 8B ganó 6 evaluaciones y se ubicó entre los 3 primeros en 12 de las 13 tareas, superando a modelos con hasta 4 veces su cantidad de parámetros. La evaluación cubrió depuración de bloqueos distribuidos, errores de concurrencia en Go, optimización SQL, diagnóstico médico bayesiano, la paradoja de Simpson, el teorema de votación de Arrow y análisis de sesgo de supervivencia.

OpenClawRadar
OpenClaw Client Añade Seguimiento de Costos y Límites de Gasto por Agente
Noticias

OpenClaw Client Añade Seguimiento de Costos y Límites de Gasto por Agente

La nueva versión añade límites de gasto por agente, interfaz de uso en vivo con barra de progreso circular, gestión de subagentes, activación de habilidades y selección de modelo por agente.

OpenClawRadar
Claude AI pasa 81 minutos en 'pensamiento real' – informe de usuarios aumenta con actualizaciones importantes
Noticias

Claude AI pasa 81 minutos en 'pensamiento real' – informe de usuarios aumenta con actualizaciones importantes

Un usuario informa que Claude AI dedicó 1 hora y 21 minutos a una tarea simple, especulando que los picos de rendimiento ocurren brevemente después de grandes actualizaciones. Ejemplo: una solicitud de investigación escaneó 5,113 fuentes en una sesión, pero luego solo 100-200 fuentes para consultas similares.

OpenClawRadar