Título del artículo: Código Abierto vs Modelos Frontera: Benchmark de Escena de Coche en Lienzo de Archivo Único

✍️ OpenClawRadar📅 Publicado: 17 de mayo de 2026🔗 Source
Título del artículo: Código Abierto vs Modelos Frontera: Benchmark de Escena de Coche en Lienzo de Archivo Único
Ad

Un desarrollador ejecutó el mismo prompt de Canvas en un solo archivo en 12 modelos para comparar las capacidades de modelos de código abierto y fronterizos en una escena realista de un coche en movimiento vista lateral. La tarea: un archivo HTML independiente, sin librerías, sin recursos externos, con paisaje de paralaje, ruedas giratorias, sutil movimiento del cuerpo, iluminación cinematográfica y bucle continuo. El banco de pruebas es OpenCodeOrchestra, y los resultados están en vivo en oco-canvas-car-scene-compare.

Modelos probados

Cada modelo se ejecutó en un Orchestrator aislado con la configuración de pensamiento/esfuerzo más alta disponible. La lista incluye GPT-5.5 xhigh, GPT-5.4 xhigh, Claude Opus 4.7 (máximo esfuerzo), Claude Opus 4.6 (máximo esfuerzo), Claude Sonnet 4.6 (alto esfuerzo), Kimi K2.6, DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.1, MiniMax M2.7, Qwen 3.6 Plus y Grok 4.3. No se midieron tokens por segundo ni tiempo de generación.

Ad

Conclusiones clave

  • Algunos modelos utilizaron internamente modelos auditores; otros no.
  • Ganadores claros y resultados ambiguos son visibles en la galería.
  • MiMo V2.5 Pro fue excluido debido a problemas de facturación con la suscripción OpenCode Go.

La página de la galería permite la comparación lado a lado de la salida de cada modelo. El código fuente está en GitHub en AidenGeunGeun/oco-canvas-car-scene-compare.

📖 Lea la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Claude Code Elimina Base de Datos de Producción Tras Error en Archivo de Estado de Terraform
Noticias

Claude Code Elimina Base de Datos de Producción Tras Error en Archivo de Estado de Terraform

Un desarrollador utilizó Claude Code para gestionar la infraestructura de AWS con Terraform, pero un archivo de estado faltante provocó recursos duplicados y una posterior operación 'destroy' que borró 2.5 años de registros, incluyendo instantáneas de bases de datos.

OpenClawRadar
PeerZero: Agentes de IA Realizan Revisión por Pares con Incentivos Basados en Credibilidad
Noticias

PeerZero: Agentes de IA Realizan Revisión por Pares con Incentivos Basados en Credibilidad

PeerZero es una plataforma donde los agentes de IA presentan trabajos de investigación, revisan el trabajo de los demás y apuestan su credibilidad en tener razón a través de un sistema de recompensas. Los agentes ganan o pierden puntuaciones de credibilidad según la precisión de sus revisiones, con mecánicas de 'disidente vindicado' que recompensan el pensamiento independiente y castigan el pensamiento grupal.

OpenClawRadar
Por qué los abogados siguen citando casos alucinados por IA: La perspectiva de un desarrollador
Noticias

Por qué los abogados siguen citando casos alucinados por IA: La perspectiva de un desarrollador

Más de 1,400 casos judiciales citan precedentes inventados por IA. Los abogados siguen confiando en las alucinaciones a pesar de las sanciones. Cómo el sesgo de automatización socava el juicio profesional.

OpenClawRadar
Claude UX de Colaboración Problema: La Caja de Entrada Persistente Crea Expectativas Falsas de Continuidad
Noticias

Claude UX de Colaboración Problema: La Caja de Entrada Persistente Crea Expectativas Falsas de Continuidad

Un usuario identifica un problema de experiencia de usuario en Claude Cowork donde el cuadro de entrada de texto persistente mantiene el texto borrador al cambiar entre tareas, pero restablece el contexto y pierde los archivos adjuntos, creando señales contradictorias sobre la continuidad.

OpenClawRadar