YC-Bench: Pruebas de Referencia que Evalúan a los LLM como CEOs de Startups, GLM-5 Demuestra una Fuerte Relación Costo-Eficiencia

✍️ OpenClawRadar📅 Publicado: 13 de abril de 2026🔗 Source
YC-Bench: Pruebas de Referencia que Evalúan a los LLM como CEOs de Startups, GLM-5 Demuestra una Fuerte Relación Costo-Eficiencia
Ad

YC-Bench: Un punto de referencia de simulación de startups a largo plazo

Los investigadores han desarrollado YC-Bench, un punto de referencia donde un LLM asume el papel de director ejecutivo en un entorno de startup simulado durante un año completo, involucrando cientos de turnos de decisión. La simulación requiere gestionar empleados, seleccionar contratos, manejar nóminas y navegar un mercado donde aproximadamente el 35% de los clientes inflan secretamente los requisitos de trabajo después de aceptar la tarea. La retroalimentación es tardía y escasa, sin proporcionar asistencia a los modelos.

Resultados del punto de referencia y hallazgos clave

El punto de referencia probó 12 modelos con 3 semillas cada uno. La tabla de clasificación muestra:

  • 🥇 Claude Opus 4.6 - 1,27 millones de dólares promedio en fondos finales (~86 dólares por ejecución en costo de API)
  • 🥈 GLM-5 - 1,21 millones de dólares promedio en fondos finales (~7,62 dólares por ejecución)
  • 🥉 GPT-5.4 - 1,00 millón de dólares promedio en fondos finales (~23 dólares por ejecución)
  • Todos los demás modelos se desempeñaron por debajo del capital inicial de 200.000 dólares, con varios en bancarrota

GLM-5 se destaca como un hallazgo significativo, desempeñándose dentro del 5% de Claude Opus en rendimiento bruto mientras cuesta aproximadamente 11 veces menos por ejecución. Para pipelines de agentes en producción, esto representa una mejora sustancial en eficiencia de costos. Kimi-K2.5 de hecho lidera la tabla de ingresos por dólar de API con 2,5 veces mejor que el siguiente modelo.

Ad

Lo que el punto de referencia revela sobre las capacidades de los LLM

El punto de referencia expone la coherencia a largo plazo bajo retroalimentación tardía, una capacidad que la mayoría de las evaluaciones pasan por alto. Cuando la retroalimentación inmediata no está disponible para determinar la calidad de la decisión, la mayoría de los modelos colapsan en bucles, abandonan estrategias establecidas recientemente o continúan aceptando tareas de clientes que ya han identificado como problemáticos.

El predictor más fuerte del éxito no fue el tamaño del modelo ni las puntuaciones tradicionales de referencia, sino si el modelo usaba activamente un bloc de notas persistente para registrar información aprendida. Los modelos de mejor rendimiento reescribieron sus notas aproximadamente 34 veces por ejecución, mientras que los modelos de peor rendimiento promediaron de 0 a 2 entradas.

Recursos e implementación

El punto de referencia es completamente de código abierto con el código disponible en GitHub. El artículo proporciona metodología y resultados detallados, mientras que la tabla de clasificación muestra las clasificaciones actuales de los modelos. Los investigadores animan a otros a ejecutar sus propios modelos y están disponibles para responder consultas.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Rankings de la Tienda de Aplicaciones de Claude en 7 Países
Noticias

Rankings de la Tienda de Aplicaciones de Claude en 7 Países

Claude ocupó el puesto #1 en Estados Unidos y Canadá, #3 en Francia y Alemania, #4 en el Reino Unido, #8 en Italia y #22 en Japón en las clasificaciones de aplicaciones gratuitas de App Store capturadas simultáneamente el 1 de marzo de 2026 a las 09:00 UTC.

OpenClawRadar
OpenAI desarrolla un smartphone con IA con chips de MediaTek/Qualcomm; objetivo de producción en masa para 2028
Noticias

OpenAI desarrolla un smartphone con IA con chips de MediaTek/Qualcomm; objetivo de producción en masa para 2028

Según el analista de la cadena de suministro Ming-Chi Kuo, OpenAI está desarrollando un teléfono inteligente con IA con los socios de chips MediaTek y Qualcomm, el fabricante exclusivo Luxshare Precision y producción en masa prevista para 2028. El dispositivo está posicionado como una plataforma de agentes de IA conscientes del contexto.

OpenClawRadar
Método Simple de Auto-Destilación Mejora la Generación de Código en LLM
Noticias

Método Simple de Auto-Destilación Mejora la Generación de Código en LLM

Los investigadores demuestran que el ajuste fino de LLMs en sus propias salidas muestreadas (auto-distilación simple) mejora el rendimiento en generación de código, aumentando Qwen3-30B-Instruct del 42.4% al 55.3% en pass@1 en LiveCodeBench v6.

OpenClawRadar
OpenClaw 2026.6.5: Búsqueda Paralela Gratuita, Correcciones de Estabilidad en Todos los Ámbitos
Noticias

OpenClaw 2026.6.5: Búsqueda Paralela Gratuita, Correcciones de Estabilidad en Todos los Ámbitos

OpenClaw 2026.6.5 añade Búsqueda Paralela gratuita sin configuración, respuestas de canal más seguras, mejor recuperación de ejecuciones de agente y configuración de proveedor/modelo menos frágil.

OpenClawRadar