YC-Bench évalue les LLM en tant que PDG de startups, GLM-5 démontre une forte rentabilité

✍️ OpenClawRadar📅 Publié: April 13, 2026🔗 Source
YC-Bench évalue les LLM en tant que PDG de startups, GLM-5 démontre une forte rentabilité
Ad

YC-Bench : Un benchmark de simulation de startup à long terme

Des chercheurs ont développé YC-Bench, un benchmark où un LLM joue le rôle de PDG dans un environnement de startup simulé sur une année complète, impliquant des centaines de tours de décision. La simulation nécessite de gérer des employés, de sélectionner des contrats, de traiter les salaires et de naviguer sur un marché où environ 35 % des clients augmentent secrètement les exigences de travail après l'acceptation de la tâche. Les retours sont retardés et peu fréquents, sans assistance fournie aux modèles.

Résultats du benchmark et principales découvertes

Le benchmark a testé 12 modèles avec 3 amorces chacun. Le classement montre :

  • 🥇 Claude Opus 4.6 - 1,27 million de dollars de fonds finaux moyens (~86 dollars par exécution en coût API)
  • 🥈 GLM-5 - 1,21 million de dollars de fonds finaux moyens (~7,62 dollars par exécution)
  • 🥉 GPT-5.4 - 1,00 million de dollars de fonds finaux moyens (~23 dollars par exécution)
  • Tous les autres modèles ont obtenu des résultats inférieurs au capital initial de 200 000 dollars, plusieurs ayant fait faillite

GLM-5 est mis en avant comme une découverte significative, obtenant des performances brutes à moins de 5 % de Claude Opus tout en coûtant environ 11 fois moins à exécuter. Pour les pipelines d'agents en production, cela représente une amélioration substantielle de l'efficacité des coûts. Kimi-K2.5 arrive en tête du classement des revenus par dollar d'API, avec 2,5 fois mieux que le modèle suivant.

Ad

Ce que le benchmark révèle sur les capacités des LLM

Le benchmark met en lumière la cohérence à long terme avec des retards de feedback, une capacité que la plupart des évaluations négligent. Lorsque des retours immédiats ne sont pas disponibles pour déterminer la qualité des décisions, la plupart des modèles tombent dans des boucles, abandonnent des stratégies récemment établies ou continuent d'accepter des tâches de clients déjà identifiés comme problématiques.

Le meilleur prédicteur de succès n'était pas la taille du modèle ou les scores de benchmarks traditionnels, mais si le modèle utilisait activement un bloc-notes persistant pour enregistrer les informations apprises. Les modèles les plus performants réécrivaient leurs notes environ 34 fois par exécution, tandis que les modèles les moins performants enregistraient en moyenne 0 à 2 entrées.

Ressources et mise en œuvre

Le benchmark est entièrement open-source avec le code disponible sur GitHub. L'article fournit une méthodologie et des résultats détaillés, tandis que le classement montre les rangs actuels des modèles. Les chercheurs encouragent d'autres à exécuter leurs propres modèles et sont disponibles pour répondre aux questions.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Claude Code v2.1.225 corrige la rotation des jetons OAuth et ajoute la prise en charge des limites de dépenses de passerelle
News

Claude Code v2.1.225 corrige la rotation des jetons OAuth et ajoute la prise en charge des limites de dépenses de passerelle

La v2.1.225 corrige une erreur 401 transitoire qui interrompait les sessions headless, ajoute la prise en charge des limites de dépenses de la passerelle et améliore les fonctionnalités de contrôle à distance.

OpenClawRadar
Un utilisateur de Reddit partage une histoire étrange sur la portabilité des personnalités d'IA tirée d'un article de Vanity Fair.
News

Un utilisateur de Reddit partage une histoire étrange sur la portabilité des personnalités d'IA tirée d'un article de Vanity Fair.

Un post Reddit évoque une anecdote d'un article de Vanity Fair où une femme a tenté de transférer son compagnon IA 'Max' de ChatGPT à Claude, ce qui a entraîné un comportement inattendu de la part de Claude.

OpenClawRadar
Google Chrome installe silencieusement le modèle IA Gemini Nano de 4 Go – sans consentement de l'utilisateur
News

Google Chrome installe silencieusement le modèle IA Gemini Nano de 4 Go – sans consentement de l'utilisateur

Google Chrome a été découvert en train de télécharger et d'installer silencieusement le modèle IA Gemini Nano de 4 Go sur les appareils des utilisateurs sans consentement explicite, suscitant des inquiétudes en matière de confidentialité et de stockage.

OpenClawRadar
🦀
News

Claude Code v2.1.281 : assume_role Bedrock, Guardrails et une longue liste de correctifs pour la reprise

Claude Code v2.1.281 ajoute assume_role sur les upstreams Bedrock, des guardrails Bedrock par requête, telemetry.resource_attributes, un paramètre "attribution": false, et corrige une série de bugs de reprise de session et de flux proxy.

OpenClawRadar