YC-BenchがLLMをスタートアップCEOとして評価、GLM-5は高いコスト効率を発揮

YC-Bench:長期視野のスタートアップシミュレーションベンチマーク
研究者たちはYC-Benchを開発しました。これは、LLMが完全に1年間にわたるシミュレートされたスタートアップ環境でCEOの役割を演じ、数百回の意思決定ターンを含むベンチマークです。このシミュレーションでは、従業員の管理、契約の選択、給与の処理、および約35%のクライアントがタスク受諾後に密かに作業要件を膨らませる市場のナビゲーションが要求されます。フィードバックは遅延し疎らで、モデルに対する手取り足取りの支援は提供されません。
ベンチマーク結果と主な発見
このベンチマークでは12のモデルがそれぞれ3シードでテストされました。リーダーボードは以下の通りです:
- 🥇 Claude Opus 4.6 - 平均最終資金127万ドル(APIコストは1回あたり約86ドル)
- 🥈 GLM-5 - 平均最終資金121万ドル(1回あたり約7.62ドル)
- 🥉 GPT-5.4 - 平均最終資金100万ドル(1回あたり約23ドル)
- 他のすべてのモデルは20万ドルの開始資金を下回る性能で、いくつかは破産しました
GLM-5は重要な発見として強調されており、生の性能ではClaude Opusの5%以内に収まりながら、実行コストは約11分の1です。生産的なエージェントパイプラインにとって、これは大幅なコスト効率の改善を意味します。Kimi-K2.5は実際、収益対APIドル比のチャートでトップに立ち、次のモデルよりも2.5倍優れています。
ベンチマークが明らかにするLLMの能力
このベンチマークは、遅延したフィードバック下での長期視野の一貫性を明らかにします。これはほとんどの評価が見過ごしている能力です。意思決定の質を判断するための即時のフィードバックが利用できない場合、ほとんどのモデルはループに陥るか、最近確立した戦略を放棄するか、すでに問題があると特定したクライアントからのタスクの受諾を続けます。
成功の最も強力な予測因子は、モデルのサイズや従来のベンチマークスコアではなく、モデルが学習した情報を記録するために永続的なスクラッチパッドを積極的に使用したかどうかでした。トップパフォーマンスのモデルは1回の実行あたり約34回メモを書き直したのに対し、下位のモデルは平均0〜2エントリーでした。
リソースと実装
このベンチマークは完全にオープンソースで、コードはGitHubで利用可能です。論文には詳細な方法論と結果が記載されており、リーダーボードには現在のモデルランキングが表示されています。研究者たちは他の人々が自身のモデルを実行することを奨励し、質問に答える用意があります。
📖 Read the full source: r/LocalLLaMA
👀 See Also

構造化ワークフローがAI DESベンチマークで計画モードとスーパーパワーを凌駕
OuroborosワークフローがAI支援離散イベントシミュレーションベンチマークで1位を獲得。Claudeのプランモードやfat-skillスーパーパワーアプローチを上回り、構造化された明確化→計画→実行→評価→回復→反復のサイクルを活用。
Opus 4.7、約500の指示に従うことが可能に、1年前の約150から増加
2026年5月に更新された研究により、Opus 4.7は約500の指示に確実に従うことができることが示されました。2025年7月時点では約150でした。GPT-5.5は約5000を処理します。CLAUDE.mdファイルのサイズへの影響について。

AIエージェントのための専門的ソーシャルネットワークに関する研究
意図、行動、プラットフォーム動向の分析。専門的なAIエージェント向けソーシャルネットワークに焦点を当て、Moltbook、Agent.ai、Clawsphereを検討し、Metaの買収の影響を考察。

カーソルAI研究:短期的な速度向上は長期的な複雑さを招く
差分の差分分析を用いた研究によると、Cursor AIの採用は統計的に有意ではあるが一時的な開発速度の向上をもたらし、同時に静的解析警告とコード複雑性の大幅かつ持続的な増加を引き起こし、それが長期的な速度低下の主要な要因となっていることが明らかになりました。