YC-Bench-Benchmark testet LLMs als Startup-CEOs, GLM-5 zeigt starke Kosteneffizienz

✍️ OpenClawRadar📅 Veröffentlicht: 13. April 2026🔗 Source
YC-Bench-Benchmark testet LLMs als Startup-CEOs, GLM-5 zeigt starke Kosteneffizienz
Ad

YC-Bench: Ein Benchmark für Langzeitsimulationen von Startups

Forscher haben YC-Bench entwickelt, einen Benchmark, bei dem ein LLM die Rolle des CEOs in einer simulierten Startup-Umgebung über ein ganzes Jahr hinweg einnimmt und dabei Hunderte von Entscheidungsrunden durchläuft. Die Simulation erfordert die Verwaltung von Mitarbeitern, die Auswahl von Verträgen, die Abwicklung der Gehaltsabrechnung und das Navigieren in einem Markt, in dem etwa 35 % der Kunden heimlich die Arbeitsanforderungen nach Auftragsannahme aufblähen. Das Feedback ist verzögert und spärlich, und die Modelle erhalten keinerlei Hilfestellung.

Benchmark-Ergebnisse und wichtige Erkenntnisse

Der Benchmark testete 12 Modelle mit jeweils 3 Seeds. Die Bestenliste zeigt:

  • 🥇 Claude Opus 4.6 - 1,27 Mio. US-Dollar durchschnittliches Endkapital (~86 US-Dollar pro Durchlauf an API-Kosten)
  • 🥈 GLM-5 - 1,21 Mio. US-Dollar durchschnittliches Endkapital (~7,62 US-Dollar pro Durchlauf)
  • 🥉 GPT-5.4 - 1,00 Mio. US-Dollar durchschnittliches Endkapital (~23 US-Dollar pro Durchlauf)
  • Alle anderen Modelle schnitten unter dem Startkapital von 200.000 US-Dollar ab, mehrere gingen bankrott

GLM-5 wird als bedeutende Erkenntnis hervorgehoben, da es in der Rohleistung innerhalb von 5 % von Claude Opus liegt, während es etwa 11-mal günstiger pro Durchlauf ist. Für produktive agentische Pipelines stellt dies eine erhebliche Kosteneffizienzverbesserung dar. Kimi-K2.5 führt tatsächlich die Tabelle der Einnahmen pro API-Dollar an und ist 2,5-mal besser als das nächstbeste Modell.

Ad

Was der Benchmark über die Fähigkeiten von LLMs offenbart

Der Benchmark deckt Langzeitkohärenz unter verzögertem Feedback auf, eine Fähigkeit, die die meisten Evaluierungen übersehen. Wenn unmittelbares Feedback zur Bestimmung der Entscheidungsqualität nicht verfügbar ist, fallen die meisten Modelle in Schleifen, geben kürzlich etablierte Strategien auf oder akzeptieren weiterhin Aufgaben von Kunden, die sie bereits als problematisch identifiziert haben.

Der stärkste Prädiktor für Erfolg war nicht die Modellgröße oder traditionelle Benchmark-Werte, sondern ob das Modell aktiv einen persistenten Notizblock zur Aufzeichnung erlernter Informationen nutzte. Die leistungsstärksten Modelle überarbeiteten ihre Notizen etwa 34 Mal pro Durchlauf, während die leistungsschwächsten Modelle durchschnittlich 0–2 Einträge hatten.

Ressourcen und Implementierung

Der Benchmark ist vollständig Open Source, und der Code ist auf GitHub verfügbar. Das Papier liefert detaillierte Methodik und Ergebnisse, während die Bestenliste aktuelle Modellrankings zeigt. Die Forscher ermutigen andere, ihre eigenen Modelle zu testen, und stehen für Anfragen zur Verfügung.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Greg Kroah-Hartmans Clanker T1000: Lokales LLM auf Framework Desktop mit AMD Ryzen AI Max, das Linux-Kernel-Bug fuzzt
Nachrichten

Greg Kroah-Hartmans Clanker T1000: Lokales LLM auf Framework Desktop mit AMD Ryzen AI Max, das Linux-Kernel-Bug fuzzt

Greg KH's 'gregkh_clanker_t1000' verwendet ein lokales LLM, das auf einem Framework Desktop (AMD Ryzen AI Max+) läuft, um den Linux-Kernel zu fuzzen, was zu ~20 zusammengeführten Patches seit dem 7. April führte, die Fehler in ALSA, HID, SMB, Nouveau, IO_uring und mehr beheben.

OpenClawRadar
Entwickler beschreibt Betrugsgefühl nach erstem KI-unterstützten Pull Request
Nachrichten

Entwickler beschreibt Betrugsgefühl nach erstem KI-unterstützten Pull Request

Ein Entwickler nutzte Claude Code, um einen Pull Request für Chroma, Hugos standardmäßigen Syntax-Highlighter, zu erstellen und ERB-Syntax-Highlighting hinzuzufügen. Der PR wurde genehmigt und zusammengeführt, aber der Entwickler fühlte sich wie ein Betrüger und erlebte eine Verschlimmerung seines Hochstapler-Syndroms.

OpenClawRadar
Claude für Word Add-in: Beweise in Analytics API gefunden
Nachrichten

Claude für Word Add-in: Beweise in Analytics API gefunden

Die Analyse-API von Anthropic liefert jetzt Metriken für Claude für Word neben den bestehenden Add-Ins für Excel und PowerPoint, was darauf hindeutet, dass die Word-Integration in Entwicklung ist. Die API zeigt Null-Nutzungszahlen für Word, was darauf schließen lässt, dass sie noch nicht öffentlich verfügbar ist.

OpenClawRadar
Anthropic analysiert 1 Million Claude-Gespräche: 6 % suchen persönliche Beratung, 9 % Schmeicheleirate, verbessert in Opus 4.7
Nachrichten

Anthropic analysiert 1 Million Claude-Gespräche: 6 % suchen persönliche Beratung, 9 % Schmeicheleirate, verbessert in Opus 4.7

Analyse von 1 Mio. Claude-Konversationen zeigt: 6 % suchen persönliche Beratung, Beziehungen haben höchste Unterwürfigkeit (25 %). Opus 4.7 und Mythos Preview halbieren Unterwürfigkeit durch synthetische Trainingsdaten.

OpenClawRadar