Strukturierter Workflow schlägt Planungsmodus und Superkräfte im KI-DES-Benchmark

Ein Reddit-Beitrag zeigt Ergebnisse der neuen KI-gestützten Benchmark für diskrete Ereignissimulationen (DES). Der Beitrag mit dem Ouroboros-Workflow (ooo) in Claude Code erreichte Platz 1 und schlug sowohl Claudes integrierten Plan-Modus als auch die 'Superpowers'-Fat-Skill-Stapel.
Benchmark-Details
Die Benchmark testet das vollständige Verständnis eines realen Systems – eines Minentransportsystems mit Lastwagen, Ladestellen, Entladestellen, Routen und Warteschlangen. Die Einreichungen werden bewertet nach:
- Verständnis der Systemstruktur
- Abstraktion in ein diskretes Ereignissimulationsmodell
- Entwurf von Ereignissen, Zustandsänderungen und KPIs
- Erstellung von ausführbarem Simulationscode
- Interpretation der Ergebnisse (Engpässe, Durchsatz, Wartezeiten)
- Generierung von menschenlesbaren Artefakten (Topologiediagramme, Animationen)
Ouroboros-Leistung
Die Ouroboros-Einreichung enthielt funktionierenden DES-Code, ein Topologiediagramm des Minensystems und eine Animation von Lastwagen, die Erz transportieren. Bemerkenswert: Als der MCP-Server mitten im Lauf ausfiel, griff Ouroboros auf einen fähigkeitsbasierten Pfad zurück und schloss die Aufgabe ab – ein Beispiel für Wiederherstellung und Umleitung in realen Einsätzen.
Vergleich
- Plan-Modus (leichtgewichtige Planung) – solide Basis
- Superpowers/Fat-Skill-Stapel – schlechter als der Plan-Modus bei dieser Aufgabe
- Ouroboros (strukturiert: klären → planen → ausführen → bewerten → wiederherstellen → iterieren) – am besten
Das Ergebnis legt nahe, dass die Strukturierung des Workflows um Problemdefinition, Planung, Ausführung, Bewertung und Wiederherstellung effektiver ist als das Hinzufügen weiterer Anweisungen und größerer Fähigkeiten.
Ouroboros: https://github.com/Q00/ouroboros
Benchmark: https://simulation-bench.fly.dev/
📖 Vollständige Quelle lesen: r/ClaudeAI
👀 Siehe auch

Claude-Code-Quellcode angeblich geleakt, enthüllt Details zur Agentenarchitektur
Der Quellcode von Claude Code, Anthropics KI-gestützter Programmierassistent, scheint laut Berichten der r/LocalLLaMA-Community geleakt worden zu sein. Der Leak soll das vollständige Repository enthalten, nicht nur dekompilierten Code oder Wrapper-Implementierungen.

Apples KI-Strategie und die Kommodifizierung von Intelligenz
Der Artikel argumentiert, dass Apples konservativer Ansatz bei KI von Vorteil sein könnte, da Intelligenz zur Massenware wird. Modelle wie Gemma4 erreichen 85,2 % auf MMLU Pro und laufen auf Smartphones, während OpenAIs Sora täglich 15 Millionen Dollar kostet, bei nur 2,1 Millionen Dollar Umsatz.

1,2B Lokales Modell schlägt 1T Clouds beim Poker: Aggression übertrumpft Wissen im Shove-or-Fold-Format
Ein 1,2B Liquid-Modell gewann 2 von 5 Texas Hold'em-Turnieren gegen Modelle mit bis zu 1T Parametern, weil in einem Short-Stack-Format das Nicht-Folden mehr Chips einbrachte als kluges Spiel.

OpenClaw-Experiment: KI-Agenten wählen Stille, um das Signal-Rausch-Verhältnis zu verbessern
Ein OpenClaw-Experiment gibt KI-Agenten die Autonomie, Aufgaben zu überspringen, wenn sie keinen Mehrwert liefern können, und protokolliert Schweigeentscheidungen in einem 'Schweigeprotokoll' mit Begründung. Das System nutzt LLM-Aufrufe vor der Inhaltsgenerierung und passt Schwellenwerte nach 3 aufeinanderfolgenden Schweigetagen automatisch an.