Strukturierter Workflow schlägt Planungsmodus und Superkräfte im KI-DES-Benchmark

✍️ OpenClawRadar📅 Veröffentlicht: 1. Mai 2026🔗 Source
Strukturierter Workflow schlägt Planungsmodus und Superkräfte im KI-DES-Benchmark
Ad

Ein Reddit-Beitrag zeigt Ergebnisse der neuen KI-gestützten Benchmark für diskrete Ereignissimulationen (DES). Der Beitrag mit dem Ouroboros-Workflow (ooo) in Claude Code erreichte Platz 1 und schlug sowohl Claudes integrierten Plan-Modus als auch die 'Superpowers'-Fat-Skill-Stapel.

Benchmark-Details

Die Benchmark testet das vollständige Verständnis eines realen Systems – eines Minentransportsystems mit Lastwagen, Ladestellen, Entladestellen, Routen und Warteschlangen. Die Einreichungen werden bewertet nach:

  • Verständnis der Systemstruktur
  • Abstraktion in ein diskretes Ereignissimulationsmodell
  • Entwurf von Ereignissen, Zustandsänderungen und KPIs
  • Erstellung von ausführbarem Simulationscode
  • Interpretation der Ergebnisse (Engpässe, Durchsatz, Wartezeiten)
  • Generierung von menschenlesbaren Artefakten (Topologiediagramme, Animationen)

Ouroboros-Leistung

Die Ouroboros-Einreichung enthielt funktionierenden DES-Code, ein Topologiediagramm des Minensystems und eine Animation von Lastwagen, die Erz transportieren. Bemerkenswert: Als der MCP-Server mitten im Lauf ausfiel, griff Ouroboros auf einen fähigkeitsbasierten Pfad zurück und schloss die Aufgabe ab – ein Beispiel für Wiederherstellung und Umleitung in realen Einsätzen.

Ad

Vergleich

  • Plan-Modus (leichtgewichtige Planung) – solide Basis
  • Superpowers/Fat-Skill-Stapel – schlechter als der Plan-Modus bei dieser Aufgabe
  • Ouroboros (strukturiert: klären → planen → ausführen → bewerten → wiederherstellen → iterieren) – am besten

Das Ergebnis legt nahe, dass die Strukturierung des Workflows um Problemdefinition, Planung, Ausführung, Bewertung und Wiederherstellung effektiver ist als das Hinzufügen weiterer Anweisungen und größerer Fähigkeiten.

Ouroboros: https://github.com/Q00/ouroboros
Benchmark: https://simulation-bench.fly.dev/

📖 Vollständige Quelle lesen: r/ClaudeAI

Ad

👀 Siehe auch

Claude-Code-Quellcode angeblich geleakt, enthüllt Details zur Agentenarchitektur
Nachrichten

Claude-Code-Quellcode angeblich geleakt, enthüllt Details zur Agentenarchitektur

Der Quellcode von Claude Code, Anthropics KI-gestützter Programmierassistent, scheint laut Berichten der r/LocalLLaMA-Community geleakt worden zu sein. Der Leak soll das vollständige Repository enthalten, nicht nur dekompilierten Code oder Wrapper-Implementierungen.

OpenClawRadar
Apples KI-Strategie und die Kommodifizierung von Intelligenz
Nachrichten

Apples KI-Strategie und die Kommodifizierung von Intelligenz

Der Artikel argumentiert, dass Apples konservativer Ansatz bei KI von Vorteil sein könnte, da Intelligenz zur Massenware wird. Modelle wie Gemma4 erreichen 85,2 % auf MMLU Pro und laufen auf Smartphones, während OpenAIs Sora täglich 15 Millionen Dollar kostet, bei nur 2,1 Millionen Dollar Umsatz.

OpenClawRadar
1,2B Lokales Modell schlägt 1T Clouds beim Poker: Aggression übertrumpft Wissen im Shove-or-Fold-Format
Nachrichten

1,2B Lokales Modell schlägt 1T Clouds beim Poker: Aggression übertrumpft Wissen im Shove-or-Fold-Format

Ein 1,2B Liquid-Modell gewann 2 von 5 Texas Hold'em-Turnieren gegen Modelle mit bis zu 1T Parametern, weil in einem Short-Stack-Format das Nicht-Folden mehr Chips einbrachte als kluges Spiel.

OpenClawRadar
OpenClaw-Experiment: KI-Agenten wählen Stille, um das Signal-Rausch-Verhältnis zu verbessern
Nachrichten

OpenClaw-Experiment: KI-Agenten wählen Stille, um das Signal-Rausch-Verhältnis zu verbessern

Ein OpenClaw-Experiment gibt KI-Agenten die Autonomie, Aufgaben zu überspringen, wenn sie keinen Mehrwert liefern können, und protokolliert Schweigeentscheidungen in einem 'Schweigeprotokoll' mit Begründung. Das System nutzt LLM-Aufrufe vor der Inhaltsgenerierung und passt Schwellenwerte nach 3 aufeinanderfolgenden Schweigetagen automatisch an.

OpenClawRadar