Strukturierter Workflow schlägt Planungsmodus und Superkräfte im KI-DES-Benchmark

Ein Reddit-Beitrag zeigt Ergebnisse der neuen KI-gestützten Benchmark für diskrete Ereignissimulationen (DES). Der Beitrag mit dem Ouroboros-Workflow (ooo) in Claude Code erreichte Platz 1 und schlug sowohl Claudes integrierten Plan-Modus als auch die 'Superpowers'-Fat-Skill-Stapel.
Benchmark-Details
Die Benchmark testet das vollständige Verständnis eines realen Systems – eines Minentransportsystems mit Lastwagen, Ladestellen, Entladestellen, Routen und Warteschlangen. Die Einreichungen werden bewertet nach:
- Verständnis der Systemstruktur
- Abstraktion in ein diskretes Ereignissimulationsmodell
- Entwurf von Ereignissen, Zustandsänderungen und KPIs
- Erstellung von ausführbarem Simulationscode
- Interpretation der Ergebnisse (Engpässe, Durchsatz, Wartezeiten)
- Generierung von menschenlesbaren Artefakten (Topologiediagramme, Animationen)
Ouroboros-Leistung
Die Ouroboros-Einreichung enthielt funktionierenden DES-Code, ein Topologiediagramm des Minensystems und eine Animation von Lastwagen, die Erz transportieren. Bemerkenswert: Als der MCP-Server mitten im Lauf ausfiel, griff Ouroboros auf einen fähigkeitsbasierten Pfad zurück und schloss die Aufgabe ab – ein Beispiel für Wiederherstellung und Umleitung in realen Einsätzen.
Vergleich
- Plan-Modus (leichtgewichtige Planung) – solide Basis
- Superpowers/Fat-Skill-Stapel – schlechter als der Plan-Modus bei dieser Aufgabe
- Ouroboros (strukturiert: klären → planen → ausführen → bewerten → wiederherstellen → iterieren) – am besten
Das Ergebnis legt nahe, dass die Strukturierung des Workflows um Problemdefinition, Planung, Ausführung, Bewertung und Wiederherstellung effektiver ist als das Hinzufügen weiterer Anweisungen und größerer Fähigkeiten.
Ouroboros: https://github.com/Q00/ouroboros
Benchmark: https://simulation-bench.fly.dev/
📖 Vollständige Quelle lesen: r/ClaudeAI
👀 Siehe auch

Die verborgene Finanzblase in der KI-Infrastruktur – Kernaussagen
Eine kritische Analyse des Booms bei den Investitionen in KI-Infrastruktur, die vor einer nicht nachhaltigen Blase ähnlich wie bei früheren Technologiecrashs warnt. Das PDF argumentiert, dass die massiven Kapitalausgaben für GPUs und Rechenzentren die tatsächliche Umsatzgenerierung bei weitem übersteigen.

Claude AI stellt 11 Jahre alte Bitcoin-Wallet im Wert von 400.000 $ wieder her, indem es ein Backup findet und einen Brute-Force-Fehler behebt
Ein Benutzer stellte nach 11 Jahren eine 5-BTC-Wallet (im Wert von ~400.000 USD) wieder her, indem er sämtliche Dateien seines College-Computers in Claude einspeiste. Die KI fand ein älteres Backup-Wallet und identifizierte einen Fehler in der Passwort-Kombinationslogik von btcrecover, was die erfolgreiche Entschlüsselung ermöglichte.

Kimi K2.6 vs Claude Opus 4.7: Ein praktischer Coding-Vergleich bei einem Minetest-Mod + Google Sheets-Integration
Ein Entwickler testete Kimi K2.6 und Claude Opus 4.7 beim Bau eines Minetest-Bounty-Board-Mods mit TypeScript-Backend und Google-Sheets-Protokollierung. Opus bestand beide Aufgaben; Kimi bestand die lokale Aufgabe, scheiterte jedoch bei der Integration. Kosten: Opus ~3,59 $ lokal, 16,03 $ integriert; Kimi 0,39 $ lokal, 5,03 $ gescheitert.

OpenClaw 0.9 CLI-Entfernung verursacht Agent-Unterbrechung
Ein Benutzer meldete, dass der Versuch, OpenClaw über einen KI-Agenten zu aktualisieren, zur Entfernung der CLI führte, wodurch Gateway-Befehle und die Telegram-Chat-Funktionalität unterbrochen wurden. OpenClaw 0.9 hat die CLI vollständig entfernt, wodurch Befehle wie 'openclaw gateway start' und 'openclaw status' wegfallen.