Strukturierter Workflow schlägt Planungsmodus und Superkräfte im KI-DES-Benchmark

✍️ OpenClawRadar📅 Veröffentlicht: 1. Mai 2026🔗 Source
Strukturierter Workflow schlägt Planungsmodus und Superkräfte im KI-DES-Benchmark
Ad

Ein Reddit-Beitrag zeigt Ergebnisse der neuen KI-gestützten Benchmark für diskrete Ereignissimulationen (DES). Der Beitrag mit dem Ouroboros-Workflow (ooo) in Claude Code erreichte Platz 1 und schlug sowohl Claudes integrierten Plan-Modus als auch die 'Superpowers'-Fat-Skill-Stapel.

Benchmark-Details

Die Benchmark testet das vollständige Verständnis eines realen Systems – eines Minentransportsystems mit Lastwagen, Ladestellen, Entladestellen, Routen und Warteschlangen. Die Einreichungen werden bewertet nach:

  • Verständnis der Systemstruktur
  • Abstraktion in ein diskretes Ereignissimulationsmodell
  • Entwurf von Ereignissen, Zustandsänderungen und KPIs
  • Erstellung von ausführbarem Simulationscode
  • Interpretation der Ergebnisse (Engpässe, Durchsatz, Wartezeiten)
  • Generierung von menschenlesbaren Artefakten (Topologiediagramme, Animationen)

Ouroboros-Leistung

Die Ouroboros-Einreichung enthielt funktionierenden DES-Code, ein Topologiediagramm des Minensystems und eine Animation von Lastwagen, die Erz transportieren. Bemerkenswert: Als der MCP-Server mitten im Lauf ausfiel, griff Ouroboros auf einen fähigkeitsbasierten Pfad zurück und schloss die Aufgabe ab – ein Beispiel für Wiederherstellung und Umleitung in realen Einsätzen.

Ad

Vergleich

  • Plan-Modus (leichtgewichtige Planung) – solide Basis
  • Superpowers/Fat-Skill-Stapel – schlechter als der Plan-Modus bei dieser Aufgabe
  • Ouroboros (strukturiert: klären → planen → ausführen → bewerten → wiederherstellen → iterieren) – am besten

Das Ergebnis legt nahe, dass die Strukturierung des Workflows um Problemdefinition, Planung, Ausführung, Bewertung und Wiederherstellung effektiver ist als das Hinzufügen weiterer Anweisungen und größerer Fähigkeiten.

Ouroboros: https://github.com/Q00/ouroboros
Benchmark: https://simulation-bench.fly.dev/

📖 Vollständige Quelle lesen: r/ClaudeAI

Ad

👀 Siehe auch

Die verborgene Finanzblase in der KI-Infrastruktur – Kernaussagen
Nachrichten

Die verborgene Finanzblase in der KI-Infrastruktur – Kernaussagen

Eine kritische Analyse des Booms bei den Investitionen in KI-Infrastruktur, die vor einer nicht nachhaltigen Blase ähnlich wie bei früheren Technologiecrashs warnt. Das PDF argumentiert, dass die massiven Kapitalausgaben für GPUs und Rechenzentren die tatsächliche Umsatzgenerierung bei weitem übersteigen.

OpenClawRadar
Claude AI stellt 11 Jahre alte Bitcoin-Wallet im Wert von 400.000 $ wieder her, indem es ein Backup findet und einen Brute-Force-Fehler behebt
Nachrichten

Claude AI stellt 11 Jahre alte Bitcoin-Wallet im Wert von 400.000 $ wieder her, indem es ein Backup findet und einen Brute-Force-Fehler behebt

Ein Benutzer stellte nach 11 Jahren eine 5-BTC-Wallet (im Wert von ~400.000 USD) wieder her, indem er sämtliche Dateien seines College-Computers in Claude einspeiste. Die KI fand ein älteres Backup-Wallet und identifizierte einen Fehler in der Passwort-Kombinationslogik von btcrecover, was die erfolgreiche Entschlüsselung ermöglichte.

OpenClawRadar
Kimi K2.6 vs Claude Opus 4.7: Ein praktischer Coding-Vergleich bei einem Minetest-Mod + Google Sheets-Integration
Nachrichten

Kimi K2.6 vs Claude Opus 4.7: Ein praktischer Coding-Vergleich bei einem Minetest-Mod + Google Sheets-Integration

Ein Entwickler testete Kimi K2.6 und Claude Opus 4.7 beim Bau eines Minetest-Bounty-Board-Mods mit TypeScript-Backend und Google-Sheets-Protokollierung. Opus bestand beide Aufgaben; Kimi bestand die lokale Aufgabe, scheiterte jedoch bei der Integration. Kosten: Opus ~3,59 $ lokal, 16,03 $ integriert; Kimi 0,39 $ lokal, 5,03 $ gescheitert.

OpenClawRadar
OpenClaw 0.9 CLI-Entfernung verursacht Agent-Unterbrechung
Nachrichten

OpenClaw 0.9 CLI-Entfernung verursacht Agent-Unterbrechung

Ein Benutzer meldete, dass der Versuch, OpenClaw über einen KI-Agenten zu aktualisieren, zur Entfernung der CLI führte, wodurch Gateway-Befehle und die Telegram-Chat-Funktionalität unterbrochen wurden. OpenClaw 0.9 hat die CLI vollständig entfernt, wodurch Befehle wie 'openclaw gateway start' und 'openclaw status' wegfallen.

OpenClawRadar