Flux de travail structuré dépasse le mode plan et les superpouvoirs sur le benchmark AI DES

✍️ OpenClawRadar📅 Publié: May 1, 2026🔗 Source
Flux de travail structuré dépasse le mode plan et les superpouvoirs sur le benchmark AI DES
Ad

Un post Reddit partage les résultats du nouveau benchmark de simulation à événements discrets (DES) assistée par IA. La soumission utilisant le workflow Ouroboros (ooo) dans Claude Code a été classée numéro 1, battant à la fois le mode plan intégré de Claude et les piles fat-skill 'superpowers'.

Détails du benchmark

Le benchmark teste la compréhension complète d'un système réel — un système de transport minier avec des camions, des points de chargement, des points de déchargement, des itinéraires et des files d'attente. Les soumissions sont évaluées sur :

  • Compréhension de la structure du système
  • Abstraction en un modèle de simulation à événements discrets
  • Conception des événements, des changements d'état et des KPI
  • Production de code de simulation exécutable
  • Interprétation des résultats (goulots d'étranglement, débit, temps d'attente)
  • Génération d'artefacts lisibles (diagrammes de topologie, animations)
Ad

Performance d'Ouroboros

La soumission Ouroboros incluait un code DES fonctionnel, un diagramme de topologie du système minier et une animation de camions transportant du minerai. Notamment, lorsque le serveur MCP a échoué en cours d'exécution, Ouroboros est revenu à un chemin basé sur les compétences et a terminé la tâche — démontrant la récupération et le réacheminement dans des déploiements réels.

Comparaison

  • Mode plan (planification légère) — référence décente
  • Superpowers / piles fat-skill — pires que le mode plan sur cette tâche
  • Ouroboros (structuré : clarifier → planifier → exécuter → évaluer → récupérer → itérer) — meilleur

Le résultat suggère que structurer le workflow autour de la définition du problème, de la planification, de l'exécution, de l'évaluation et de la récupération est plus efficace que d'accumuler plus d'instructions et de compétences plus grandes.

Ouroboros : https://github.com/Q00/ouroboros
Benchmark : https://simulation-bench.fly.dev/

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

Mise à jour OpenClaw 5.2 : interruption des tâches cron et des appels de plugin MCP
News

Mise à jour OpenClaw 5.2 : interruption des tâches cron et des appels de plugin MCP

La mise à niveau d'OpenClaw 4.23 vers 5.2 rend les plugins d'outils MCP visibles mais non appelables par l'agent, et l'enregistrement des tâches cron via CLI échoue avec des erreurs d'appairage d'appareils.

OpenClawRadar
Claude Code v2.1.136 : Refus strict pour le mode automatique, correctifs MCP OAuth et plus de 40 corrections de bugs
News

Claude Code v2.1.136 : Refus strict pour le mode automatique, correctifs MCP OAuth et plus de 40 corrections de bugs

Anthropic a publié Claude Code v2.1.136 avec un paramètre hard_deny pour les règles du classificateur en mode automatique, des correctifs pour la disparition du serveur MCP après /clear, les problèmes de concurrence lors de l'actualisation des jetons OAuth, et plus de 40 autres corrections de bugs.

OpenClawRadar
Le district de Longgang à Shenzhen propose des subventions OpenClaw pour les startups d'agents IA
News

Le district de Longgang à Shenzhen propose des subventions OpenClaw pour les startups d'agents IA

Le district de Longgang à Shenzhen a publié un projet de document politique offrant des subventions et un soutien spécifiquement pour le développement de l'écosystème OpenClaw et les startups OPC, visant à devenir un pôle mondial pour l'entrepreneuriat en agents IA.

OpenClawRadar
🦀
News

Débat chez Debian sur la politique de contribution à l'IA/LLM : ce que les développeurs doivent savoir

Debian a commencé à voter sur l'avenir des contributions IA/LLM. Le résultat déterminera comment le code généré par IA sera traité dans les paquets Debian.

OpenClawRadar