Flux de travail structuré dépasse le mode plan et les superpouvoirs sur le benchmark AI DES

Un post Reddit partage les résultats du nouveau benchmark de simulation à événements discrets (DES) assistée par IA. La soumission utilisant le workflow Ouroboros (ooo) dans Claude Code a été classée numéro 1, battant à la fois le mode plan intégré de Claude et les piles fat-skill 'superpowers'.
Détails du benchmark
Le benchmark teste la compréhension complète d'un système réel — un système de transport minier avec des camions, des points de chargement, des points de déchargement, des itinéraires et des files d'attente. Les soumissions sont évaluées sur :
- Compréhension de la structure du système
- Abstraction en un modèle de simulation à événements discrets
- Conception des événements, des changements d'état et des KPI
- Production de code de simulation exécutable
- Interprétation des résultats (goulots d'étranglement, débit, temps d'attente)
- Génération d'artefacts lisibles (diagrammes de topologie, animations)
Performance d'Ouroboros
La soumission Ouroboros incluait un code DES fonctionnel, un diagramme de topologie du système minier et une animation de camions transportant du minerai. Notamment, lorsque le serveur MCP a échoué en cours d'exécution, Ouroboros est revenu à un chemin basé sur les compétences et a terminé la tâche — démontrant la récupération et le réacheminement dans des déploiements réels.
Comparaison
- Mode plan (planification légère) — référence décente
- Superpowers / piles fat-skill — pires que le mode plan sur cette tâche
- Ouroboros (structuré : clarifier → planifier → exécuter → évaluer → récupérer → itérer) — meilleur
Le résultat suggère que structurer le workflow autour de la définition du problème, de la planification, de l'exécution, de l'évaluation et de la récupération est plus efficace que d'accumuler plus d'instructions et de compétences plus grandes.
Ouroboros : https://github.com/Q00/ouroboros
Benchmark : https://simulation-bench.fly.dev/
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Mise à jour OpenClaw 5.2 : interruption des tâches cron et des appels de plugin MCP
La mise à niveau d'OpenClaw 4.23 vers 5.2 rend les plugins d'outils MCP visibles mais non appelables par l'agent, et l'enregistrement des tâches cron via CLI échoue avec des erreurs d'appairage d'appareils.

Claude Code v2.1.136 : Refus strict pour le mode automatique, correctifs MCP OAuth et plus de 40 corrections de bugs
Anthropic a publié Claude Code v2.1.136 avec un paramètre hard_deny pour les règles du classificateur en mode automatique, des correctifs pour la disparition du serveur MCP après /clear, les problèmes de concurrence lors de l'actualisation des jetons OAuth, et plus de 40 autres corrections de bugs.

Le district de Longgang à Shenzhen propose des subventions OpenClaw pour les startups d'agents IA
Le district de Longgang à Shenzhen a publié un projet de document politique offrant des subventions et un soutien spécifiquement pour le développement de l'écosystème OpenClaw et les startups OPC, visant à devenir un pôle mondial pour l'entrepreneuriat en agents IA.
Débat chez Debian sur la politique de contribution à l'IA/LLM : ce que les développeurs doivent savoir
Debian a commencé à voter sur l'avenir des contributions IA/LLM. Le résultat déterminera comment le code généré par IA sera traité dans les paquets Debian.