Exécuteur de benchmarks open-source pour tester les agents OpenClaw sur des workflows réels

Un utilisateur de Reddit a publié un outil open-source appelé personal_agent_eval (repo : github.com/javiersgjavi/personal_agent_eval) pour évaluer les agents OpenClaw sur des flux de travail réalistes et désordonnés — et non sur des ensembles de données publics factices.
Flux de travail
Définissez des cas de test sous forme de fichiers YAML contenant :
- Messages d'entrée
- Artéfacts attendus
- Critères d'évaluation
- Vérifications déterministes
- Profils d'exécution et profils de jugement
L'exécuteur lance les cas sur une instance OpenClaw réelle, stocke les sorties, évalue les exécutions et génère des rapports et des graphiques.
Fonctionnalité clé : Importation d'espace de travail réel
Vous pouvez importer votre espace de travail OpenClaw réel — y compris la mémoire, les compétences, les fichiers, les invites et le contexte — au lieu d'une imitation simplifiée. L'agent s'exécute dans une véritable instance OpenClaw, testant exactement l'agent que vous utilisez quotidiennement.
Ensembles d'évaluation privés
L'auteur ne publie explicitement pas ses ensembles d'évaluation privés pour éviter que les benchmarks publics ne deviennent obsolètes. Cependant, le repo inclut des cas d'exemple, des configurations, des profils d'évaluation, des vérifications déterministes et la génération de graphiques pour que vous puissiez construire votre propre suite privée.
SKILL.md pour l'assistance à l'agent
Un fichier SKILL.md dans le repo est conçu pour donner à un agent suffisamment de contexte pour vous aider à définir de nouveaux cas de benchmark, profils d'exécution, critères d'évaluation et vérifications déterministes — réduisant l'édition manuelle.
Exemples de résultats (exécution privée de l'auteur)
L'auteur a partagé une comparaison sur une seule exécution (métrique non précisée, probablement moyenne pondérée 0-10) :
Claude Opus 4.6 - 9.44 GLM 5.1 - 9.31 GPT-5.5 - 9.31 Claude Sonnet 4.6 - 9.25 DeepSeek V4 Flash - 8.61 Gemma 4 31B - 8.39 DeepSeek V4 Pro - 8.28 Kimi K2.6 - 7.97
Plus intéressant que les scores : les modes d'échec. Certains modèles raisonnent bien mais sont maladroits avec les outils ; les modèles moins chers se dégradent sur les tâches longues ou avec état ; certains échecs sont comportementaux, d'autres sont des cas limites d'OpenClaw/outillage exposés par le benchmark.
À qui cela s'adresse
Aux utilisateurs d'OpenClaw qui exploitent des agents pour un travail réel et souhaitent comparer les modèles sur leurs propres tâches privées plutôt que de débattre à partir de ressentis ou de classements génériques.
📖 Source : r/openclaw
👀 See Also

Mise en place de contrôles IA avec Continue pour les revues de PR sous contrôle de source
Continue intègre des vérifications IA directement dans votre flux de travail de demande de tirage en utilisant des fichiers markdown comme contrôles versionnés, visibles via les vérifications d'état GitHub.

SynapsCAD : Application de bureau open-source pour OpenSCAD avec intégration de l'IA Claude
SynapsCAD est une application de bureau open-source qui combine un éditeur de code OpenSCAD, une fenêtre de visualisation 3D en temps réel et un assistant IA. Développée entièrement en Rust avec Bevy 0.15 et egui, elle prend en charge l'intégration de l'API Claude pour le codage de CAO 3D en langage naturel.

T9OS : Un système d'orchestration d'IA entièrement construit avec du code Claude
Un étudiant en économie a construit T9OS, une couche complète d'orchestration d'IA utilisant Claude Code comme seul outil de programmation. Le système comprend 18 pipelines de production, un moteur de cycle de vie à 12 états et 7 'Gardians' IA qui examinent chaque sortie.

Comment j'ai créé une compétence pour déployer des agents OpenClaw sur des applications web - Un regard dans les coulisses
Découvrez une nouvelle compétence innovante développée pour les agents OpenClaw qui facilite leur déploiement sur des applications web. Apprenez-en plus sur ses fonctionnalités, ses avantages et comment elle transforme les processus de production.