Résultats de PinchBench : Premier Benchmark Spécifique aux Agents d'IA de Codage OpenClaw

✍️ OpenClawRadar📅 Publié: March 8, 2026🔗 Source
Résultats de PinchBench : Premier Benchmark Spécifique aux Agents d'IA de Codage OpenClaw
Ad

PinchBench est le premier benchmark conçu spécifiquement pour évaluer les agents de codage IA dans l'écosystème OpenClaw, classant les modèles selon leur taux de réussite, leur coût et leur vitesse.

Résultats clés

Le benchmark a testé 32 modèles. Les meilleurs performants par taux de réussite :

  • 1. google/gemini-3-flash-preview : 95,1 % de réussite, 0,72 $ de coût, 254,50 s de vitesse
  • 2. minimax/minimax-m2.1 : 93,6 % de réussite, 0,14 $ de coût, 239,79 s de vitesse
  • 3. moonshotai/kimi-k2.5 : 93,4 % de réussite, 0,20 $ de coût, 291,67 s de vitesse
  • 4. anthropic/claude-sonnet-4.5 : 92,7 % de réussite, 3,07 $ de coût, 304,53 s de vitesse
  • 5. google/gemini-3-pro-preview : 91,7 % de réussite, 1,48 $ de coût, 239,55 s de vitesse
Ad

Observations notables

  • Les modèles Flash surpassent les modèles Pro à moindre coût : Gemini-3-Flash-Preview (95,1 %, 0,72 $) surpasse Gemini-3-Pro-Preview (91,7 %, 1,48 $)
  • Les modèles plus chers ne sont pas nécessairement meilleurs
  • Minimax 2.5 s'est classé 31e avec un taux de réussite de 35,5 % et une vitesse de 105,96 s (coût non indiqué)
  • Plusieurs modèles affichent des taux de réussite élevés au-dessus de 90 % tout en maintenant les coûts sous 1 $

Éventail des performances

Les taux de réussite vont de 95,1 % (meilleur) à 35,2 % (moins bon). Les options rentables incluent :

  • openai/gpt-5-nano : 85,8 % de réussite pour 0,03 $
  • google/gemini-2.5-flash-lite : 83,2 % de réussite pour 0,05 $
  • mistralai/devstral-2512 : 81,7 % de réussite pour 0,10 $

Plusieurs modèles en bas du classement (positions 23 à 32) affichent des taux de réussite d'environ 40 % ou moins, avec des coûts non indiqués dans les données fournies.

📖 Lire la source complète : r/openclaw

Ad

👀 See Also

🦀
Tools

Extraction chirurgicale de GitHub : une compétence Claude pour récupérer une fonction, pas tout le dépôt

Un nouveau Skill Claude open-source nommé surgical-github-extraction empêche Claude Code de cloner des dépôts entiers quand vous ne voulez qu'une seule fonction ou un motif. Il lit le README, extrait 1 à 3 fichiers sources bruts, et prélève la plus petite unité utile avec un commentaire de provenance.

OpenClawRadar
Titre de l'article : Bot de trading de simulation multi-LLM avec Claude Opus comme ingénieur principal et Gemini comme stratège : Analyse de l'architecture
Tools

Titre de l'article : Bot de trading de simulation multi-LLM avec Claude Opus comme ingénieur principal et Gemini comme stratège : Analyse de l'architecture

Un développeur solo partage un bot de paper-trading de 4 900 lignes sur Alpaca, où Claude Opus 4 (Ingénieur) a un droit de veto sur Gemini Pro (Stratège), avec un journal de désaccords de plus de 270 entrées appelé le Codex du Stratège.

OpenClawRadar
Maestro v1.5.0 ajoute la prise en charge de Claude Code pour l'orchestration multi-agent.
Tools

Maestro v1.5.0 ajoute la prise en charge de Claude Code pour l'orchestration multi-agent.

Maestro v1.5.0, une plateforme d'orchestration multi-agents open source, fonctionne désormais comme un plugin natif sur Claude Code en plus de Gemini CLI. La mise à jour comprend une planification de conception plus approfondie, une colonne vertébrale d'orchestration en 42 étapes, l'application des capacités des agents et un renforcement de la sécurité.

OpenClawRadar
EctoLedger : MicroVM open source en bac à sable pour agents IA locaux avec accès terminal
Tools

EctoLedger : MicroVM open source en bac à sable pour agents IA locaux avec accès terminal

EctoLedger est un pare-feu et registre d'exécution open-source qui fournit une isolation microVM pour les agents d'IA locaux avec accès terminal, exécutant quatre couches de prévention avant d'exécuter des commandes dans Apple Hypervisor.framework (macOS) ou des environnements microVM Firecracker (Linux).

OpenClawRadar