Résultats de Benchmark : 15 LLM Testés sur 38 Tâches de Flux de Travail Réelles

✍️ OpenClawRadar📅 Publié: March 10, 2026🔗 Source
Résultats de Benchmark : 15 LLM Testés sur 38 Tâches de Flux de Travail Réelles
Ad

Un développeur a créé un banc d'essai pour déterminer vers quels LLMs router le travail, en testant 15 modèles sur 38 tâches issues de son flux de travail réel. Les tâches incluaient des transformations CSV, des comptages de lettres, de l'arithmétique modulaire, de la conformité de format et des instructions en plusieurs étapes. Toutes les tâches ont été notées de manière programmatique à l'aide d'expressions régulières et de correspondances exactes — aucun juge LLM n'a été impliqué.

Résultats du benchmark

Le benchmark a impliqué 570 appels API coûtant 2,29 $ au total. Principales conclusions :

  • Claude 3.5 Opus : score de 100 %, 0,69 $ par exécution, 14,2 secondes
  • Claude 3.5 Sonnet : score de 100 %, 0,20 $ par exécution, 5,1 secondes
  • MiniMax M2.5 : score de 98,60 %, 0,02 $ par exécution, 2,3 secondes
  • Kimi K2.5 : score de 98,60 %, 0,05 $ par exécution, 3,8 secondes
  • GPT-oss-20b (local) : score de 98,30 %, 0 $ par exécution, 4,1 secondes
  • Gemini 2.5 Flash : score de 97,10 %, 0,00 $ par exécution, 1,1 seconde
  • Claude 3.5 Haiku : score de 96,90 %, 0,02 $ par exécution, 1,8 seconde
Ad

Analyse coût-performance

Sonnet et Opus ont tous deux obtenu 100 %, mais Opus coûte 3,5 fois plus par appel. Pour les tâches quotidiennes du développeur, Sonnet gère tout ce qu'Opus fait. Gemini Flash à 0,003 $ par exécution contre Opus à 0,69 $ représente une différence de coût de 265 fois pour un écart de performance de 2,9 points.

Découvertes surprenantes

MiniMax M2.5 et Kimi K2.5 ont tous deux atteint 98,6 % avec une conformité de format de 100 % — le développeur n'avait utilisé aucun de ces modèles avant de lancer le benchmark. GPT-oss-20b fonctionnant localement a obtenu 98,3 % pour 0 $, surpassant Haiku et DeepSeek R1.

Processus d'assurance qualité

Le processus d'assurance qualité a révélé des bugs de notation. Les résultats initiaux montraient Haiku battant Sonnet, ce qui s'est avéré être un bug du système de notation produisant des scores de qualité supérieurs à 100 %. Cinq passes d'assurance qualité ont été réalisées, chacune avec un modèle différent, et chacune a trouvé des bugs que les précédentes avaient manqués.

Le développeur change son outil principal pour Sonnet sur la base de ces résultats, mais prévoit de basculer plus fréquemment entre les modèles compte tenu des variations de performance.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Serveur MCP Nutrition Construit avec Claude Code pour l'Exportation de Journal Alimentaire
Tools

Serveur MCP Nutrition Construit avec Claude Code pour l'Exportation de Journal Alimentaire

Un développeur a créé un serveur MCP de nutrition en utilisant Claude Code après que des applications commerciales ont bloqué l'exportation des données, créant ainsi un outil qui enregistre les repas via Claude, génère des résumés et exporte vers Excel sans changer d'application.

OpenClawRadar
Supra-50M-Reasoning : Petit modèle open-source avec raisonnement par chaîne de pensée
Tools

Supra-50M-Reasoning : Petit modèle open-source avec raisonnement par chaîne de pensée

SupraLabs publie Supra-50M-Reasoning, un modèle de 50M paramètres affiné pour produire une chaîne de pensée complète avant les réponses. Dataset de 500 échantillons rédigé à la main, entièrement open source.

OpenClawRadar
Système de mémoire persistante open-source pour Claude Code résolvant la perte de contexte entre les sessions
Tools

Système de mémoire persistante open-source pour Claude Code résolvant la perte de contexte entre les sessions

Un développeur a créé un système de mémoire basé sur des fichiers pour Claude Code qui capture automatiquement le contexte du projet sans plugins ni clés API. Il utilise des transcriptions de conversation, un fichier de réception et des tâches cron nocturnes pour maintenir une mémoire persistante entre les sessions.

OpenClawRadar
🦀
Tools

Collaborer : Une compétence Claude Code pour la rédaction structurée et asynchrone de documents avec transferts multi-agents

Une compétence Claude Code appelée « collaborate » permet l'écriture collaborative de documents où chaque participant reçoit un briefing de Claude en anglais simple sur les changements précédents, le raisonnement et les tâches suivantes, avec prise en charge des sections parallèles, des critiques structurées et des notifications Slack/Signal.

OpenClawRadar