Résultats de Benchmark : 15 LLM Testés sur 38 Tâches de Flux de Travail Réelles

Un développeur a créé un banc d'essai pour déterminer vers quels LLMs router le travail, en testant 15 modèles sur 38 tâches issues de son flux de travail réel. Les tâches incluaient des transformations CSV, des comptages de lettres, de l'arithmétique modulaire, de la conformité de format et des instructions en plusieurs étapes. Toutes les tâches ont été notées de manière programmatique à l'aide d'expressions régulières et de correspondances exactes — aucun juge LLM n'a été impliqué.
Résultats du benchmark
Le benchmark a impliqué 570 appels API coûtant 2,29 $ au total. Principales conclusions :
- Claude 3.5 Opus : score de 100 %, 0,69 $ par exécution, 14,2 secondes
- Claude 3.5 Sonnet : score de 100 %, 0,20 $ par exécution, 5,1 secondes
- MiniMax M2.5 : score de 98,60 %, 0,02 $ par exécution, 2,3 secondes
- Kimi K2.5 : score de 98,60 %, 0,05 $ par exécution, 3,8 secondes
- GPT-oss-20b (local) : score de 98,30 %, 0 $ par exécution, 4,1 secondes
- Gemini 2.5 Flash : score de 97,10 %, 0,00 $ par exécution, 1,1 seconde
- Claude 3.5 Haiku : score de 96,90 %, 0,02 $ par exécution, 1,8 seconde
Analyse coût-performance
Sonnet et Opus ont tous deux obtenu 100 %, mais Opus coûte 3,5 fois plus par appel. Pour les tâches quotidiennes du développeur, Sonnet gère tout ce qu'Opus fait. Gemini Flash à 0,003 $ par exécution contre Opus à 0,69 $ représente une différence de coût de 265 fois pour un écart de performance de 2,9 points.
Découvertes surprenantes
MiniMax M2.5 et Kimi K2.5 ont tous deux atteint 98,6 % avec une conformité de format de 100 % — le développeur n'avait utilisé aucun de ces modèles avant de lancer le benchmark. GPT-oss-20b fonctionnant localement a obtenu 98,3 % pour 0 $, surpassant Haiku et DeepSeek R1.
Processus d'assurance qualité
Le processus d'assurance qualité a révélé des bugs de notation. Les résultats initiaux montraient Haiku battant Sonnet, ce qui s'est avéré être un bug du système de notation produisant des scores de qualité supérieurs à 100 %. Cinq passes d'assurance qualité ont été réalisées, chacune avec un modèle différent, et chacune a trouvé des bugs que les précédentes avaient manqués.
Le développeur change son outil principal pour Sonnet sur la base de ces résultats, mais prévoit de basculer plus fréquemment entre les modèles compte tenu des variations de performance.
📖 Read the full source: r/ClaudeAI
👀 See Also

Nouvel outil injecte des instructions dans le code Claude en fonction de l'utilisation contextuelle
Un développeur frustré par les limites de contexte de Claude Code en plein travail a créé un outil qui surveille l'utilisation du contexte et injecte des instructions personnalisées lorsque des seuils sont franchis — permettant à Claude d'agir sur les avertissements avant qu'il ne soit trop tard.
WorldClaw : Génération d’agents en monde ouvert 3D à grande échelle
WorldClaw de Tencent est un nouveau système de génération agentique de mondes ouverts 3D à grande échelle, visant à créer des environnements virtuels vastes et détaillés.

Claude a écrit 3 000 lignes de code au lieu d'importer pywikibot — une étude de cas sur les agents IA ignorant les bibliothèques existantes
Un développeur a confié à Claude Code (Opus 4.7) la correction de fautes sur des wikis Fandom. Le modèle a écrit ~3 000 lignes de Python réimplémentant pywikibot, mwparserfromhell et les règles RETF au lieu de les importer. L'article explore pourquoi cela se produit et comment une recherche de deux minutes a réduit la base de code à 1 259 lignes.

Serveur MCP Open Source Connecte Claude à l'API Mailchimp
Un développeur a créé un serveur MCP Mailchimp en utilisant Claude Code, fournissant 53 outils pour les campagnes, audiences, rapports, automations et e-commerce avec des modes de sécurité intégrés et une configuration en lecture seule.