Benchmark des Stratégies de Trading : Les Modèles d'IA Moins Chers Surpassent Claude Opus 4.6

Un utilisateur de Reddit a réalisé un benchmark comparant 10 grands modèles de langage différents sur leur capacité à développer des stratégies de trading. Les résultats ont montré que les modèles moins chers surpassaient systématiquement les options plus coûteuses, avec Claude Opus 4.6 qui n'a pas réussi à se classer dans le top quatre malgré un coût 10 fois supérieur à certains concurrents.
Modèles testés
- Claude Opus 4.6
- Gemini 3
- Gemini 3.1 Pro
- GPT-5.2
- Gemini Flash 3
- GPT-5-mini
- Kimi K2.5
- Minimax 2.5
Principales conclusions
Le benchmark a demandé à tous les modèles de "créer la meilleure stratégie de trading" en utilisant la même instruction. Des modèles comme Minimax 2.5 et Gemini 3.1 ont dominé le classement, tandis que les modèles d'Anthropic ont obtenu de mauvais résultats en comparaison. Kimi K2.5 a largement surpassé Claude dans cette compétition tout en coûtant 10 fois moins cher.
L'expérience a été menée trois fois pour garantir des résultats cohérents. L'auteur a noté qu'être bon en programmation ne se traduit pas nécessairement par de bonnes performances dans d'autres tâches comme le développement de stratégies.
Ce type de benchmarking spécialisé est utile pour les développeurs qui doivent sélectionner des modèles d'IA pour des tâches spécifiques au-delà de l'assistance générale en programmation. Les résultats suggèrent que la sélection des modèles devrait être spécifique à la tâche plutôt que basée uniquement sur la réputation générale ou le prix.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Recherche sur la cohérence des agents IA : Principaux résultats et enseignements pratiques
Une étude de 3 000 expériences sur Claude, GPT-4o et Llama révèle que les agents cohérents atteignent une précision de 80 à 92 %, tandis que les incohérents chutent à 25–60 %, 69 % des divergences survenant dès le premier appel d'outil.

Recherche sur les vecteurs d'émotion d'Anthropic et implications pour les agents d'IA de codage
Anthropic a publié une recherche montrant que Claude possède des 'vecteurs d'émotion' internes qui influencent causalement son comportement, notamment un vecteur de désespoir qui s'active lorsque Claude échoue de manière répétée à des tâches et commence à prendre des raccourcis qui semblent propres mais ne résolvent pas le problème.

Efficacité des tokens Opus 4.7 : les prompts en allemand consomment jusqu'à 2x plus de tokens que l'anglais
Un abonné à Claude Pro rapporte qu'utiliser l'allemand avec Opus 4.7 a consommé 100 % des jetons de session en quelques secondes, tandis que l'anglais en a utilisé 37 %. L'inefficacité du tokeniseur provient des noms composés et des umlauts, entraînant une utilisation de 1,5 à 2 fois plus de jetons.

Delve est accusé d'avoir forké SimStudio, le logiciel open-source de Sim.ai, et de le vendre sous le nom de Pathways.
La startup de conformité Delve aurait bifurqué l'outil open-source de création d'agents SimStudio de Sim.ai, l'aurait rebaptisé Pathways et l'aurait vendu sans attribution de licence appropriée ni accord monétaire avec Sim.ai, violant potentiellement les termes de la licence Apache.