Benchmark des Stratégies de Trading : Les Modèles d'IA Moins Chers Surpassent Claude Opus 4.6

Un utilisateur de Reddit a réalisé un benchmark comparant 10 grands modèles de langage différents sur leur capacité à développer des stratégies de trading. Les résultats ont montré que les modèles moins chers surpassaient systématiquement les options plus coûteuses, avec Claude Opus 4.6 qui n'a pas réussi à se classer dans le top quatre malgré un coût 10 fois supérieur à certains concurrents.
Modèles testés
- Claude Opus 4.6
- Gemini 3
- Gemini 3.1 Pro
- GPT-5.2
- Gemini Flash 3
- GPT-5-mini
- Kimi K2.5
- Minimax 2.5
Principales conclusions
Le benchmark a demandé à tous les modèles de "créer la meilleure stratégie de trading" en utilisant la même instruction. Des modèles comme Minimax 2.5 et Gemini 3.1 ont dominé le classement, tandis que les modèles d'Anthropic ont obtenu de mauvais résultats en comparaison. Kimi K2.5 a largement surpassé Claude dans cette compétition tout en coûtant 10 fois moins cher.
L'expérience a été menée trois fois pour garantir des résultats cohérents. L'auteur a noté qu'être bon en programmation ne se traduit pas nécessairement par de bonnes performances dans d'autres tâches comme le développement de stratégies.
Ce type de benchmarking spécialisé est utile pour les développeurs qui doivent sélectionner des modèles d'IA pour des tâches spécifiques au-delà de l'assistance générale en programmation. Les résultats suggèrent que la sélection des modèles devrait être spécifique à la tâche plutôt que basée uniquement sur la réputation générale ou le prix.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Claude Opus 4.7 signale des questions sur le vaccin contre l'hantavirus comme un risque de sécurité, interrompant les conversations
Demander à Claude Opus 4.7 comment développer un vaccin contre le hantavirus déclenche des filtres de sécurité qui mettent la conversation en pause, tandis que Sonnet 4.6 bloque également la modélisation prédictive associée.
Modèle de langage Transformer fonctionnant localement sur une Game Boy Color standard
Le modèle TinyStories-260K d'Andrej Karpathy fonctionne sur une Game Boy Color de série via une ROM personnalisée, en utilisant des mathématiques en virgule fixe INT8 et une mémoire de cartouche à commutation de banques pour les poids et le cache KV.

Kimi k2.5 : Repousser les limites de l'automatisation par IA
Kimi k2.5 a établi une nouvelle norme pour l'automatisation de l'IA, avec des capacités avancées qui attirent l'attention de la communauté technologique. Découvrez comment il redéfinit le paysage.
Claude Code v2.1.288 apporte des correctifs de reprise, la récupération de brouillon avec Ctrl+C et /code-review --max-findings
Claude Code v2.1.288 corrige la perte de contexte compacté et de réponses non enregistrées lors de --resume, et ajoute la récupération de brouillon via Ctrl+C, la recherche de session via Ctrl+F, ainsi que --max-findings pour /code-review.