Comparaison actuelle des coûts des LLM : Deepseek, Qwen, MiniMax vs OpenAI

Répartition des prix par fournisseur
Voici la comparaison actuelle des coûts parmi les principaux fournisseurs de LLM basée sur une récente analyse Reddit. Tous les prix sont en USD par 1 million de tokens et proviennent de la date de l'analyse.
- Deepseek-V3.2 : 0,26$ entrée / 0,38$ sortie. C'est environ 10 fois moins cher que GPT-4 tout en offrant ce que les benchmarks suggèrent être des performances de classe GPT-5.
- Série Qwen3.5 : Le modèle 27B coûte 0,26$ entrée / 2,60$ sortie, offrant une qualité comparable à Claude à une fraction du coût. La série offre une flexibilité allant de 0,8B à 397TB de paramètres, chaque variante prenant en charge des fenêtres de contexte de 262k extensibles à 1M+ et un mode de réflexion intégré.
- MiniMax-M2.5 : 0,27$ entrée / 0,95$ sortie. Excelle pour les flux de travail de codage avec 80,2% sur SWE bench vérifié, le rendant exceptionnel pour les tâches de codage agentique.
- OpenAI GPT-4.1 : 2,00$ entrée / 8,00$ sortie. Bien que certainement capable, la prime de prix est difficile à justifier pour les cas d'utilisation en production à haut volume lorsque des alternatives offrent des performances comparables.
Contexte technique clé
L'analyse inclut les scores ELO LMSYS lorsque disponibles, car la plupart des autres benchmarks semblent être optimisés à ce stade. La capacité de la fenêtre de contexte est devenue de plus en plus importante, la plupart des modèles actuels prenant en charge 200k+ tokens comme standard, ce qui change fondamentalement la façon dont vous pouvez structurer les applications autour de documents longs et de conversations étendues.
Pour les développeurs utilisant des agents de codage IA, ces disparités de prix sont significatives lors de l'examen des coûts de déploiement en production. Les données suggèrent que les alternatives aux modèles à prix premium comme GPT-4 peuvent offrir des performances comparables à des coûts substantiellement inférieurs, en particulier pour les cas d'utilisation à haut volume.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Les agents de codage remplacent la revue humaine de code : un article affirme que la revue traditionnelle est morte
Un article sur arXiv affirme que les agents de codage ont franchi le seuil pour remplacer la revue humaine, offrant un coût réduit et un débit accru.

L'IA dévore le monde (Printemps 2026) – Une analyse complète du marché
Un rapport PDF détaillé sur les tendances de l'industrie de l'IA, les tailles de marché et les métriques d'adoption pour le printemps 2026, couvrant les technologies clés, les acteurs et les prévisions.

Nouveaux crédits d'abonnement Claude d'Anthropic : SDK Agent et claude -p obtiennent un pool plafonné séparé à partir du 15 juin
À partir du 15 juin, les abonnés Claude bénéficient d'un crédit mensuel distinct pour l'utilisation du SDK Agent et de claude -p : 200 $/mois pour Max 20x, 100 $ pour Max 5x, 20 $ pour Pro. L'utilisation s'arrête lorsque le crédit est épuisé, sauf si la facturation supplémentaire est activée. L'utilisation interactive de Claude Code et du chat reste sur le pool d'abonnement.

Autoresearch pousse Qwen3.5-397B à 20,34 tok/s sur M5 Max via le streaming SSD
Un développeur a atteint une vitesse d'inférence de 20,34 tokens/seconde pour le modèle Qwen3.5-397B de 209 Go sur un MacBook Pro M5 Max avec 128 Go de RAM en utilisant le streaming SSD et 36 expériences systématiques. Ce résultat représente une accélération de 2x par rapport au point de référence du M5 Max et de 4,67x par rapport au résultat original du M3 Max.