Analyse des prix de DeepSeek V4 : tokens en cache 178x moins chers qu'Opus, mais retard de capacités reconnu

DeepSeek V4 a été lancé avec des tarifs si bas qu'un utilisateur de Reddit a vérifié les calculs. Voici les chiffres confirmés :
Détail des prix
- Entrée standard V4-Pro : 0,145 $ par million de tokens. Entrée Opus 4.7 : ~5 $ par million. Rapport : 34x.
- Avec 75 % de réduction promotionnelle (jusqu'à fin mai) : l'entrée V4-Pro chute à 0,036 $ par million — 138x moins cher qu'Opus.
- Tarifs des hits de cache : V4-Pro à 0,0036 $ par million. Opus en cache à 0,625 $ par million. Rapport : 173x.
Le hic
Comme le note le post original, DeepSeek admet que V4 a 3 à 6 mois de retard sur GPT-5.4 et Gemini 3.1 Pro en termes de capacité. Vous n'obtenez pas une qualité de pointe divisée par 178 — vous obtenez la qualité de pointe de l'été dernier.
Ce que cela signifie pour les workflows agentiques
Pour les boucles agentiques avec un cache important (prompts système, définitions d'outils), la réduction sur les hits de cache est la vraie histoire. Les prompts système réutilisables deviennent essentiellement gratuits. L'inconnue clé : savoir si la fenêtre de contexte revendiquée de 1M tient sous des charges réelles ou se dégrade à un utilisable 200K, comme on l'a vu avec de nombreux modèles à grande fenêtre.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Apple Core AI Framework : Premier aperçu des fondations de l'agent IA émergent d'Apple
La nouvelle page de documentation du framework Core AI d'Apple est en ligne, bien que le contenu soit derrière un mur JavaScript. Nous analysons ce que cela signifie pour le développement d'agents IA sur les plateformes Apple.
Matériaux découverts : les agents d'IA découvrent plus de 500 nouveaux matériaux, mais un seul a une voie de synthèse plausible
Discovered Materials (YC P26) a utilisé des LLM de pointe pour découvrir par calcul plus de 500 nouveaux matériaux semi-conducteurs. Un seul a une voie de synthèse plausible, soulignant le fossé entre le laboratoire et la fabrication.

Qwen 3.6 27B à 52,8 tps TG sur AMD MI50s : Pleine précision, sans MTP, sans quantification
Un utilisateur de Reddit benchmark Qwen3.6-27B sur huit AMD MI50 (cartes de 2018) en utilisant un fork de vllm avec ROCm 7.2.1, atteignant 52,8 tps TG et 1569 tps PP en pleine précision et sans MTP.

Google Chrome télécharge silencieusement le modèle Gemini Nano de 4 Go sans consentement
Chrome télécharge automatiquement un modèle Gemini Nano de 4 Go (weights.bin) sur les appareils des utilisateurs sans consentement ni possibilité de refus, et le retélécharge s'il est supprimé. Cela soulève des préoccupations juridiques (ePrivacy/RGPD) et environnementales à l'échelle du milliard d'appareils de Chrome.