Analyse des coûts de DeepSeek V4 Flash : Taux de cache et rapport de prix expliqués

Un utilisateur de Reddit a analysé 922 traces de tâches agentiques exécutées sur OpenClaw (avec la boucle agent PI) et OpenRouter, comparant DeepSeek V4 Flash à Opus 4.7. La différence de coût est stupéfiante : 0,01 $ par tâche pour DeepSeek contre 1,52 $ pour Opus, malgré des nombres de tokens similaires (~962K en moyenne) et d'appels d'outils (~14 en moyenne). Le rapport de prix est de 0,0066x, bien en dessous des 0,03x attendus sur la seule base du prix des tokens d'entrée.
Pourquoi DeepSeek est moins cher : Taux de hit de cache et prix lecture/écriture
Deux facteurs expliquent cet écart :
- Taux de hit de cache : DeepSeek V4 Flash a atteint 97 % contre 87 % pour Opus 4.7. Avec ces rapports de prix lecture-écriture du cache, chaque augmentation de 1 % du taux de hit réduit le coût total d'environ 20 %. L'avantage de 10 % de DeepSeek réduit d'environ 2/3 le coût total.
- Rapport de prix lecture-écriture du cache : Le rapport de DeepSeek est de 0,02 (la lecture du cache coûte 2 % d'une écriture manquée), tandis que celui d'Opus est de 0,08 — comparable à OpenAI, Anthropic et Gemini (0,08–0,10). Cela réduit à lui seul le coût de moitié.
Comment cela s'additionne
Avec des tokens et des outils similaires par tâche, le coût total de DeepSeek est de 0,0066x celui d'Opus. L'utilisateur suppose que ces efficacités sont conçues au niveau de l'infrastructure ou de l'architecture du modèle (par exemple, une meilleure stratégie de mise en cache). Le mécanisme exact n'est pas divulgué.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

4 mois pour atteindre 950 $MRR en construisant un serveur MCP pour Claude Code Intel
Un développeur solo a construit un serveur MCP pour l'intelligence de codebase, atteignant 950 $ MRR en 4 mois avec 54 utilisateurs, travaillant 8 à 10 heures après son travail de jour. Pas de pub, pas de growth hacking — juste Reddit et Medium.

Machine à flux d'état : l'architecture non-transformeuse maintient 62 % de précision sur les séquences longues, là où les transformateurs tombent à 2 %.
Un chercheur a développé State Flow Machine (SFM), une architecture alternative utilisant des emplacements de mémoire explicites au lieu de têtes d'attention, atteignant 62 % de précision sur une tâche synthétique de suivi d'état de programme à une longueur d'entraînement 4× où les transformateurs tombent à 1,9-3,1 %. Le modèle fonctionne sur un seul NPU Huawei Ascend 910 ProA.

Mise à jour du classement SWE-rebench : les résultats de février 2026 révèlent une compétition serrée
Le classement SWE-rebench a été mis à jour avec les résultats de février 2026 testant 57 nouvelles tâches de PR GitHub. Claude Opus 4.6 mène avec un taux de résolution de 65,3 %, mais les six premiers modèles sont à moins de 5 points de pourcentage.

Claude-Code v2.1.84 ajoute l'outil PowerShell, les variables d'environnement et de multiples corrections
Claude-Code v2.1.84 introduit un outil PowerShell pour Windows en version préliminaire facultative, ajoute des variables d'environnement pour la configuration des modèles et les délais d'attente du streaming, et inclut de nombreuses corrections de bugs et améliorations de performances.