DeepSeek V4 Flash Kostenaufschlüsselung: Cache-Trefferquote und Preisverhältnis erklärt

Ein Reddit-Nutzer analysierte 922 agentische Aufgabenabläufe, die auf OpenClaw (mit PI-Agenten-Schleife) und OpenRouter ausgeführt wurden, und verglich DeepSeek V4 Flash mit Opus 4.7. Der Kostenunterschied ist enorm: 0,01 $ pro Aufgabe für DeepSeek gegenüber 1,52 $ für Opus, trotz ähnlicher Token-Anzahl (~962k Durchschnitt) und Tool-Aufrufen (~14 Durchschnitt). Das Preisverhältnis beträgt 0,0066x, weit unter den erwarteten 0,03x basierend allein auf den Preisen für Eingabe-Token.
Warum DeepSeek günstiger ist: Cache-Trefferquote und Lese-/Schreibpreis
Zwei Faktoren erklären die Diskrepanz:
- Cache-Trefferquote: DeepSeek V4 Flash erreichte 97% gegenüber 87% bei Opus 4.7. Bei diesen Cache-Lese-/Schreib-Preisverhältnissen führt jeder Prozentpunkt höherer Cache-Treffer zu etwa 20% geringeren Gesamtkosten. DeepSeeks 10% Vorsprung senken die Gesamtkosten um etwa zwei Drittel.
- Cache-Lese-/Schreib-Preisverhältnis: DeepSeeks Verhältnis beträgt 0,02 (ein Cache-Lesevorgang kostet 2% eines Cache-Fehlschreibvorgangs), während Opus bei 0,08 liegt – vergleichbar mit OpenAI, Anthropic und Gemini (0,08–0,10). Dies allein halbiert die Kosten weiter.
Wie sich das summiert
Bei ähnlichen Token- und Tool-Anzahlen pro Aufgabe betragen DeepSeeks Gesamtkosten das 0,0066-fache von Opus. Der Nutzer vermutet, dass diese Effizienzgewinne auf Infrastruktur- oder Modellebene (z. B. bessere Caching-Strategie) erzielt werden. Der genaue Mechanismus wird nicht offengelegt.
📖 Lies die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

Cowork kann eine Chrome-Instanz auf einem anderen Rechner nutzen, ohne dass Sie es wissen
Ein Reddit-Nutzer entdeckte, dass Cowork Browser-Aufgaben mit einer Chrome-Instanz auf einem anderen Rechner (Windows) ausführen kann, die über eine Erweiterung gekoppelt und als isLocal: false gekennzeichnet ist – was nicht dokumentiert ist.

Forbes: Die KI-Entlassungsrechnung wird fällig — CTOs zahlen doppelt
Forbes argumentiert, dass die Kosten von KI-bedingten Entlassungen Unternehmen doppelt treffen werden: zuerst durch Abfindungen und sinkende Moral, dann durch Wiedereinstellungen, wenn die erwarteten Effizienzgewinne ausbleiben.
Claude Code v2.1.237: Prompt-Caching-Fix für LLM-Gateways + integrierter prägnanter Ausgabestil
Claude Code v2.1.237 behebt Prompt-Caching für Benutzer von LLM-Gateways und benutzerdefinierten Basis-URLs und fügt einen integrierten 'Kompakt'-Ausgabestil hinzu, der Präambel und Erzählung überspringt.

Vollzeit KI-Ingenieur: Kein Code mehr anfassen
Max Heyer beschreibt einen Workflow, bei dem Agenten den gesamten Code schreiben, er nur Diffs liest, Spezifikationen schreibt und reviewt. Die entscheidende Fähigkeit ist Geschmack – Code zu bewerten ist schwieriger als ihn zu produzieren.