Глубокое погружение в стоимость DeepSeek V4 Flash: объяснение коэффициента попадания в кэш и ценового соотношения

Пользователь Reddit проанализировал 922 трассы агентных заданий, выполненных на OpenClaw (с циклом PI-агента) и OpenRouter, сравнив DeepSeek V4 Flash с Opus 4.7. Разница в стоимости ошеломляет: $0,01 за задание для DeepSeek против $1,52 для Opus, несмотря на схожее количество токенов (~962 тыс. в среднем) и вызовов инструментов (~14 в среднем). Соотношение цен составляет 0,0066x, что значительно ниже ожидаемых 0,03x, исходя из цены входных токенов.
Почему DeepSeek дешевле: частота попаданий в кэш и цена чтения/записи
Два фактора объясняют разрыв:
- Частота попаданий в кэш: DeepSeek V4 Flash достиг 97% против 87% у Opus 4.7. При таких соотношениях цен чтения/записи кэша каждый дополнительный процент попаданий снижает общую стоимость примерно на 20%. Преимущество DeepSeek в 10% сокращает около 2/3 общей стоимости.
- Соотношение цены чтения/записи кэша: У DeepSeek это соотношение составляет 0,02 (чтение кэша стоит 2% от записи при промахе), тогда как у Opus — 0,08, что сравнимо с OpenAI, Anthropic и Gemini (0,08–0,10). Это само по себе вдвое снижает стоимость.
Как это суммируется
При схожих количествах токенов и инструментов на задание общая стоимость DeepSeek составляет 0,0066x от стоимости Opus. Пользователь предполагает, что такая эффективность достигнута на уровне инфраструктуры или архитектуры модели (например, лучшая стратегия кэширования). Точный механизм не раскрыт.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Nvidia Nemotron 3 Super: Модель с 120 миллиардами параметров и 12 миллиардами активных при выводе.
Модель Nvidia Nemotron 3 Super имеет 120 миллиардов общих параметров, но активирует только 12 миллиардов во время вывода, достигая знаний модели на 120 миллиардов параметров примерно по вычислительной стоимости модели на 12 миллиардов благодаря эффективной маршрутизации, а не сжатию.
Claude Code v2.1.207: Автоматический режим GA, исправление зависания терминала и усиление безопасности
Автоматический режим теперь стабилен без опции на Bedrock/Vertex/Foundry. Исправлено зависание терминала при длинном выводе, внедрение команд в плагины и многое другое.

RTX 5080 16GB: Qwen3.6 35B MoE при 128k контексте — 56 tok/s, и почему MTP не помогает
Новые бенчмарки показывают, что Qwen3.6 35B MoE на RTX 5080 16GB выдает 56 ток/с при контексте 128k. MTP (Multi-Token Prediction) замедляет работу на 23% из-за нехватки VRAM, вытесняя экспертные слои на CPU.

MTP Multi-Token Prediction: генерация токенов в 2 раза быстрее на AMD Strix Halo и Radeon 9700 AI Pro
Мультитокенное предсказание (MTP) обещает до 2-кратного ускорения генерации токенов для локальных LLM. Новое демо-видео показывает MTP на оборудовании AMD Strix Halo и Dual Radeon 9700 AI Pro, ориентированном на модели класса Qwen 3.6.