Глубокое погружение в стоимость DeepSeek V4 Flash: объяснение коэффициента попадания в кэш и ценового соотношения

Пользователь Reddit проанализировал 922 трассы агентных заданий, выполненных на OpenClaw (с циклом PI-агента) и OpenRouter, сравнив DeepSeek V4 Flash с Opus 4.7. Разница в стоимости ошеломляет: $0,01 за задание для DeepSeek против $1,52 для Opus, несмотря на схожее количество токенов (~962 тыс. в среднем) и вызовов инструментов (~14 в среднем). Соотношение цен составляет 0,0066x, что значительно ниже ожидаемых 0,03x, исходя из цены входных токенов.
Почему DeepSeek дешевле: частота попаданий в кэш и цена чтения/записи
Два фактора объясняют разрыв:
- Частота попаданий в кэш: DeepSeek V4 Flash достиг 97% против 87% у Opus 4.7. При таких соотношениях цен чтения/записи кэша каждый дополнительный процент попаданий снижает общую стоимость примерно на 20%. Преимущество DeepSeek в 10% сокращает около 2/3 общей стоимости.
- Соотношение цены чтения/записи кэша: У DeepSeek это соотношение составляет 0,02 (чтение кэша стоит 2% от записи при промахе), тогда как у Opus — 0,08, что сравнимо с OpenAI, Anthropic и Gemini (0,08–0,10). Это само по себе вдвое снижает стоимость.
Как это суммируется
При схожих количествах токенов и инструментов на задание общая стоимость DeepSeek составляет 0,0066x от стоимости Opus. Пользователь предполагает, что такая эффективность достигнута на уровне инфраструктуры или архитектуры модели (например, лучшая стратегия кэширования). Точный механизм не раскрыт.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

inclusionAI发布Ling-2.6-1T:混合架构万亿参数模型,具备稀疏注意力与快速推理能力
Ling-2.6-1T — это новая открытая модель с триллионом параметров, сочетающая MLA и Linear Attention для эффективной работы с длинными контекстами и использующая Contextual Process Redundancy Suppression для сокращения многословных цепочек рассуждений. Достигает открытых SOTA на AIME26, SWE-bench Verified, BFCL-V4, TAU2-Bench и IFBench.

Uber израсходовал годовой бюджет Claude Code за 4 месяца — вот что это значит
Сообщается, что Uber исчерпал годовой бюджет на Claude Code к концу апреля. В статье разбирается, почему структура использования сломала подписную модель, и какие уроки разработчики могут извлечь о постановке границ при работе с ИИ-кодингом.

Lovable предлагает $100 бесплатных кредитов на API Claude в честь Международного женского дня.
Lovable раздает $100 кредитов на API Anthropic Claude, $250 кредитов на комиссии Stripe и 24-часовой бесплатный доступ к своей платформе до 8 марта. Пользователям необходимо активировать предложение до 12:59 по восточному времени 9 марта.

Перспективы проекта Rust в области ИИ: практические взгляды от участников проекта
Сводный документ собирает мнения участников проекта Rust об использовании инструментов ИИ, подчеркивая, что эффективная интеграция ИИ требует тщательной инженерии, и демонстрируя конкретные примеры использования, такие как навигация по кодовой базе, помощь в ревью кода и обработка полуструктурированных данных.