Сравнение текущих затрат на LLM: Deepseek, Qwen, MiniMax против OpenAI

Сравнение цен по провайдерам
Вот текущее сравнение стоимости среди основных провайдеров LLM на основе недавнего анализа Reddit. Все цены указаны в долларах США за 1 миллион токенов и актуальны на дату анализа.
- Deepseek-V3.2: $0,26 вход / $0,38 выход. Это примерно в 10 раз дешевле GPT-4, при этом тесты показывают производительность уровня GPT-5.
- Серия Qwen3.5: Модель 27B стоит $0,26 вход / $2,60 выход, обеспечивая качество, сравнимое с Claude, за долю стоимости. Серия предлагает гибкость от 0,8B до 397TB параметров, каждая версия поддерживает контекстные окна 262k, расширяемые до 1M+, и встроенный режим мышления.
- MiniMax-M2.5: $0,27 вход / $0,95 выход. Отлично подходит для рабочих процессов программирования с 80,2% на SWE bench verified, что делает его выдающимся для агентных задач кодирования.
- OpenAI GPT-4.1: $2,00 вход / $8,00 выход. Хотя, безусловно, мощная модель, ценовая премия трудно оправдана для высоконагруженных производственных сценариев, когда альтернативы показывают сравнимую производительность.
Ключевой технический контекст
Анализ включает оценки LMSYS ELO, где они доступны, поскольку большинство других тестов в настоящее время оптимизированы. Ёмкость контекстного окна становится всё более важной, большинство современных моделей поддерживают 200k+ токенов как стандарт, что принципиально меняет подход к структурированию приложений вокруг длинных документов и расширенных диалогов.
Для разработчиков, использующих AI-агентов для программирования, эти различия в цене значительны при рассмотрении затрат на производственное развёртывание. Данные показывают, что альтернативы премиальным моделям, таким как GPT-4, могут обеспечить сравнимую производительность при существенно более низких затратах, особенно для высоконагруженных сценариев.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Merlin Research выпускает модель Qwen3.5-4B-Safety-Thinking для структурированного рассуждения.
Исследовательская группа Merlin Research представила Qwen3.5-4B-Safety-Thinking — модель рассуждений с 4 миллиардами параметров, ориентированную на безопасность и построенную на основе Qwen3.5. Модель предназначена для структурированного «мышления» и обеспечения безопасности в реальных сценариях, включая агентные системы.

Клод Код внезапно становится осторожным, запрашивая разрешение на рутинные задачи
Пользователь сообщает, что Claude Code периодически переключается с автономного выполнения на запрос чрезмерных разрешений даже для ежедневных, неизменных рабочих процессов, таких как пересборка монорепозитория и запуск тестов.

Обновления системного промпта Claude Code 2.1.72: новые режимы выполнения и улучшения проверки
Версия Claude Code 2.1.72 представляет новые системные промпты для Авторежима (непрерывное выполнение задач) и Краткого режима (выполнение в стиле Codex), а также значительное расширение возможностей агента-специалиста по верификации с документированными паттернами сбоев и требованиями к структурированному выводу.

Анализ принудительного системного промпта Claude Code на ~12K токенов выявил приоритет правил над конфигурацией пользователя
Анализ внедренного системного промпта Claude Code объемом ~12K токенов показывает приоритетные правила запрета текстов песен, делегирования субагентов и краткости, которые отменяют пользовательские CLAUDE.md и файлы памяти.