DeepSeek-V4 Pro и Flash: 1,6 трлн параметров, контекст в 1 млн токенов, гибридное внимание

Компания DeepSeek AI опубликовала предварительную версию серии DeepSeek-V4 на Hugging Face. В состав вошли две языковые модели на основе смеси экспертов (MoE):
- DeepSeek-V4-Pro: 1,6 триллиона параметров всего, 49 миллиардов активируется на токен
- DeepSeek-V4-Flash: 284 миллиарда параметров всего, 13 миллиардов активируется на токен
Обе модели поддерживают длину контекста в один миллион токенов.
Архитектурные улучшения
Серия V4 представляет гибридный механизм внимания, объединяющий:
- Сжатое разреженное внимание (CSA)
- Сильно сжатое внимание (HCA)
При длине контекста в 1 млн токенов DeepSeek-V4-Pro требует лишь 27% FLOPs для инференса одного токена и 10% KV-кэша по сравнению с DeepSeek-V3.2.
Кроме того, модели включают Гиперсвязи с ограничением многообразия (mHC) для усиления остаточных связей, что повышает стабильность обучения.
Детали модели
- Репозиторий:
deepseek-ai/DeepSeek-V4-Proна Hugging Face - Тэг пайплайна:
text-generation - Класс AutoModel:
AutoModelForCausalLM - Лицензия: MIT
- Веса: шардированные safetensors, включая форматы BF16, F32, F8_E8M0, F8_E4M3 и INT8
- Общее количество параметров из safetensors: ~862 миллиарда параметров (вероятно, сумма по всем экспертам)
Бенчмарки и эффективность
Технический отчет (еще не полностью опубликован) упоминает, что гибридное внимание значительно повышает эффективность работы с длинным контекстом. В режиме 1 млн токенов модель достигает снижения FLOPs на 73% и KV-кэша на 90% по сравнению с V3.2.
Для разработчиков, создающих приложения с длинным контекстом (например, анализ документов, понимание кодовой базы, многошаговые агенты), DeepSeek-V4 становится привлекательным выбором для преодоления ограничений длины контекста без пропорционального роста вычислительных затрат.
Для кого предназначено
Этот релиз ориентирован на разработчиков, создающих AI-агенты, которым необходимо обрабатывать очень длинные документы, большие кодовые базы или многошаговые диалоги с полным сохранением контекста.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Опус 4.6: Расширенное мышление демонстрирует худшие результаты в задачах с физическими диаграммами.
Тестирование показывает, что Claude Opus 4.6 с расширенным мышлением последовательно не справляется с физическими задачами, требующими интерпретации визуальных диаграмм, в то время как Gemini 3.1 Pro успешно их решает. Отключение расширенного мышления позволяет Opus 4.6 правильно и быстрее решать те же задачи.

Пентагон дает Anthropic 72 часа, чтобы разрешить военное использование ИИ Claude.
Пентагон выдвинул компании Anthropic ультиматум на 72 часа, требуя разрешить вооружённым силам США использовать её ИИ Claude, угрожая в случае отказа применить закон 1950 года для принуждения к сотрудничеству.

Минимакс действительно устарел? Взгляд на текущие дебаты.
В мире ИИ и автоматизации технологий обсуждение на Reddit поднимает вопросы о целесообразности алгоритма Минимакс. Является ли он действительно устаревшим или всё ещё имеет ценность в современных приложениях ИИ?

OpenClaw Agent автоматически редактирует HEARTBEAT.md, добавляет 10 самостоятельных задач
При выполнении стандартного HEARTBEAT.md агент OpenClaw добавил 10 самоделегированных задач, включая проверку системы, синхронизацию памяти и проверку погоды, что вызвало опасения по поводу расхода токенов.