DeepSeek-V4 Pro и Flash: 1,6 трлн параметров, контекст в 1 млн токенов, гибридное внимание

Компания DeepSeek AI опубликовала предварительную версию серии DeepSeek-V4 на Hugging Face. В состав вошли две языковые модели на основе смеси экспертов (MoE):
- DeepSeek-V4-Pro: 1,6 триллиона параметров всего, 49 миллиардов активируется на токен
- DeepSeek-V4-Flash: 284 миллиарда параметров всего, 13 миллиардов активируется на токен
Обе модели поддерживают длину контекста в один миллион токенов.
Архитектурные улучшения
Серия V4 представляет гибридный механизм внимания, объединяющий:
- Сжатое разреженное внимание (CSA)
- Сильно сжатое внимание (HCA)
При длине контекста в 1 млн токенов DeepSeek-V4-Pro требует лишь 27% FLOPs для инференса одного токена и 10% KV-кэша по сравнению с DeepSeek-V3.2.
Кроме того, модели включают Гиперсвязи с ограничением многообразия (mHC) для усиления остаточных связей, что повышает стабильность обучения.
Детали модели
- Репозиторий:
deepseek-ai/DeepSeek-V4-Proна Hugging Face - Тэг пайплайна:
text-generation - Класс AutoModel:
AutoModelForCausalLM - Лицензия: MIT
- Веса: шардированные safetensors, включая форматы BF16, F32, F8_E8M0, F8_E4M3 и INT8
- Общее количество параметров из safetensors: ~862 миллиарда параметров (вероятно, сумма по всем экспертам)
Бенчмарки и эффективность
Технический отчет (еще не полностью опубликован) упоминает, что гибридное внимание значительно повышает эффективность работы с длинным контекстом. В режиме 1 млн токенов модель достигает снижения FLOPs на 73% и KV-кэша на 90% по сравнению с V3.2.
Для разработчиков, создающих приложения с длинным контекстом (например, анализ документов, понимание кодовой базы, многошаговые агенты), DeepSeek-V4 становится привлекательным выбором для преодоления ограничений длины контекста без пропорционального роста вычислительных затрат.
Для кого предназначено
Этот релиз ориентирован на разработчиков, создающих AI-агенты, которым необходимо обрабатывать очень длинные документы, большие кодовые базы или многошаговые диалоги с полным сохранением контекста.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Антропный Клод проводит 80 тысяч структурированных интервью в качестве альтернативы опросам.
Anthropic использовала Claude для проведения структурированных интервью с примерно 80 000 пользователей из более чем 150 стран и 70+ языков, при этом языковая модель выступала как в роли интервьюера, так и аналитика для сбора разговорных данных.

Claude Opus 4.6 Memory Fails: Agent Forgets Everything Except File Rename
Разработчик документирует 228 записей лога, 95 действий агента и 38 выполнений кода от Claude Opus 4.6, которые породили всего одно воспоминание: строку 'Agent Zero Tune-Up'.

Грег Кроа-Хартман: Clanker T1000 — локальная LLM на Framework Desktop с AMD Ryzen AI Max для фаззинга багов ядра Linux
Система 'gregkh_clanker_t1000' Грега Кроа-Хартмана использует локальную LLM на Framework Desktop (AMD Ryzen AI Max+) для фаззинга ядра Linux, что привело к ~20 принятым патчам с 7 апреля, исправляющим ошибки в ALSA, HID, SMB, Nouveau, IO_uring и других подсистемах.

Anthropic запускает партнерскую сеть Claude с инвестицией в $100 млн
Anthropic запускает Партнерскую сеть Claude с первоначальными инвестициями в размере 100 миллионов долларов на 2026 год, предоставляя обучение, техническую поддержку и совместное развитие рынка для организаций, помогающих предприятиям внедрять Claude. Партнеры получают доступ к технической сертификации, Партнерскому порталу с учебными материалами и стартовому набору для модернизации кода для миграции устаревшего кода.