DeepSeek-V4 Pro e Flash: 1,6 trilhão de parâmetros, contexto de 1 milhão de tokens, atenção híbrida

A DeepSeek AI lançou uma prévia da série DeepSeek-V4 no Hugging Face. A linha inclui dois modelos de linguagem Mixture-of-Experts (MoE):
- DeepSeek-V4-Pro: 1,6 trilhão de parâmetros totais, 49 bilhões ativados por token
- DeepSeek-V4-Flash: 284 bilhões de parâmetros totais, 13 bilhões ativados por token
Ambos os modelos suportam um comprimento de contexto de um milhão de tokens.
Atualizações Arquiteturais
A série V4 introduz um mecanismo de atenção híbrido que combina:
- Atenção Esparsa Comprimida (CSA)
- Atenção Altamente Comprimida (HCA)
No comprimento de contexto de 1 milhão de tokens, o DeepSeek-V4-Pro requer apenas 27% dos FLOPs de inferência por token e 10% do cache KV em comparação com o DeepSeek-V3.2.
Além disso, os modelos incorporam Conexões Hiper com Restrição de Manifold (mHC) para fortalecer as conexões residuais, melhorando a estabilidade do treinamento.
Detalhes do Modelo
- Repositório:
deepseek-ai/DeepSeek-V4-Prono Hugging Face - Tag de pipeline:
text-generation - Classe de modelo automático:
AutoModelForCausalLM - Licença: MIT
- Pesos: safetensors fragmentados, incluindo formatos BF16, F32, F8_E8M0, F8_E4M3 e INT8
- Contagem total de parâmetros dos safetensors: ~862 bilhões de parâmetros (provavelmente total entre todos os especialistas)
Benchmarks e Eficiência
O relatório técnico (ainda não totalmente público) menciona que a atenção híbrida melhora drasticamente a eficiência em contextos longos. No cenário de 1 milhão de tokens, o modelo alcança uma redução de 73% nos FLOPs e 90% no cache KV em relação ao V3.2.
Para desenvolvedores que executam aplicações de contexto longo (por exemplo, análise de documentos, compreensão de bases de código, agentes multi-turn), isso torna o DeepSeek-V4 uma escolha atraente para superar limites de comprimento de contexto sem custos computacionais proporcionais.
Para Quem é Indicado
Este lançamento é voltado para desenvolvedores que constroem agentes de IA que precisam processar documentos muito longos, grandes bases de código ou conversas multi-turn com retenção total de contexto.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

DeepSeek-V4-Flash Torna o Controle de LLMs Prático para Modelos Locais
Seen Goedecke explica por que os vetores de direção são relevantes novamente graças ao DeepSeek-V4-Flash rodando localmente via DwarfStar, com detalhes práticos sobre como a direção funciona e por que ela não foi adotada antes.

IA Aprende a 'Arte Negra' do Design de RFIC — Chips Mais Rápidos, Sem Intuição Humana Necessária
Pesquisadores de Princeton usam aprendizado por reforço e design inverso para criar RFICs do zero. Modelos de difusão geram layouts inovadores com desempenho recorde, reduzindo drasticamente o tempo de projeto.

O volume de código gerado por IA está sobrecarregando engenheiros seniores, mostra estudo
Usuários de IA mesclam 98% mais pull requests com assistência de IA, mas engenheiros seniores relatam aumento da carga cognitiva e esgotamento. Pesquisas mostram que a detecção de defeitos cai de 87% para PRs com menos de 100 linhas para 28% para PRs com mais de 1.000 linhas.

A Liquid AI lança o modelo LFM2.5-350M para loops agentivos
A Liquid AI lançou o LFM2.5-350M, um modelo de 350 milhões de parâmetros treinado para extração confiável de dados e uso de ferramentas. Tem menos de 500MB quando quantizado e supera modelos maiores como o Qwen3.5-0.8B na maioria dos benchmarks, sendo mais rápido e eficiente em memória.