DeepSeek-V4 Pro e Flash: 1,6 trilhão de parâmetros, contexto de 1 milhão de tokens, atenção híbrida

✍️ OpenClawRadar📅 Publicado: April 24, 2026🔗 Source
DeepSeek-V4 Pro e Flash: 1,6 trilhão de parâmetros, contexto de 1 milhão de tokens, atenção híbrida
Ad

A DeepSeek AI lançou uma prévia da série DeepSeek-V4 no Hugging Face. A linha inclui dois modelos de linguagem Mixture-of-Experts (MoE):

  • DeepSeek-V4-Pro: 1,6 trilhão de parâmetros totais, 49 bilhões ativados por token
  • DeepSeek-V4-Flash: 284 bilhões de parâmetros totais, 13 bilhões ativados por token

Ambos os modelos suportam um comprimento de contexto de um milhão de tokens.

Atualizações Arquiteturais

A série V4 introduz um mecanismo de atenção híbrido que combina:

  • Atenção Esparsa Comprimida (CSA)
  • Atenção Altamente Comprimida (HCA)

No comprimento de contexto de 1 milhão de tokens, o DeepSeek-V4-Pro requer apenas 27% dos FLOPs de inferência por token e 10% do cache KV em comparação com o DeepSeek-V3.2.

Além disso, os modelos incorporam Conexões Hiper com Restrição de Manifold (mHC) para fortalecer as conexões residuais, melhorando a estabilidade do treinamento.

Ad

Detalhes do Modelo

  • Repositório: deepseek-ai/DeepSeek-V4-Pro no Hugging Face
  • Tag de pipeline: text-generation
  • Classe de modelo automático: AutoModelForCausalLM
  • Licença: MIT
  • Pesos: safetensors fragmentados, incluindo formatos BF16, F32, F8_E8M0, F8_E4M3 e INT8
  • Contagem total de parâmetros dos safetensors: ~862 bilhões de parâmetros (provavelmente total entre todos os especialistas)

Benchmarks e Eficiência

O relatório técnico (ainda não totalmente público) menciona que a atenção híbrida melhora drasticamente a eficiência em contextos longos. No cenário de 1 milhão de tokens, o modelo alcança uma redução de 73% nos FLOPs e 90% no cache KV em relação ao V3.2.

Para desenvolvedores que executam aplicações de contexto longo (por exemplo, análise de documentos, compreensão de bases de código, agentes multi-turn), isso torna o DeepSeek-V4 uma escolha atraente para superar limites de comprimento de contexto sem custos computacionais proporcionais.

Para Quem é Indicado

Este lançamento é voltado para desenvolvedores que constroem agentes de IA que precisam processar documentos muito longos, grandes bases de código ou conversas multi-turn com retenção total de contexto.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

DeepSeek-V4-Flash Torna o Controle de LLMs Prático para Modelos Locais
News

DeepSeek-V4-Flash Torna o Controle de LLMs Prático para Modelos Locais

Seen Goedecke explica por que os vetores de direção são relevantes novamente graças ao DeepSeek-V4-Flash rodando localmente via DwarfStar, com detalhes práticos sobre como a direção funciona e por que ela não foi adotada antes.

OpenClawRadar
IA Aprende a 'Arte Negra' do Design de RFIC — Chips Mais Rápidos, Sem Intuição Humana Necessária
News

IA Aprende a 'Arte Negra' do Design de RFIC — Chips Mais Rápidos, Sem Intuição Humana Necessária

Pesquisadores de Princeton usam aprendizado por reforço e design inverso para criar RFICs do zero. Modelos de difusão geram layouts inovadores com desempenho recorde, reduzindo drasticamente o tempo de projeto.

OpenClawRadar
O volume de código gerado por IA está sobrecarregando engenheiros seniores, mostra estudo
News

O volume de código gerado por IA está sobrecarregando engenheiros seniores, mostra estudo

Usuários de IA mesclam 98% mais pull requests com assistência de IA, mas engenheiros seniores relatam aumento da carga cognitiva e esgotamento. Pesquisas mostram que a detecção de defeitos cai de 87% para PRs com menos de 100 linhas para 28% para PRs com mais de 1.000 linhas.

OpenClawRadar
A Liquid AI lança o modelo LFM2.5-350M para loops agentivos
News

A Liquid AI lança o modelo LFM2.5-350M para loops agentivos

A Liquid AI lançou o LFM2.5-350M, um modelo de 350 milhões de parâmetros treinado para extração confiável de dados e uso de ferramentas. Tem menos de 500MB quando quantizado e supera modelos maiores como o Qwen3.5-0.8B na maioria dos benchmarks, sendo mais rápido e eficiente em memória.

OpenClawRadar