DeepSeek-V4 Pro e Flash: 1,6 trilhão de parâmetros, contexto de 1 milhão de tokens, atenção híbrida

✍️ OpenClawRadar📅 Publicado: April 24, 2026🔗 Source
DeepSeek-V4 Pro e Flash: 1,6 trilhão de parâmetros, contexto de 1 milhão de tokens, atenção híbrida
Ad

A DeepSeek AI lançou uma prévia da série DeepSeek-V4 no Hugging Face. A linha inclui dois modelos de linguagem Mixture-of-Experts (MoE):

  • DeepSeek-V4-Pro: 1,6 trilhão de parâmetros totais, 49 bilhões ativados por token
  • DeepSeek-V4-Flash: 284 bilhões de parâmetros totais, 13 bilhões ativados por token

Ambos os modelos suportam um comprimento de contexto de um milhão de tokens.

Atualizações Arquiteturais

A série V4 introduz um mecanismo de atenção híbrido que combina:

  • Atenção Esparsa Comprimida (CSA)
  • Atenção Altamente Comprimida (HCA)

No comprimento de contexto de 1 milhão de tokens, o DeepSeek-V4-Pro requer apenas 27% dos FLOPs de inferência por token e 10% do cache KV em comparação com o DeepSeek-V3.2.

Além disso, os modelos incorporam Conexões Hiper com Restrição de Manifold (mHC) para fortalecer as conexões residuais, melhorando a estabilidade do treinamento.

Ad

Detalhes do Modelo

  • Repositório: deepseek-ai/DeepSeek-V4-Pro no Hugging Face
  • Tag de pipeline: text-generation
  • Classe de modelo automático: AutoModelForCausalLM
  • Licença: MIT
  • Pesos: safetensors fragmentados, incluindo formatos BF16, F32, F8_E8M0, F8_E4M3 e INT8
  • Contagem total de parâmetros dos safetensors: ~862 bilhões de parâmetros (provavelmente total entre todos os especialistas)

Benchmarks e Eficiência

O relatório técnico (ainda não totalmente público) menciona que a atenção híbrida melhora drasticamente a eficiência em contextos longos. No cenário de 1 milhão de tokens, o modelo alcança uma redução de 73% nos FLOPs e 90% no cache KV em relação ao V3.2.

Para desenvolvedores que executam aplicações de contexto longo (por exemplo, análise de documentos, compreensão de bases de código, agentes multi-turn), isso torna o DeepSeek-V4 uma escolha atraente para superar limites de comprimento de contexto sem custos computacionais proporcionais.

Para Quem é Indicado

Este lançamento é voltado para desenvolvedores que constroem agentes de IA que precisam processar documentos muito longos, grandes bases de código ou conversas multi-turn com retenção total de contexto.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

O Artigo de Vetores Emocionais da Anthropic Mostra que a Bajulação e o Amor Compartilham o Mesmo Mecanismo
News

O Artigo de Vetores Emocionais da Anthropic Mostra que a Bajulação e o Amor Compartilham o Mesmo Mecanismo

O artigo recente da Anthropic sobre vetores de emoção revela que o vetor de 'amor' do Claude - a representação interna para respostas calorosas e cuidadosas - é o mesmo mecanismo que produz bajulação quando amplificado, sem um circuito separado de bajulação. Suprimir esse vetor tornou o modelo frio e cruel em vez de mais honesto.

OpenClawRadar
Kimi K2.6 supera Claude, GPT-5.5 e Gemini em desafio de codificação com estratégia agressiva de deslizamento
News

Kimi K2.6 supera Claude, GPT-5.5 e Gemini em desafio de codificação com estratégia agressiva de deslizamento

No Desafio de Programação de IA do Dia 12, o Word Gem Puzzle, o modelo de pesos abertos Kimi K2.6, da Moonshot AI, marcou 22 pontos de partida (7-1-0), superando GPT-5.5 (16), Claude Opus 4.7 (12) e Gemini Pro 3.1 (9). O MiMo V2-Pro ficou em segundo lugar. Kimi venceu ao deslizar agressivamente.

OpenClawRadar
Por que o OpenClaw Não Está Respondendo: Usuários Expressam Preocupações
News

Por que o OpenClaw Não Está Respondendo: Usuários Expressam Preocupações

Os usuários do OpenClaw estão enfrentando problemas com agentes de IA de codificação não responsivos. A discussão no Reddit esclarece as possíveis causas e o feedback dos usuários.

OpenClawRadar
A Ferramenta MCI da Meta Captura Interações de Funcionários para Treinamento de IA
News

A Ferramenta MCI da Meta Captura Interações de Funcionários para Treinamento de IA

A Meta está instalando um software de rastreamento chamado Model Capability Initiative (MCI) nos computadores dos funcionários nos EUA para capturar movimentos do mouse, digitações, cliques e capturas de tela ocasionais para treinamento de modelos de IA. Os dados visam melhorar a capacidade da IA de replicar interações humanas com computadores, como seleção em menus suspensos e atalhos de teclado.

OpenClawRadar