DeepSeek-V4 Pro e Flash: 1,6 trilhão de parâmetros, contexto de 1 milhão de tokens, atenção híbrida

A DeepSeek AI lançou uma prévia da série DeepSeek-V4 no Hugging Face. A linha inclui dois modelos de linguagem Mixture-of-Experts (MoE):
- DeepSeek-V4-Pro: 1,6 trilhão de parâmetros totais, 49 bilhões ativados por token
- DeepSeek-V4-Flash: 284 bilhões de parâmetros totais, 13 bilhões ativados por token
Ambos os modelos suportam um comprimento de contexto de um milhão de tokens.
Atualizações Arquiteturais
A série V4 introduz um mecanismo de atenção híbrido que combina:
- Atenção Esparsa Comprimida (CSA)
- Atenção Altamente Comprimida (HCA)
No comprimento de contexto de 1 milhão de tokens, o DeepSeek-V4-Pro requer apenas 27% dos FLOPs de inferência por token e 10% do cache KV em comparação com o DeepSeek-V3.2.
Além disso, os modelos incorporam Conexões Hiper com Restrição de Manifold (mHC) para fortalecer as conexões residuais, melhorando a estabilidade do treinamento.
Detalhes do Modelo
- Repositório:
deepseek-ai/DeepSeek-V4-Prono Hugging Face - Tag de pipeline:
text-generation - Classe de modelo automático:
AutoModelForCausalLM - Licença: MIT
- Pesos: safetensors fragmentados, incluindo formatos BF16, F32, F8_E8M0, F8_E4M3 e INT8
- Contagem total de parâmetros dos safetensors: ~862 bilhões de parâmetros (provavelmente total entre todos os especialistas)
Benchmarks e Eficiência
O relatório técnico (ainda não totalmente público) menciona que a atenção híbrida melhora drasticamente a eficiência em contextos longos. No cenário de 1 milhão de tokens, o modelo alcança uma redução de 73% nos FLOPs e 90% no cache KV em relação ao V3.2.
Para desenvolvedores que executam aplicações de contexto longo (por exemplo, análise de documentos, compreensão de bases de código, agentes multi-turn), isso torna o DeepSeek-V4 uma escolha atraente para superar limites de comprimento de contexto sem custos computacionais proporcionais.
Para Quem é Indicado
Este lançamento é voltado para desenvolvedores que constroem agentes de IA que precisam processar documentos muito longos, grandes bases de código ou conversas multi-turn com retenção total de contexto.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

O Artigo de Vetores Emocionais da Anthropic Mostra que a Bajulação e o Amor Compartilham o Mesmo Mecanismo
O artigo recente da Anthropic sobre vetores de emoção revela que o vetor de 'amor' do Claude - a representação interna para respostas calorosas e cuidadosas - é o mesmo mecanismo que produz bajulação quando amplificado, sem um circuito separado de bajulação. Suprimir esse vetor tornou o modelo frio e cruel em vez de mais honesto.

Kimi K2.6 supera Claude, GPT-5.5 e Gemini em desafio de codificação com estratégia agressiva de deslizamento
No Desafio de Programação de IA do Dia 12, o Word Gem Puzzle, o modelo de pesos abertos Kimi K2.6, da Moonshot AI, marcou 22 pontos de partida (7-1-0), superando GPT-5.5 (16), Claude Opus 4.7 (12) e Gemini Pro 3.1 (9). O MiMo V2-Pro ficou em segundo lugar. Kimi venceu ao deslizar agressivamente.

Por que o OpenClaw Não Está Respondendo: Usuários Expressam Preocupações
Os usuários do OpenClaw estão enfrentando problemas com agentes de IA de codificação não responsivos. A discussão no Reddit esclarece as possíveis causas e o feedback dos usuários.

A Ferramenta MCI da Meta Captura Interações de Funcionários para Treinamento de IA
A Meta está instalando um software de rastreamento chamado Model Capability Initiative (MCI) nos computadores dos funcionários nos EUA para capturar movimentos do mouse, digitações, cliques e capturas de tela ocasionais para treinamento de modelos de IA. Os dados visam melhorar a capacidade da IA de replicar interações humanas com computadores, como seleção em menus suspensos e atalhos de teclado.