DeepSeek-V4 Pro et Flash : 1,6 T de paramètres, contexte de 1 M de tokens, attention hybride

✍️ OpenClawRadar📅 Publié: April 24, 2026🔗 Source
DeepSeek-V4 Pro et Flash : 1,6 T de paramètres, contexte de 1 M de tokens, attention hybride
Ad

DeepSeek AI a publié un aperçu de la série DeepSeek-V4 sur Hugging Face. La gamme comprend deux modèles de langage Mixture-of-Experts (MoE) :

  • DeepSeek-V4-Pro : 1,6 billion de paramètres au total, 49 milliards activés par token
  • DeepSeek-V4-Flash : 284 milliards de paramètres au total, 13 milliards activés par token

Les deux modèles prennent en charge une longueur de contexte de un million de tokens.

Améliorations architecturales

La série V4 introduit un mécanisme d'attention hybride combinant :

  • Attention Sparse Comprimée (CSA)
  • Attention Fortement Comprimée (HCA)

Pour une longueur de contexte d'un million de tokens, DeepSeek-V4-Pro ne nécessite que 27% des FLOPs d'inférence par token et 10% du cache KV par rapport à DeepSeek-V3.2.

De plus, les modèles intègrent des Hyper-Connexions sous Contrainte de Variété (mHC) pour renforcer les connexions résiduelles, améliorant ainsi la stabilité de l'entraînement.

Ad

Détails du modèle

  • Répertoire : deepseek-ai/DeepSeek-V4-Pro sur Hugging Face
  • Pipeline : text-generation
  • Classe de modèle automatique : AutoModelForCausalLM
  • Licence : MIT
  • Poids : safetensors fragmentés, incluant les formats BF16, F32, F8_E8M0, F8_E4M3 et INT8
  • Nombre total de paramètres d'après les safetensors : environ 862 milliards de paramètres (probablement le total sur tous les experts)

Benchmarks et efficacité

Le rapport technique (pas encore entièrement public) mentionne que l'attention hybride améliore considérablement l'efficacité des longs contextes. Dans le cadre d'un million de tokens, le modèle atteint une réduction de 73% des FLOPs et de 90% du cache KV par rapport à V3.2.

Pour les développeurs qui utilisent des applications à longs contextes (par exemple, analyse de documents, compréhension de codebase, agents multi-tours), cela fait de DeepSeek-V4 un choix convaincant pour dépasser les limites de longueur de contexte sans coûts de calcul proportionnels.

À qui s'adresse-t-il

Cette version cible les développeurs qui construisent des agents d'IA devant traiter de très longs documents, de grandes codebases ou des conversations multi-tours avec une rétention complète du contexte.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

Claude restreint l'utilisation de harnais tiers, y compris OpenClaw, à partir du 4 avril.
News

Claude restreint l'utilisation de harnais tiers, y compris OpenClaw, à partir du 4 avril.

Anthropic ne permettra plus que les limites d'abonnement à Claude soient utilisées avec des interfaces tierces comme OpenClaw à partir du 4 avril, exigeant une facturation séparée au paiement à l'usage pour une telle utilisation. Les utilisateurs recevront un crédit unique égal au prix de leur abonnement mensuel et pourront pré-acheter des forfaits d'utilisation avec une remise allant jusqu'à 30 %.

OpenClawRadar
Claude Code v2.1.153 intègre Skip LFS, correctifs MCP et autocomplétion d'agent
News

Claude Code v2.1.153 intègre Skip LFS, correctifs MCP et autocomplétion d'agent

Claude Code v2.1.153 ajoute l'option skipLfs pour éviter Git LFS, corrige les boucles de reconnexion des serveurs MCP avec état, et améliore l'auto-complétion des commandes slash et des compétences intégrées dans l'agent.

OpenClawRadar
Les agents de codage remplacent la revue humaine de code : un article affirme que la revue traditionnelle est morte
News

Les agents de codage remplacent la revue humaine de code : un article affirme que la revue traditionnelle est morte

Un article sur arXiv affirme que les agents de codage ont franchi le seuil pour remplacer la revue humaine, offrant un coût réduit et un débit accru.

OpenClawRadar
Détails du règlement sur les droits d'auteur Anthropic pour les développeurs
News

Détails du règlement sur les droits d'auteur Anthropic pour les développeurs

Anthropic a réglé une action collective en matière de droits d'auteur de 1,5 milliard de dollars pour l'utilisation d'œuvres protégées pour entraîner des modèles d'IA. Les titulaires de droits d'auteur éligibles peuvent réclamer entre 500 et 3 000 dollars par œuvre validée, avec une date limite fixée au 23 mars 2026.

OpenClawRadar