DeepSeek-V4 Pro et Flash : 1,6 T de paramètres, contexte de 1 M de tokens, attention hybride

DeepSeek AI a publié un aperçu de la série DeepSeek-V4 sur Hugging Face. La gamme comprend deux modèles de langage Mixture-of-Experts (MoE) :
- DeepSeek-V4-Pro : 1,6 billion de paramètres au total, 49 milliards activés par token
- DeepSeek-V4-Flash : 284 milliards de paramètres au total, 13 milliards activés par token
Les deux modèles prennent en charge une longueur de contexte de un million de tokens.
Améliorations architecturales
La série V4 introduit un mécanisme d'attention hybride combinant :
- Attention Sparse Comprimée (CSA)
- Attention Fortement Comprimée (HCA)
Pour une longueur de contexte d'un million de tokens, DeepSeek-V4-Pro ne nécessite que 27% des FLOPs d'inférence par token et 10% du cache KV par rapport à DeepSeek-V3.2.
De plus, les modèles intègrent des Hyper-Connexions sous Contrainte de Variété (mHC) pour renforcer les connexions résiduelles, améliorant ainsi la stabilité de l'entraînement.
Détails du modèle
- Répertoire :
deepseek-ai/DeepSeek-V4-Prosur Hugging Face - Pipeline :
text-generation - Classe de modèle automatique :
AutoModelForCausalLM - Licence : MIT
- Poids : safetensors fragmentés, incluant les formats BF16, F32, F8_E8M0, F8_E4M3 et INT8
- Nombre total de paramètres d'après les safetensors : environ 862 milliards de paramètres (probablement le total sur tous les experts)
Benchmarks et efficacité
Le rapport technique (pas encore entièrement public) mentionne que l'attention hybride améliore considérablement l'efficacité des longs contextes. Dans le cadre d'un million de tokens, le modèle atteint une réduction de 73% des FLOPs et de 90% du cache KV par rapport à V3.2.
Pour les développeurs qui utilisent des applications à longs contextes (par exemple, analyse de documents, compréhension de codebase, agents multi-tours), cela fait de DeepSeek-V4 un choix convaincant pour dépasser les limites de longueur de contexte sans coûts de calcul proportionnels.
À qui s'adresse-t-il
Cette version cible les développeurs qui construisent des agents d'IA devant traiter de très longs documents, de grandes codebases ou des conversations multi-tours avec une rétention complète du contexte.
📖 Lire la source complète : HN AI Agents
👀 See Also

Claude restreint l'utilisation de harnais tiers, y compris OpenClaw, à partir du 4 avril.
Anthropic ne permettra plus que les limites d'abonnement à Claude soient utilisées avec des interfaces tierces comme OpenClaw à partir du 4 avril, exigeant une facturation séparée au paiement à l'usage pour une telle utilisation. Les utilisateurs recevront un crédit unique égal au prix de leur abonnement mensuel et pourront pré-acheter des forfaits d'utilisation avec une remise allant jusqu'à 30 %.

Claude Code v2.1.153 intègre Skip LFS, correctifs MCP et autocomplétion d'agent
Claude Code v2.1.153 ajoute l'option skipLfs pour éviter Git LFS, corrige les boucles de reconnexion des serveurs MCP avec état, et améliore l'auto-complétion des commandes slash et des compétences intégrées dans l'agent.

Les agents de codage remplacent la revue humaine de code : un article affirme que la revue traditionnelle est morte
Un article sur arXiv affirme que les agents de codage ont franchi le seuil pour remplacer la revue humaine, offrant un coût réduit et un débit accru.

Détails du règlement sur les droits d'auteur Anthropic pour les développeurs
Anthropic a réglé une action collective en matière de droits d'auteur de 1,5 milliard de dollars pour l'utilisation d'œuvres protégées pour entraîner des modèles d'IA. Les titulaires de droits d'auteur éligibles peuvent réclamer entre 500 et 3 000 dollars par œuvre validée, avec une date limite fixée au 23 mars 2026.