DeepSeek-V4 Pro und Flash: 1,6 Billionen Parameter, 1 Million Token-Kontext, Hybride Aufmerksamkeit

DeepSeek AI hat eine Vorschau der DeepSeek-V4-Serie auf Hugging Face veröffentlicht. Das Lineup umfasst zwei Mixture-of-Experts (MoE)-Sprachmodelle:
- DeepSeek-V4-Pro: 1,6 Billionen Gesamtparameter, 49 Milliarden aktiv pro Token
- DeepSeek-V4-Flash: 284 Milliarden Gesamtparameter, 13 Milliarden aktiv pro Token
Beide Modelle unterstützen eine Kontextlänge von einer Million Token.
Architektonische Verbesserungen
Die V4-Serie führt einen hybriden Aufmerksamkeitsmechanismus ein, der Folgendes kombiniert:
- Compressed Sparse Attention (CSA)
- Heavily Compressed Attention (HCA)
Bei einer Kontextlänge von 1 Million Token benötigt DeepSeek-V4-Pro nur 27 % der Single-Token-Inferenz-FLOPs und 10 % des KV-Caches im Vergleich zu DeepSeek-V3.2.
Zusätzlich integrieren die Modelle Manifold-Constrained Hyper-Connections (mHC), um residuale Verbindungen zu stärken und die Trainingsstabilität zu verbessern.
Modelldetails
- Repository:
deepseek-ai/DeepSeek-V4-Proauf Hugging Face - Pipeline-Tag:
text-generation - Auto-Modellklasse:
AutoModelForCausalLM - Lizenz: MIT
- Gewichte: sharded safetensors, einschließlich BF16, F32, F8_E8M0, F8_E4M3 und INT8-Formaten
- Gesamtparameteranzahl aus safetensors: ~862 Milliarden Parameter (wahrscheinlich Summe über alle Experten)
Benchmarks und Effizienz
Der technische Bericht (noch nicht vollständig öffentlich) erwähnt, dass die hybride Aufmerksamkeit die Effizienz bei langen Kontexten drastisch verbessert. Im 1-Millionen-Token-Setting erreicht das Modell eine Reduktion der FLOPs um 73 % und des KV-Caches um 90 % im Vergleich zu V3.2.
Für Entwickler, die langkontextige Anwendungen ausführen (z. B. Dokumentenanalyse, Codebasis-Verständnis, Multi-Turn-Agenten), macht dies DeepSeek-V4 zu einer überzeugenden Wahl, um Kontextlängenbeschränkungen ohne proportionale Rechenkosten zu überwinden.
Zielgruppe
Diese Veröffentlichung richtet sich an Entwickler, die KI-Agenten erstellen, die sehr lange Dokumente, große Codebasen oder Multi-Turn-Gespräche mit vollständiger Kontextbeibehaltung verarbeiten müssen.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

Autoresearch bringt Qwen3.5-397B auf 20,34 Tok/s auf dem M5 Max durch SSD-Streaming.
Ein Entwickler erreichte eine Inferenzgeschwindigkeit von 20,34 Token/Sekunde für das 209 GB große Qwen3.5-397B-Modell auf einem MacBook Pro M5 Max mit 128 GB RAM durch SSD-Streaming und 36 systematische Experimente. Das Ergebnis stellt eine 2-fache Beschleunigung gegenüber der M5 Max-Basislinie und eine 4,67-fache gegenüber dem ursprünglichen M3 Max-Ergebnis dar.

Der IDP-Leaderboard-Benchmark zeigt, dass Claude Sonnet 4.6 bei Dokumenten-KI-Aufgaben mit Opus 4.6 gleichzieht.
Das IDP-Leaderboard testete 16 KI-Modelle an über 9.000 Dokumenten in den Bereichen OCR, Tabellenextraktion, Schlüsselextraktion, visuelle Fragenbeantwortung, Handschrift und lange Dokumente. Claude Sonnet 4.6 erzielte insgesamt 80,8 Punkte und lag damit im Wesentlichen gleichauf mit Opus 4.6 bei 80,3, während Haiku 4.5 auf 69,6 Punkte kam.
Amazon-Mitarbeiter 'Tokenmaxxing' mit MeshClaw KI-Agenten zur Erfüllung von Nutzungszielen
Amazon-Entwickler automatisieren unnötige Aufgaben mit dem internen MeshClaw-Tool, um den KI-Tokenverbrauch zu steigern, nachdem das Unternehmen wöchentliche Nutzungsziele für 80 % der Entwickler festgelegt und interne Bestenlisten eingeführt hat.

Claude Artifacts API-Nutzung zählt gegen Chat-Kontingent, nicht gegen API-Abrechnung
Die Verwendung von Claude-Artefakten innerhalb von Claude führt zu normalen API-Aufrufen, die von Anthropic abgefangen und über die angemeldete Sitzung authentifiziert werden. Diese zählen gegen das Chat-Kontingent eines Plans und nicht gegen die API-Abrechnung. Nutzer können dies überprüfen, indem sie Artefakte testen und prüfen, dass die API-Nutzung in der Claude-Konsole bei null bleibt.