DeepSeek-V4 Pro und Flash: 1,6 Billionen Parameter, 1 Million Token-Kontext, Hybride Aufmerksamkeit

✍️ OpenClawRadar📅 Veröffentlicht: 24. April 2026🔗 Source
DeepSeek-V4 Pro und Flash: 1,6 Billionen Parameter, 1 Million Token-Kontext, Hybride Aufmerksamkeit
Ad

DeepSeek AI hat eine Vorschau der DeepSeek-V4-Serie auf Hugging Face veröffentlicht. Das Lineup umfasst zwei Mixture-of-Experts (MoE)-Sprachmodelle:

  • DeepSeek-V4-Pro: 1,6 Billionen Gesamtparameter, 49 Milliarden aktiv pro Token
  • DeepSeek-V4-Flash: 284 Milliarden Gesamtparameter, 13 Milliarden aktiv pro Token

Beide Modelle unterstützen eine Kontextlänge von einer Million Token.

Architektonische Verbesserungen

Die V4-Serie führt einen hybriden Aufmerksamkeitsmechanismus ein, der Folgendes kombiniert:

  • Compressed Sparse Attention (CSA)
  • Heavily Compressed Attention (HCA)

Bei einer Kontextlänge von 1 Million Token benötigt DeepSeek-V4-Pro nur 27 % der Single-Token-Inferenz-FLOPs und 10 % des KV-Caches im Vergleich zu DeepSeek-V3.2.

Zusätzlich integrieren die Modelle Manifold-Constrained Hyper-Connections (mHC), um residuale Verbindungen zu stärken und die Trainingsstabilität zu verbessern.

Ad

Modelldetails

  • Repository: deepseek-ai/DeepSeek-V4-Pro auf Hugging Face
  • Pipeline-Tag: text-generation
  • Auto-Modellklasse: AutoModelForCausalLM
  • Lizenz: MIT
  • Gewichte: sharded safetensors, einschließlich BF16, F32, F8_E8M0, F8_E4M3 und INT8-Formaten
  • Gesamtparameteranzahl aus safetensors: ~862 Milliarden Parameter (wahrscheinlich Summe über alle Experten)

Benchmarks und Effizienz

Der technische Bericht (noch nicht vollständig öffentlich) erwähnt, dass die hybride Aufmerksamkeit die Effizienz bei langen Kontexten drastisch verbessert. Im 1-Millionen-Token-Setting erreicht das Modell eine Reduktion der FLOPs um 73 % und des KV-Caches um 90 % im Vergleich zu V3.2.

Für Entwickler, die langkontextige Anwendungen ausführen (z. B. Dokumentenanalyse, Codebasis-Verständnis, Multi-Turn-Agenten), macht dies DeepSeek-V4 zu einer überzeugenden Wahl, um Kontextlängenbeschränkungen ohne proportionale Rechenkosten zu überwinden.

Zielgruppe

Diese Veröffentlichung richtet sich an Entwickler, die KI-Agenten erstellen, die sehr lange Dokumente, große Codebasen oder Multi-Turn-Gespräche mit vollständiger Kontextbeibehaltung verarbeiten müssen.

📖 Vollständige Quelle lesen: HN AI Agents

Ad

👀 Siehe auch

PeerZero: KI-Agenten führen Peer-Reviews mit Glaubwürdigkeitsbasierten Anreizen durch
Nachrichten

PeerZero: KI-Agenten führen Peer-Reviews mit Glaubwürdigkeitsbasierten Anreizen durch

PeerZero ist eine Plattform, auf der KI-Agenten Forschungsarbeiten einreichen, die Arbeiten anderer begutachten und ihre Glaubwürdigkeit über ein Kopfgeld-System darauf verwetten, richtig zu liegen. Agenten verdienen oder verlieren Glaubwürdigkeitspunkte basierend auf der Genauigkeit ihrer Begutachtungen, mit einem Mechanismus für gerechtfertigte Außenseiter, der unabhängiges Denken belohnt und Gruppendenken bestraft.

OpenClawRadar
OpenClaw: Tauche ein in die erste AMA auf r/clawdbot
Nachrichten

OpenClaw: Tauche ein in die erste AMA auf r/clawdbot

In einer spannenden AMA-Sitzung diskutierte das OpenClaw-Team die Zukunft von KI-Coding-Agenten im Reddit-Subreddit r/clawdbot. Entdecken Sie wichtige Erkenntnisse und Takeaways aus diesem interaktiven Event.

OpenClawRadar
LLM räumliches Denken getestet: Sokoban-Benchmark zeigt ChatGPT, Qwen3.7-max, Gemini 3.5-thinking führen
Nachrichten

LLM räumliches Denken getestet: Sokoban-Benchmark zeigt ChatGPT, Qwen3.7-max, Gemini 3.5-thinking führen

Ein benutzerdefinierter Sokoban-Benchmark testete das räumliche Denken von LLMs im Zero-Shot-Ansatz mit strengen Formatierungsvorgaben. Nur ChatGPT, Qwen3.7-max und Gemini 3.5-thinking bestanden. Modelle wie Gemini 3.5-flash und Qwen3.7-plus scheiterten an illegalen Zügen oder Deadlocks.

OpenClawRadar
Claude-Projekte: Probleme beim Hochladen und Indizieren von Dateien dokumentiert
Nachrichten

Claude-Projekte: Probleme beim Hochladen und Indizieren von Dateien dokumentiert

Claude Projects hat mehrere bestätigte Backend-Probleme: Dateien bleiben beim Indexieren hängen, der RAG-Suchmodus wird vorzeitig bei etwa 13 Dateien aktiviert – unabhängig von der Tokenanzahl – und zwischengespeicherte Inhalte bleiben auch nach Löschung und erneutem Hochladen erhalten.

OpenClawRadar