DeepSeek-V4 ProおよびFlash:1.6Tパラメータ、100万トークンコンテキスト、ハイブリッドアテンション

DeepSeek AIは、Hugging Face上でDeepSeek-V4シリーズのプレビューを公開しました。ラインナップには2つのMixture-of-Experts(MoE)言語モデルが含まれます。
- DeepSeek-V4-Pro: 総パラメータ1.6兆、トークンあたり活性化パラメータ490億
- DeepSeek-V4-Flash: 総パラメータ2840億、トークンあたり活性化パラメータ130億
両モデルとも100万トークンのコンテキスト長をサポートしています。
アーキテクチャのアップグレード
V4シリーズは、以下を組み合わせたハイブリッド注意機構を導入しています。
- 圧縮スパース注意機構(CSA)
- 高圧縮注意機構(HCA)
100万トークンのコンテキスト長において、DeepSeek-V4-ProはDeepSeek-V3.2と比較して、単一トークン推論のFLOPsが27%、KVキャッシュが10%で済みます。
さらに、モデルは多様体制約付きハイパー接続(mHC)を採用し、残差接続を強化して学習の安定性を向上させています。
モデルの詳細
- リポジトリ: Hugging Face上の
deepseek-ai/DeepSeek-V4-Pro - パイプライインタグ:
text-generation - オートモデルクラス:
AutoModelForCausalLM - ライセンス: MIT
- 重み: シャーディングされたsafetensors(BF16、F32、F8_E8M0、F8_E4M3、INT8形式を含む)
- safetensorsからの総パラメータ数: 約8620億(おそらく全エキスパートの合計)
ベンチマークと効率性
技術レポート(まだ完全には公開されていません)によると、ハイブリッド注意機構は長コンテキストの効率を劇的に向上させます。100万トークンの設定では、V3.2と比較してFLOPsが73%削減、KVキャッシュが90%削減されます。
長コンテキストアプリケーション(例:文書分析、コードベース理解、マルチターンエージェント)を開発する開発者にとって、DeepSeek-V4は比例的な計算コストをかけずにコンテキスト長の限界を突破する魅力的な選択肢です。
対象ユーザー
このリリースは、非常に長い文書、大規模なコードベース、または完全なコンテキスト保持を必要とするマルチターン会話を処理するAIエージェントを構築する開発者を対象としています。
📖 全文のソース: HN AI Agents
👀 See Also

「エージェンティック」な物語に欠けているもの:明確に定義されたユーザーエージェントの役割
Mark Nottinghamは、現在のAIエージェントには明確なユーザーエージェントの役割が欠けており、ユーザーの期待と実際のエージェントの動作との間に信頼ギャップが生じていると論じています。

Claude Code v2.1.118では、Vimビジュアルモード、カスタムテーマ、MCPの改善が追加されました。
Claude Code v2.1.118では、選択演算子を備えたVimビジュアルモード、/themeコマンドによるカスタムテーマ管理、MCP OAuth認証とプラグイン依存関係解決の複数の修正が導入されました。

君 $19/月 アップデート:構造化モデルによるOpenClawの強化
Kimiは、OpenClaw内のモデル構造化の強化に焦点を当てた最新アップデートを月額19ドルで導入しました。このアップデートは、効率的な運用と自動化機能の向上を約束します。

Cronの自動更新が設定検証エラーによりOpenClawを破損しました
OpenClawの自動更新を設定したcronジョブが、cliBackendsフィールドの設定検証問題に遭遇し、接続が失われました。問題のあるセクションを削除し、ゲートウェイを再起動することで修正されました。