DeepSeek-V4 ProおよびFlash:1.6Tパラメータ、100万トークンコンテキスト、ハイブリッドアテンション

DeepSeek AIは、Hugging Face上でDeepSeek-V4シリーズのプレビューを公開しました。ラインナップには2つのMixture-of-Experts(MoE)言語モデルが含まれます。
- DeepSeek-V4-Pro: 総パラメータ1.6兆、トークンあたり活性化パラメータ490億
- DeepSeek-V4-Flash: 総パラメータ2840億、トークンあたり活性化パラメータ130億
両モデルとも100万トークンのコンテキスト長をサポートしています。
アーキテクチャのアップグレード
V4シリーズは、以下を組み合わせたハイブリッド注意機構を導入しています。
- 圧縮スパース注意機構(CSA)
- 高圧縮注意機構(HCA)
100万トークンのコンテキスト長において、DeepSeek-V4-ProはDeepSeek-V3.2と比較して、単一トークン推論のFLOPsが27%、KVキャッシュが10%で済みます。
さらに、モデルは多様体制約付きハイパー接続(mHC)を採用し、残差接続を強化して学習の安定性を向上させています。
モデルの詳細
- リポジトリ: Hugging Face上の
deepseek-ai/DeepSeek-V4-Pro - パイプライインタグ:
text-generation - オートモデルクラス:
AutoModelForCausalLM - ライセンス: MIT
- 重み: シャーディングされたsafetensors(BF16、F32、F8_E8M0、F8_E4M3、INT8形式を含む)
- safetensorsからの総パラメータ数: 約8620億(おそらく全エキスパートの合計)
ベンチマークと効率性
技術レポート(まだ完全には公開されていません)によると、ハイブリッド注意機構は長コンテキストの効率を劇的に向上させます。100万トークンの設定では、V3.2と比較してFLOPsが73%削減、KVキャッシュが90%削減されます。
長コンテキストアプリケーション(例:文書分析、コードベース理解、マルチターンエージェント)を開発する開発者にとって、DeepSeek-V4は比例的な計算コストをかけずにコンテキスト長の限界を突破する魅力的な選択肢です。
対象ユーザー
このリリースは、非常に長い文書、大規模なコードベース、または完全なコンテキスト保持を必要とするマルチターン会話を処理するAIエージェントを構築する開発者を対象としています。
📖 全文のソース: HN AI Agents
👀 See Also

AIバブルはインターネットバブルとは異なる ― 労働者はスプレッドシートを密輸したようにAIを密輸しない
コリー・ドクトロウは、AIバブルがドットコム時代とは根本的に異なると主張する。ワーカーは仕事に役立つからこそインターネットツールをこっそり企業ネットワークに持ち込んだ。AIエージェントをこっそり持ち込む者はいない——経営陣から強制されているのだ。

OpenClawの使い勝手と経済的実現性に対する懸念が浮上
OpenClawは、参入障壁の高さ、法外なコスト、セキュリティ問題、誤解を招くメモリ機能などで批判されています。MemU Botのような代替ソリューションが推奨されています。

エージェンティックWebインデックス:AIボットトラフィック統計が大量スクレイピングとスプーフィングを示す
Known Agentsの新しいインデックスによると、ボットはウェブトラフィックの35%を占め、AI関連のボットトラフィックは12%増加し、攻撃者はClaudeBotなどのAIエージェントを偽装して大規模な脆弱性スキャンを実行しています。
レア本に仕込まれたAirTagが暴く、アマゾンの破壊的AIトレーニングスキャン作戦
ある書店主が希少本にAirTagを仕込み、AmazonのAIトレーニング施設に届く様子を追跡。AIトレーニングデータのために本が破棄されていることが明らかになった。