広告枠を募集中 ご相談ください

DeepSeek-V4-Proを徹底解剖:1.6T MoE、CSA/HCAハイブリッドアテンション、100万トークンのKVキャッシュ革新

365Finds Editorial

2026年8月13日、DeepSeekはフラッグシップ・オープンウェイトモデル「DeepSeek-V4-Pro(0813正式版)」を正式リリースしました。本モデルは、従来の単一高密度(Dense)推論や固定的な思考プロセスから、超大規模なスパース・Mixture-of-Experts(MoE)アーキテクチャと動的な長文コンテキスト・メモリ圧縮技術への本格的な転換を象徴しています。総パラメータ数1.6兆、1トークンあたりのアクティブパラメータ約490億という高効率設計に加え、最大100万トークンのコンテキストウィンドウと3段階の思考モード(Thinking Modes)を備え、複雑なソフトウェアエンジニアリングや自律型AIエージェントの基盤を強力に支援します。

長文コンテキスト処理において最大の課題であった「KVキャッシュのメモリ壁」を突破するため、DeepSeek-V4-Proはアテンション機構を根本から再設計しました。圧縮スパースアテンション(CSA)と重度圧縮アテンション(HCA)のハイブリッド構成を採用することで、KVキャッシュのメモリ消費を劇的に抑えつつ、高精度なドキュメント横断検索と論理推論を実現しています。

1.6T MoEと動的エキスパートルーティング

DeepSeek-V4-Proは、32兆トークンを超える高品質な多言語テキストおよびコードデータセットを用いて事前学習されました。モデル骨格には、DeepSeek独自のエキスパート細分化および共有エキスパート分離アーキテクチャが採用されています。

アーキテクチャ構成DeepSeek-V4-ProDeepSeek-V4-Flash
総パラメータ数1.6T (1,600B)284B
トークン毎のアクティブパラメータ~49B~13B
コンテキスト長1,000,000トークン (1M)1,000,000トークン (1M)
事前学習トークン規模> 32T トークン> 32T トークン
ライセンスMIT LicenseMIT License
モデル重み公開先Hugging Face公式リポジトリHugging Face公式リポジトリ

フォワード計算時には、動的ルーティングゲートが入力トークンを最も適した専門エキスパートへ割り振る一方、一定比率の共有エキスパートが共通の文法や一般知識を処理します。これにより、従来型MoEに見られたエキスパート負荷の偏りによるスループット低下を防ぎ、49Bモデル並みの計算負荷で1.6T Denseモデルに匹敵する表現力を獲得しています。

CSAとHCA:100万トークンのメモリ壁を克服

標準的な全量アテンション(Full Attention)では、KVキャッシュのメモリ使用量がシーケンス長に比例して直線的に増加し、計算量は二乗で増大します。100万トークン規模ではKVキャッシュの保持だけで膨大なVRAMが必要となり、持続的なエージェント運用において経済的なボトルネックとなっていました。

DeepSeek-V4-Proは、協調動作する2つの圧縮アテンション機構によってこの課題を解決しています。

入力シーケンス (1M Tokens)
  │
  ├── 近傍高頻度ウィンドウ ──► HCA (Heavily Compressed Attention) ──► 高精度スライディングウィンドウ
  │
  └── 広域グローバル履歴   ──► CSA (Compressed Sparse Attention)  ──► 動的セレクターと低次元圧縮
                                                                          │
                                                                          ▼
                                                              KVキャッシュメモリを約70〜80%削減
  1. 圧縮スパースアテンション (CSA, Compressed Sparse Attention):軽量なスコアリング機構により過去の重要トークンを動的に選別・クラスタ化し、現在のクエリに関連性の高いブロックのみを展開。残りのコンテキストは低次元射影により圧縮保持します。
  2. 重度圧縮アテンション (HCA, Heavily Compressed Attention):局所的なスライディングウィンドウ内でコンテキストの整合性を維持しつつ、ウィンドウ外のデータに対してクロスレイヤー量子化とKVプーリングを実施します。

これら2つの技術の統合により、1Mコンテキスト推論時のKVキャッシュメモリ使用量が70%以上削減され、数十ステップに及ぶ大規模コードリファクタリングやリポジトリ全体の静的解析が現実的なコストで実行可能になりました。

3段階の思考モード(Thinking Modes)

初期の推論特化型モデル(DeepSeek-R1など)は、一律の思考ステップ長に依存していました。しかし実業務では、単純なデータ整形と複雑なアーキテクチャ設計とで求められる推論深度が異なります。

DeepSeek-V4-Proは、APIおよびモデルインターフェース上で切り替え可能な思考モードをネイティブ提供しています。

この設定は公式の APIドキュメントおよびResponses APIガイド から直接指定可能であり、タスクの重要度に応じた柔軟なコスト最適化が可能です。

ベンチマークとエージェント性能

ソフトウェアエンジニアリングとターミナル操作の評価において、DeepSeek-V4-Proは高い実用性を示しています。公開ベンチマークデータによると、Terminal-Bench 2.1(環境操作とコマンド実行)およびDeepSWE(オープンソースIssueの自律解決)において、先行するオープンウェイトモデルを上回り、主要な商用クローズドモデルと同等のスコアを記録しています。

リアルタイム対話には低レイテンシなDeepSeek-V4-Flashが適している一方、数百ファイルにまたがる複雑な依存関係の解析や重要バグの修正においては、V4-Proの1.6Tモデル規模とMax思考モードが明確な優位性を発揮します。

導入方針とエコシステム連携

DeepSeek-V4-Proの導入を検討する開発チームには、以下の構成が推奨されます。

DeepSeek-V4-Proの登場により、オープンウェイトモデルは超長文コンテキスト処理と柔軟な推論制御の両立を実証しました。計算コストとメモリ消費の最適化を通じて、高度な自律型エージェントシステムの構築が一段と現実的なものとなっています。