2026 DEEPSEEK V4
ZENSHIN_BAN_
GA_RELEASE.

DeepSeek V4 正式版 GA 公開:アーキテクチャ・時間帯別料金・ベンチマーク比較

リード:3か月の待機を経て、DeepSeek V4 正式版(GA)が2026年7月20日に本番公開されました。4月のプレビュー版と比べ、Agent能力・数学推論・コード生成が強化されたほか、初めて時間帯別差別化料金が導入されました。これは DeepSeek が「ほぼ無料」から規律ある商用運用へ移行する節目です。本記事では調査素材の全要点を網羅します:完全タイムライン、V4-Pro/Flash仕様表、CSA+HCA+mHCアーキテクチャ、3つの推論モード、ベンチマーク全表、時間帯別料金、API移行ガイド(7月24日締切)、GPT-5.6 / Claude Fable 5 比較マトリクス、FAQ、オープンソースのマイルストーン考察。

30秒で把握 · TL;DR

公開2026-07-20 GA正式版リリース · 7/24 deepseek-chat 永久廃止
規模V4-Pro 1.6T(49Bアクティブ)· V4-Flash 284B(13Bアクティブ)· いずれも 1M コンテキスト
核心能力SWE-bench Verified 80.6%(オープン最高)· LiveCodeBench 93.5% · MITオープンソース
料金時間帯別 · V4-Pro出力 $0.87/M(オフピーク)/ $1.74/M(ピーク)
コスパ同等タスクのコストは Claude Fable 5 の 1/116($0.03 vs $3.48)

1. なぜ正式版が重要なのか

  1. プレビューは強いが、本番には「正式な約束」が欠けていた。4月24日のプレビュー公開後、開発者が抱えた疑問は2つです。性能はさらに上がるのか?料金は急変するのか?GA正式版は3か月の本番チューニングで前者に、時間帯別料金体系で後者に答えました。SLAの下で安心して本番投入できる段階に入りました。
  2. 旧API名がまもなく永久廃止され、移行ウィンドウは極めて短い。deepseek-chatdeepseek-reasoner7月24日15:59 UTC にサービス終了します。Cursor、OpenClaw、自前Agentが旧モデル名を参照しているなら、残りはわずか4日です。
  3. 時間帯別料金は両刃の剣です。平日09–12時、14–18時(北京時間)は料金が2倍になりますが、ピーク時でもV4-Proの出力単価($1.74/M)はClaude Opus 4.8($15/M)より 8.6倍安いです。コツはオフピークスケジューリングとFlashによるトラフィック分散です。

2. ひとことで言うと

DeepSeek V4 正式版は、2026年7月20日に公開された一般提供(GA)版で、V4-Pro(1.6兆パラメータMoE)と V4-Flash(2840億パラメータMoE)の2モデルを含みます。いずれも MITライセンスでオープンソース化され、100万トークンのコンテキストと 384K の最大出力をサポートします。

プレビュー版と比べ、GA版はAgentオーケストレーション・数学推論・コード生成を強化し、時間帯別API料金を整備しました。アーキテクチャ自体は新しくありません——CSA(圧縮スパースアテンション)+ HCA(高度圧縮アテンション)+ mHC(多様体制約ハイパーコネクション)は4月プレビューから確立されており、正式版は安定性・チューニング・商用化の完結を担います。

要約: DeepSeek V4 はオープンモデルで SWE-bench Verified 最高スコア(80.6%)を記録し、クローズドフラッグシップの1/10〜1/100のコストでフロンティアに近い性能を提供し、プライベートデプロイと1M超長コンテキストにも対応します。

3. タイムライン:プレビューから正式版へ

日付イベント
2026-04-24V4プレビュー公開 + オープンソース(MIT)、V4-Pro(1.6T)とV4-Flash(284B)を含む
2026-05V4-FlashとV4-Proの本番チューニング版リリース、API正式利用可能
2026-06V4-Pro価格を恒久的に 75% 値下げ(出力$0.87/M tokens)、史上最高のコスパ帯に
2026-06-29DeepSeekが全APIユーザーにメール送信、GA正式版を 7月中旬に公開すると発表、初めて時間帯別料金を開示
2026-07-19複数の開発者がGAグレー内測資格を取得、メディアが「正式版は明日公開の可能性」と報道
2026-07-20GA正式版公開(本記事公開日)
2026-07-24旧インターフェース名 deepseek-chatdeepseek-reasoner永久廃止

関連記事:DeepSeek自研チップと算力戦略Kimi K3 徹底評価6月AI大モデル値下げ・割引攻略もあわせてご覧ください。

4. モデルファミリー仕様:V4-Pro vs V4-Flash

仕様V4-ProV4-Flash
総パラメータ数1.6兆(1.6T)2840億(284B)
トークンあたりアクティブパラメータ490億(49B)130億(13B)
Transformer層数61層43層
コンテキストウィンドウ1,000,000 tokens1,000,000 tokens
最大出力384K tokens384K tokens
精度FP4(エキスパート重み)+ FP8(その他)FP4 + FP8 混合
事前学習データ量33T+ tokens32T+ tokens
オープンソースライセンスMITMIT

5. コアアーキテクチャ:CSA + HCA + mHC 詳解

従来のTransformerでは、KV Cacheのメモリ消費がコンテキスト長に比例して増加し、1Mトークンのサポートは事実上不可能でした。DeepSeek V4はV2/V3時代のMLA(マルチヘッド潜在アテンション)を廃止し、3つの主要なアーキテクチャ革新でこの課題を解決しています。

5.1 圧縮スパースアテンション(CSA、Compressed Sparse Attention)

  • KVシーケンスをSoftmaxゲート付きプーリングでまず 4倍 圧縮
  • FP4精度の「Lightning Indexer」でtop-kスパース選択(V4-Proは top-1024、V4-Flashは top-512
  • 直近 128 トークンのスライディングウィンドウも保持
  • 効果:1Mコンテキストで、DeepSeek V3.2比 27% の推論FLOPsで済む

5.2 高度圧縮アテンション(HCA、Heavily Compressed Attention)

  • トークンを 128倍 圧縮し、グローバルな密なアテンションを実行
  • 長距離依存を捉え、CSAと補完的に機能
  • V4-Flashは最初の2層がHCA、その後CSA/HCAを交互に使用。V4-Proも同様の構造

総合効果:1Mトークンシナリオで、KV CacheメモリはV3.2の 10%(V4-Flashは 7% まで低減)。

5.3 多様体制約ハイパーコネクション(mHC)と Muon オプティマイザ

mHC(Manifold-Constrained Hyper-Connections) は従来の残差接続のアップグレードです。標準Transformerの x = x + f(x) 残差パスは、極めて深いネットワークで勾配劣化を起こしやすくなります。mHCは 4チャネル残差ストリーム を導入し、双確率行列制約(Birkhoff多面体)を満たす混合行列により、61層の深いネットワークでも信号が安定して伝播します。

学習時は標準のAdamWではなく Muonオプティマイザ を採用し、ニュートン-シュルツ直交化で勾配を処理することで、より根拠のある勾配ステップと高速な収束、安定した学習を実現しています。

5.4 3つの推論モード

モード特徴適用シーン
Non-think思考チェーンなし、超高速応答簡単なQ&A、ルーティング
Think High明示的推論(<redacted_thinking> タグ)中程度の複雑タスク、コードデバッグ
Think Max最大推論強度、384K+コンテキストが必要複雑な数学、長チェーンAgent

推奨サンプリングパラメータ:temperature=1.0, top_p=1.0(公式推奨、全モード共通)。

6. ベンチマーク:オープンソース王者の成績表

ベンチマークDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6% ★ オープン最高96.0%個別未公表~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

読み解きのポイント:

  • SWE-bench Verified:V4-Proは80.6%でオープンモデル1位、Gemini 3.1 Proと同率
  • LiveCodeBench:V4-Proは93.5%で全クローズド競合を上回り、アルゴリズム競技シーンで最適
  • SWE-bench Pro:Claude Fable 5が80.3%でリード、マルチファイルRepo級のバグ修正は依然としてその得意分野
  • Terminal-Bench:GPT-5.6 Ultraが85.1%でリード、ターミナル/ツールチェーン密集のAgentシーンに優れる

注意:上記ベンチマークはDeepSeek自報および第三者集計データに基づきます。モデルごとに異なる推論harnessが使われており、独立した再現検証は進行中です。

7. コストパフォーマンス:タスクあたりのコスト vs 性能

Artificial Analysisの評価データによると、Strategy & Ops指数タスクでは次のとおりです。

モデルタスクあたりコストスコアコスパ倍率
Claude Fable 5$3.4850点基準
DeepSeek V4-Pro$0.0338点コストはFable 5の 1/116
DeepSeek V4-Flash6カテゴリ全指数タスクで $0.04 未満軽量タスクで極限の節約

Fable 5のコストはV4-Proの 116倍 ですが、スコアは約12点(31%)しか上回りません。ほとんどの本番シーンでは、V4-Proのコスパは比類がありません。

8. 横断比較:DeepSeek V4 vs GPT-5.6 Sol vs Claude Fable 5

観点DeepSeek V4-ProGPT-5.6 SolClaude Fable 5
オープンソース✅ MITライセンス❌ クローズド❌ クローズド
セルフホスト✅ 対応
コンテキストウィンドウ1M tokens未公開1M tokens
コード能力極めて強い(Fable 5に近い)極めて強い最強
API出力単価(オフピーク)$0.87/M tokens~$15/M$50/M
ピーク出力単価$1.74/M tokens
Agent能力強い、マルチAgentオーケストレーション対応強い最強
データプライバシー✅ プライベートデプロイ可
シーン推奨モデル理由
予算重視 / 高頻度呼び出し / プライベートデプロイDeepSeek V4-Pro / Flash出力$0.87/M、MITオープンソース
究極のコード能力、コスト不問Claude Fable 5SWE-bench Pro最高80.3%
複雑なアルゴリズム + 数学推論GPT-5.6 Sol / UltraTerminal-Benchリード
超大規模ログ/ドキュメント処理V4-Flashキャッシュヒット入力は$0.0028/Mのみ

9. 時間帯別料金:完全価格表と節約術

これはGA版で最も注目され、議論を呼ぶ変更です。DeepSeekは初めて時間帯別差別化料金を導入しました。電力の時間帯別料金に似た仕組みです。ピーク時間帯(北京時間):平日 09:00–12:0014:00–18:00、全料金が2倍になります。

モデル課金項目オフピークピーク
V4-Pro入力(キャッシュヒット)¥0.025 / $0.0035 / 1M tokens2倍
入力(キャッシュミス)¥3.00 / $0.435 / 1M tokens¥6.00 / $0.87
出力¥6.00 / $0.87 / 1M tokens¥12.00 / $1.74
V4-Flash入力(キャッシュヒット)¥0.02 / $0.0028 / 1M tokens2倍
入力(キャッシュミス)¥1.00 / $0.14 / 1M tokens¥2.00 / $0.28
出力¥2.00 / $0.28 / 1M tokens¥4.00 / $0.56

9.1 4つの節約テクニック

  1. 非リアルタイムタスクはオフピークに:バッチ文書処理、データアノテーション、コードレビューなどは18:00以降または朝9時前に実行
  2. キャッシュヒットを活用:繰り返しのSystem PromptにはPrompt Cacheを構築。V4-Flashのキャッシュヒットコストは $0.0028/M でほぼ無料
  3. Flashでトラフィック分散:簡単な意図認識・ルーティング判断はV4-Flash、複雑な推論はV4-Proへ——推論コストを60–80%削減可能
  4. 請求通知を事前に取得:DeepSeekは料金変更の 24時間前 にメール通知を送ると約束しています

ピーク時でも、V4-Proの出力単価($1.74/M)はClaude Opus 4.8($15/M)より 8.6倍安く、GPT-5.6 Sol(約$15/M)と同等の倍率で安いです。

10. 開発者必読:API移行ガイド(7月24日締切)⚠️

重要警告:旧モデル名 deepseek-chatdeepseek-reasoner2026年7月24日15:59 UTC(北京時間7月24日23:59) に永久アクセス停止します。

旧モデル名新モデル名備考
deepseek-chatdeepseek-v4-flash(非思考モード)高速、軽量タスク向け
deepseek-reasonerdeepseek-v4-flash(思考モード)または deepseek-v4-pro にアップグレードしてより強い推論を

10.1 OpenAI SDK(Python)

from openai import OpenAI client = OpenAI( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com/v1" ) # ❌ 旧写法(7月24日以降無効) # client.chat.completions.create(model="deepseek-chat", messages=[...]) # ✅ 新写法 — 非思考モード response = client.chat.completions.create( model="deepseek-v4-flash", messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}] ) # ✅ 新写法 — 思考モード(deepseek-reasonerの代替) response = client.chat.completions.create( model="deepseek-v4-pro", messages=[{"role": "user", "content": "Solve this step by step..."}], extra_body={ "thinking": {"type": "enabled", "budget_tokens": 8000} } )

10.2 Anthropic SDK 互換写法

V4はOpenAI ChatCompletions形式とAnthropic Messages形式の両方をサポートします。base_url は変更不要で、model パラメータのみ更新してください。

import anthropic client = anthropic.Anthropic( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com" ) message = client.messages.create( model="deepseek-v4-pro", max_tokens=4096, messages=[{"role": "user", "content": "What changed in the V4 GA release?"}] )

11. 導入ステップ:5つの方法ですぐに接続

  1. DeepSeek Web/App(最も簡単)chat.deepseek.com にアクセスし、アカウント登録。V4正式版はデフォルトで利用可能です。
  2. 公式API(開発者向け)platform.deepseek.com でAPI Keyを取得し、OpenAI互換インターフェースでモデル名を deepseek-v4-pro または deepseek-v4-flash に変更します。
  3. OpenRouterマルチルート:モデルID deepseek/deepseek-v4-pro。詳細は OpenRouterプログラミングランキングとMacマルチルートガイド を参照してください。
  4. Cursor / IDE設定:DeepSeek V4-Proを日常のコーディング主力にし、複雑なRepoバグ修正時は Claude Fable 5 にフォールバックします。
  5. コードベース検索で移行完了deepseek-chatdeepseek-reasoner をグローバル検索し、staging環境で新モデル名をテスト、7月24日前に本番切り替えを完了してください。

12. よくある質問(FAQ)

Q:DeepSeek V4 正式版とプレビュー版の違いは?
A:正式版はプレビュー版をベースにAgent能力・数学推論・コード生成を強化し、初めて時間帯別差別化料金を導入しました。CSA+HCAアーキテクチャは同一ですが、本番安定性とチューニングがより成熟しています。

Q:V4-Pro と V4-Flash はどちらを選ぶべき?
A:V4-Proは複雑な推論・長チェーンAgent向け。V4-Flashは高頻度の軽量呼び出し・意図ルーティング向けで、出力単価は$0.28/M(オフピーク)です。

Q:時間帯別料金のピーク時間帯は?
A:北京時間の平日09:00–12:00と14:00–18:00、全料金が2倍です。非リアルタイムタスクはオフピーク実行を推奨します。

Q:deepseek-chat はいつ廃止?
A:2026年7月24日15:59 UTC(北京時間23:59)に永久廃止。直ちに deepseek-v4-flash または deepseek-v4-pro へ移行してください。

Q:DeepSeek V4 はローカルデプロイできる?
A:はい——MITライセンスでオープンソース、Hugging Faceでウェイト公開済み。ただし1.6T MoEの本番デプロイにはマルチGPUクラスタが必要で、MacローカルではAPIまたは量子化版での検証が現実的です。

Q:Claude Fable 5 とどちらが強い?
A:Fable 5はSWE-benchでリードしていますが、V4-Proは1/116のコストでフロンティアに近い性能を提供し、プライベートデプロイも可能です。

13. 深層考察:2026年オープンソース大モデルのマイルストーン

DeepSeek V4 GA正式版の公開は、単なる「プレビュー卒業」にとどまりません——2026年中期における中国オープンソース大モデルエコシステムの構造的転換点を示しています。この転換の深さを理解するには、3つの観点から分析する必要があります。

13.1 「価格破壊者」から「規律ある商用プラットフォーム」へ

過去18か月、DeepSeekは革命的な低価格(V3時代の出力$0.28/M)でグローバルAI API市場を再編し、OpenAIやAnthropicの値下げを促しました。しかし「ほぼ無料」は持続不可能です——算力コスト、R&D投資、コンプライアンス運用にはキャッシュフローが必要です。時間帯別料金の導入は、DeepSeekが市場獲得のための補助金から規律ある商用化へ移行するシグナルです。

この転換の核心は、DeepSeekが値上げで競争力を犠牲にしていない点にあります。ピーク時でもV4-Proの出力は$1.74/Mで、Claude Opus 4.8より8.6倍安いままです。時間帯別メカニズムは本質的に需要側スケジューリングツールであり、非リアルタイムの算力需要をオフピークに誘導してクラスタ利用率を高め、単にコストをユーザーに転嫁するものではありません。オフピークスケジューリングが可能なエンジニアリングチーム(夜間バッチ処理、週末コードレビュー)にとって、実際の請求額は以前より低くなる可能性もあります。

13.2 アーキテクチャ革新が「長コンテキスト経済学」を再定義

1Mトークンのコンテキストは2026年には希少なパラメータではありません——Kimi K3、Claude Fable 5も百万級コンテキストを謳っています。しかしDeepSeek V4の独自価値は、1Mコンテキストを経済的に実現可能にした点にあります:CSA 4倍圧縮 + top-1024スパース選択 + 128トークンスライディングウィンドウにより、1Mシナリオの推論FLOPsはV3.2の27%、KV Cacheメモリは10%に低減します。

これは同等のハードウェアでより長いコンテキストをサービスでき、API料金を低位に維持できることを意味します。Kimi K3の$15/M出力単価と比べ、V4-Proの$0.87/Mは百万トークンシナリオで桁違いのコスト差を生みます。コードベース全体の一括分析、長文の法律/研究文書、マルチターンAgentの長期記憶が必要なチームにとって、V4は「コンテキスト長 × 性能 × コスト」の三角形で3項目すべてに弱点がない唯一の選択肢です。

mHC 4チャネル残差ストリームとMuonオプティマイザの組み合わせは、「より深いネットワーク = より不安定な学習」という従来の課題を解決しました。61層の深さにより、V4-Proは学習安定性を保ちながらV3シリーズを超える表現力を獲得しています——パラメータ規模が671Bから1.6Tへ飛躍しても効率的に学習できる技術基盤です。

13.3 オープンソースライセンスの戦略的重要性:MITは「ダウンロードできる」以上の意味

2026年7月のオープンソース大モデル格局において、ライセンスはパラメータ規模と同等に重要な選定要因となっています。Llamaシリーズの商用利用制限、一部国産モデルの「研究用途のみ」条項は、企業のコンプライアントデプロイに潜在的リスクをもたらします。DeepSeek V4の MITライセンスは次を意味します。

  • 企業は社内ネットワークに無制限デプロイ可能で、DeepSeekへの報告や収益分配は不要
  • V4ウェイトに基づくファインチューニング・蒸留・二次開発の成果をクローズド商用化可能
  • データ国外持ち出し不可の政府・金融・医療シーンにコンプライアントな技術パスを提供

Kimi K3が2.8Tパラメータで「最大オープンソースモデル」の称号を奪還したとき(K3徹底評価参照)、DeepSeek V4はパラメータ規模での正面競争を避け、エンジニアリング効率・コスト構造・ライセンス自由度の3次元で差別化の壁を築きました。これは後退ではなく、より成熟した競争戦略です——オープンソースコミュニティでは「広く採用される」ことが「パラメータ数が最大」より長期的価値を持ちます。

Mac開発者にとって、V4のMITライセンス + OpenAI/AnthropicデュアルSDK互換は、Cursor、Continue、OpenClawなどのツールチェーンでシームレスに切り替えられ、将来のMLX / llama.cpp量子化適配の可能性も残せます。フルウェイトの本番デプロイにはマルチGPUクラスタが必要ですが、V4-Flashの13BアクティブパラメータはApple Silicon統一メモリアーキテクチャでコミュニティの量子化実験が進行中です——Apple Silicon DeepSeek V4 AMX-2ベンチマークでローカル推論の進捗を追跡してください。

結局のところ、DeepSeek V4 GAの価値はClaude Fable 5やGPT-5.6を打ち負かせるか(現時点ではまだ無理)ではなく、クローズドフラッグシップの1/10〜1/100のコストで、オープンモデル中最強の性能を提供する点にあります。データ国外持ち出しを避けたい企業、予算の限られた個人開発者、1Mコンテキストが必要なAgentエンジニア、極限のコスパを追求するAIプロダクトチームにとって——DeepSeek V4 Proは現時点で弱点のない唯一の選択肢です。

14. まとめ:API試用は任意デバイス、Agent実測は依然Mac

platform.deepseek.comに登録し、API Keyをコピーし、OpenRouterでルートを切り替える——WindowsやLinuxで十分です。しかし 同一環境 でCursor + DeepSeek V4長コンテキストコーディング、XcodeでのiOS側Agent連携、Mac上でのMLXによるV4-Flash量子化版の対照検証を行うなら、Apple Silicon統一メモリ + Metalグラフィックススタック が依然として最も抵抗の少ないパスです。

より実用的なアプローチ:メインマシンはAPI呼び出しを継続し、V4-Pro Think Maxストレステスト、マルチリポジトリSWE-bench回帰、1Mコンテキスト文書バッチ処理を MACGPUリモートMac mini M4ノード に任せましょう——オンデマンド起動、SSH安全アクセス、時間帯別料金の枠組みの中で算力を実機検証に、ローカルマシンを日常の安定開発に使い分けられます。