2026 DEEPSEEK V4
MAN_XUE_BAN_
GA_RELEASE.
導語:等了整整三個月,DeepSeek V4 滿血版(GA 正式版)終於在 2026 年 7 月 20 日迎來正式上線。相比 4 月預覽版,這次不僅帶來 Agent 能力、數學推理與程式碼生成的專項提升,更首次引入尖離峰差異化計費——標誌著 DeepSeek 從「近乎免費」邁向有紀律的商業化營運。本文嚴格按調研素材全部要點撰寫:完整時間線、V4-Pro/Flash 規格表、CSA+HCA+mHC 架構、三種推理模式、Benchmark 全表、尖離峰定價、API 遷移指南(7 月 24 日截止)、與 GPT-5.6 / Claude Fable 5 對比矩陣、FAQ 與開源里程碑深度洞察。
30 秒讀懂 · TL;DR
| 發布 | 2026-07-20 GA 正式版上線 · 7/24 deepseek-chat 永久下線 |
| 規模 | V4-Pro 1.6T(49B 啟用)· V4-Flash 284B(13B 啟用)· 均支援 1M 上下文 |
| 核心能力 | SWE-bench Verified 80.6%(開源最高)· LiveCodeBench 93.5% · MIT 開源 |
| 定價 | 尖離峰計費 · V4-Pro 輸出 $0.87/M(離峰)/ $1.74/M(尖峰) |
| 性價比 | 同類任務成本僅為 Claude Fable 5 的 1/116($0.03 vs $3.48) |
1. 痛點拆解:為什麼滿血版值得關注?
- 預覽版已強,但生產環境缺「正式承諾」。4 月 24 日預覽版上線後,開發者普遍面臨兩個問題:效能是否還會提升?定價會不會突變?GA 正式版用三個月的生產調校回答了前者,用尖離峰計費體系回答了後者——終於可以在 SLA 框架下放心上生產。
- 舊 API 名即將永久下線,遷移視窗極短。
deepseek-chat與deepseek-reasoner將於 7 月 24 日 15:59 UTC 停止服務。若你的 Cursor、OpenClaw 或自建 Agent 仍引用舊模型名,現在就是最後四天。 - 尖離峰計費是雙面刃。工作日 09–12、14–18(北京時間)費率翻倍,但即使尖峰期 V4-Pro 輸出價($1.74/M)仍比 Claude Opus 4.8($15/M)便宜 8.6 倍。關鍵是學會錯峰排程與 Flash 分流。
2. 它是什麼?一句話說清楚
DeepSeek V4 滿血版是 DeepSeek 於 2026 年 7 月 20 日正式發布的通用可用(GA)版本,包含 V4-Pro(1.6 兆參數 MoE)與 V4-Flash(2840 億參數 MoE)兩個型號,均以 MIT 協議開源,支援 100 萬 token 上下文與 384K 最大輸出。
與預覽版相比,GA 版本在 Agent 編排、數學推理、程式碼生成上做了專項提升,並配套尖離峰差異化 API 定價。它不是全新架構——CSA(壓縮稀疏注意力)+ HCA(重度壓縮注意力)+ mHC(流形約束超連接)的設計自 4 月預覽版起就已確立,滿血版做的是穩定性、調校與商業化閉環。
一句話總結: DeepSeek V4 是目前開源模型中 SWE-bench Verified 最高分(80.6%),以閉源旗艦 1/10 乃至 1/100 的成本提供接近前沿的效能,且支援私有部署與 1M 超長上下文。
3. 時間線回顧:從預覽版到滿血版
| 時間 | 事件 |
|---|---|
| 2026-04-24 | V4 預覽版上線 + 開源(MIT 協議),含 V4-Pro(1.6T)和 V4-Flash(284B) |
| 2026-05 | V4-Flash 與 V4-Pro 生產調校版本上線,API 正式可用 |
| 2026-06 | V4-Pro 價格永久降價 75%(輸出價 $0.87/M tokens),定格為史上最具性價比區間 |
| 2026-06-29 | DeepSeek 向全體 API 用戶發送郵件,宣布 GA 正式版將於 7 月中旬上線,並首次披露尖離峰計費方案 |
| 2026-07-19 | 多位開發者獲得 GA 灰度內測資格,新智元等媒體報導「滿血版最快明日發布」 |
| 2026-07-20 | GA 正式版上線(即本文發布日) |
| 2026-07-24 | 舊介面名 deepseek-chat 與 deepseek-reasoner 永久下線 |
姊妹篇可參考本站 DeepSeek 自研晶片與算力布局、Kimi K3 深度評測 與 6 月 AI 大模型降價優惠全攻略,對照當下開源與閉源旗艦格局。
4. 模型家族規格:V4-Pro vs V4-Flash
| 規格 | V4-Pro | V4-Flash |
|---|---|---|
| 總參數量 | 1.6 兆(1.6T) | 2840 億(284B) |
| 每 Token 啟用參數 | 490 億(49B) | 130 億(13B) |
| Transformer 層數 | 61 層 | 43 層 |
| 上下文視窗 | 1,000,000 tokens | 1,000,000 tokens |
| 最大輸出 | 384K tokens | 384K tokens |
| 精度 | FP4(專家權重)+ FP8(其餘) | FP4 + FP8 混合 |
| 預訓練資料量 | 33T+ tokens | 32T+ tokens |
| 開源協議 | MIT | MIT |
5. 核心架構:CSA + HCA + mHC 詳解
傳統 Transformer 在 KV Cache 上的記憶體開銷隨上下文長度線性增長,支援 1M token 幾乎是不可能完成的任務。DeepSeek V4 拋棄了 V2/V3 時代的 MLA(多頭潛在注意力),透過三項關鍵架構革新解決了這個問題:
5.1 壓縮稀疏注意力(CSA,Compressed Sparse Attention)
- 將 KV 序列先透過 Softmax 門控池化壓縮 4 倍
- 再用 FP4 精度的「閃電索引器」(Lightning Indexer)做 top-k 稀疏選擇(V4-Pro 選 top-1024,V4-Flash 選 top-512)
- 同時保留最近 128 個 token 的滑動視窗
- 效果:在 1M 上下文下,相比 DeepSeek V3.2 只需 27% 的推理 FLOPs
5.2 重度壓縮注意力(HCA,Heavily Compressed Attention)
- 將 token 壓縮 128 倍,進行全域密集注意力
- 捕獲長程依賴,與 CSA 形成互補
- V4-Flash 的前 2 層用 HCA,之後 CSA/HCA 交替使用;V4-Pro 結構類似
綜合效果:1M token 場景下,KV Cache 記憶體僅為 V3.2 的 10%(V4-Flash 更低至 7%)。
5.3 流形約束超連接(mHC)與 Muon 優化器
mHC(Manifold-Constrained Hyper-Connections) 是對傳統殘差連接的升級。標準 Transformer 用簡單的 x = x + f(x) 殘差路徑,在極深網路中容易出現梯度退化。mHC 引入 4 通道殘差流,透過滿足雙隨機矩陣約束(Birkhoff 多面體)的混合矩陣,確保訊號在 61 層深網路中的穩定傳播。
訓練時採用 Muon 優化器(而非標準 AdamW),透過牛頓-舒爾茨正交化處理梯度,使梯度步長更加有據,收斂速度更快、訓練更穩定。
5.4 三種推理模式
| 模式 | 特點 | 適用場景 |
|---|---|---|
| Non-think | 無思維鏈,極速回應 | 簡單問答、路由分發 |
| Think High | 顯式推理(<redacted_thinking> 標籤) | 中等複雜任務、程式碼除錯 |
| Think Max | 最大推理力度,需要 384K+ 上下文 | 複雜數學、長鏈路 Agent |
推薦取樣參數:temperature=1.0, top_p=1.0(官方推薦,全模式通用)。
6. Benchmark 跑分:開源之王的成績單
| 基準測試 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ 開源最高 | 96.0% | 未單獨公布 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
解讀重點:
- SWE-bench Verified:V4-Pro 以 80.6% 位列開源模型第一,與 Gemini 3.1 Pro 並列
- LiveCodeBench:V4-Pro 以 93.5% 超越所有閉源競品,演算法競賽場景首選
- SWE-bench Pro:Claude Fable 5 以 80.3% 領跑,多檔案 Repo 級修 Bug 仍是其主場
- Terminal-Bench:GPT-5.6 Ultra 以 85.1% 領先,終端/工具鏈密集型 Agent 場景更優
注意事項:上述基準為 DeepSeek 自報及第三方彙總資料,不同模型使用了各自的推理 harness,獨立複現工作仍在進行中。
7. 性價比:每任務成本 vs 效能
根據 Artificial Analysis 的評測資料,在 Strategy & Ops 指數任務中:
| 模型 | 每次任務成本 | 得分 | 性價比倍數 |
|---|---|---|---|
| Claude Fable 5 | $3.48 | 50 分 | 基準 |
| DeepSeek V4-Pro | $0.03 | 38 分 | 成本僅為 Fable 5 的 1/116 |
| DeepSeek V4-Flash | 全部六類指數任務均低於 $0.04 | — | 輕量任務極致省錢 |
Fable 5 的成本是 V4-Pro 的 116 倍,但得分僅高出約 12 分(31%)。對於大多數生產場景,V4-Pro 的性價比無可匹敵。
8. 橫向對比:DeepSeek V4 vs GPT-5.6 Sol vs Claude Fable 5
| 維度 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 開源 | ✅ MIT 協議 | ❌ 閉源 | ❌ 閉源 |
| 可自託管 | ✅ 支援 | ❌ | ❌ |
| 上下文視窗 | 1M tokens | 未公開 | 1M tokens |
| 程式碼能力 | 極強(接近 Fable 5) | 極強 | 最強 |
| API 輸出價(離峰) | $0.87/M tokens | ~$15/M | $50/M |
| 尖峰輸出價 | $1.74/M tokens | — | — |
| Agent 能力 | 強,支援多 Agent 編排 | 強 | 最強 |
| 資料隱私 | ✅ 可私有部署 | ❌ | ❌ |
| 場景 | 推薦模型 | 原因 |
|---|---|---|
| 預算有限 / 高頻呼叫 / 私有部署 | DeepSeek V4-Pro / Flash | 輸出 $0.87/M,MIT 開源 |
| 極致程式碼能力、不在乎成本 | Claude Fable 5 | SWE-bench Pro 最高分 80.3% |
| 複雜演算法 + 數學推理 | GPT-5.6 Sol / Ultra | Terminal-Bench 領先 |
| 超大規模日誌/文件處理 | V4-Flash | 快取命中輸入僅 $0.0028/M |
9. 尖離峰計費詳解:完整價格表與省錢攻略
這是 GA 版本最受關注也最具爭議的變化。DeepSeek 首次引入尖離峰差異化定價,類似電網的分時電價。尖峰時段(北京時間):工作日 09:00–12:00 和 14:00–18:00,所有費率翻倍。
| 模型 | 計費項 | 離峰(Off-Peak) | 尖峰(Peak) |
|---|---|---|---|
| V4-Pro | 輸入(快取命中) | ¥0.025 / $0.0035 / 1M tokens | 翻倍 |
| 輸入(快取未命中) | ¥3.00 / $0.435 / 1M tokens | ¥6.00 / $0.87 | |
| 輸出 | ¥6.00 / $0.87 / 1M tokens | ¥12.00 / $1.74 | |
| V4-Flash | 輸入(快取命中) | ¥0.02 / $0.0028 / 1M tokens | 翻倍 |
| 輸入(快取未命中) | ¥1.00 / $0.14 / 1M tokens | ¥2.00 / $0.28 | |
| 輸出 | ¥2.00 / $0.28 / 1M tokens | ¥4.00 / $0.56 |
9.1 四大省錢技巧
- 非即時任務排到離峰時段:批次文件處理、資料標註、程式碼審查等,安排在 18:00 之後或早上 9 點之前執行
- 善用快取命中:對於重複的 System Prompt,建構 Prompt Cache,V4-Flash 快取命中成本僅 $0.0028/M,接近免費
- Flash 做分流:簡單意圖識別、路由判斷用 V4-Flash,複雜推理再轉 V4-Pro——可節省 60–80% 推理成本
- 提前取得帳單通知:DeepSeek 承諾在計費變更 24 小時前發送郵件通知
即使在尖峰期,V4-Pro 的輸出價($1.74/M)也比 Claude Opus 4.8($15/M)便宜 8.6 倍,比 GPT-5.6 Sol(約 $15/M)便宜同等倍數。
10. 開發者必看:API 遷移指南(7 月 24 日截止)⚠️
重要警告:舊模型名 deepseek-chat 和 deepseek-reasoner 將於 2026 年 7 月 24 日 15:59 UTC(北京時間 7 月 24 日 23:59) 永久停止存取。
| 舊模型名 | 新模型名 | 備註 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考模式) | 速度快,適合輕量任務 |
deepseek-reasoner | deepseek-v4-flash(思考模式) | 或升級到 deepseek-v4-pro 獲取更強推理 |
10.1 OpenAI SDK(Python)
10.2 Anthropic SDK 相容寫法
V4 同時支援 OpenAI ChatCompletions 格式和 Anthropic Messages 格式,base_url 不變,僅需更新 model 參數:
11. 落地步驟:五種方式立即接入
- DeepSeek 網頁/App(最簡單):造訪 chat.deepseek.com,註冊帳號,V4 滿血版已預設上線。
- 官方 API(開發者):在 platform.deepseek.com 取得 API Key,使用 OpenAI 相容介面,模型名改為
deepseek-v4-pro或deepseek-v4-flash。 - OpenRouter 多路由:模型 ID
deepseek/deepseek-v4-pro,參考本站 OpenRouter 程式分榜與 Mac 多路由指南。 - Cursor / IDE 設定:將 DeepSeek V4-Pro 設為日常程式設計主力,複雜 Repo 修 Bug 時 fallback 到 Claude Fable 5。
- 搜尋程式碼庫完成遷移:全域搜尋
deepseek-chat和deepseek-reasoner,在 staging 環境測試新模型名,7 月 24 日前完成生產切換。
12. 常見問題(FAQ)
Q:DeepSeek V4 滿血版和預覽版有什麼區別?
A:滿血版在預覽版基礎上提升了 Agent 能力、數學推理與程式碼生成,並首次引入尖離峰差異化計費。底層 CSA+HCA 架構不變,但生產穩定性與調校版本更成熟。
Q:V4-Pro 和 V4-Flash 應該怎麼選?
A:V4-Pro 適合複雜推理、長鏈路 Agent;V4-Flash 適合高頻輕量呼叫、意圖路由,輸出價僅 $0.28/M(離峰時段)。
Q:尖離峰計費的尖峰時段是幾點?
A:北京時間工作日 09:00–12:00 和 14:00–18:00,所有費率翻倍。非即時任務建議錯峰執行。
Q:deepseek-chat 什麼時候停用?
A:2026 年 7 月 24 日 15:59 UTC(北京時間 23:59)永久下線。請立即遷移到 deepseek-v4-flash 或 deepseek-v4-pro。
Q:DeepSeek V4 能本地部署嗎?
A:可以——MIT 協議開源,權重已在 Hugging Face 開放。但 1.6T MoE 生產部署需多卡叢集,Mac 本地更適合 API 或量化版驗證。
Q:和 Claude Fable 5 哪個更強?
A:Fable 5 在 SWE-bench 上領先,但 V4-Pro 以 1/116 的成本提供接近前沿的效能,且支援私有部署。
13. 深度洞察:2026 開源大模型的里程碑訊號
DeepSeek V4 GA 正式版的發布,遠不止是一次「預覽版畢業」——它標誌著中國開源大模型生態在 2026 年中期迎來了一個結構性轉折點。要理解這一轉折的深度,需要從三個維度拆解:
13.1 從「價格屠夫」到「有規則的商業平台」
過去 18 個月,DeepSeek 以近乎顛覆性的低價(V3 時代輸出 $0.28/M)重塑了全球 AI API 市場格局,迫使 OpenAI、Anthropic 紛紛跟進降價。但「近乎免費」不可持續——算力成本、研發投入、合規營運都需要現金流支撐。尖離峰計費的引入,是 DeepSeek 從補貼換市場轉向有紀律的商業化的訊號。
這一轉型的關鍵洞察在於:DeepSeek 並沒有在漲價中犧牲競爭力。即使尖峰期 V4-Pro 輸出 $1.74/M,仍比 Claude Opus 4.8 便宜 8.6 倍。尖離峰機制本質上是一種需求側調度工具——把非即時算力需求引導到離峰時段,提升伺服器叢集利用率,而非簡單向用戶轉嫁成本。對於能錯峰排程的工程團隊(夜間批次處理、週末程式碼審查),實際帳單可能比之前更低。
13.2 架構創新重新定義「長上下文經濟學」
1M token 上下文在 2026 年已不是稀缺參數——Kimi K3、Claude Fable 5 均宣稱支援百萬級上下文。但 DeepSeek V4 的獨特價值在於讓 1M 上下文在經濟上可行:CSA 4 倍壓縮 + top-1024 稀疏選擇 + 128 token 滑動視窗,使 1M 場景下推理 FLOPs 僅為 V3.2 的 27%,KV Cache 記憶體降至 10%。
這意味著同等硬體可以服務更長的上下文,API 定價可以維持低位。對比 Kimi K3 的 $15/M 輸出價,V4-Pro 的 $0.87/M 在百萬 token 場景下的成本差距是數量級的。對於需要一次性分析完整程式碼庫、處理長篇法律/研究文件、多輪 Agent 長記憶的團隊,V4 是目前唯一在「上下文長度 × 效能 × 成本」三角中三項都不短板的選項。
mHC 4 通道殘差流與 Muon 優化器的組合,則解決了「更深網路 = 更不穩定訓練」的傳統困境。61 層深度使 V4-Pro 在保持訓練穩定性的同時,獲得了超越 V3 系列的表徵能力——這是參數規模從 671B 躍升至 1.6T 仍能高效訓練的技術底座。
13.3 開源許可的戰略權重:MIT 不只是「能下載」
在 2026 年 7 月的開源大模型格局中,許可協議已成為與參數規模同等重要的選型因素。Llama 系列的商業使用限制、部分國產模型的「研究用途 only」條款,使企業在合規部署時面臨隱性風險。DeepSeek V4 的 MIT 協議意味著:
- 企業可在內網無限制部署,無需向 DeepSeek 報備或分成
- 可基於 V4 權重進行微調、蒸餾、二次開發,成果可閉源商用
- 資料不出境的政企、金融、醫療場景獲得了一條合規的技術路徑
當 Kimi K3 以 2.8T 參數重奪「最大開源模型」頭銜時(參見本站 K3 深度評測),DeepSeek V4 並未在參數規模上正面競爭,而是在工程效率、成本結構、許可自由度三個維度建立了差異化壁壘。這不是退縮,而是更成熟的競爭策略——在開源社群中,「能被廣泛採用」比「參數數字最大」更具長期價值。
對 Mac 開發者而言,V4 的 MIT 許可 + OpenAI/Anthropic 雙 SDK 相容,意味著可以在 Cursor、Continue、OpenClaw 等工具鏈中無縫切換,同時保留未來 MLX / llama.cpp 量化適配的可能性。完整權重雖需多卡叢集才能生產部署,但 V4-Flash 的 13B 啟用參數在 Apple Silicon 統一記憶體架構上已有社群量化實驗——可參考本站 Apple Silicon DeepSeek V4 AMX-2 基準測試 追蹤本地推理進展。
歸根結底,DeepSeek V4 GA 的價值不在於能否擊敗 Claude Fable 5 或 GPT-5.6(暫時還不能),而在於它以閉源旗艦 1/10 乃至 1/100 的成本,提供了開源模型中無可爭議的最強效能。對於不想資料出境的企業、預算有限的獨立開發者、需要 1M 上下文的 Agent 工程師、追求極致性價比的 AI 產品團隊——DeepSeek V4 Pro 是目前唯一沒有短板的選擇。
14. 收束:API 嘗鮮用任意裝置,Agent 實測仍靠 Mac
註冊 platform.deepseek.com、複製 API Key、在 OpenRouter 上切換路由——Windows 或 Linux 完全夠用。但若你要在 同一套環境 裡跑 Cursor + DeepSeek V4 長上下文程式設計、用 Xcode 做 iOS 側 Agent 聯調、或在 Mac 上用 MLX 做 V4-Flash 量化版對照驗收,Apple Silicon 統一記憶體 + Metal 圖形棧 仍是阻力最小的路徑。
更務實的做法:主力機繼續調 API,把 V4-Pro Think Max 壓力測試、多倉庫 SWE-bench 回歸、1M 上下文文件批次處理放到 MACGPU 遠端 Mac mini M4 節點——按需啟停、SSH 安全存取,在尖離峰計費框架下把算力留給真機驗證,把本機留給日常穩定開發。高頻寬遠端節點還能避免 1M token 會話佔滿本機記憶體與磁碟頻寬。