2026 DEEPSEEK V4
FLASH_0731_
OFFICIAL.
導語:如果你在 7 月底盯著 DeepSeek 的 changelog,會發現一件反直覺的事——沒有新模型發布,只有同一個 284B 參數的 V4-Flash 換了一遍後訓練,卻在 Agent 跑分上反超自家 1.6T 的 V4-Pro 預覽版,API 價格僅為 Claude Opus 4.8 的幾十分之一。本文嚴格按調研素材全部要點撰寫:4 月至 8 月完整時間線、核心定價對比表、後訓練與 Harness 框架拆解、中國開源六邊形混戰橫評、爭議警示、「斬殺線」行業洞察、五步落地指南與 FAQ。
30 秒讀懂 · TL;DR
| 發布 | 2026-07-31 V4-Flash-0731 官方版 API 公測 · 僅限 API,App/網頁未同步 |
| 架構 | 284B / 13B 激活,與 4 月預覽版完全相同 · 效能提升僅來自後訓練 |
| 定價 | 輸入 $0.14(快取未命中)/ $0.0028(命中)· 輸出 $0.28/M |
| Agent | Terminal Bench 2.0 82.7(廠商自報 + Harness 極簡模式)· 反超 V4-Pro 預覽版 67.9 |
| 未發布 | V4-Pro 官方版 · 自研 Agent 框架 Harness · 均無確切日期 |
1. 痛點拆解:為什麼 0731 值得關注?
- 旗艦 Pro 版遲遲未兌現,Flash 卻「越級」了。社群曾戲稱梁文鋒「梁白開」——V4-Pro 官方版原預期 7 月中旬全量上線卻一再推遲。7 月 31 日 Flash 0731 以更小參數量反超 Pro 預覽版 Agent 跑分,情緒迅速翻轉為「梁聖」——但 Pro 與 Harness 仍無確切日期。
- 跑分好看,框架敏感。官方公布的 Terminal Bench 2.0(82.7)等 Agent 分數全部基於尚未公開發布的 Harness「極簡模式」測得,官方自己也提醒「跑分對 harness 選擇非常敏感」——不能直接等同於在 Claude Code / Cursor 裡的真實表現。
- API-only 更新,消費端仍滯後。本次公測僅限 API,App 和網頁端暫未同步。若你在 chat.deepseek.com 上體感「沒變」,並不矛盾——開發者與終端使用者看到的是兩個版本節奏。
2. 時間線:從 4 月預覽到 7 月「官方版」
| 時間 | 事件 |
|---|---|
| 2026-04-24 | DeepSeek-V4 預覽版首次發布並開源(MIT),含 V4-Pro(1.6T/49B 激活)與 V4-Flash(284B/13B 激活),均支援 1M 上下文 |
| 2026-07-24 | 舊介面 deepseek-chat 與 deepseek-reasoner 正式停用,全部流量切換到 V4 系列命名 |
| 2026-07-27 | 月之暗面 Kimi K3(2.8T)開源權重上線 Hugging Face,給 DeepSeek 製造競爭壓力 |
| 2026-07-31 | V4-Flash-0731 正式版 API 公測,權重同步 Hugging Face;changelog 首次點名自研 Agent 框架「Harness」,稱即將隨 V4 正式版發布 |
| 截至 2026-08-05 | V4-Pro 官方版仍「盡快發布」。媒體援引未署名消息源稱 8/10–8/20 可能 GA——未經官方證實,僅供參考 |
3. 核心數據一覽
| 模型 | 狀態 | 總參數/激活 | 上下文 | 輸入價(未命中/命中,$/M) | 輸出價($/M) | 協議 |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | 官方正式版(07-31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| V4-Pro | 預覽版(04-24,官方版未發布) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 權重開源(07-27) | 2.8T / ~104B(社群估算) | ~1.05M | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| GLM-5.2 | 開源(2026年6月) | ~744B / ~40B | 1M | 本文未核實 | 本文未核實 | MIT |
| Qwen3.8-Max | API GA(08-02),權重待放出 | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 承諾開源 |
以上定價均為廠商自報公開數據。DeepSeek 已預告未來將對 API 啟用「高峰時段 2 倍加價」(北京時間 9–12 點、14–18 點),截至發稿未公布具體生效日期。
4. 深度拆解:效能是怎麼「變出來」的
4.1 架構沒有變,變的是後訓練
V4-Flash-0731 在參數規模、模型結構上與 4 月預覽版完全相同,官方明確說明效能提升「完全來自重新進行的後訓練」。284B/13B 的 Flash 在多項 Agent 基準上反而超過 1.6T/49B 的 V4-Pro 預覽版——2026 年下半年大模型競爭,後訓練品質的重要性正在逼近甚至超過單純堆參數。
4.2 混合注意力:CSA+HCA、mHC、Muon 優化器
根據技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列三處關鍵改動:
- 混合注意力架構:壓縮稀疏注意力(CSA)+ 高度壓縮注意力(HCA),對外統稱「DSA 稀疏注意力」,降低長上下文計算與顯存開銷;
- 流形約束超連接(mHC):改進傳統殘差連接;
- Muon 優化器:提升訓練收斂速度與穩定性。
官方指標:1M token 場景下,V4-Pro 單 token 推理 FLOPs 僅為 V3.2 的 27%,KV Cache 佔用僅為 10%(廠商自報,尚未見獨立第三方復現)。
4.3 自研 Agent 框架 Harness 首次亮相
7 月 31 日 changelog 首次出現「DeepSeek Harness」——對標 Claude Code 的 Agent 執行框架,用於檔案讀寫、工具呼叫、端到端工程任務。此前 DeepSeek 主要依賴 Claude Code、OpenCode 等第三方工具。官方 Agent 跑分全部用 Harness「極簡模式」測出,參數為 max 檔位、top_p=0.95、temperature=1.0。官方提示:「跑分對 harness 選擇非常敏感,不能簡單等同於模型本身能力的提升。」
5. 橫向對比:中國開源大模型的「六邊形混戰」
| 模型 | 實驗室 | 發布/權重 | 總參數 | AA Intelligence Index | 單任務成本(AA) |
|---|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 07-31 官方版 | 284B | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 07-16 預覽 / 07-27 權重 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智譜/Z.ai | 2026年6月 | ~744B | 比 Flash 高約 1 分 | 本文未核實 |
| Qwen3.8-Max | 阿里 | 08-02 GA(權重待放出) | 2.4T | 本文未核實 | 本文未核實 |
| GPT-5.6 Sol | OpenAI | 閉源 | 未公開 | 比 Flash 高 9+ 分 | $1.86 |
| Claude Fable 5 | Anthropic | 閉源 | 未公開 | 比 Flash 高 9+ 分 | $3.15 |
數據來源:Intelligence Index 與單任務成本引自 Artificial Analysis(第三方獨立評測);DeepSeek Agent 跑分為廠商自報,評測方法不同,不可直接相加比較。
反差很明顯:AA 綜合指數上 V4-Flash 並非最高,甚至落後於 Kimi K3 和 GLM-5.2;但單任務成本僅為 Kimi K3 的約 1/29、GPT-5.6 Sol 的約 1/62、Claude Fable 5 的約 1/105。DeepSeek 打的不是「跑分第一」,而是「夠用的智能 + 極致的價格」——這也解釋了 V4-Flash 預覽版為何能在 OpenRouter 連續七週穩坐呼叫量第一。
6. 爭議點:跑分好看,不代表沒有水分
- 跑分依賴 Harness,官方自己也在提醒。Terminal Bench 2.0(82.7 vs Pro 預覽版 67.9)基於未公開發布的 Harness 極簡模式,應視為「廠商自報 + 特定框架」結果。
- 海外開發者回饋可用性問題。據 21 世紀經濟報導援引社群回饋,正式版存在輸入快取命中率偏低、安全分類器偶發逾時等問題。
- V4-Pro 與 Harness 上線時間未經證實。媒體「8 月 10–20 日 GA」為未署名消息源,官方 changelog 原話僅為「將盡快發布」。
- 融資與 IPO 傳聞需謹慎。媒體報導約 74 億美元融資、487 億美元估值等資訊目前主要來自「據報導」「消息人士稱」,尚無官方或監管備案直接確認。
7. 五步落地指南:開發者現在該做什麼
- 確認 API 模型名已遷移:全域搜尋
deepseek-chat/deepseek-reasoner,統一改為deepseek-v4-flash或deepseek-v4-pro(7 月 24 日起舊名已停用)。 - 按場景選型 Flash vs Pro 預覽版:批量 Agent、意圖路由、高頻輕量呼叫 → Flash 0731;更深世界知識與複雜推理 → Pro 預覽版,等官方版再評估切換。
- 構建 Prompt Cache 降本:重複 System Prompt 走快取命中,Flash 快取命中成本僅 $0.0028/M,接近免費。
- 錯峰應對未來高峰加價:非即時批處理安排在北京時間 9 點前或 18 點後,規避預告中的 2 倍高峰費率。
- 在 Mac 上做對照驗收:用 Cursor / OpenClaw 分別接 Flash 0731 與 Kimi K3 / Qwen3.8-Max,在同一套 SWE-bench 子集上對比真實延遲與通過率——別只看廠商榜單。
8. 常見問題(FAQ)
Q:V4 和 V3.2 最大區別是什麼?
A:原生 1M 上下文,長上下文 FLOPs 降至 V3.2 的 27%、KV Cache 降至 10%(官方數據);Agent 能力專項優化,適配 Claude Code、OpenCode 等主流工具。
Q:日常選 Flash 還是 Pro?
A:批量處理、Agent 流水線、成本敏感 → Flash 0731(Agent 跑分已反超 Pro 預覽版);更深推理且預算充裕 → Pro 預覽版,等官方版再評估。
Q:現在能用 V4 Pro 官方版嗎?
A:截至 2026-08-05 不能。官方版僅 Flash 0731,且僅限 API。網上「8/10–20」為未經證實傳言。
Q:跑分能直接相信嗎?
A:SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 等 Agent 分數依賴未公開 Harness,建議等社群獨立復現。
Q:對普通開發者有什麼實際影響?
A:OpenAI / Anthropic 格式 API 無需改程式碼,deepseek-v4-flash 自動指向新官方版;舊模型名須盡快切換。
9. 深度洞察:「斬殺線」與價格戰下一輪
在 V4-Flash-0731 上線前,中文 AI 社群因 Pro 版延期戲稱梁文鋒「梁白開」;上線後因表現超預期又改稱「梁聖」——暱稱反轉本身就是社群情緒的晴雨表。
更值得關注的概念是開發者圈子流傳的「斬殺線」:DeepSeek 以「夠用效能 + 極端低價」設下門檻——友商若效能無明顯超越、又拿不出更低價格,便可能在市場上失去存在感。這也解釋了同期 GPT-5.6 Luna 低價版 reportedly 降價 80% 等密集調價。一位 AI 創業孵化人士對 21 世紀經濟報導的評價頗為形象:「所有大模型公司都在梁文鋒前面奔跑,不管用什麼方式,都必須跑到 DeepSeek 前面才能生存。」
從行業背景看,7 月 31 日輝達、博通、AMD 等算力股並未明顯波動——市場似乎已習慣「DeepSeek 式效率突破」,不再簡單將其等同於利空算力股。這與 2025 年初 R1 發布時引發全球 AI 晶片股下跌形成鮮明對比,說明市場對中國大模型工程創新的認知已相對成熟。
對 Mac 開發者而言,Flash 0731 的 MIT 許可 + 13B 激活參數,使 V4-Flash 量化版在 Apple Silicon 統一記憶體上有社群實驗空間(可參考本站 AMX-2 基準測試)。但生產級 Agent 流水線、Harness 對照驗收、與 Kimi K3 / Qwen3.8-Max 的橫向 SWE-bench 回歸,仍建議在隔離環境中跑——避免占滿本機統一記憶體、影響 Cursor / Xcode 日常開發。
10. 收束:API 路由任意裝置,Agent 實測仍靠 Mac
切換 OpenRouter 路由、複製 DeepSeek API Key——Windows 或 Linux 完全夠用。但若你要在同一套環境裡跑 Cursor + V4-Flash 長上下文編程、用 OpenClaw 做多通路 Agent 對照、或在 Mac 上用 MLX 做 Flash 量化版本地驗收,Apple Silicon 統一記憶體 + Metal 圖形棧仍是阻力最小的路徑。
更務實的做法:主力機繼續調 API,把 Flash 0731 批量 Agent 壓測、Harness 發布後的對照回歸、1M 上下文文件批處理放到 MACGPU 遠端 Mac mini M4 節點——按需啟停、SSH 安全存取,在預告的高峰加價框架下把算力留給真機驗證,把本機留給穩定開發。