2026 DEEPSEEK V4
FLASH_0731_
OFFICIAL.

DeepSeek V4 Flash 0731 正式版評測:跑分與定價對比

導語:如果你在 7 月底盯著 DeepSeek 的 changelog,會發現一件反直覺的事——沒有新模型發布,只有同一個 284B 參數的 V4-Flash 換了一遍後訓練,卻在 Agent 跑分上反超自家 1.6T 的 V4-Pro 預覽版,API 價格僅為 Claude Opus 4.8 的幾十分之一。本文嚴格按調研素材全部要點撰寫:4 月至 8 月完整時間線、核心定價對比表、後訓練與 Harness 框架拆解、中國開源六邊形混戰橫評、爭議警示、「斬殺線」行業洞察、五步落地指南與 FAQ。

30 秒讀懂 · TL;DR

發布2026-07-31 V4-Flash-0731 官方版 API 公測 · 僅限 API,App/網頁未同步
架構284B / 13B 激活,與 4 月預覽版完全相同 · 效能提升僅來自後訓練
定價輸入 $0.14(快取未命中)/ $0.0028(命中)· 輸出 $0.28/M
AgentTerminal Bench 2.0 82.7(廠商自報 + Harness 極簡模式)· 反超 V4-Pro 預覽版 67.9
未發布V4-Pro 官方版 · 自研 Agent 框架 Harness · 均無確切日期

1. 痛點拆解:為什麼 0731 值得關注?

  1. 旗艦 Pro 版遲遲未兌現,Flash 卻「越級」了。社群曾戲稱梁文鋒「梁白開」——V4-Pro 官方版原預期 7 月中旬全量上線卻一再推遲。7 月 31 日 Flash 0731 以更小參數量反超 Pro 預覽版 Agent 跑分,情緒迅速翻轉為「梁聖」——但 Pro 與 Harness 仍無確切日期。
  2. 跑分好看,框架敏感。官方公布的 Terminal Bench 2.0(82.7)等 Agent 分數全部基於尚未公開發布的 Harness「極簡模式」測得,官方自己也提醒「跑分對 harness 選擇非常敏感」——不能直接等同於在 Claude Code / Cursor 裡的真實表現。
  3. API-only 更新,消費端仍滯後。本次公測僅限 API,App 和網頁端暫未同步。若你在 chat.deepseek.com 上體感「沒變」,並不矛盾——開發者與終端使用者看到的是兩個版本節奏。

2. 時間線:從 4 月預覽到 7 月「官方版」

時間事件
2026-04-24DeepSeek-V4 預覽版首次發布並開源(MIT),含 V4-Pro(1.6T/49B 激活)與 V4-Flash(284B/13B 激活),均支援 1M 上下文
2026-07-24舊介面 deepseek-chatdeepseek-reasoner 正式停用,全部流量切換到 V4 系列命名
2026-07-27月之暗面 Kimi K3(2.8T)開源權重上線 Hugging Face,給 DeepSeek 製造競爭壓力
2026-07-31V4-Flash-0731 正式版 API 公測,權重同步 Hugging Face;changelog 首次點名自研 Agent 框架「Harness」,稱即將隨 V4 正式版發布
截至 2026-08-05V4-Pro 官方版仍「盡快發布」。媒體援引未署名消息源稱 8/10–8/20 可能 GA——未經官方證實,僅供參考

3. 核心數據一覽

模型狀態總參數/激活上下文輸入價(未命中/命中,$/M)輸出價($/M)協議
V4-Flash-0731官方正式版(07-31)284B / 13B1M$0.14 / $0.0028$0.28MIT
V4-Pro預覽版(04-24,官方版未發布)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3權重開源(07-27)2.8T / ~104B(社群估算)~1.05M$3.00 / $0.30$15.00Kimi K3 License
GLM-5.2開源(2026年6月)~744B / ~40B1M本文未核實本文未核實MIT
Qwen3.8-MaxAPI GA(08-02),權重待放出2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00承諾開源

以上定價均為廠商自報公開數據。DeepSeek 已預告未來將對 API 啟用「高峰時段 2 倍加價」(北京時間 9–12 點、14–18 點),截至發稿未公布具體生效日期。

4. 深度拆解:效能是怎麼「變出來」的

4.1 架構沒有變,變的是後訓練

V4-Flash-0731 在參數規模、模型結構上與 4 月預覽版完全相同,官方明確說明效能提升「完全來自重新進行的後訓練」。284B/13B 的 Flash 在多項 Agent 基準上反而超過 1.6T/49B 的 V4-Pro 預覽版——2026 年下半年大模型競爭,後訓練品質的重要性正在逼近甚至超過單純堆參數。

4.2 混合注意力:CSA+HCA、mHC、Muon 優化器

根據技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列三處關鍵改動:

  1. 混合注意力架構:壓縮稀疏注意力(CSA)+ 高度壓縮注意力(HCA),對外統稱「DSA 稀疏注意力」,降低長上下文計算與顯存開銷;
  2. 流形約束超連接(mHC):改進傳統殘差連接;
  3. Muon 優化器:提升訓練收斂速度與穩定性。

官方指標:1M token 場景下,V4-Pro 單 token 推理 FLOPs 僅為 V3.2 的 27%,KV Cache 佔用僅為 10%(廠商自報,尚未見獨立第三方復現)。

4.3 自研 Agent 框架 Harness 首次亮相

7 月 31 日 changelog 首次出現「DeepSeek Harness」——對標 Claude Code 的 Agent 執行框架,用於檔案讀寫、工具呼叫、端到端工程任務。此前 DeepSeek 主要依賴 Claude Code、OpenCode 等第三方工具。官方 Agent 跑分全部用 Harness「極簡模式」測出,參數為 max 檔位、top_p=0.95、temperature=1.0。官方提示:「跑分對 harness 選擇非常敏感,不能簡單等同於模型本身能力的提升。」

5. 橫向對比:中國開源大模型的「六邊形混戰」

模型實驗室發布/權重總參數AA Intelligence Index單任務成本(AA)
V4-Flash-0731DeepSeek07-31 官方版284B50$0.03
Kimi K3月之暗面07-16 預覽 / 07-27 權重2.8T57$0.86
GLM-5.2智譜/Z.ai2026年6月~744B比 Flash 高約 1 分本文未核實
Qwen3.8-Max阿里08-02 GA(權重待放出)2.4T本文未核實本文未核實
GPT-5.6 SolOpenAI閉源未公開比 Flash 高 9+ 分$1.86
Claude Fable 5Anthropic閉源未公開比 Flash 高 9+ 分$3.15

數據來源:Intelligence Index 與單任務成本引自 Artificial Analysis(第三方獨立評測);DeepSeek Agent 跑分為廠商自報,評測方法不同,不可直接相加比較

反差很明顯:AA 綜合指數上 V4-Flash 並非最高,甚至落後於 Kimi K3 和 GLM-5.2;但單任務成本僅為 Kimi K3 的約 1/29、GPT-5.6 Sol 的約 1/62、Claude Fable 5 的約 1/105。DeepSeek 打的不是「跑分第一」,而是「夠用的智能 + 極致的價格」——這也解釋了 V4-Flash 預覽版為何能在 OpenRouter 連續七週穩坐呼叫量第一。

6. 爭議點:跑分好看,不代表沒有水分

  • 跑分依賴 Harness,官方自己也在提醒。Terminal Bench 2.0(82.7 vs Pro 預覽版 67.9)基於未公開發布的 Harness 極簡模式,應視為「廠商自報 + 特定框架」結果。
  • 海外開發者回饋可用性問題。據 21 世紀經濟報導援引社群回饋,正式版存在輸入快取命中率偏低、安全分類器偶發逾時等問題。
  • V4-Pro 與 Harness 上線時間未經證實。媒體「8 月 10–20 日 GA」為未署名消息源,官方 changelog 原話僅為「將盡快發布」。
  • 融資與 IPO 傳聞需謹慎。媒體報導約 74 億美元融資、487 億美元估值等資訊目前主要來自「據報導」「消息人士稱」,尚無官方或監管備案直接確認。

7. 五步落地指南:開發者現在該做什麼

  1. 確認 API 模型名已遷移:全域搜尋 deepseek-chat / deepseek-reasoner,統一改為 deepseek-v4-flashdeepseek-v4-pro(7 月 24 日起舊名已停用)。
  2. 按場景選型 Flash vs Pro 預覽版:批量 Agent、意圖路由、高頻輕量呼叫 → Flash 0731;更深世界知識與複雜推理 → Pro 預覽版,等官方版再評估切換。
  3. 構建 Prompt Cache 降本:重複 System Prompt 走快取命中,Flash 快取命中成本僅 $0.0028/M,接近免費。
  4. 錯峰應對未來高峰加價:非即時批處理安排在北京時間 9 點前或 18 點後,規避預告中的 2 倍高峰費率。
  5. 在 Mac 上做對照驗收:用 Cursor / OpenClaw 分別接 Flash 0731 與 Kimi K3 / Qwen3.8-Max,在同一套 SWE-bench 子集上對比真實延遲與通過率——別只看廠商榜單。
from openai import OpenAI client = OpenAI( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com/v1" ) # V4-Flash-0731 會自動指向最新官方版本 response = client.chat.completions.create( model="deepseek-v4-flash", messages=[{"role": "user", "content": "Summarize the 0731 changelog."}] )

8. 常見問題(FAQ)

Q:V4 和 V3.2 最大區別是什麼?
A:原生 1M 上下文,長上下文 FLOPs 降至 V3.2 的 27%、KV Cache 降至 10%(官方數據);Agent 能力專項優化,適配 Claude Code、OpenCode 等主流工具。

Q:日常選 Flash 還是 Pro?
A:批量處理、Agent 流水線、成本敏感 → Flash 0731(Agent 跑分已反超 Pro 預覽版);更深推理且預算充裕 → Pro 預覽版,等官方版再評估。

Q:現在能用 V4 Pro 官方版嗎?
A:截至 2026-08-05 不能。官方版僅 Flash 0731,且僅限 API。網上「8/10–20」為未經證實傳言。

Q:跑分能直接相信嗎?
A:SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 等 Agent 分數依賴未公開 Harness,建議等社群獨立復現。

Q:對普通開發者有什麼實際影響?
A:OpenAI / Anthropic 格式 API 無需改程式碼,deepseek-v4-flash 自動指向新官方版;舊模型名須盡快切換。

9. 深度洞察:「斬殺線」與價格戰下一輪

在 V4-Flash-0731 上線前,中文 AI 社群因 Pro 版延期戲稱梁文鋒「梁白開」;上線後因表現超預期又改稱「梁聖」——暱稱反轉本身就是社群情緒的晴雨表。

更值得關注的概念是開發者圈子流傳的「斬殺線」:DeepSeek 以「夠用效能 + 極端低價」設下門檻——友商若效能無明顯超越、又拿不出更低價格,便可能在市場上失去存在感。這也解釋了同期 GPT-5.6 Luna 低價版 reportedly 降價 80% 等密集調價。一位 AI 創業孵化人士對 21 世紀經濟報導的評價頗為形象:「所有大模型公司都在梁文鋒前面奔跑,不管用什麼方式,都必須跑到 DeepSeek 前面才能生存。」

從行業背景看,7 月 31 日輝達、博通、AMD 等算力股並未明顯波動——市場似乎已習慣「DeepSeek 式效率突破」,不再簡單將其等同於利空算力股。這與 2025 年初 R1 發布時引發全球 AI 晶片股下跌形成鮮明對比,說明市場對中國大模型工程創新的認知已相對成熟。

對 Mac 開發者而言,Flash 0731 的 MIT 許可 + 13B 激活參數,使 V4-Flash 量化版在 Apple Silicon 統一記憶體上有社群實驗空間(可參考本站 AMX-2 基準測試)。但生產級 Agent 流水線、Harness 對照驗收、與 Kimi K3 / Qwen3.8-Max 的橫向 SWE-bench 回歸,仍建議在隔離環境中跑——避免占滿本機統一記憶體、影響 Cursor / Xcode 日常開發。

10. 收束:API 路由任意裝置,Agent 實測仍靠 Mac

切換 OpenRouter 路由、複製 DeepSeek API Key——Windows 或 Linux 完全夠用。但若你要在同一套環境裡跑 Cursor + V4-Flash 長上下文編程、用 OpenClaw 做多通路 Agent 對照、或在 Mac 上用 MLX 做 Flash 量化版本地驗收,Apple Silicon 統一記憶體 + Metal 圖形棧仍是阻力最小的路徑。

更務實的做法:主力機繼續調 API,把 Flash 0731 批量 Agent 壓測、Harness 發布後的對照回歸、1M 上下文文件批處理放到 MACGPU 遠端 Mac mini M4 節點——按需啟停、SSH 安全存取,在預告的高峰加價框架下把算力留給真機驗證,把本機留給穩定開發。