2026 DEEPSEEK V4
FLASH_0731_
OFFICIAL.

DeepSeek V4 Flash 0731 正式版评测:跑分与定价对比

导语:如果你在 7 月底盯着 DeepSeek 的 changelog,会发现一件反直觉的事——没有新模型发布,只有同一个 284B 参数的 V4-Flash 换了一遍后训练,却在 Agent 跑分上反超自家 1.6T 的 V4-Pro 预览版,API 价格仅为 Claude Opus 4.8 的几十分之一。本文严格按调研素材全部要点撰写:4 月至 8 月完整时间线、核心定价对比表、后训练与 Harness 框架拆解、中国开源六边形混战横评、争议警示、「斩杀线」行业洞察、五步落地指南与 FAQ。

30 秒读懂 · TL;DR

发布2026-07-31 V4-Flash-0731 官方版 API 公测 · 仅限 API,App/网页未同步
架构284B / 13B 激活,与 4 月预览版完全相同 · 性能提升仅来自后训练
定价输入 $0.14(缓存未命中)/ $0.0028(命中)· 输出 $0.28/M
AgentTerminal Bench 2.0 82.7(厂商自报 + Harness 极简模式)· 反超 V4-Pro 预览版 67.9
未发布V4-Pro 官方版 · 自研 Agent 框架 Harness · 均无确切日期

1. 痛点拆解:为什么 0731 值得关注?

  1. 旗舰 Pro 版迟迟未兑现,Flash 却「越级」了。社区曾戏称梁文锋「梁白开」——V4-Pro 官方版原预期 7 月中旬全量上线却一再推迟。7 月 31 日 Flash 0731 以更小参数量反超 Pro 预览版 Agent 跑分,情绪迅速翻转为「梁圣」——但 Pro 与 Harness 仍无确切日期。
  2. 跑分好看,框架敏感。官方公布的 Terminal Bench 2.0(82.7)等 Agent 分数全部基于尚未公开发布的 Harness「极简模式」测得,官方自己也提醒「跑分对 harness 选择非常敏感」——不能直接等同于在 Claude Code / Cursor 里的真实表现。
  3. API-only 更新,消费端仍滞后。本次公测仅限 API,App 和网页端暂未同步。若你在 chat.deepseek.com 上体感「没变」,并不矛盾——开发者与终端用户看到的是两个版本节奏。

2. 时间线:从 4 月预览到 7 月「官方版」

时间事件
2026-04-24DeepSeek-V4 预览版首次发布并开源(MIT),含 V4-Pro(1.6T/49B 激活)与 V4-Flash(284B/13B 激活),均支持 1M 上下文
2026-07-24旧接口 deepseek-chatdeepseek-reasoner 正式停用,全部流量切换到 V4 系列命名
2026-07-27月之暗面 Kimi K3(2.8T)开源权重上线 Hugging Face,给 DeepSeek 制造竞争压力
2026-07-31V4-Flash-0731 正式版 API 公测,权重同步 Hugging Face;changelog 首次点名自研 Agent 框架「Harness」,称即将随 V4 正式版发布
截至 2026-08-05V4-Pro 官方版仍「尽快发布」。媒体援引未署名消息源称 8/10–8/20 可能 GA——未经官方证实,仅供参考

3. 核心数据一览

模型状态总参数/激活上下文输入价(未命中/命中,$/M)输出价($/M)协议
V4-Flash-0731官方正式版(07-31)284B / 13B1M$0.14 / $0.0028$0.28MIT
V4-Pro预览版(04-24,官方版未发布)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3权重开源(07-27)2.8T / ~104B(社区估算)~1.05M$3.00 / $0.30$15.00Kimi K3 License
GLM-5.2开源(2026年6月)~744B / ~40B1M本文未核实本文未核实MIT
Qwen3.8-MaxAPI GA(08-02),权重待放出2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00承诺开源

以上定价均为厂商自报公开数据。DeepSeek 已预告未来将对 API 启用「高峰时段 2 倍加价」(北京时间 9–12 点、14–18 点),截至发稿未公布具体生效日期。

4. 深度拆解:性能是怎么「变出来」的

4.1 架构没有变,变的是后训练

V4-Flash-0731 在参数规模、模型结构上与 4 月预览版完全相同,官方明确说明性能提升「完全来自重新进行的后训练」。284B/13B 的 Flash 在多项 Agent 基准上反而超过 1.6T/49B 的 V4-Pro 预览版——2026 年下半年大模型竞争,后训练质量的重要性正在逼近甚至超过单纯堆参数。

4.2 混合注意力:CSA+HCA、mHC、Muon 优化器

根据技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列三处关键改动:

  1. 混合注意力架构:压缩稀疏注意力(CSA)+ 高度压缩注意力(HCA),对外统称「DSA 稀疏注意力」,降低长上下文计算与显存开销;
  2. 流形约束超连接(mHC):改进传统残差连接;
  3. Muon 优化器:提升训练收敛速度与稳定性。

官方指标:1M token 场景下,V4-Pro 单 token 推理 FLOPs 仅为 V3.2 的 27%,KV Cache 占用仅为 10%(厂商自报,尚未见独立第三方复现)。

4.3 自研 Agent 框架 Harness 首次亮相

7 月 31 日 changelog 首次出现「DeepSeek Harness」——对标 Claude Code 的 Agent 执行框架,用于文件读写、工具调用、端到端工程任务。此前 DeepSeek 主要依赖 Claude Code、OpenCode 等第三方工具。官方 Agent 跑分全部用 Harness「极简模式」测出,参数为 max 档位、top_p=0.95、temperature=1.0。官方提示:「跑分对 harness 选择非常敏感,不能简单等同于模型本身能力的提升。」

5. 横向对比:中国开源大模型的「六边形混战」

模型实验室发布/权重总参数AA Intelligence Index单任务成本(AA)
V4-Flash-0731DeepSeek07-31 官方版284B50$0.03
Kimi K3月之暗面07-16 预览 / 07-27 权重2.8T57$0.86
GLM-5.2智谱/Z.ai2026年6月~744B比 Flash 高约 1 分本文未核实
Qwen3.8-Max阿里08-02 GA(权重待放出)2.4T本文未核实本文未核实
GPT-5.6 SolOpenAI闭源未公开比 Flash 高 9+ 分$1.86
Claude Fable 5Anthropic闭源未公开比 Flash 高 9+ 分$3.15

数据来源:Intelligence Index 与单任务成本引自 Artificial Analysis(第三方独立评测);DeepSeek Agent 跑分为厂商自报,评测方法不同,不可直接相加比较

反差很明显:AA 综合指数上 V4-Flash 并非最高,甚至落后于 Kimi K3 和 GLM-5.2;但单任务成本仅为 Kimi K3 的约 1/29、GPT-5.6 Sol 的约 1/62、Claude Fable 5 的约 1/105。DeepSeek 打的不是「跑分第一」,而是「够用的智能 + 极致的价格」——这也解释了 V4-Flash 预览版为何能在 OpenRouter 连续七周稳坐调用量第一。

6. 争议点:跑分好看,不代表没有水分

  • 跑分依赖 Harness,官方自己也在提醒。Terminal Bench 2.0(82.7 vs Pro 预览版 67.9)基于未公开发布的 Harness 极简模式,应视为「厂商自报 + 特定框架」结果。
  • 海外开发者反馈可用性问题。据 21 世纪经济报道援引社区反馈,正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题。
  • V4-Pro 与 Harness 上线时间未经证实。媒体「8 月 10–20 日 GA」为未署名消息源,官方 changelog 原话仅为「将尽快发布」。
  • 融资与 IPO 传闻需谨慎。媒体报道约 74 亿美元融资、487 亿美元估值等信息目前主要来自「据报道」「消息人士称」,尚无官方或监管备案直接确认。

7. 五步落地指南:开发者现在该做什么

  1. 确认 API 模型名已迁移:全局搜索 deepseek-chat / deepseek-reasoner,统一改为 deepseek-v4-flashdeepseek-v4-pro(7 月 24 日起旧名已停用)。
  2. 按场景选型 Flash vs Pro 预览版:批量 Agent、意图路由、高频轻量调用 → Flash 0731;更深世界知识与复杂推理 → Pro 预览版,等官方版再评估切换。
  3. 构建 Prompt Cache 降本:重复 System Prompt 走缓存命中,Flash 缓存命中成本仅 $0.0028/M,接近免费。
  4. 错峰应对未来高峰加价:非实时批处理安排在北京时间 9 点前或 18 点后,规避预告中的 2 倍高峰费率。
  5. 在 Mac 上做对照验收:用 Cursor / OpenClaw 分别接 Flash 0731 与 Kimi K3 / Qwen3.8-Max,在同一套 SWE-bench 子集上对比真实延迟与通过率——别只看厂商榜单。
from openai import OpenAI client = OpenAI( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com/v1" ) # V4-Flash-0731 会自动指向最新官方版本 response = client.chat.completions.create( model="deepseek-v4-flash", messages=[{"role": "user", "content": "Summarize the 0731 changelog."}] )

8. 常见问题(FAQ)

Q:V4 和 V3.2 最大区别是什么?
A:原生 1M 上下文,长上下文 FLOPs 降至 V3.2 的 27%、KV Cache 降至 10%(官方数据);Agent 能力专项优化,适配 Claude Code、OpenCode 等主流工具。

Q:日常选 Flash 还是 Pro?
A:批量处理、Agent 流水线、成本敏感 → Flash 0731(Agent 跑分已反超 Pro 预览版);更深推理且预算充裕 → Pro 预览版,等官方版再评估。

Q:现在能用 V4 Pro 官方版吗?
A:截至 2026-08-05 不能。官方版仅 Flash 0731,且仅限 API。网上「8/10–20」为未经证实传言。

Q:跑分能直接相信吗?
A:SWE-bench Verified 等第三方基准可信度较高;Terminal Bench 2.0 等 Agent 分数依赖未公开 Harness,建议等社区独立复现。

Q:对普通开发者有什么实际影响?
A:OpenAI / Anthropic 格式 API 无需改代码,deepseek-v4-flash 自动指向新官方版;旧模型名须尽快切换。

9. 深度洞察:「斩杀线」与价格战下一轮

在 V4-Flash-0731 上线前,中文 AI 社区因 Pro 版延期戏称梁文锋「梁白开」;上线后因表现超预期又改称「梁圣」——昵称反转本身就是社区情绪的晴雨表。

更值得关注的概念是开发者圈子流传的「斩杀线」:DeepSeek 以「够用性能 + 极端低价」设下门槛——友商若性能无明显超越、又拿不出更低价格,便可能在市场上失去存在感。这也解释了同期 GPT-5.6 Luna 低价版 reportedly 降价 80% 等密集调价。一位 AI 创业孵化人士对 21 世纪经济报道的评价颇为形象:「所有大模型公司都在梁文锋前面奔跑,不管用什么方式,都必须跑到 DeepSeek 前面才能生存。」

从行业背景看,7 月 31 日英伟达、博通、AMD 等算力股并未明显波动——市场似乎已习惯「DeepSeek 式效率突破」,不再简单将其等同于利空算力股。这与 2025 年初 R1 发布时引发全球 AI 芯片股下跌形成鲜明对比,说明市场对中国大模型工程创新的认知已相对成熟。

对 Mac 开发者而言,Flash 0731 的 MIT 许可 + 13B 激活参数,使 V4-Flash 量化版在 Apple Silicon 统一内存上有社区实验空间(可参考本站 AMX-2 基准测试)。但生产级 Agent 流水线、Harness 对照验收、与 Kimi K3 / Qwen3.8-Max 的横向 SWE-bench 回归,仍建议在隔离环境中跑——避免占满本机统一内存、影响 Cursor / Xcode 日常开发。

10. 收束:API 路由任意设备,Agent 实测仍靠 Mac

切换 OpenRouter 路由、复制 DeepSeek API Key——Windows 或 Linux 完全够用。但若你要在同一套环境里跑 Cursor + V4-Flash 长上下文编程、用 OpenClaw 做多渠道 Agent 对照、或在 Mac 上用 MLX 做 Flash 量化版本地验收,Apple Silicon 统一内存 + Metal 图形栈仍是阻力最小的路径。

更务实的做法:主力机继续调 API,把 Flash 0731 批量 Agent 压测、Harness 发布后的对照回归、1M 上下文文档批处理放到 MACGPU 远程 Mac mini M4 节点——按需启停、SSH 安全访问,在预告的高峰加价框架下把算力留给真机验证,把本机留给稳定开发。