2026 DEEPSEEK V4
FLASH_0731_
OFFICIAL.
导语:如果你在 7 月底盯着 DeepSeek 的 changelog,会发现一件反直觉的事——没有新模型发布,只有同一个 284B 参数的 V4-Flash 换了一遍后训练,却在 Agent 跑分上反超自家 1.6T 的 V4-Pro 预览版,API 价格仅为 Claude Opus 4.8 的几十分之一。本文严格按调研素材全部要点撰写:4 月至 8 月完整时间线、核心定价对比表、后训练与 Harness 框架拆解、中国开源六边形混战横评、争议警示、「斩杀线」行业洞察、五步落地指南与 FAQ。
30 秒读懂 · TL;DR
| 发布 | 2026-07-31 V4-Flash-0731 官方版 API 公测 · 仅限 API,App/网页未同步 |
| 架构 | 284B / 13B 激活,与 4 月预览版完全相同 · 性能提升仅来自后训练 |
| 定价 | 输入 $0.14(缓存未命中)/ $0.0028(命中)· 输出 $0.28/M |
| Agent | Terminal Bench 2.0 82.7(厂商自报 + Harness 极简模式)· 反超 V4-Pro 预览版 67.9 |
| 未发布 | V4-Pro 官方版 · 自研 Agent 框架 Harness · 均无确切日期 |
1. 痛点拆解:为什么 0731 值得关注?
- 旗舰 Pro 版迟迟未兑现,Flash 却「越级」了。社区曾戏称梁文锋「梁白开」——V4-Pro 官方版原预期 7 月中旬全量上线却一再推迟。7 月 31 日 Flash 0731 以更小参数量反超 Pro 预览版 Agent 跑分,情绪迅速翻转为「梁圣」——但 Pro 与 Harness 仍无确切日期。
- 跑分好看,框架敏感。官方公布的 Terminal Bench 2.0(82.7)等 Agent 分数全部基于尚未公开发布的 Harness「极简模式」测得,官方自己也提醒「跑分对 harness 选择非常敏感」——不能直接等同于在 Claude Code / Cursor 里的真实表现。
- API-only 更新,消费端仍滞后。本次公测仅限 API,App 和网页端暂未同步。若你在 chat.deepseek.com 上体感「没变」,并不矛盾——开发者与终端用户看到的是两个版本节奏。
2. 时间线:从 4 月预览到 7 月「官方版」
| 时间 | 事件 |
|---|---|
| 2026-04-24 | DeepSeek-V4 预览版首次发布并开源(MIT),含 V4-Pro(1.6T/49B 激活)与 V4-Flash(284B/13B 激活),均支持 1M 上下文 |
| 2026-07-24 | 旧接口 deepseek-chat 与 deepseek-reasoner 正式停用,全部流量切换到 V4 系列命名 |
| 2026-07-27 | 月之暗面 Kimi K3(2.8T)开源权重上线 Hugging Face,给 DeepSeek 制造竞争压力 |
| 2026-07-31 | V4-Flash-0731 正式版 API 公测,权重同步 Hugging Face;changelog 首次点名自研 Agent 框架「Harness」,称即将随 V4 正式版发布 |
| 截至 2026-08-05 | V4-Pro 官方版仍「尽快发布」。媒体援引未署名消息源称 8/10–8/20 可能 GA——未经官方证实,仅供参考 |
3. 核心数据一览
| 模型 | 状态 | 总参数/激活 | 上下文 | 输入价(未命中/命中,$/M) | 输出价($/M) | 协议 |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | 官方正式版(07-31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| V4-Pro | 预览版(04-24,官方版未发布) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 权重开源(07-27) | 2.8T / ~104B(社区估算) | ~1.05M | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| GLM-5.2 | 开源(2026年6月) | ~744B / ~40B | 1M | 本文未核实 | 本文未核实 | MIT |
| Qwen3.8-Max | API GA(08-02),权重待放出 | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 承诺开源 |
以上定价均为厂商自报公开数据。DeepSeek 已预告未来将对 API 启用「高峰时段 2 倍加价」(北京时间 9–12 点、14–18 点),截至发稿未公布具体生效日期。
4. 深度拆解:性能是怎么「变出来」的
4.1 架构没有变,变的是后训练
V4-Flash-0731 在参数规模、模型结构上与 4 月预览版完全相同,官方明确说明性能提升「完全来自重新进行的后训练」。284B/13B 的 Flash 在多项 Agent 基准上反而超过 1.6T/49B 的 V4-Pro 预览版——2026 年下半年大模型竞争,后训练质量的重要性正在逼近甚至超过单纯堆参数。
4.2 混合注意力:CSA+HCA、mHC、Muon 优化器
根据技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列三处关键改动:
- 混合注意力架构:压缩稀疏注意力(CSA)+ 高度压缩注意力(HCA),对外统称「DSA 稀疏注意力」,降低长上下文计算与显存开销;
- 流形约束超连接(mHC):改进传统残差连接;
- Muon 优化器:提升训练收敛速度与稳定性。
官方指标:1M token 场景下,V4-Pro 单 token 推理 FLOPs 仅为 V3.2 的 27%,KV Cache 占用仅为 10%(厂商自报,尚未见独立第三方复现)。
4.3 自研 Agent 框架 Harness 首次亮相
7 月 31 日 changelog 首次出现「DeepSeek Harness」——对标 Claude Code 的 Agent 执行框架,用于文件读写、工具调用、端到端工程任务。此前 DeepSeek 主要依赖 Claude Code、OpenCode 等第三方工具。官方 Agent 跑分全部用 Harness「极简模式」测出,参数为 max 档位、top_p=0.95、temperature=1.0。官方提示:「跑分对 harness 选择非常敏感,不能简单等同于模型本身能力的提升。」
5. 横向对比:中国开源大模型的「六边形混战」
| 模型 | 实验室 | 发布/权重 | 总参数 | AA Intelligence Index | 单任务成本(AA) |
|---|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 07-31 官方版 | 284B | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 07-16 预览 / 07-27 权重 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智谱/Z.ai | 2026年6月 | ~744B | 比 Flash 高约 1 分 | 本文未核实 |
| Qwen3.8-Max | 阿里 | 08-02 GA(权重待放出) | 2.4T | 本文未核实 | 本文未核实 |
| GPT-5.6 Sol | OpenAI | 闭源 | 未公开 | 比 Flash 高 9+ 分 | $1.86 |
| Claude Fable 5 | Anthropic | 闭源 | 未公开 | 比 Flash 高 9+ 分 | $3.15 |
数据来源:Intelligence Index 与单任务成本引自 Artificial Analysis(第三方独立评测);DeepSeek Agent 跑分为厂商自报,评测方法不同,不可直接相加比较。
反差很明显:AA 综合指数上 V4-Flash 并非最高,甚至落后于 Kimi K3 和 GLM-5.2;但单任务成本仅为 Kimi K3 的约 1/29、GPT-5.6 Sol 的约 1/62、Claude Fable 5 的约 1/105。DeepSeek 打的不是「跑分第一」,而是「够用的智能 + 极致的价格」——这也解释了 V4-Flash 预览版为何能在 OpenRouter 连续七周稳坐调用量第一。
6. 争议点:跑分好看,不代表没有水分
- 跑分依赖 Harness,官方自己也在提醒。Terminal Bench 2.0(82.7 vs Pro 预览版 67.9)基于未公开发布的 Harness 极简模式,应视为「厂商自报 + 特定框架」结果。
- 海外开发者反馈可用性问题。据 21 世纪经济报道援引社区反馈,正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题。
- V4-Pro 与 Harness 上线时间未经证实。媒体「8 月 10–20 日 GA」为未署名消息源,官方 changelog 原话仅为「将尽快发布」。
- 融资与 IPO 传闻需谨慎。媒体报道约 74 亿美元融资、487 亿美元估值等信息目前主要来自「据报道」「消息人士称」,尚无官方或监管备案直接确认。
7. 五步落地指南:开发者现在该做什么
- 确认 API 模型名已迁移:全局搜索
deepseek-chat/deepseek-reasoner,统一改为deepseek-v4-flash或deepseek-v4-pro(7 月 24 日起旧名已停用)。 - 按场景选型 Flash vs Pro 预览版:批量 Agent、意图路由、高频轻量调用 → Flash 0731;更深世界知识与复杂推理 → Pro 预览版,等官方版再评估切换。
- 构建 Prompt Cache 降本:重复 System Prompt 走缓存命中,Flash 缓存命中成本仅 $0.0028/M,接近免费。
- 错峰应对未来高峰加价:非实时批处理安排在北京时间 9 点前或 18 点后,规避预告中的 2 倍高峰费率。
- 在 Mac 上做对照验收:用 Cursor / OpenClaw 分别接 Flash 0731 与 Kimi K3 / Qwen3.8-Max,在同一套 SWE-bench 子集上对比真实延迟与通过率——别只看厂商榜单。
8. 常见问题(FAQ)
Q:V4 和 V3.2 最大区别是什么?
A:原生 1M 上下文,长上下文 FLOPs 降至 V3.2 的 27%、KV Cache 降至 10%(官方数据);Agent 能力专项优化,适配 Claude Code、OpenCode 等主流工具。
Q:日常选 Flash 还是 Pro?
A:批量处理、Agent 流水线、成本敏感 → Flash 0731(Agent 跑分已反超 Pro 预览版);更深推理且预算充裕 → Pro 预览版,等官方版再评估。
Q:现在能用 V4 Pro 官方版吗?
A:截至 2026-08-05 不能。官方版仅 Flash 0731,且仅限 API。网上「8/10–20」为未经证实传言。
Q:跑分能直接相信吗?
A:SWE-bench Verified 等第三方基准可信度较高;Terminal Bench 2.0 等 Agent 分数依赖未公开 Harness,建议等社区独立复现。
Q:对普通开发者有什么实际影响?
A:OpenAI / Anthropic 格式 API 无需改代码,deepseek-v4-flash 自动指向新官方版;旧模型名须尽快切换。
9. 深度洞察:「斩杀线」与价格战下一轮
在 V4-Flash-0731 上线前,中文 AI 社区因 Pro 版延期戏称梁文锋「梁白开」;上线后因表现超预期又改称「梁圣」——昵称反转本身就是社区情绪的晴雨表。
更值得关注的概念是开发者圈子流传的「斩杀线」:DeepSeek 以「够用性能 + 极端低价」设下门槛——友商若性能无明显超越、又拿不出更低价格,便可能在市场上失去存在感。这也解释了同期 GPT-5.6 Luna 低价版 reportedly 降价 80% 等密集调价。一位 AI 创业孵化人士对 21 世纪经济报道的评价颇为形象:「所有大模型公司都在梁文锋前面奔跑,不管用什么方式,都必须跑到 DeepSeek 前面才能生存。」
从行业背景看,7 月 31 日英伟达、博通、AMD 等算力股并未明显波动——市场似乎已习惯「DeepSeek 式效率突破」,不再简单将其等同于利空算力股。这与 2025 年初 R1 发布时引发全球 AI 芯片股下跌形成鲜明对比,说明市场对中国大模型工程创新的认知已相对成熟。
对 Mac 开发者而言,Flash 0731 的 MIT 许可 + 13B 激活参数,使 V4-Flash 量化版在 Apple Silicon 统一内存上有社区实验空间(可参考本站 AMX-2 基准测试)。但生产级 Agent 流水线、Harness 对照验收、与 Kimi K3 / Qwen3.8-Max 的横向 SWE-bench 回归,仍建议在隔离环境中跑——避免占满本机统一内存、影响 Cursor / Xcode 日常开发。
10. 收束:API 路由任意设备,Agent 实测仍靠 Mac
切换 OpenRouter 路由、复制 DeepSeek API Key——Windows 或 Linux 完全够用。但若你要在同一套环境里跑 Cursor + V4-Flash 长上下文编程、用 OpenClaw 做多渠道 Agent 对照、或在 Mac 上用 MLX 做 Flash 量化版本地验收,Apple Silicon 统一内存 + Metal 图形栈仍是阻力最小的路径。
更务实的做法:主力机继续调 API,把 Flash 0731 批量 Agent 压测、Harness 发布后的对照回归、1M 上下文文档批处理放到 MACGPU 远程 Mac mini M4 节点——按需启停、SSH 安全访问,在预告的高峰加价框架下把算力留给真机验证,把本机留给稳定开发。