2026 DEEPSEEK V4
MANXUE_BAN_
GA_RELEASE.
导语:等了整整三个月,DeepSeek V4 满血版(GA 正式版)终于在 2026 年 7 月 20 日迎来正式上线。相比 4 月预览版,这次不仅带来 Agent 能力、数学推理与代码生成的专项提升,更首次引入峰谷差异化计费——标志着 DeepSeek 从「近乎免费」迈向有纪律的商业化运营。本文严格按调研素材全部要点撰写:完整时间线、V4-Pro/Flash 规格表、CSA+HCA+mHC 架构、三种推理模式、Benchmark 全表、峰谷定价、API 迁移指南(7 月 24 日截止)、与 GPT-5.6 / Claude Fable 5 对比矩阵、FAQ 与开源里程碑深度洞察。
30 秒读懂 · TL;DR
| 发布 | 2026-07-20 GA 正式版上线 · 7/24 deepseek-chat 永久下线 |
| 规模 | V4-Pro 1.6T(49B 激活)· V4-Flash 284B(13B 激活)· 均支持 1M 上下文 |
| 核心能力 | SWE-bench Verified 80.6%(开源最高)· LiveCodeBench 93.5% · MIT 开源 |
| 定价 | 峰谷计费 · V4-Pro 输出 $0.87/M(平时)/ $1.74/M(高峰) |
| 性价比 | 同类任务成本仅为 Claude Fable 5 的 1/116($0.03 vs $3.48) |
1. 痛点拆解:为什么满血版值得关注?
- 预览版已强,但生产环境缺「正式承诺」。4 月 24 日预览版上线后,开发者普遍面临两个问题:性能是否还会提升?定价会不会突变?GA 正式版用三个月的生产调优回答了前者,用峰谷计费体系回答了后者——终于可以在 SLA 框架下放心上生产。
- 旧 API 名即将永久下线,迁移窗口极短。
deepseek-chat与deepseek-reasoner将于 7 月 24 日 15:59 UTC 停止服务。若你的 Cursor、OpenClaw 或自建 Agent 仍引用旧模型名,现在就是最后四天。 - 峰谷计费是双刃剑。工作日 09–12、14–18(北京时间)费率翻倍,但即使高峰期 V4-Pro 输出价($1.74/M)仍比 Claude Opus 4.8($15/M)便宜 8.6 倍。关键是学会错峰调度与 Flash 分流。
2. 它是什么?一句话说清楚
DeepSeek V4 满血版是 DeepSeek 于 2026 年 7 月 20 日正式发布的通用可用(GA)版本,包含 V4-Pro(1.6 万亿参数 MoE)与 V4-Flash(2840 亿参数 MoE)两个型号,均以 MIT 协议开源,支持 100 万 token 上下文与 384K 最大输出。
与预览版相比,GA 版本在 Agent 编排、数学推理、代码生成上做了专项提升,并配套峰谷差异化 API 定价。它不是全新架构——CSA(压缩稀疏注意力)+ HCA(重度压缩注意力)+ mHC(流形约束超连接)的设计自 4 月预览版起就已确立,满血版做的是稳定性、调优与商业化闭环。
一句话总结: DeepSeek V4 是目前开源模型中 SWE-bench Verified 最高分(80.6%),以闭源旗舰 1/10 乃至 1/100 的成本提供接近前沿的性能,且支持私有部署与 1M 超长上下文。
3. 时间线回顾:从预览版到满血版
| 时间 | 事件 |
|---|---|
| 2026-04-24 | V4 预览版上线 + 开源(MIT 协议),含 V4-Pro(1.6T)和 V4-Flash(284B) |
| 2026-05 | V4-Flash 与 V4-Pro 生产调优版本上线,API 正式可用 |
| 2026-06 | V4-Pro 价格永久降价 75%(输出价 $0.87/M tokens),定格为史上最具性价比区间 |
| 2026-06-29 | DeepSeek 向全体 API 用户发送邮件,宣布 GA 正式版将于 7 月中旬上线,并首次披露峰谷计费方案 |
| 2026-07-19 | 多位开发者获得 GA 灰度内测资格,新智元等媒体报道「满血版最快明日发布」 |
| 2026-07-20 | GA 正式版上线(即本文发布日) |
| 2026-07-24 | 旧接口名 deepseek-chat 与 deepseek-reasoner 永久下线 |
姊妹篇可参考本站 DeepSeek 自研芯片与算力布局、Kimi K3 深度评测 与 6 月 AI 大模型降价优惠全攻略,对照当下开源与闭源旗舰格局。
4. 模型家族规格:V4-Pro vs V4-Flash
| 规格 | V4-Pro | V4-Flash |
|---|---|---|
| 总参数量 | 1.6 万亿(1.6T) | 2840 亿(284B) |
| 每 Token 激活参数 | 490 亿(49B) | 130 亿(13B) |
| Transformer 层数 | 61 层 | 43 层 |
| 上下文窗口 | 1,000,000 tokens | 1,000,000 tokens |
| 最大输出 | 384K tokens | 384K tokens |
| 精度 | FP4(专家权重)+ FP8(其余) | FP4 + FP8 混合 |
| 预训练数据量 | 33T+ tokens | 32T+ tokens |
| 开源协议 | MIT | MIT |
5. 核心架构:CSA + HCA + mHC 详解
传统 Transformer 在 KV Cache 上的内存开销随上下文长度线性增长,支持 1M token 几乎是不可能完成的任务。DeepSeek V4 抛弃了 V2/V3 时代的 MLA(多头潜在注意力),通过三项关键架构革新解决了这个问题:
5.1 压缩稀疏注意力(CSA,Compressed Sparse Attention)
- 将 KV 序列先通过 Softmax 门控池化压缩 4 倍
- 再用 FP4 精度的「闪电索引器」(Lightning Indexer)做 top-k 稀疏选择(V4-Pro 选 top-1024,V4-Flash 选 top-512)
- 同时保留最近 128 个 token 的滑动窗口
- 效果:在 1M 上下文下,相比 DeepSeek V3.2 只需 27% 的推理 FLOPs
5.2 重度压缩注意力(HCA,Heavily Compressed Attention)
- 将 token 压缩 128 倍,进行全局密集注意力
- 捕获长程依赖,与 CSA 形成互补
- V4-Flash 的前 2 层用 HCA,之后 CSA/HCA 交替使用;V4-Pro 结构类似
综合效果:1M token 场景下,KV Cache 内存仅为 V3.2 的 10%(V4-Flash 更低至 7%)。
5.3 流形约束超连接(mHC)与 Muon 优化器
mHC(Manifold-Constrained Hyper-Connections) 是对传统残差连接的升级。标准 Transformer 用简单的 x = x + f(x) 残差路径,在极深网络中容易出现梯度退化。mHC 引入 4 通道残差流,通过满足双随机矩阵约束(Birkhoff 多面体)的混合矩阵,确保信号在 61 层深网络中的稳定传播。
训练时采用 Muon 优化器(而非标准 AdamW),通过牛顿-舒尔茨正交化处理梯度,使梯度步长更加有据,收敛速度更快、训练更稳定。
5.4 三种推理模式
| 模式 | 特点 | 适用场景 |
|---|---|---|
| Non-think | 无思维链,极速响应 | 简单问答、路由分发 |
| Think High | 显式推理(<redacted_thinking> 标签) | 中等复杂任务、代码调试 |
| Think Max | 最大推理力度,需要 384K+ 上下文 | 复杂数学、长链路 Agent |
推荐采样参数:temperature=1.0, top_p=1.0(官方推荐,全模式通用)。
6. Benchmark 跑分:开源之王的成绩单
| 基准测试 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ 开源最高 | 96.0% | 未单独公布 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
解读重点:
- SWE-bench Verified:V4-Pro 以 80.6% 位列开源模型第一,与 Gemini 3.1 Pro 并列
- LiveCodeBench:V4-Pro 以 93.5% 超越所有闭源竞品,算法竞赛场景首选
- SWE-bench Pro:Claude Fable 5 以 80.3% 领跑,多文件 Repo 级修 Bug 仍是其主场
- Terminal-Bench:GPT-5.6 Ultra 以 85.1% 领先,终端/工具链密集型 Agent 场景更优
注意事项:上述基准为 DeepSeek 自报及第三方汇总数据,不同模型使用了各自的推理 harness,独立复现工作仍在进行中。
7. 性价比:每任务成本 vs 性能
根据 Artificial Analysis 的评测数据,在 Strategy & Ops 指数任务中:
| 模型 | 每次任务成本 | 得分 | 性价比倍数 |
|---|---|---|---|
| Claude Fable 5 | $3.48 | 50 分 | 基准 |
| DeepSeek V4-Pro | $0.03 | 38 分 | 成本仅为 Fable 5 的 1/116 |
| DeepSeek V4-Flash | 全部六类指数任务均低于 $0.04 | — | 轻量任务极致省钱 |
Fable 5 的成本是 V4-Pro 的 116 倍,但得分仅高出约 12 分(31%)。对于大多数生产场景,V4-Pro 的性价比无可匹敌。
8. 横向对比:DeepSeek V4 vs GPT-5.6 Sol vs Claude Fable 5
| 维度 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 开源 | ✅ MIT 协议 | ❌ 闭源 | ❌ 闭源 |
| 可自托管 | ✅ 支持 | ❌ | ❌ |
| 上下文窗口 | 1M tokens | 未公开 | 1M tokens |
| 代码能力 | 极强(接近 Fable 5) | 极强 | 最强 |
| API 输出价(平时) | $0.87/M tokens | ~$15/M | $50/M |
| 峰值输出价 | $1.74/M tokens | — | — |
| Agent 能力 | 强,支持多 Agent 编排 | 强 | 最强 |
| 数据隐私 | ✅ 可私有部署 | ❌ | ❌ |
| 场景 | 推荐模型 | 原因 |
|---|---|---|
| 预算有限 / 高频调用 / 私有部署 | DeepSeek V4-Pro / Flash | 输出 $0.87/M,MIT 开源 |
| 极致代码能力、不在乎成本 | Claude Fable 5 | SWE-bench Pro 最高分 80.3% |
| 复杂算法 + 数学推理 | GPT-5.6 Sol / Ultra | Terminal-Bench 领先 |
| 超大规模日志/文档处理 | V4-Flash | 缓存命中输入仅 $0.0028/M |
9. 峰谷计费详解:完整价格表与省钱攻略
这是 GA 版本最受关注也最具争议的变化。DeepSeek 首次引入峰谷差异化定价,类似电网的分时电价。高峰时段(北京时间):工作日 09:00–12:00 和 14:00–18:00,所有费率翻倍。
| 模型 | 计费项 | 平时(Off-Peak) | 高峰(Peak) |
|---|---|---|---|
| V4-Pro | 输入(缓存命中) | ¥0.025 / $0.0035 / 1M tokens | 翻倍 |
| 输入(缓存未命中) | ¥3.00 / $0.435 / 1M tokens | ¥6.00 / $0.87 | |
| 输出 | ¥6.00 / $0.87 / 1M tokens | ¥12.00 / $1.74 | |
| V4-Flash | 输入(缓存命中) | ¥0.02 / $0.0028 / 1M tokens | 翻倍 |
| 输入(缓存未命中) | ¥1.00 / $0.14 / 1M tokens | ¥2.00 / $0.28 | |
| 输出 | ¥2.00 / $0.28 / 1M tokens | ¥4.00 / $0.56 |
9.1 四大省钱技巧
- 非实时任务排到非高峰:批量文档处理、数据标注、代码审查等,安排在 18:00 之后或早上 9 点之前运行
- 善用缓存命中:对于重复的 System Prompt,构建 Prompt Cache,V4-Flash 缓存命中成本仅 $0.0028/M,接近免费
- Flash 做分流:简单意图识别、路由判断用 V4-Flash,复杂推理再转 V4-Pro——可节省 60–80% 推理成本
- 提前获取账单通知:DeepSeek 承诺在计费变更 24 小时前发送邮件通知
即使在高峰期,V4-Pro 的输出价($1.74/M)也比 Claude Opus 4.8($15/M)便宜 8.6 倍,比 GPT-5.6 Sol(约 $15/M)便宜同等倍数。
10. 开发者必看:API 迁移指南(7 月 24 日截止)⚠️
重要警告:旧模型名 deepseek-chat 和 deepseek-reasoner 将于 2026 年 7 月 24 日 15:59 UTC(北京时间 7 月 24 日 23:59) 永久停止访问。
| 旧模型名 | 新模型名 | 备注 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考模式) | 速度快,适合轻量任务 |
deepseek-reasoner | deepseek-v4-flash(思考模式) | 或升级到 deepseek-v4-pro 获取更强推理 |
10.1 OpenAI SDK(Python)
10.2 Anthropic SDK 兼容写法
V4 同时支持 OpenAI ChatCompletions 格式和 Anthropic Messages 格式,base_url 不变,仅需更新 model 参数:
11. 落地步骤:五种方式立即接入
- DeepSeek 网页/App(最简单):访问 chat.deepseek.com,注册账号,V4 满血版已默认上线。
- 官方 API(开发者):在 platform.deepseek.com 获取 API Key,使用 OpenAI 兼容接口,模型名改为
deepseek-v4-pro或deepseek-v4-flash。 - OpenRouter 多路由:模型 ID
deepseek/deepseek-v4-pro,参考本站 OpenRouter 编程分榜与 Mac 多路由指南。 - Cursor / IDE 配置:将 DeepSeek V4-Pro 设为日常编程主力,复杂 Repo 修 Bug 时 fallback 到 Claude Fable 5。
- 搜索代码库完成迁移:全局搜索
deepseek-chat和deepseek-reasoner,在 staging 环境测试新模型名,7 月 24 日前完成生产切换。
12. 常见问题(FAQ)
Q:DeepSeek V4 满血版和预览版有什么区别?
A:满血版在预览版基础上提升了 Agent 能力、数学推理与代码生成,并首次引入峰谷差异化计费。底层 CSA+HCA 架构不变,但生产稳定性与调优版本更成熟。
Q:V4-Pro 和 V4-Flash 应该怎么选?
A:V4-Pro 适合复杂推理、长链路 Agent;V4-Flash 适合高频轻量调用、意图路由,输出价仅 $0.28/M(平时)。
Q:峰谷计费的高峰时段是几点?
A:北京时间工作日 09:00–12:00 和 14:00–18:00,所有费率翻倍。非实时任务建议错峰运行。
Q:deepseek-chat 什么时候停用?
A:2026 年 7 月 24 日 15:59 UTC(北京时间 23:59)永久下线。请立即迁移到 deepseek-v4-flash 或 deepseek-v4-pro。
Q:DeepSeek V4 能本地部署吗?
A:可以——MIT 协议开源,权重已在 Hugging Face 开放。但 1.6T MoE 生产部署需多卡集群,Mac 本地更适合 API 或量化版验证。
Q:和 Claude Fable 5 哪个更强?
A:Fable 5 在 SWE-bench 上领先,但 V4-Pro 以 1/116 的成本提供接近前沿的性能,且支持私有部署。
13. 深度洞察:2026 开源大模型的里程碑信号
DeepSeek V4 GA 正式版的发布,远不止是一次「预览版毕业」——它标志着中国开源大模型生态在 2026 年中期迎来了一个结构性转折点。要理解这一转折的深度,需要从三个维度拆解:
13.1 从「价格屠夫」到「有规则的商业平台」
过去 18 个月,DeepSeek 以近乎颠覆性的低价(V3 时代输出 $0.28/M)重塑了全球 AI API 市场格局,迫使 OpenAI、Anthropic 纷纷跟进降价。但「近乎免费」不可持续——算力成本、研发投入、合规运营都需要现金流支撑。峰谷计费的引入,是 DeepSeek 从补贴换市场转向有纪律的商业化的信号。
这一转型的关键洞察在于:DeepSeek 并没有在涨价中牺牲竞争力。即使高峰期 V4-Pro 输出 $1.74/M,仍比 Claude Opus 4.8 便宜 8.6 倍。峰谷机制本质上是一种需求侧调度工具——把非实时算力需求引导到低谷时段,提升集群利用率,而非简单向用户转嫁成本。对于能错峰调度的工程团队(夜间批处理、周末代码审查),实际账单可能比之前更低。
13.2 架构创新重新定义「长上下文经济学」
1M token 上下文在 2026 年已不是稀缺参数——Kimi K3、Claude Fable 5 均宣称支持百万级上下文。但 DeepSeek V4 的独特价值在于让 1M 上下文在经济上可行:CSA 4 倍压缩 + top-1024 稀疏选择 + 128 token 滑动窗口,使 1M 场景下推理 FLOPs 仅为 V3.2 的 27%,KV Cache 内存降至 10%。
这意味着同等硬件可以服务更长的上下文,API 定价可以维持低位。对比 Kimi K3 的 $15/M 输出价,V4-Pro 的 $0.87/M 在百万 token 场景下的成本差距是数量级的。对于需要一次性分析完整代码库、处理长篇法律/研究文档、多轮 Agent 长记忆的团队,V4 是目前唯一在「上下文长度 × 性能 × 成本」三角中三项都不短板的选项。
mHC 4 通道残差流与 Muon 优化器的组合,则解决了「更深网络 = 更不稳定训练」的传统困境。61 层深度使 V4-Pro 在保持训练稳定性的同时,获得了超越 V3 系列的表征能力——这是参数规模从 671B 跃升至 1.6T 仍能高效训练的技术底座。
13.3 开源许可的战略权重:MIT 不只是「能下载」
在 2026 年 7 月的开源大模型格局中,许可协议已成为与参数规模同等重要的选型因素。Llama 系列的商业使用限制、部分国产模型的「研究用途 only」条款,使企业在合规部署时面临隐性风险。DeepSeek V4 的 MIT 协议意味着:
- 企业可在内网无限制部署,无需向 DeepSeek 报备或分成
- 可基于 V4 权重进行微调、蒸馏、二次开发,成果可闭源商用
- 数据不出境的政企、金融、医疗场景获得了一条合规的技术路径
当 Kimi K3 以 2.8T 参数重夺「最大开源模型」头衔时(参见本站 K3 深度评测),DeepSeek V4 并未在参数规模上正面竞争,而是在工程效率、成本结构、许可自由度三个维度建立了差异化壁垒。这不是退缩,而是更成熟的竞争策略——在开源社区中,「能被广泛采用」比「参数数字最大」更具长期价值。
对 Mac 开发者而言,V4 的 MIT 许可 + OpenAI/Anthropic 双 SDK 兼容,意味着可以在 Cursor、Continue、OpenClaw 等工具链中无缝切换,同时保留未来 MLX / llama.cpp 量化适配的可能性。完整权重虽需多卡集群才能生产部署,但 V4-Flash 的 13B 激活参数在 Apple Silicon 统一内存架构上已有社区量化实验——可参考本站 Apple Silicon DeepSeek V4 AMX-2 基准测试 跟踪本地推理进展。
归根结底,DeepSeek V4 GA 的价值不在于能否击败 Claude Fable 5 或 GPT-5.6(暂时还不能),而在于它以闭源旗舰 1/10 乃至 1/100 的成本,提供了开源模型中无可争议的最强性能。对于不想数据出境的企业、预算有限的独立开发者、需要 1M 上下文的 Agent 工程师、追求极致性价比的 AI 产品团队——DeepSeek V4 Pro 是目前唯一没有短板的选择。
14. 收束:API 尝鲜用任意设备,Agent 实测仍靠 Mac
注册 platform.deepseek.com、复制 API Key、在 OpenRouter 上切换路由——Windows 或 Linux 完全够用。但若你要在 同一套环境 里跑 Cursor + DeepSeek V4 长上下文编程、用 Xcode 做 iOS 侧 Agent 联调、或在 Mac 上用 MLX 做 V4-Flash 量化版对照验收,Apple Silicon 统一内存 + Metal 图形栈 仍是阻力最小的路径。
更务实的做法:主力机继续调 API,把 V4-Pro Think Max 压力测试、多仓库 SWE-bench 回归、1M 上下文文档批处理放到 MACGPU 远程 Mac mini M4 节点——按需启停、SSH 安全访问,在峰谷计费框架下把算力留给真机验证,把本机留给日常稳定开发。