2026 DEEPSEEK V4
MANXUE_BAN_
GA_RELEASE.

DeepSeek V4 满血版 GA 正式发布:架构、峰谷计费与基准对比

导语:等了整整三个月,DeepSeek V4 满血版(GA 正式版)终于在 2026 年 7 月 20 日迎来正式上线。相比 4 月预览版,这次不仅带来 Agent 能力、数学推理与代码生成的专项提升,更首次引入峰谷差异化计费——标志着 DeepSeek 从「近乎免费」迈向有纪律的商业化运营。本文严格按调研素材全部要点撰写:完整时间线、V4-Pro/Flash 规格表、CSA+HCA+mHC 架构、三种推理模式、Benchmark 全表、峰谷定价、API 迁移指南(7 月 24 日截止)、与 GPT-5.6 / Claude Fable 5 对比矩阵、FAQ 与开源里程碑深度洞察。

30 秒读懂 · TL;DR

发布2026-07-20 GA 正式版上线 · 7/24 deepseek-chat 永久下线
规模V4-Pro 1.6T(49B 激活)· V4-Flash 284B(13B 激活)· 均支持 1M 上下文
核心能力SWE-bench Verified 80.6%(开源最高)· LiveCodeBench 93.5% · MIT 开源
定价峰谷计费 · V4-Pro 输出 $0.87/M(平时)/ $1.74/M(高峰)
性价比同类任务成本仅为 Claude Fable 5 的 1/116($0.03 vs $3.48)

1. 痛点拆解:为什么满血版值得关注?

  1. 预览版已强,但生产环境缺「正式承诺」。4 月 24 日预览版上线后,开发者普遍面临两个问题:性能是否还会提升?定价会不会突变?GA 正式版用三个月的生产调优回答了前者,用峰谷计费体系回答了后者——终于可以在 SLA 框架下放心上生产。
  2. 旧 API 名即将永久下线,迁移窗口极短。deepseek-chatdeepseek-reasoner 将于 7 月 24 日 15:59 UTC 停止服务。若你的 Cursor、OpenClaw 或自建 Agent 仍引用旧模型名,现在就是最后四天。
  3. 峰谷计费是双刃剑。工作日 09–12、14–18(北京时间)费率翻倍,但即使高峰期 V4-Pro 输出价($1.74/M)仍比 Claude Opus 4.8($15/M)便宜 8.6 倍。关键是学会错峰调度与 Flash 分流。

2. 它是什么?一句话说清楚

DeepSeek V4 满血版是 DeepSeek 于 2026 年 7 月 20 日正式发布的通用可用(GA)版本,包含 V4-Pro(1.6 万亿参数 MoE)与 V4-Flash(2840 亿参数 MoE)两个型号,均以 MIT 协议开源,支持 100 万 token 上下文与 384K 最大输出。

与预览版相比,GA 版本在 Agent 编排、数学推理、代码生成上做了专项提升,并配套峰谷差异化 API 定价。它不是全新架构——CSA(压缩稀疏注意力)+ HCA(重度压缩注意力)+ mHC(流形约束超连接)的设计自 4 月预览版起就已确立,满血版做的是稳定性、调优与商业化闭环

一句话总结: DeepSeek V4 是目前开源模型中 SWE-bench Verified 最高分(80.6%),以闭源旗舰 1/10 乃至 1/100 的成本提供接近前沿的性能,且支持私有部署与 1M 超长上下文。

3. 时间线回顾:从预览版到满血版

时间事件
2026-04-24V4 预览版上线 + 开源(MIT 协议),含 V4-Pro(1.6T)和 V4-Flash(284B)
2026-05V4-Flash 与 V4-Pro 生产调优版本上线,API 正式可用
2026-06V4-Pro 价格永久降价 75%(输出价 $0.87/M tokens),定格为史上最具性价比区间
2026-06-29DeepSeek 向全体 API 用户发送邮件,宣布 GA 正式版将于 7 月中旬上线,并首次披露峰谷计费方案
2026-07-19多位开发者获得 GA 灰度内测资格,新智元等媒体报道「满血版最快明日发布」
2026-07-20GA 正式版上线(即本文发布日)
2026-07-24旧接口名 deepseek-chatdeepseek-reasoner 永久下线

姊妹篇可参考本站 DeepSeek 自研芯片与算力布局Kimi K3 深度评测6 月 AI 大模型降价优惠全攻略,对照当下开源与闭源旗舰格局。

4. 模型家族规格:V4-Pro vs V4-Flash

规格V4-ProV4-Flash
总参数量1.6 万亿(1.6T)2840 亿(284B)
每 Token 激活参数490 亿(49B)130 亿(13B)
Transformer 层数61 层43 层
上下文窗口1,000,000 tokens1,000,000 tokens
最大输出384K tokens384K tokens
精度FP4(专家权重)+ FP8(其余)FP4 + FP8 混合
预训练数据量33T+ tokens32T+ tokens
开源协议MITMIT

5. 核心架构:CSA + HCA + mHC 详解

传统 Transformer 在 KV Cache 上的内存开销随上下文长度线性增长,支持 1M token 几乎是不可能完成的任务。DeepSeek V4 抛弃了 V2/V3 时代的 MLA(多头潜在注意力),通过三项关键架构革新解决了这个问题:

5.1 压缩稀疏注意力(CSA,Compressed Sparse Attention)

  • 将 KV 序列先通过 Softmax 门控池化压缩 4 倍
  • 再用 FP4 精度的「闪电索引器」(Lightning Indexer)做 top-k 稀疏选择(V4-Pro 选 top-1024,V4-Flash 选 top-512
  • 同时保留最近 128 个 token 的滑动窗口
  • 效果:在 1M 上下文下,相比 DeepSeek V3.2 只需 27% 的推理 FLOPs

5.2 重度压缩注意力(HCA,Heavily Compressed Attention)

  • 将 token 压缩 128 倍,进行全局密集注意力
  • 捕获长程依赖,与 CSA 形成互补
  • V4-Flash 的前 2 层用 HCA,之后 CSA/HCA 交替使用;V4-Pro 结构类似

综合效果:1M token 场景下,KV Cache 内存仅为 V3.2 的 10%(V4-Flash 更低至 7%)。

5.3 流形约束超连接(mHC)与 Muon 优化器

mHC(Manifold-Constrained Hyper-Connections) 是对传统残差连接的升级。标准 Transformer 用简单的 x = x + f(x) 残差路径,在极深网络中容易出现梯度退化。mHC 引入 4 通道残差流,通过满足双随机矩阵约束(Birkhoff 多面体)的混合矩阵,确保信号在 61 层深网络中的稳定传播。

训练时采用 Muon 优化器(而非标准 AdamW),通过牛顿-舒尔茨正交化处理梯度,使梯度步长更加有据,收敛速度更快、训练更稳定。

5.4 三种推理模式

模式特点适用场景
Non-think无思维链,极速响应简单问答、路由分发
Think High显式推理(<redacted_thinking> 标签)中等复杂任务、代码调试
Think Max最大推理力度,需要 384K+ 上下文复杂数学、长链路 Agent

推荐采样参数:temperature=1.0, top_p=1.0(官方推荐,全模式通用)。

6. Benchmark 跑分:开源之王的成绩单

基准测试DeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6% ★ 开源最高96.0%未单独公布~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

解读重点:

  • SWE-bench Verified:V4-Pro 以 80.6% 位列开源模型第一,与 Gemini 3.1 Pro 并列
  • LiveCodeBench:V4-Pro 以 93.5% 超越所有闭源竞品,算法竞赛场景首选
  • SWE-bench Pro:Claude Fable 5 以 80.3% 领跑,多文件 Repo 级修 Bug 仍是其主场
  • Terminal-Bench:GPT-5.6 Ultra 以 85.1% 领先,终端/工具链密集型 Agent 场景更优

注意事项:上述基准为 DeepSeek 自报及第三方汇总数据,不同模型使用了各自的推理 harness,独立复现工作仍在进行中。

7. 性价比:每任务成本 vs 性能

根据 Artificial Analysis 的评测数据,在 Strategy & Ops 指数任务中:

模型每次任务成本得分性价比倍数
Claude Fable 5$3.4850 分基准
DeepSeek V4-Pro$0.0338 分成本仅为 Fable 5 的 1/116
DeepSeek V4-Flash全部六类指数任务均低于 $0.04轻量任务极致省钱

Fable 5 的成本是 V4-Pro 的 116 倍,但得分仅高出约 12 分(31%)。对于大多数生产场景,V4-Pro 的性价比无可匹敌。

8. 横向对比:DeepSeek V4 vs GPT-5.6 Sol vs Claude Fable 5

维度DeepSeek V4-ProGPT-5.6 SolClaude Fable 5
开源✅ MIT 协议❌ 闭源❌ 闭源
可自托管✅ 支持
上下文窗口1M tokens未公开1M tokens
代码能力极强(接近 Fable 5)极强最强
API 输出价(平时)$0.87/M tokens~$15/M$50/M
峰值输出价$1.74/M tokens
Agent 能力强,支持多 Agent 编排最强
数据隐私✅ 可私有部署
场景推荐模型原因
预算有限 / 高频调用 / 私有部署DeepSeek V4-Pro / Flash输出 $0.87/M,MIT 开源
极致代码能力、不在乎成本Claude Fable 5SWE-bench Pro 最高分 80.3%
复杂算法 + 数学推理GPT-5.6 Sol / UltraTerminal-Bench 领先
超大规模日志/文档处理V4-Flash缓存命中输入仅 $0.0028/M

9. 峰谷计费详解:完整价格表与省钱攻略

这是 GA 版本最受关注也最具争议的变化。DeepSeek 首次引入峰谷差异化定价,类似电网的分时电价。高峰时段(北京时间):工作日 09:00–12:0014:00–18:00,所有费率翻倍。

模型计费项平时(Off-Peak)高峰(Peak)
V4-Pro输入(缓存命中)¥0.025 / $0.0035 / 1M tokens翻倍
输入(缓存未命中)¥3.00 / $0.435 / 1M tokens¥6.00 / $0.87
输出¥6.00 / $0.87 / 1M tokens¥12.00 / $1.74
V4-Flash输入(缓存命中)¥0.02 / $0.0028 / 1M tokens翻倍
输入(缓存未命中)¥1.00 / $0.14 / 1M tokens¥2.00 / $0.28
输出¥2.00 / $0.28 / 1M tokens¥4.00 / $0.56

9.1 四大省钱技巧

  1. 非实时任务排到非高峰:批量文档处理、数据标注、代码审查等,安排在 18:00 之后或早上 9 点之前运行
  2. 善用缓存命中:对于重复的 System Prompt,构建 Prompt Cache,V4-Flash 缓存命中成本仅 $0.0028/M,接近免费
  3. Flash 做分流:简单意图识别、路由判断用 V4-Flash,复杂推理再转 V4-Pro——可节省 60–80% 推理成本
  4. 提前获取账单通知:DeepSeek 承诺在计费变更 24 小时前发送邮件通知

即使在高峰期,V4-Pro 的输出价($1.74/M)也比 Claude Opus 4.8($15/M)便宜 8.6 倍,比 GPT-5.6 Sol(约 $15/M)便宜同等倍数。

10. 开发者必看:API 迁移指南(7 月 24 日截止)⚠️

重要警告:旧模型名 deepseek-chatdeepseek-reasoner 将于 2026 年 7 月 24 日 15:59 UTC(北京时间 7 月 24 日 23:59) 永久停止访问。

旧模型名新模型名备注
deepseek-chatdeepseek-v4-flash(非思考模式)速度快,适合轻量任务
deepseek-reasonerdeepseek-v4-flash(思考模式)或升级到 deepseek-v4-pro 获取更强推理

10.1 OpenAI SDK(Python)

from openai import OpenAI client = OpenAI( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com/v1" ) # ❌ 旧写法(7月24日后失效) # client.chat.completions.create(model="deepseek-chat", messages=[...]) # ✅ 新写法 — 非思考模式 response = client.chat.completions.create( model="deepseek-v4-flash", messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}] ) # ✅ 新写法 — 思考模式(替代 deepseek-reasoner) response = client.chat.completions.create( model="deepseek-v4-pro", messages=[{"role": "user", "content": "Solve this step by step..."}], extra_body={ "thinking": {"type": "enabled", "budget_tokens": 8000} } )

10.2 Anthropic SDK 兼容写法

V4 同时支持 OpenAI ChatCompletions 格式和 Anthropic Messages 格式,base_url 不变,仅需更新 model 参数:

import anthropic client = anthropic.Anthropic( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com" ) message = client.messages.create( model="deepseek-v4-pro", max_tokens=4096, messages=[{"role": "user", "content": "What changed in the V4 GA release?"}] )

11. 落地步骤:五种方式立即接入

  1. DeepSeek 网页/App(最简单):访问 chat.deepseek.com,注册账号,V4 满血版已默认上线。
  2. 官方 API(开发者):在 platform.deepseek.com 获取 API Key,使用 OpenAI 兼容接口,模型名改为 deepseek-v4-prodeepseek-v4-flash
  3. OpenRouter 多路由:模型 ID deepseek/deepseek-v4-pro,参考本站 OpenRouter 编程分榜与 Mac 多路由指南
  4. Cursor / IDE 配置:将 DeepSeek V4-Pro 设为日常编程主力,复杂 Repo 修 Bug 时 fallback 到 Claude Fable 5
  5. 搜索代码库完成迁移:全局搜索 deepseek-chatdeepseek-reasoner,在 staging 环境测试新模型名,7 月 24 日前完成生产切换。

12. 常见问题(FAQ)

Q:DeepSeek V4 满血版和预览版有什么区别?
A:满血版在预览版基础上提升了 Agent 能力、数学推理与代码生成,并首次引入峰谷差异化计费。底层 CSA+HCA 架构不变,但生产稳定性与调优版本更成熟。

Q:V4-Pro 和 V4-Flash 应该怎么选?
A:V4-Pro 适合复杂推理、长链路 Agent;V4-Flash 适合高频轻量调用、意图路由,输出价仅 $0.28/M(平时)。

Q:峰谷计费的高峰时段是几点?
A:北京时间工作日 09:00–12:00 和 14:00–18:00,所有费率翻倍。非实时任务建议错峰运行。

Q:deepseek-chat 什么时候停用?
A:2026 年 7 月 24 日 15:59 UTC(北京时间 23:59)永久下线。请立即迁移到 deepseek-v4-flashdeepseek-v4-pro

Q:DeepSeek V4 能本地部署吗?
A:可以——MIT 协议开源,权重已在 Hugging Face 开放。但 1.6T MoE 生产部署需多卡集群,Mac 本地更适合 API 或量化版验证。

Q:和 Claude Fable 5 哪个更强?
A:Fable 5 在 SWE-bench 上领先,但 V4-Pro 以 1/116 的成本提供接近前沿的性能,且支持私有部署。

13. 深度洞察:2026 开源大模型的里程碑信号

DeepSeek V4 GA 正式版的发布,远不止是一次「预览版毕业」——它标志着中国开源大模型生态在 2026 年中期迎来了一个结构性转折点。要理解这一转折的深度,需要从三个维度拆解:

13.1 从「价格屠夫」到「有规则的商业平台」

过去 18 个月,DeepSeek 以近乎颠覆性的低价(V3 时代输出 $0.28/M)重塑了全球 AI API 市场格局,迫使 OpenAI、Anthropic 纷纷跟进降价。但「近乎免费」不可持续——算力成本、研发投入、合规运营都需要现金流支撑。峰谷计费的引入,是 DeepSeek 从补贴换市场转向有纪律的商业化的信号。

这一转型的关键洞察在于:DeepSeek 并没有在涨价中牺牲竞争力。即使高峰期 V4-Pro 输出 $1.74/M,仍比 Claude Opus 4.8 便宜 8.6 倍。峰谷机制本质上是一种需求侧调度工具——把非实时算力需求引导到低谷时段,提升集群利用率,而非简单向用户转嫁成本。对于能错峰调度的工程团队(夜间批处理、周末代码审查),实际账单可能比之前更低。

13.2 架构创新重新定义「长上下文经济学」

1M token 上下文在 2026 年已不是稀缺参数——Kimi K3、Claude Fable 5 均宣称支持百万级上下文。但 DeepSeek V4 的独特价值在于让 1M 上下文在经济上可行:CSA 4 倍压缩 + top-1024 稀疏选择 + 128 token 滑动窗口,使 1M 场景下推理 FLOPs 仅为 V3.2 的 27%,KV Cache 内存降至 10%。

这意味着同等硬件可以服务更长的上下文,API 定价可以维持低位。对比 Kimi K3 的 $15/M 输出价,V4-Pro 的 $0.87/M 在百万 token 场景下的成本差距是数量级的。对于需要一次性分析完整代码库、处理长篇法律/研究文档、多轮 Agent 长记忆的团队,V4 是目前唯一在「上下文长度 × 性能 × 成本」三角中三项都不短板的选项。

mHC 4 通道残差流与 Muon 优化器的组合,则解决了「更深网络 = 更不稳定训练」的传统困境。61 层深度使 V4-Pro 在保持训练稳定性的同时,获得了超越 V3 系列的表征能力——这是参数规模从 671B 跃升至 1.6T 仍能高效训练的技术底座。

13.3 开源许可的战略权重:MIT 不只是「能下载」

在 2026 年 7 月的开源大模型格局中,许可协议已成为与参数规模同等重要的选型因素。Llama 系列的商业使用限制、部分国产模型的「研究用途 only」条款,使企业在合规部署时面临隐性风险。DeepSeek V4 的 MIT 协议意味着:

  • 企业可在内网无限制部署,无需向 DeepSeek 报备或分成
  • 可基于 V4 权重进行微调、蒸馏、二次开发,成果可闭源商用
  • 数据不出境的政企、金融、医疗场景获得了一条合规的技术路径

当 Kimi K3 以 2.8T 参数重夺「最大开源模型」头衔时(参见本站 K3 深度评测),DeepSeek V4 并未在参数规模上正面竞争,而是在工程效率、成本结构、许可自由度三个维度建立了差异化壁垒。这不是退缩,而是更成熟的竞争策略——在开源社区中,「能被广泛采用」比「参数数字最大」更具长期价值。

对 Mac 开发者而言,V4 的 MIT 许可 + OpenAI/Anthropic 双 SDK 兼容,意味着可以在 Cursor、Continue、OpenClaw 等工具链中无缝切换,同时保留未来 MLX / llama.cpp 量化适配的可能性。完整权重虽需多卡集群才能生产部署,但 V4-Flash 的 13B 激活参数在 Apple Silicon 统一内存架构上已有社区量化实验——可参考本站 Apple Silicon DeepSeek V4 AMX-2 基准测试 跟踪本地推理进展。

归根结底,DeepSeek V4 GA 的价值不在于能否击败 Claude Fable 5 或 GPT-5.6(暂时还不能),而在于它以闭源旗舰 1/10 乃至 1/100 的成本,提供了开源模型中无可争议的最强性能。对于不想数据出境的企业、预算有限的独立开发者、需要 1M 上下文的 Agent 工程师、追求极致性价比的 AI 产品团队——DeepSeek V4 Pro 是目前唯一没有短板的选择。

14. 收束:API 尝鲜用任意设备,Agent 实测仍靠 Mac

注册 platform.deepseek.com、复制 API Key、在 OpenRouter 上切换路由——Windows 或 Linux 完全够用。但若你要在 同一套环境 里跑 Cursor + DeepSeek V4 长上下文编程、用 Xcode 做 iOS 侧 Agent 联调、或在 Mac 上用 MLX 做 V4-Flash 量化版对照验收,Apple Silicon 统一内存 + Metal 图形栈 仍是阻力最小的路径。

更务实的做法:主力机继续调 API,把 V4-Pro Think Max 压力测试、多仓库 SWE-bench 回归、1M 上下文文档批处理放到 MACGPU 远程 Mac mini M4 节点——按需启停、SSH 安全访问,在峰谷计费框架下把算力留给真机验证,把本机留给日常稳定开发。