刚刚 DeepSeek V4 Pro 0813正式发布:Pro终于把旗舰位置拿回来了
就在刚刚,DeepSeek V4 Pro 正式版上线,底层版本号为DeepSeek-V4-Pro-0813。
这次不只是 API 页面换了一个日期。DeepSeek 随后放出的正式版跑分显示,0813 在代码 Agent、工具调用和自动化任务上都有明显提升。7 月底,参数更小的 V4 Flash 0731 曾在九项 Agent 测试中全面超过 Pro 预览版;不到两周,Pro 又把差距拉了回来。
先说结论:V4 Pro 0813 在 DeepSeek 自家模型中重新坐稳旗舰位置,也进入了当前 Agent 模型的第一梯队。不过,它没有全面超过 Kimi K3、Opus 4.8 和 Fable 5。
图:DeepSeek 官方公布的 V4 Pro 0813 模型对比成绩,2026 年 8 月 13 日。
这次正式发布了什么
DeepSeek 官方 API 文档已经将deepseek-v4-pro指向DeepSeek-V4-Pro-0813。原有用户不需要改模型名,也不需要更换 Base URL,重新请求时会直接使用新版本。DeepSeek API 文档
目前确认的规格如下:
| 项目 | DeepSeek V4 Pro 0813 |
|---|---|
| API 模型名 | deepseek-v4-pro |
| 底层版本 | DeepSeek-V4-Pro-0813 |
| 模型结构 | MoE |
| 总参数量 | 1.6T |
| 每 Token 激活参数 | 49B |
| 上下文长度 | 1M Token |
| 最大输出 | 384K Token |
| 推理模式 | 非思考、思考(默认) |
| API 支持 | Chat Completions、Responses、Anthropic 兼容接口 |
| 其他能力 | JSON Output、Tool Calls、前缀续写、FIM |
| 输入模态 | 文本 |
其中,版本号、上下文、输出上限和接口能力来自当前 API 页面;1.6T 总参数、49B 激活参数来自 DeepSeek V4 Pro 模型卡。官方暂未说明 0813 是否调整了基础架构,从跑分变化的位置看,这轮升级的重点显然落在了后训练和 Agent 能力上。DeepSeek 模型与价格|V4 Pro 官方模型卡
Pro 预览版到 0813:有几项几乎换了一个模型
先看 DeepSeek 内部的纵向对比。除 HLE 外,下面的分数均为单项成绩,越高越好;HLE 分别列出不使用工具和使用工具的成绩。
| Benchmark | V4 Pro 0813 | V4 Flash 0731 | V4 Pro Preview | 0813 相比 Pro Preview |
|---|---|---|---|---|
| HLE(不用/使用工具) | 42.7 / 60.0 | 37.8 / 51.5 | 37.7 / 48.2 | +5.0 / +11.8 |
| Terminal Bench 2.1 | 87.9 | 82.7 | 72.1 | +15.8 |
| NL2Repo | 61.5 | 54.2 | 38.5 | +23.0 |
| Cybergym | 83.3 | 76.7 | 52.7 | +30.6 |
| DeepSWE | 62.7 | 54.4 | 12.8 | +49.9 |
| Toolathlon-Verified | 74.1 | 70.3 | 55.9 | +18.2 |
| Agents’ Last Exam | 25.7 | 25.2 | 16.5 | +9.2 |
| AutomationBench(Public) | 31.8 | 25.1 | 12.8 | +19.0 |
| DSBench-FullStack | 71.1 | 68.7 | 41.8 | +29.3 |
| DSBench-Hard | 67.2 | 59.6 | 31.1 | +36.1 |
最夸张的是 DeepSWE:12.8 涨到 62.7,增加了 49.9 分。Cybergym、DSBench-FullStack 和 DSBench-Hard 也分别提高 30.6、29.3 和 36.1 分。这几项都涉及较长链路的代码修改、环境操作或工具调用,刚好也是 V4 Pro 预览版最容易掉链子的地方。
这组变化很难用“多想一会儿”解释。更合理的判断是,0813 进行了面向代码 Agent 的大规模后训练,补齐了预览版在工具使用和长任务执行上的短板。
相比 V4 Flash 0731,Pro 0813 在表中所有项目也都领先,但差距没有它对预览版那么夸张:Terminal Bench 高 5.2 分,DeepSWE 高 8.3 分,DSBench-FullStack 只高 2.4 分,Agents’ Last Exam 更是只高 0.5 分。
所以 Flash 0731 并没有突然失去价值。它仍是更便宜、更快的选择;Pro 的优势主要出现在更难、更长、失败成本更高的任务里。
和 GLM、Kimi、Claude 放在一起,V4 Pro 到了什么位置
官方图同时列出了 GLM 5.2、Kimi K3、Opus 4.8,以及带 fallback 的 Fable 5。完整成绩如下:
| Benchmark | V4 Pro 0813 | GLM 5.2 | Kimi K3 | Opus 4.8 | Fable 5(含 fallback) |
|---|---|---|---|---|---|
| HLE(不用/使用工具) | 42.7 / 60.0 | 40.5 / 54.7 | 43.5 / 56.0 | 49.8 / 57.9 | 53.3 / 63.0 |
| Terminal Bench 2.1 | 87.9 | 81.0 | 88.3 | 85.0 | 88.0 |
| NL2Repo | 61.5 | 48.9 | — | 69.7 | — |
| Cybergym | 83.3 | — | 80.0 | 78.3 | 83.1 |
| DeepSWE | 62.7 | 46.2 | 67.5 | 58.0 | 70.0 |
| Toolathlon-Verified | 74.1 | 59.9 | 76.5 | 76.2 | 77.9 |
| Agents’ Last Exam | 25.7 | 23.8 | 27.6 | 25.7 | — |
| AutomationBench(Public) | 31.8 | 12.9 | 30.8 | 27.2 | 29.1 |
| DSBench-FullStack | 71.1 | 61.8 | 73.7 | 71.6 | 77.2 |
| DSBench-Hard | 67.2 | 54.5 | 63.0 | 71.7 | 68.3 |
V4 Pro 0813 有两个明确的单项第一:
- Cybergym 83.3,略高于 Fable 5 的 83.1;
- AutomationBench Public 31.8,高于 Kimi K3 的 30.8、Fable 5 的 29.1 和 Opus 4.8 的 27.2。
Terminal Bench 2.1 的 87.9 也已经贴近最高水平:比 Opus 4.8 高 2.9 分,距离 Kimi K3 只有 0.4 分,距离 Fable 5 只有 0.1 分。
短板同样很清楚。HLE 不使用工具时,V4 Pro 0813 只有 42.7,落后 Opus 4.8 的 49.8 和 Fable 5 的 53.3;DeepSWE、Toolathlon 和 DSBench-FullStack 也没有拿到第一。NL2Repo 则以 61.5 落后 Opus 4.8 的 69.7。
这不是一张“DeepSeek 全面碾压”的表。更准确的说法是:V4 Pro 0813 在终端操作、安全和自动化工作流上已经能和头部闭源模型正面对打,但在纯知识推理与部分复杂软件工程任务上仍有差距。
这张跑分表还要注意三件事
第一,数据来自 DeepSeek 官方,并非第三方独立复测。厂商跑分适合判断模型升级方向,最后是否好用,仍要看同一套 Agent 框架和真实项目里的复现结果。
第二,Fable 5 一栏明确写有w/ fallback,说明部分任务可能触发后备模型。它和单一模型的直接比较需要留一点余地。
第三,DSBench-FullStack 与 DSBench-Hard 是 DeepSeek 自有测试集。它们能反映内部优化成果,但外部目前无法像公开 Benchmark 那样完整核验。真正值得优先看的,是 Terminal Bench、DeepSWE、Toolathlon、HLE 等公开项目。
截至发稿,Artificial Analysis 的 V4 Pro 页面仍显示 4 月版本,尚未明确标注完成 0813 重测。此前“Flash 0731 综合分高于 Pro”的第三方结论,现在只能视为旧版 Pro 的历史成绩,不能再拿来代表 0813。Artificial Analysis:V4 Pro
价格没变:Pro 仍然便宜,但不再是 Flash 的平替
DeepSeek 当前的人民币 API 价格如下:
| 每百万 Token | V4 Flash 0731 | V4 Pro 0813 |
|---|---|---|
| 输入,缓存命中 | 0.02 元 | 0.025 元 |
| 输入,缓存未命中 | 1 元 | 3 元 |
| 输出 | 2 元 | 6 元 |
| 并发上限 | 2500 | 500 |
Pro 的缓存命中价只比 Flash 高 0.005 元,但缓存未命中输入和输出都是 Flash 的三倍。对于会反复读取同一个代码仓库、长文档或系统提示词的 Agent,缓存命中价格很有吸引力;普通聊天、批量生成和高并发接口,Flash 依旧更划算。DeepSeek 官方价格页
需要留意的是,官方已经在价格页提示:近期计划整体上调 API 定价,而且“预计涨幅较大”。因此,当前 3 元输入、6 元输出的 Pro 价格不一定会维持很久。
已接入的项目不用改代码
DeepSeek 继续使用滚动模型名deepseek-v4-pro。原来的 Java、Python 或 Node.js 项目不需要迁移接口,只要正常发起请求,就会访问最新的 0813 版本。
{"model":"deepseek-v4-pro","messages":[{"role":"user","content":"阅读这个代码仓库,定位订单重复扣款的原因并提交修复方案"}],"thinking":{"type":"enabled"},"reasoning_effort":"max","stream":true}OpenAI 兼容接口仍是https://api.deepseek.com,Anthropic 兼容接口为https://api.deepseek.com/anthropic。
滚动升级虽然省事,生产环境仍建议保留版本切换前后的回归样例。0813 对 Agent 行为改动很大,同一条提示词的工具选择、思考长度和输出格式都可能变化。至少应重新测试函数调用、JSON 输出、超时设置和 Token 上限,不要只看接口是否返回 200。
最后说几句
V4 Pro 0813 最重要的变化,是把预览版“题做得不错,但 Agent 容易翻车”的印象扭了回来。
DeepSWE 从 12.8 到 62.7,Cybergym 从 52.7 到 83.3,Terminal Bench 从 72.1 到 87.9。这不是边角修补。虽然 DeepSeek 还没有公布 0813 的完整训练细节,但从提升集中的项目看,代码 Agent 显然是这轮更新的主线。Flash 0731 先展示了后训练带来的跃升,Pro 0813 随后又把上限往前推了一截。
当然,官方跑分只是第一张成绩单。V4 Pro 0813 能否在不同 Agent 框架、真实代码库和长时间任务中保持稳定,还要等第三方复测。至少从今天这张表看,DeepSeek 已经回答了一个最直接的问题:
Pro 为什么叫 Pro?这次终于有一组说得过去的答案了。
资料来源
- DeepSeek 官方发布的 V4 Pro 0813 跑分对比图,2026 年 8 月 13 日
- DeepSeek:首次调用 API
- DeepSeek:模型与价格
- DeepSeek:更新日志
- DeepSeek V4 Pro 官方模型卡
- DeepSeek V4 Flash 0731 官方模型卡
- Artificial Analysis:DeepSeek V4 Pro
信息核验时间:2026 年 8 月 13 日。模型版本、价格和第三方榜单可能继续更新。