摘要
DeepSeek-V4-Flash-0731 正式版 API 已上线公测,稳定调用名仍是deepseek-v4-flash。我用旧版同题 20 轮长篇、原创 12 轮链、两张 RP 卡、四题材写卡和 Responses 工具闭环重跑了一遍。结论不是简单的“全面升级”:0731 明显减少跨轮复读、Agent 工具可用,但原著文风距离变大;在 8192 token 输出上限下,high/max 还可能把额度全部耗在 reasoning,正文为 0。把上限放到 32K 后,同一批 max 任务可以完整结束。
7 月 31 日,DeepSeek 官方更新日志写的是:DeepSeek-V4-Flash 正式版 API 上线公测。
这句话有四个边界:
- API 调用名仍是
deepseek-v4-flash;DeepSeek-V4-Flash-0731是当前版本名,不是请求时要填写的新 ID。 - 0731 与 Preview 的架构、尺寸相同,本次变化是重新后训练。
- 这次只更新 Flash API;V4 Pro API、App 和 Web 模型没有同步切换。
- “正式版上线公测”不是全面 GA。
我先请求官方/v1/models,HTTP 200,目录同时列出deepseek-v4-flash和deepseek-v4-pro。随后才开始生成测试。
先给结论
| 场景 | 发布日结果 | 当前建议 |
|---|---|---|
| Chat SSE | 200,正常终止 | 可用 |
| Responses SSE | 200,正常终止 | 可用 |
| Responses Agent 工具两步闭环 | auto下 200/200 | 可用,但不要强制required |
| 旧考卷 20 轮长篇 | 20/20 完成 | 少复读,但文风与事实并非单边升级 |
| 原创长篇 · none / low · 8K | 两档均 12/12 完成 | none 更快、更便宜 |
| 原创长篇 · high / max · 8K | high 首轮空正文;max 第 4 轮空正文 | 8K 不够 |
| max · 32K 续写 | 完成,706 字符 | 32K 本轮够用 |
| max · 16K 四题材写卡 | 只写出第 1 张卡开头 | 失败 |
| max · 32K 四题材写卡 | 四卡全部完成 | 能完成,但篇幅仍偏长 |
官方价格
英文价格页当日牌价,单位均为每 100 万 token:
| 计费项 | 美元 |
|---|---|
| 输入 · 缓存命中 | $0.0028 |
| 输入 · 缓存未命中 | $0.14 |
| 输出(含 reasoning) | $0.28 |
中文价格页对应列为 0.02 元、1 元、2 元。本文成本统一按英文页美元牌价计算,不把它描述成汇率换算。
官方还预告未来高峰时段可能按 2 倍计价,高峰为北京时间 09:00–12:00、14:00–18:00;但生效时间仍写“以正式通知为准”。因此本文没有把 2 倍价格当作已经执行。
协议与 Agent:有一个真实 400
Chat max SSE 用时 1.82 秒,输出正确;118 输入 token、43 输出 token,其中 35 个 reasoning token。
Responses max SSE 用时 1.71 秒,输出正确;111 输入、19 输出,其中 9 个 reasoning token。
Agent 工具测试使用 Responses 的无状态两步方式:
- 第一步让模型调用函数工具。
- 客户端执行工具。
- 第二次请求显式重放 reasoning 与 function call,再附上
function_call_output。
tool_choice=auto时两步均为 200,最终答案正确,第二步还命中 512 个缓存 token。
但thinking=max + tool_choice=required在发布日真实返回 400:
Thinking mode does not support this tool_choice
所以当前 Agent 路由不能把“必须调用工具”机械翻译成required。在 thinking 模式下,用auto配合明确提示词可以走通。这个负例也解释了为什么“模型支持工具”不等于所有 OpenAI 参数组合都兼容。
20 轮旧考卷:少复读了,文风却更远了
这条轨复用旧 M69 长篇脚本:同一本中文玄幻、同一 55% 起点、同一 21,500 字符滚动窗口、同一 B2 提示词、温度字段 0.7、max_tokens=2800、思考档省略。历史链来自 0731 上线前;新链直连官方稳定 ID。
| 指标 | 历史 Preview 链 | 0731 正式版链 |
|---|---|---|
| 完成轮数 | 20/20 | 20/20 |
| 可见正文总字符 | 6,514 | 8,761 |
| 每轮平均字符 | 325.7 | 438.1 |
| 80–220 字符合要求 | 1/20 | 1/20 |
| 跨轮 12-gram 最坏重叠 | 72.0% | 1.2% |
| 与原著结构画像距离(越低越贴) | 0.356 | 0.550 |
0731 的进步很具体:旧链第 14 轮与此前内容出现 72% 的机械重叠,新链最坏只有 1.2%,20 轮全部唯一,没有来源标记泄漏。
退步也很具体:正文更长,三轮超过 500 字符、两轮超过 1,000;结构画像离原著更远。两套映射翻转盲评最终 1:1:
- 一位评审判 Preview 窄胜,理由是文风、事实稳定和长度控制更好。
- 另一位评审判 0731 小胜,理由是推进更强、倒带和模板复演更少。
两位评审其实在描述同一件事:0731 更愿意往前写,但更容易写成自己的长段落,并临时改动人物或规则。这不是“全面提升 X%”,而是一组取舍。
新链 20 轮共输入 281,313 token、输出 22,764,其中 reasoning 16,625,占输出 73.03%。中位耗时 14.31 秒/轮,总成本约 $0.04513。
四档思考:8K 下 none/low 能跑,high/max 会空
原创公开考卷《潮痕档案》要求每轮 450–700 字符,连续写 12 轮,窗口仍为 21,500 字符。四档都使用同一题面与 8,192 output token 上限。
| effort | 完成 | 首正文中位 | 单轮总耗时中位 | 正文字符中位 | reasoning 合计 | 成本 |
|---|---|---|---|---|---|---|
| none | 12/12 | 0.75s | 11.12s | 921 | 0 | $0.00464 |
| low | 12/12 | 7.06s | 22.62s | 1,303 | 6,179 | $0.00745 |
| high | 0/1 | 无正文 | 109.53s | 0 | 8,191 | $0.00252 |
| max | 前 3 轮有正文,第 4 轮中断 | — | — | — | 第 4 轮 8,189 | $0.00755 |
none 与 low 都跑满,但长度控制都不合格:两档均为 0/12 落入 450–700 字符,low 反而更长。快速抽读还看到正文自我纠错和时间线硬填,因此“接口完成”不能替代质量判断。
high/max 的失败则非常明确:HTTP 仍是 200,但 output budget 被 reasoning 用完,终止态是incomplete/length,正文为 0。
不是官方只给 8K,是应用侧上限太旧
DeepSeek 并没有把 V4 Flash 正式版限制在 8K 输出。本轮 8K 是应用常见的请求包络。
我们随后只改一个变量,把 max 档输出上限放到 32,768:
| 32K 定点 case | 结果 | reasoning | 可见正文 | 总耗时 | 成本 |
|---|---|---|---|---|---|
| 原创续写首轮 | completed | 6,806 | 706 字符 | 106.1s | $0.00206 |
| 四题材角色卡 | completed,四卡齐全 | 12,442 | 5,852 字符 | 206.9s | $0.00466 |
32K 足以让两条此前被截断的 max 任务完整结束,没必要直接冲到 64K。四张卡虽然齐全,四个开场仍都超过题面 700–1,000 字符,所以这是“解除截断”,不是“质量全绿”。
这也给应用开发一个明确修复方向:
- 不要对所有模型统一硬截 8K。
- 计费预扣仍要保留,但上限应按模型和 reasoning 档分级。
- DeepSeek V4 Flash 的 none/low 可继续用 8K;high/max 至少应给到本轮验证过的 32K。
- UI 的“关闭思考”必须真的发送 Responses
none或 Chatthinking=disabled。如果只是“不传参数”,DeepSeek 会回到默认 high,并不是真的关闭。
RP 与写卡:接口成功不代表事实稳定
两张角色卡各 4 轮 RP,共 8/8 完成,长度也都落在 180–350 字符。但人工快检发现三类硬问题:
- 为化解公开母亲录音的伦理质疑,临时编出题面没有的许可式原话。
- 便利店人数直接写错。
- 02 点场景突然跳到 11:59。
因此 RP 的结论是“API 与长度闸通过,事实纪律仍需模型或提示词层修复”。
四题材写卡在 16K max 档下用了约 16.2K reasoning,只剩 255 字正文,仅写出第一张卡开头;32K 后四卡齐全。这个 case 很适合当生产回归:一旦服务端又把 DS high/max 压回 8K/16K,它会立刻红。
缓存与总费用
不同请求形态的缓存差异很大:
- Agent 工具第二步:命中 512 token。
- M69 20 轮旧考卷:只命中 4,608 / 281,313 输入 token,约 1.64%。
- 原创 none/low 12 轮:分别命中约 77.35% / 78.00%。
- 所有 Responses 内容调用的
cache_write_tokens都是null;官方 usage 只明确提供命中 token,不应虚构“写缓存 token”。
本轮所有官方调用合计估算 $0.07994。按1 credit = $0.0001直接换算、总额一次向上取整是 800 credits;若像应用账本一样每个请求分别向上取整,约 832 credits。这里是上游成本等价,不包含应用可能设置的服务加价。
最后结论
DeepSeek-V4-Flash-0731 的 API 确实已上线,Chat、Responses、缓存和 Responses Agent 工具闭环都能工作。与 Preview 同题相比,它的长篇机械复读大幅下降,但文风距离、事实稳定和长度服从没有同步变好。
对应用开发者,发布日最重要的不是“换模型 ID”,而是三件事:
- 调用名继续用
deepseek-v4-flash。 - thinking Agent 用
tool_choice=auto,不要在当前版本强制required。 - high/max 不要再给统一 8K;32K 是本轮已经验证能解除截断的起点。若想真正关闭思考,必须显式传
none/thinking=disabled。
样本边界也写清:20 轮对比只有单书、单起点、单链;原创努力档也是每档一条链,不足以做统计显著的通用排行榜。本文能证明的是发布日端点的真实行为和几个稳定复现的工程风险。
官方资料
- DeepSeek 2026-07-31 更新日志:https://api-docs.deepseek.com/zh-cn/updates/#时间-2026-07-31
- 模型与价格:https://api-docs.deepseek.com/zh-cn/quick_start/pricing/
- 思考模式:https://api-docs.deepseek.com/zh-cn/guides/thinking_mode/
- Responses API:https://api-docs.deepseek.com/zh-cn/guides/responses_api/
标签
DeepSeek-V4-Flash/DeepSeek V4/Responses API/Agent/大模型评测/AI 写作