ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

DeepSeek-V4-Flash正式版Agent实测:执行任务能力到底提升多少?

2026/8/2 14:41:58 拓冰建站 浏览量
DeepSeek-V4-Flash正式版Agent实测:执行任务能力到底提升多少?

DeepSeek-V4-Flash正式版发布,正式版重点提升了Agent任务处理的能力。

直接通过两个任务测试它Agent 执行复杂任务的能力。

本次设计两个实际任务:

  • 一个偏基础:文件处理与数据计算

  • 一个偏复杂:网络信息获取与分析

分别测试:

  • 思考模式

  • 非思考模式

重点观察:

  1. 任务是否完成

  2. 执行过程是否稳定

  3. 遇到问题是否会解决

  4. 最终交付质量如何


测试一:Excel数据生成与处理任务

任务内容

帮我生成50个学生成绩测试数据,包含学生姓名、语文、数学、英语、物理、历史成绩,并保存到Excel文件。然后读取Excel文件,计算每个学生平均成绩和总成绩,添加到原数据中,最后保存新的Excel文件。

思考模式表现

首先规划任务,规划的十分详细,后续执行也是严格按照规划过程执

所有步骤都准确无误的地执行,最终结果有效。

在计算总成绩和平均成绩时,消耗token:22530,用时2分12秒。

思考占用大量时间和token消耗,在思考的前1/10,就输出了要计算的结果。剩下的都在验证数据计算是否正确,它通过多种方式验证计算是否正确。

  1. 每个学习成绩逐项相加计算总分数和平均分数,验证是否与初始生成的相同
  2. 每个学科相加后计算所有学科的总成绩,验证是否与每个学生的总成绩之和相同。
  3. 基于两种方式计算的总成绩,又验证总平均成绩是否相同。
  4. 再次使用计算的每个学生的总成绩/5对比平均成绩是否相同。
  5. 再次以每个同学的成绩逐项相加,计算总成绩和平均成绩,并验证是否与初始数据是否相同。

头尾两次完整计算数据输出,中间5轮数据验证。

每次验证的过程和结果都是正确的,感觉有点过度思考了。

验证的目的是判断输出的计算结果是否正确,这本身没有问题,经历5轮数据验证,确实有助于反复验证数据是否准确。

但验证本身与输出数据一样,也是可能出现输出错误问题的,5轮验证很可能反而提高了输出错误的风险。

最后任务顺利完成

非思考模式表现

首先规划任务:

但过程中出现一次,生成的数据不符合要求,不是标准的二维数组。不过模型没有直接失败,而是重写构造正确的数据完成任务

最终结果

最后完成任务,执行速度明显比思考模式更快。

第一个任务总结

这个任务包含多个连续操作:

步骤

任务

1

生成50名学生数据

2

写入成绩数据到Excel文件

3

读取Excel文件

4

计算总成绩、平均成绩

5

将数据汇总

6

保存新文件

属于典型办公自动化 Agent 场景。

思考模式 和 非思考模式 执行结果对比

模式

执行结果

耗时

Token消耗

缓存命中

思考模式

成功完成

4分32秒

71022

17024

非思考模式

成功完成

46秒

43055

26624

思考模式输出的规划过程更详细、输出的结果更正确。但思考过程耗时较长,token消耗较多


测试二:AI热点资讯获取与分析任务

任务内容

查询网络信息,获取最近几天热点AI资讯,汇总摘要,并附原文链接。筛选1-2篇偏AI技术应用方面最有价值的资讯,分析应用发展前景。

相比第一个任务,这个任务难度更高。因为它不是一个仅靠内部就可以闭环的任务,任务中可能遇到各种未知的问题。

思考模式执行过程

任务规划,规划得很详细,逻辑清晰。

实际执行时,遇到机器之心需要订阅问题。

只有订阅后才可以获取网络链接地址和具体内容

它识别到问题后,拼接了一个rss的链接地址https://www.jiqizhixin.com/rss,

访问失败后,它又开始构造新的地址https://www.jiqizhixin.com/rss.xml,

它好像一直没有Get,未订阅不能访问数据。

解决办法,要么订阅后获取数据,要么放弃从这个完整获取数据。而是一直自己的尝试用野路子。

尝试

结果

寻找隐藏链接

失败

构造RSS方式获取

失败

寻找订阅源

失败

继续尝试获取

失败

最终因为持续循环,我主动终止任务。

非思考模式执行过程

规划执行流程,流程同样很清晰

与思考模式一样,它也规划了从机器之心获取数据,虽然它也经过了多次尝试获取网页数据,但它最终判断出要订阅才能获取链接地址,在未获取到链接地址的情况下退出了该子任务

接着,他在36氪AI频道获取了数据,最后选取了两篇文章访问具体内容,生成总结与分析。

但在最终输出结果时,他丢失了获取的咨询列表,仅保留两篇重点分析的文章。还好他自我检查出来了。

然后他重写规划,最后顺利完了任务

在整个任务执行过程中,它的整体逻辑比较清晰,虽然也有错误,但它能够即使发现错误,然后纠正错误。

在之前的预览版中它,任务完成就结束了,不会验证结果是否符合要求。

第二个任务暴露的问题

这个结果其实很有代表性。

DeepSeek-V4-Flash正式版明显增强了:

1. 问题解决意识

以前模型:

工具失败 → 返回失败原因

现在:

工具失败 → 分析原因 → 尝试解决

这是Agent能力的重要提升。

2. 任务交付意识

相比预览版:

正式版明显更关注最终结果。

以前:

执行完成即可。

现在:

会尝试:

  • 丰富结果
  • 检查内容
  • 优化输出

更像一个真正执行任务的助手。

但是:

3. 缺少停止判断

这是目前最大的问题。特别是思考模式,存在过度思考的问题。过度执着与不能完成的任务。

Agent不仅需要:

解决问题能力

还需要:

判断什么时候应该停止。

否则:

越强的思考能力,可能导致:

  • 更长执行时间
  • 更多Token消耗
  • 无意义循环

DeepSeek-V4-Flash正式版 vs 预览版

从这次测试来看,最大的变化不是模型知识提升,而是 Agent行为变化。

能力

预览版

正式版

任务执行

能调用工具

更关注完成任务

异常处理

容易失败

会尝试解决

结果检查

较少

明显增强

最终交付

完成即可

更加关注质量

失败处理

直接结束

寻找替代方案

通过两个任务测试:

DeepSeek-V4-Flash正式版相比预览版,Agent能力有明显提升。

主要提升集中在三个方面:

提升方向

表现

结果检查

执行完成后主动验证

问题解决

失败后尝试寻找方案

任务交付

更加关注最终结果

但目前仍存在:

问题

影响

思考模式耗时长

执行效率下降

Token消耗高

成本增加

缺少停止策略

容易陷入循环

这次测试虽然只有两个任务,并且都是单次执行,存在一定随机性。

但从实际Agent使用角度来看,一次任务执行能力本身就是重要指标。

从测试结果来看,DeepSeek-V4-Flash正式版相比预览版,最大的变化不是单纯能力提升,而是明显具备了更强的 Agent 思维方式


真实任务环境和Demo展示有很大区别。

Demo通常都是:

  • 固定流程

  • 已知工具

  • 理想环境

  • 没有异常情况

而实际工作中:

  • 网站可能无法访问

  • 数据可能不存在

  • 工具可能失败

  • 文件格式可能异常

  • 用户需求可能存在歧义

永远会出现模型训练中没有覆盖的情况。

这也是当前Agent最大的挑战:

不是能不能完成任务,而是遇到未知问题时,如何快速找到正确方向。

未来Agent能力评价不能只看:

“这个任务能不能完成”

还需要看:

“能不能快速完成”
“能不能稳定完成”
“消耗多少成本完成”

因为在真实生产环境中:

一次成功但耗时10分钟、消耗几十万Token的Agent,并不一定比一个几十秒完成任务的Agent更优秀。

真正优秀的Agent应该同时具备:

解决问题的能力 + 判断问题的能力 + 控制成本的能力。

DeepSeek-V4-Flash正式版已经迈出了重要一步,在Agent任务中,它开始像一个真正执行任务的助手,但距离一个可靠、高效,还有不少优化空间。