ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

从长期记忆中持续沉淀技能!国产开源Agent记忆框架夯爆了

2026/8/4 22:04:08 拓冰建站 浏览量
从长期记忆中持续沉淀技能!国产开源Agent记忆框架夯爆了

今天,Agent 已经不只是在对话框里给出一个答案。它们可以在代码库、浏览器和各类工具之间持续工作,把原本零散的操作串成一段更完整的任务流程。

但任务一旦跨了好几天、好几个工具,真正棘手的事就出现了:同样的问题再来一次,它能不能少走弯路?

很多系统已经有长期记忆,能存下聊天记录、工具调用、任务总结和复盘。可“存下”不等于“学会”。比如,Agent 可能记得自己装过一个插件,下次却还是重新翻目录、再试一遍。它也可能留下很多代码修改记录,却不知道哪些做法真的有效,又分别适用于什么条件。

问题不一定是记录不够多,而是这些记录还没有变成一套能在合适场景里拿出来用、并且能自己说明为什么可用的办法。任务越长,这个缺口越明显——反复试错会消耗时间,也让结果变得不稳定。

这正是记忆张量MemTensor 团队联合中国科学技术大学、香港理工大学、福州大学和西安交通大学的研究人员提出 **MSCE(Memory-Skill Co-Evolution)**的切入点。它不只把长期记忆当作可检索的历史文本,而是希望让系统从一次次交互里挑出可信的经验,再把它们整理成可复用的策略和技能。

换句话说,MSCE 要解决的不是“怎样多记一点”,而是“记住以后,怎样真的学会”。

  • 论文题目:

    From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents

  • 论文链接:

    https://arxiv.org/pdf/2607.16621

  • github链接:

    https://github.com/MemTensor/MemOS

01

一段经历,

什么时候才值得留下

如果把聊天记录、工具返回和操作轨迹都塞进长期记忆,Agent 的确“记得更多”了。但它下一次做事时,还是得把这些材料重新读一遍、重新判断一遍。

这很像把一整本工作日志交给新人:东西不少,却没有告诉他,哪一页才是真正能照着做的经验。

更难的是分辨。

一条任务成功了,可能是方法对了,也可能只是碰巧遇到了合适的环境。

一条失败记录里,也可能藏着一个本来正确、只是没走完的步骤。

要是把原始轨迹直接固化成技能,试错、偶然性和只适合当时环境的细节,也会一起被带到下一次任务里。

所以 MSCE 不把“多存一点”当作答案。它先问三个更具体的问题:哪些经验值得留,哪些做法可以抽出来复用,以及一条策略满足什么条件,才够资格变成技能。

02

论文把记忆分成了三层

MSCE 的做法,是先别把所有信息混在一个记忆池里。研究团队把它们拆成 L1、L2 和 L3 三层,每一层只回答一个问题。

  • L1 先记事实:刚才到底发生了什么?

它保留任务当时的状态、Agent 做了什么、环境给了什么反馈、这一步的局部反思,以及经过反馈校准后的轨迹价值。L1 不会急着下结论,它更像一份能回头查的原始记录。

  • L2 再整理做法:遇到这类问题,通常该怎么处理?

当不同 episode 里反复出现相似、而且结果为正的轨迹时,MSCE 会把它们归纳为一条结构化策略。里面不只写操作步骤,还要写清触发条件、验证条件、不适用的边界,以及这条策略来自哪些轨迹和 episode。

例如,智能体在多个软件环境中反复发现“基础镜像缺少系统依赖,仅安装 Python 包无法解决问题”,这就不再只是一条操作经验,而可以上升为对环境依赖关系的认知。

  • L3 则往前走一步,试着回答:这个环境有什么规律?

如果多条 L2 策略总在同一个领域出现,系统会继续整理这里的实体、结构、工具依赖和任务约束,并把相关策略留在一起。

例如,智能体在多个软件环境中反复发现“基础镜像缺少系统依赖,仅安装 Python 包无法解决问题”,这就不再只是一条操作经验,而可以上升为对环境依赖关系的认知。

可以这样理解L1 记下发生过什么 → L2 整理下次怎么做 → L3 归纳环境里的规律。把这三件事分开,后面的技能才有证据可查。

03

任务做完后,

怎样看待中间的每一步?

长任务常常只有一个最终结果:完成,或者没完成。

可一个任务做成了,不代表前面的每一步都对,做砸了,也不代表每一步都没有价值。只拿最后的成败给整条轨迹打分,很容易把真正有用的操作和无效试错混在一起。

MSCE 设计了一套**“反思加权的价值回填”**办法。

任务结束时,最终反馈先确定终点的价值,再往前看,系统会把每一步的局部反思和后续步骤的价值结合起来。某一步的反思越可靠,它越能继承最终反馈;判断不清时,就更多参考后面发生了什么。

对于文本反馈,MSCE 还会看目标完成度、执行过程质量和用户满意度,合成一个统一的终局信号。

这样,一条轨迹里的步骤不必再拿同样的分数:真正推动任务往前走的操作会被保留,反复无效的探索会被压低。

04

从一次经验,

到一项真正能用的技能

在 MSCE 里,完成一次任务不等于自动多出一项技能。

研究团队把技能看成从稳定 L2 策略里筛出来的可调用对象。一条策略得有明确证据支撑、带来过正向收益、适用范围足够稳定,还要通过验证,才会被提升为技能。

这也意味着,技能不能只写“该做什么”,还得写“什么时候别做”。系统会检查里面的工具、步骤和结论有没有证据,验证条件是否完整,以及它有没有偷偷加入证据里从没出现过的工具或能力。

最后形成的技能会带着触发器、执行过程、验证规则、适用边界、证据锚点、决策指导和可靠度。它也不是生成后就不再变化:候选、试用、激活、修正、归档,都是它可能经历的状态。连续成功的技能会被强化;反复失败或得到负面反馈的,适用范围会收缩,甚至不再默认被检索。

05

两组评测,结果怎么样?

研究团队把 MSCE 放到两类测试里看。

EvoAgentBench 覆盖信息检索、数学推理、软件工程、代码实现和知识工作五类 Agent 任务;LoCoMo 则专门考察长对话记忆。先看前一组。

和各领域最强的非 MSCE 基线相比,MSCE 在信息检索、数学推理、软件工程和知识工作上的 Pass@1 分别提高 4.61、4.00、15.39 和 5.17 个百分点。代码实现任务里,它以 61.54% 的 Pass@1 并列最佳,平均交互轮数从 3.9 降到 2.0。

再看 LoCoMo。MSCE 的总体评审得分是 61.23,总体 F1 是 49.89,比最强基线 SkillFlow-Evolve 分别高 2.01 和 1.18 分。

结果显示:除软件工程外,它在多数任务里同时改善了效果和效率;软件工程的成功率涨得明显,成本则小幅上升。

06

离开原任务,这套方法还管用吗?

一条技能如果只能在第一次学到它的任务里生效,价值有限。

研究团队又测了六组跨领域迁移:信息检索到数学推理、数学推理到代码实现、代码实现到软件工程,以及知识工作到信息检索等。

六组迁移都带来了正向的 Pass@1 增益,幅度在 2.56 到 5.13 个百分点之间,平均是 3.93 个百分点;其中四组的任务成本还降了。

至少从这组实验看,MSCE 留下的不是某一道题的标准答案,而是能换个场景继续用的操作结构、验证方式和环境认识。

同时,还观察了一个更长的过程:从 p0 到 p100,记忆和技能不断积累以后,信息检索、数学推理和软件工程的 Pass@1 都持续上升。单位成功任务的归一化成本先因探索而上升,之后再慢慢回落。

07

记忆不该只是档案

做 Agent 记忆,常见的思路是两件事:多记一点,或者检索得准一点。

MSCE 追问的是第三件事:记起来之后,怎样把经验变成下次还能用、出了问题也能改的能力?

在这套框架里,轨迹不只是日志,而是证据;策略不只是一次总结,而是带着触发器、边界和验证条件的程序;环境认知不只是模型的自由联想,而是和策略、轨迹相连的结构化信息。

技能也不是临时写出的一句提示词,它有来处、有可靠度,也会经历试用、修正和归档。

所以,这篇论文真正想处理的,不是给 Agent 多加一点存储空间,而是让它对自己做过的事有更好的记性,也有更谨慎的判断:什么该相信,什么能复用,什么还需要继续改。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费