ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Agent基于RL的统一记忆管理框架-Agentic Memory

2026/8/19 13:13:19 拓冰建站 浏览量
Agent基于RL的统一记忆管理框架-Agentic Memory 这里主要解读Agent系统记忆管理框架Agentic Memory的一些重要特性。对应arXiv论文https://arxiv.org/pdf/2601.01885v11 Agentic MemoryAgentic Memory (AgeMem)是为LLM Agent设计的统一记忆管理框架。主要解决将长期记忆(LTM)和短期记忆(STM)分开管理、依赖人工导致适应性差的问题。Agentic Memory的核心是将记忆操作转化为“工具”。通过RL训练Agent背后LLM让它学会“何时、以何种方式”调用工具处理信息。具体为动态、智能地决定信息的存、取、改、删从而在长周期复杂任务中表现得更加出色。1.1 LTM STMAgentic Memory将复杂的记忆管理操作封装成可以调用的工具。1长期记忆 (LTM) 操作ADD (添加)将重要信息存入长期记忆库。UPDATE (更新)修改长期记忆库中的已有信息。DELETE (删除)移除长期记忆库中的过时信息。2短期记忆 (STM)RETRIEVE (检索)从长期记忆中检索相关信息加载到当前上下文中。SUMMARY (总结)压缩当前上下文中的信息以节省空间。FILTER (过滤)移除上下文中的干扰或无关信息。1.2 三阶段渐进式强化学习因为记忆操作的奖励信号往往是稀疏且不连续的AgeMem设计了一套专门的训练方法1三阶段渐进式RL策略将复杂记忆管理任务分解为几个阶段进行训练。从简单到复杂逐步引导Agent学习完整的记忆行为。2Step-wise GRPO这是对GRPO(Group Relative Policy Optimization)算法的一种改进。能将最终信号(成功或失败)更准确地回溯并分配给在此之前的每一个记忆操作步骤。Step-wise GRPO解决了回溯信号的信用分配难题。1.3 评估与结果在ALFWorld, SciWorld, PDDL, BabyAI, HotpotQA这五个长周期任务基准上评估了AgeMem。实验结果表明AgeMem在多个LLM模型上均一致优于LangMem、A-Mem、Mem0等基线方法。具体提升体现在1更高的任务完成度在各类任务中表现更出色。2更高质量的长期记忆AgeMem存储的记忆与任务更相关通过Memory Quality (MQ)量化。3更高效的上下文利用Agent学会了如何更有效地管理有限的上下文窗口。2 RL学习对象Agentic Memory(AgeMem)的强化学习训练的是作为智能体大脑的底层大语言模型LLM本身。Agentic Memory并非训练一个外挂的记忆模块或控制器。2.1 训练对象AgeMem的核心创新就是将记忆管理能力直接集成到Agent的策略policy中。这意味着模型需要学会的不只是生成文本还包括在恰当的时机调用记忆工具。比如存储、检索、总结等因此RL训练目标是优化LLM本身的参数 θ使其在面临不同任务状态时能自主做出最优的记忆管理决策。这与依赖外部专家模型或启发式规则有本质不同它让记忆管理成为了LLM内化的一种能力。2.2 训练方式AgeMem采用的是强化微调(Reinforcement Fine-Tuning, RFT)方式并非从零开始训练。AgeMem是在一个已有的预训练模型比如Qwen2.5-7B基础上通过RL来进一步微调。因此可以利用基础模型已有的强大语言理解和生成能力通过RL来专门优化其作为Agent的决策能力尤其是复杂的记忆管理策略。为了让模型逐步掌握复杂的记忆管理技能AgeMem设计了一个三阶段的渐进式RL训练。第一阶段学习长期记忆(LTM)管理模型在常规互动中学习判断哪些信息值得长期存储。并练习使用ADD(添加)、UPDATE(更新)、DELETE(删除)这三个长期记忆工具。第二阶段学习短期记忆(STM)管理在更复杂、带有噪音的上下文环境中模型学习使用SUMMARY(总结)和FILTER(过滤)等短期记忆工具确保上下文信息是精简凝练同时是有效的。第三阶段整合与协同模型在一个完整的任务中综合运用前两个阶段学到的所有记忆管理技能协同管理LTM和STM以完成最终的复杂推理和问答。reference---Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agentshttps://arxiv.org/pdf/2601.01885v1Agentic Memory让Agent自主通过RL学习长短记忆管理长程任务性能显著提升https://zhuanlan.zhihu.com/p/1992704033178285304