Agent基于RL的统一记忆管理框架-Agentic Memory
2026/8/19 13:12:49 网站建设 项目流程

这里主要解读Agent系统记忆管理框架Agentic Memory的一些重要特性。

对应arXiv论文https://arxiv.org/pdf/2601.01885v1

1 Agentic Memory

Agentic Memory (AgeMem)是为LLM Agent设计的统一记忆管理框架。

主要解决将长期记忆(LTM)和短期记忆(STM)分开管理、依赖人工,导致适应性差的问题。

Agentic Memory的核心是将记忆操作转化为“工具”。

通过RL训练Agent背后LLM,让它学会“何时、以何种方式”调用工具处理信息。

具体为动态、智能地决定信息的存、取、改、删,从而在长周期复杂任务中表现得更加出色。

1.1 LTM & STM

Agentic Memory将复杂的记忆管理操作,封装成可以调用的工具。

1)长期记忆 (LTM) 操作

ADD (添加):将重要信息存入长期记忆库。

UPDATE (更新):修改长期记忆库中的已有信息。

DELETE (删除):移除长期记忆库中的过时信息。

2)短期记忆 (STM)

RETRIEVE (检索):从长期记忆中检索相关信息,加载到当前上下文中。

SUMMARY (总结):压缩当前上下文中的信息,以节省空间。

FILTER (过滤):移除上下文中的干扰或无关信息。

1.2 三阶段渐进式强化学习

因为记忆操作的奖励信号往往是稀疏且不连续的,AgeMem设计了一套专门的训练方法:

1)三阶段渐进式RL策略

将复杂记忆管理任务分解为几个阶段进行训练。

从简单到复杂,逐步引导Agent学习完整的记忆行为。

2)Step-wise GRPO

这是对GRPO(Group Relative Policy Optimization)算法的一种改进。

能将最终信号(成功或失败)更准确地回溯并分配给在此之前的每一个记忆操作步骤。

Step-wise GRPO解决了回溯信号的信用分配难题。

1.3 评估与结果

在ALFWorld, SciWorld, PDDL, BabyAI, HotpotQA这五个长周期任务基准上评估了AgeMem。

实验结果表明,AgeMem在多个LLM模型上均一致优于LangMem、A-Mem、Mem0等基线方法。

具体提升体现在:

1)更高的任务完成度:在各类任务中表现更出色。

2)更高质量的长期记忆:AgeMem存储的记忆与任务更相关,通过Memory Quality (MQ)量化。

3)更高效的上下文利用:Agent学会了如何更有效地管理有限的上下文窗口。

2 RL学习对象

Agentic Memory(AgeMem)的强化学习,训练的是作为智能体大脑的底层大语言模型LLM本身。

Agentic Memory并非训练一个外挂的记忆模块或控制器。

2.1 训练对象

AgeMem的核心创新,就是将记忆管理能力直接集成到Agent的策略policy中。

这意味着模型需要学会的不只是生成文本,还包括在恰当的时机调用记忆工具。

比如存储、检索、总结等,因此RL训练目标是优化LLM本身的参数 θ,使其在面临不同任务状态时,能自主做出最优的记忆管理决策。

这与依赖外部专家模型或启发式规则有本质不同,它让记忆管理成为了LLM内化的一种能力。

2.2 训练方式

AgeMem采用的是强化微调(Reinforcement Fine-Tuning, RFT)方式,并非从零开始训练。

AgeMem是在一个已有的预训练模型,比如Qwen2.5-7B基础上,通过RL来进一步微调。

因此可以利用基础模型已有的强大语言理解和生成能力,通过RL来专门优化其作为Agent的决策能力,尤其是复杂的记忆管理策略。

为了让模型逐步掌握复杂的记忆管理技能,AgeMem设计了一个三阶段的渐进式RL训练。

第一阶段:学习长期记忆(LTM)管理

模型在常规互动中,学习判断哪些信息值得长期存储。

并练习使用ADD(添加)、UPDATE(更新)、DELETE(删除)这三个长期记忆工具。

第二阶段:学习短期记忆(STM)管理

在更复杂、带有噪音的上下文环境中,模型学习使用SUMMARY(总结)和FILTER(过滤)等短期记忆工具,确保上下文信息是精简凝练,同时是有效的。

第三阶段:整合与协同

模型在一个完整的任务中,综合运用前两个阶段学到的所有记忆管理技能,协同管理LTM和STM,以完成最终的复杂推理和问答。

reference

---

Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents

https://arxiv.org/pdf/2601.01885v1

Agentic Memory:让Agent自主通过RL学习长短记忆管理,长程任务性能显著提升

https://zhuanlan.zhihu.com/p/1992704033178285304

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询