论文信息
| 项目 | 内容 |
|---|---|
| 日期 | 2026-09-23 |
| 论文 | RPMem: Learning Long-Term Recurrent Parametric Memory Across Sessions for LLM Agents |
| 作者 | Fanyu Zhao, Ruike Cao, Liang Dong, Fugen Yao, Jian Xu, Guanjun Jiang, Han Zhang, Yifei Zhao, Yinsheng Li |
| 机构 | 阿里巴巴通义应用业务组、复旦大学 |
| 链接 | https://arxiv.org/abs/2609.23466 |
| 代码 | https://github.com/Quark-Medical/rpmem |
一句话总结
RPMem 用「会话编译 + 跨会话门控整合 + 解码为 LoRA」的两阶段循环架构,让 LLM Agent 的长期记忆以近常数成本持续进化,并且换掉底层模型后记忆依然可用——这是第一个做到「生命周期无关」的参数化记忆框架。
解决什么问题
长期运行的 Agent 需要跨会话的记忆。主流方案是文本记忆(存外部、查询时检索),但历史越长越依赖检索质量,证据分散在多个会话时很容易漏。另一条路是参数化记忆(把经验直接编码进模型计算),但现有方法存在三大缺陷:
- 无法增量演化:像 Doc-to-LoRA、SHINE 这类方法每个会话生成一份静态 LoRA 快照,没有跨会话累积机制;
- 与骨干模型耦合:记忆表征绑定特定模型架构,线上换模型(serving backbone 替换是常态)后积累的记忆直接作废;
- 更新开销:基于梯度的记忆更新难以支撑线上部署。
论文把这三点合起来定义为「生命周期无关(lifecycle independence)」问题:记忆要在骨干模型不断替换的过程中保持可用并持续更新。
核心方法
RPMem 是一个两阶段循环架构,记忆全程存放在与模型无关的潜在空间:
第一阶段:单会话记忆编译。 一个超网络由「冻结的上下文编码器 + 可训练的 Perceiver resampler + 模型专属 LoRA 解码器」组成。变长会话先被冻结编码器抽取 L 个深度的特征,再经 resampler 压缩成固定形状的潜在记忆 $q_t \in \mathbb{R}^{L\times M\times r\times d}$(L=适配层数,M=模块类型数,r=LoRA 秩,d=潜在维度),形状与会话长度无关。解码器把 $q_t$ 映射为该骨干的 LoRA 因子对:$\widetilde{W} = W + \gamma BA$。训练目标是分布对齐——构造需要该会话信息的问答对,让「带生成 LoRA 的模型」的下一 token 分布去逼近「同一模型直接读完整上下文」的分布(TopK 截断 + 尾部质量聚合的前向 KL 损失),整个过程冻结骨干,只训 resampler 和解码器。
第二阶段:跨会话记忆整合。 编译保证所有会话记忆落在同一固定形状空间 $h_t$。之后只用一个轻量循环门控来整合新会话:$z_t = \sigma([h_{t-1}; q_t]W_g + b_g)$,$h_t = z_t \odot h_{t-1} + (1-z_t)\odot q_t$(GRU 式遗忘/写入),仅这一个门在下游任务监督下训练。记忆大小恒定,更新只需一次前向计算,无需重新处理历史会话,也无需梯度更新。
骨干无关性是关键设计:换新模型时只需保留记忆编码器 G,为新骨干重新训练一个小解码器 D’(同样的 KL 目标),潜在记忆 $h_t$ 原封不动地解码成新骨干的 LoRA 参数——记忆资产与模型资产解耦。
实验结果
- PERMA(Qwen3-8B):RPMem 达 85.52%,比最强参数化基线 Metis-9B 高 5.32 pp,比 Full Context 高 12.98 pp;比同设定下 SFT 高 25.17 pp;七个历史上下文变体平均最高(86.53%)。
- PersonaMem-v2:Overall 40.22%,比 SFT 高 8.58 pp,Self/Current 两项超过 Full Context 10.89/13.31 pp。
- PrefEval(历史间隔拉长测试):10 轮排第三,70 轮第二,300 轮时以 74.81% 登顶;对比 LightMem 从 81.30% 衰减到 73.52%,RPMem 反而从 69.81% 升到 74.81%——记忆间隔越长优势越大,说明整合确实在生效。
- 五骨干泛化:跨模型家族、参数规模、dense 与 MoE 架构,相对更强参考提升 5.95–20.41 pp。
- 更新成本与内存占用近常数,不随会话数增长。消融证实会话编译与跨会话整合缺一不可。
深层洞察
这篇论文最值得记住的不是某个数字,而是它对「记忆该存在哪」给出了第三个答案的完整形态:不是检索出来的文本,也不是梯度训进去的权重,而是一份可以在模型之间搬运的潜在记忆资产。三个洞察:
- 分布对齐取代直接监督:用「模型读上下文的分布」当老师来教「模型带 LoRA 的分布」,把「记住」变成「行为等价」,这比传统的 QA 监督更通用。
- 记忆与模型解耦是工程刚需:线上换模型是常态,任何绑死骨干的记忆方案在生产环境都活不长。论文把「生命周期无关」正式定义为问题,这个提法本身就有引领性。
- 长间隔不衰减反而上升(PrefEval 结果)暗示循环门学到了任务特定的整合策略——这是记忆「巩固」而非「堆叠」的证据。
局限性
- 编译阶段需要构造「依赖该会话信息」的问答对来训练超网络,数据构造质量直接影响记忆质量;
- 潜在记忆不可读、不可审计,出错时难以定位和修正(文本记忆的可解释性优势被放弃了);
- 记忆容量固定(L×M×r×d),理论上存在信息上限,超长历史下必然有损;
- 实验集中于问答类记忆基准,工具调用、多步任务执行等 Agent 场景的验证有限;
- 换骨干仍需为新模型训练解码器,虽轻量但不是零成本迁移。
工程实践启示
- Agent 记忆系统应把「记忆资产」和「模型资产」分开管理:记忆编码一次,多个模型复用,模型升级不丢用户记忆——这对做长期陪伴类产品的团队是直接可借鉴的架构原则。
- 前向计算更新是部署友好的关键:所有记忆写入都是前向传播,没有训练循环,适合线上流式更新。
- 混合方案值得考虑:文本记忆保证可审计与可编辑,参数化记忆保证行为内化的流畅性,两者互补而非替代;RPMem 的 Latent 空间可以作为两者之间的中间表示。
- 代码已开源(Quark-Medical/rpmem),做记忆模块选型时可以直接对比复现。