📌 系列导航🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站

论文信息

项目内容
日期2026-09-21
论文Disentangling Long-Term Memory via Latent Neuro-Symbolic Reasoning
作者Cai Ke, Xinghao Chen, Xiaoyu Shen, Keyu Chen, Siyu An, Junnan Dong, Ruifeng Xu, Ruizhi Qiao, Xing Sun
机构腾讯优图实验室、宁波工业智能重点实验室、香港理工大学、深圳河套研究院
链接arXiv:2609.18461
代码暂未放出

一句话总结

LGM(Latent Graph Memory)不再把长期记忆存成文本或静态图,而是搬进连续潜空间:用稀疏自编码器把每条交互解耦成稀疏概念激活,按当前查询动态合成图的边权,最后把聚合结果压缩成16个记忆前缀token直接喂给模型生成——全程不回放原始历史。

解决什么问题

个性化Agent需要在跨越多个会话的长历史里同时捕捉两类信息:显式偏好(用户明确说过的约束)和隐式行为证据(习惯、决策模式,从未被说出口)。现有两条路线各有硬伤:

  • 扁平检索(向量RAG):每条记忆独立打分,完全捕获不到分散在遥远会话里的分布式证据;
  • 结构化记忆(GraphRAG、Mem0、MemGPT等):图结构一旦建好就固定,与查询无关,无法体现"同一批记忆在不同问题下关联完全不同"这一现实。

更根本的困境是:原始文本记忆天然纠缠——一条交互同时编码了主题、意图、情绪、习惯,只有一小部分与当前请求相关。在token层面做细粒度解耦,代价是KV缓存爆炸、反复调用LLM、无关文本干扰。

核心方法

LGM的答案是神经符号框架,把记忆解耦和关系推理全部放进潜空间,端到端可微:

1. 潜记忆解耦。 每条历史交互和当前查询都过一遍骨干模型,多层隐状态平均后经masked pooling和线性投影映射为潜节点 z_x(低层带词法线索、高层带语义抽象,隐式偏好恰好在混合层里)。再用稀疏自编码器(SAE)把稠密表示分解为稀疏概念码:c_x = S(ReLU(W_enc·z_x))。SAE损失为重构误差加稀疏惩罚:L_sae = ‖ẑ_x − z_x‖² + λΩ(c_x)。这一步让"一句直接指令"和"一个微弱的重复习惯"能通过共享概念对上,哪怕表面文本毫无相似。

2. 查询条件化的潜图构建。 关键设计:不持久化任何全局图。查询到记忆的边权就是两者概念码的归一化重叠 ω_{q→i} = φ(c_q, c_i)。查询一变,概念码变,同一记忆池诱导出完全不同的拓扑——图是按需隐式重建的,而非预先承诺。

3. 图条件化推理。 关系图神经网络把查询信号在激活子图上做非线性消息传递,聚合分布式弱线索成紧凑图状态,映射为一组记忆前缀token(默认16个)条件化生成,不回放任何原始文本。为防潜空间传播中的信息坍缩,引入证据重构目标:惩罚信息损失,把连续状态锚定在历史事实上。记忆的选取、关联、聚合、利用整个生命周期统一进一个端到端可微优化。

实验结果

  • 主结果(PersonaMem + PrefEval):Qwen2.5-7B骨干平均准确率72.28,Gemma3-4B骨干66.16,比最强基线MemCoE分别高**+11.20和+11.70**。扁平管线(长上下文、朴素RAG)差距最大;增益集中在更难的隐式偏好split和128K长上下文。
  • 隐式偏好硬核测试(PersonaMem-v2隐式split):Qwen3-4B骨干下,32K达到62.9、128K达到51.9,两个设置均为最佳,明显超过GPT-5-Chat(45.6/41.4)等专有大模型;比同骨干的agentic memory方法(55.2)高+7.7。
  • 效率:LLM调用次数最少、token消耗最少、首token延迟最低且随上下文增长到128K保持稳定——占据准确率-成本 Pareto前沿的左下角。
  • 消融:去掉证据重构损失掉分最狠(尤其隐式偏好,潜前缀会坍缩成模型忽略的无信息信号);去SAE、去GNN也都明显退化。潜token数从1调到32,准确率在16附近封顶——很小的潜预算就够。

深层洞察

这篇论文真正值得注意的立场是:记忆管理不该是外挂的离散读写策略,而应是模型内在的可学习表示。对比MemAgent、Memory-R1等用RL学读写决策的路线,LGM把"记什么、怎么关联"变成梯度可以直接优化的对象。

第二个洞察是"图不必预先存在"。GraphRAG范式假设知识需要一个持久的全局拓扑,LGM证明拓扑可以是查询的函数——每次请求隐式诱导自己的图。这其实更接近人类记忆的检索方式:同一个记忆库,问不同问题激活不同联想路径。

第三个是SAE的角色变化:从可解释性分析工具变成记忆对齐的工程组件。稀疏概念码让显式陈述与隐式行为在共享空间可比对,这解决了个性化最核心的语义鸿沟。

局限性

  • 概念码虽号称可解释,但"稀疏激活=人类可理解概念"这一SAE固有假设仍有争议,论文未做概念语义审计;
  • 需要对骨干模型做训练适配(抽取多层隐状态、训练SAE和GNN),不是即插即用的外挂记忆,换骨干要重训;
  • 记忆以潜token形式存在,无法像Mem0那样向用户展示或人工编辑"记忆里存了什么",可审计性和可修正性弱;
  • 评测集中在对话偏好场景,对事实性长记忆(如知识密集问答)未验证。

工程实践启示

  • “16个潜token就够” 是很实用的信号:压缩记忆通道不需要大预算,瓶颈在表示质量而非容量;token给多了反而稀释信号。
  • 证据重构损失值得单独借鉴:任何把历史压成连续状态的设计(软提示、prefix tuning式记忆)都该配一个防坍缩的锚定目标。
  • 如果你的场景只需要显式偏好(用户明说的),轻量记忆库+规则就够了;LGM的收益主要在隐式、跨会话、长上下文三重叠加的难场景。
  • 4B模型+结构化潜记忆打赢GPT-5,再次说明:在记忆密集型任务上,架构创新比堆模型规模划算。