论文信息
| 项目 | 内容 |
|---|---|
| 日期 | 2026-09-21 |
| 论文 | Disentangling Long-Term Memory via Latent Neuro-Symbolic Reasoning |
| 作者 | Cai Ke, Xinghao Chen, Xiaoyu Shen, Keyu Chen, Siyu An, Junnan Dong, Ruifeng Xu, Ruizhi Qiao, Xing Sun |
| 机构 | 腾讯优图实验室、宁波工业智能重点实验室、香港理工大学、深圳河套研究院 |
| 链接 | arXiv:2609.18461 |
| 代码 | 暂未放出 |
一句话总结
LGM(Latent Graph Memory)不再把长期记忆存成文本或静态图,而是搬进连续潜空间:用稀疏自编码器把每条交互解耦成稀疏概念激活,按当前查询动态合成图的边权,最后把聚合结果压缩成16个记忆前缀token直接喂给模型生成——全程不回放原始历史。
解决什么问题
个性化Agent需要在跨越多个会话的长历史里同时捕捉两类信息:显式偏好(用户明确说过的约束)和隐式行为证据(习惯、决策模式,从未被说出口)。现有两条路线各有硬伤:
- 扁平检索(向量RAG):每条记忆独立打分,完全捕获不到分散在遥远会话里的分布式证据;
- 结构化记忆(GraphRAG、Mem0、MemGPT等):图结构一旦建好就固定,与查询无关,无法体现"同一批记忆在不同问题下关联完全不同"这一现实。
更根本的困境是:原始文本记忆天然纠缠——一条交互同时编码了主题、意图、情绪、习惯,只有一小部分与当前请求相关。在token层面做细粒度解耦,代价是KV缓存爆炸、反复调用LLM、无关文本干扰。
核心方法
LGM的答案是神经符号框架,把记忆解耦和关系推理全部放进潜空间,端到端可微:
1. 潜记忆解耦。 每条历史交互和当前查询都过一遍骨干模型,多层隐状态平均后经masked pooling和线性投影映射为潜节点 z_x(低层带词法线索、高层带语义抽象,隐式偏好恰好在混合层里)。再用稀疏自编码器(SAE)把稠密表示分解为稀疏概念码:c_x = S(ReLU(W_enc·z_x))。SAE损失为重构误差加稀疏惩罚:L_sae = ‖ẑ_x − z_x‖² + λΩ(c_x)。这一步让"一句直接指令"和"一个微弱的重复习惯"能通过共享概念对上,哪怕表面文本毫无相似。
2. 查询条件化的潜图构建。 关键设计:不持久化任何全局图。查询到记忆的边权就是两者概念码的归一化重叠 ω_{q→i} = φ(c_q, c_i)。查询一变,概念码变,同一记忆池诱导出完全不同的拓扑——图是按需隐式重建的,而非预先承诺。
3. 图条件化推理。 关系图神经网络把查询信号在激活子图上做非线性消息传递,聚合分布式弱线索成紧凑图状态,映射为一组记忆前缀token(默认16个)条件化生成,不回放任何原始文本。为防潜空间传播中的信息坍缩,引入证据重构目标:惩罚信息损失,把连续状态锚定在历史事实上。记忆的选取、关联、聚合、利用整个生命周期统一进一个端到端可微优化。
实验结果
- 主结果(PersonaMem + PrefEval):Qwen2.5-7B骨干平均准确率72.28,Gemma3-4B骨干66.16,比最强基线MemCoE分别高**+11.20和+11.70**。扁平管线(长上下文、朴素RAG)差距最大;增益集中在更难的隐式偏好split和128K长上下文。
- 隐式偏好硬核测试(PersonaMem-v2隐式split):Qwen3-4B骨干下,32K达到62.9、128K达到51.9,两个设置均为最佳,明显超过GPT-5-Chat(45.6/41.4)等专有大模型;比同骨干的agentic memory方法(55.2)高+7.7。
- 效率:LLM调用次数最少、token消耗最少、首token延迟最低且随上下文增长到128K保持稳定——占据准确率-成本 Pareto前沿的左下角。
- 消融:去掉证据重构损失掉分最狠(尤其隐式偏好,潜前缀会坍缩成模型忽略的无信息信号);去SAE、去GNN也都明显退化。潜token数从1调到32,准确率在16附近封顶——很小的潜预算就够。
深层洞察
这篇论文真正值得注意的立场是:记忆管理不该是外挂的离散读写策略,而应是模型内在的可学习表示。对比MemAgent、Memory-R1等用RL学读写决策的路线,LGM把"记什么、怎么关联"变成梯度可以直接优化的对象。
第二个洞察是"图不必预先存在"。GraphRAG范式假设知识需要一个持久的全局拓扑,LGM证明拓扑可以是查询的函数——每次请求隐式诱导自己的图。这其实更接近人类记忆的检索方式:同一个记忆库,问不同问题激活不同联想路径。
第三个是SAE的角色变化:从可解释性分析工具变成记忆对齐的工程组件。稀疏概念码让显式陈述与隐式行为在共享空间可比对,这解决了个性化最核心的语义鸿沟。
局限性
- 概念码虽号称可解释,但"稀疏激活=人类可理解概念"这一SAE固有假设仍有争议,论文未做概念语义审计;
- 需要对骨干模型做训练适配(抽取多层隐状态、训练SAE和GNN),不是即插即用的外挂记忆,换骨干要重训;
- 记忆以潜token形式存在,无法像Mem0那样向用户展示或人工编辑"记忆里存了什么",可审计性和可修正性弱;
- 评测集中在对话偏好场景,对事实性长记忆(如知识密集问答)未验证。
工程实践启示
- “16个潜token就够” 是很实用的信号:压缩记忆通道不需要大预算,瓶颈在表示质量而非容量;token给多了反而稀释信号。
- 证据重构损失值得单独借鉴:任何把历史压成连续状态的设计(软提示、prefix tuning式记忆)都该配一个防坍缩的锚定目标。
- 如果你的场景只需要显式偏好(用户明说的),轻量记忆库+规则就够了;LGM的收益主要在隐式、跨会话、长上下文三重叠加的难场景。
- 4B模型+结构化潜记忆打赢GPT-5,再次说明:在记忆密集型任务上,架构创新比堆模型规模划算。