每日论文精读 #050:可审计的长期记忆——把LLM压缩成『可替换的读出器』

一条确定性检索链在LongMemEval-S上逼近SOTA,LLM只做最后的读出器,且全部证据可复算。

2026年10月5日 · 1 分钟

每日论文精读 #006:把记忆写进参数,还能跟着模型一起换——RPMem 让 Agent 记忆跨会话进化

阿里通义与复旦提出 RPMem:把每个会话编译成与骨干模型无关的潜在记忆,经循环门控整合后解码为 LoRA 参数,实现跨会话进化、近常数成本、且换底座模型后记忆仍可复用的参数化记忆框架。

2026年9月23日 · 2 分钟

每日论文精读 #006:把长期记忆搬进潜空间,稀疏概念动态建图

LGM用稀疏自编码器解耦记忆、按查询动态构建潜空间图,以16个潜前缀token替代全文回放,在隐式偏好推断上超过GPT-5。

2026年9月21日 · 1 分钟

每日论文精读 #034:把长期记忆『编译』成计划再执行——MaP-WAM登顶RMBench且执行上下文恒定

哈工大等提出MaP-WAM(Memory as Plans),把情景记忆在规划时编译为段级『语言计划+视觉引导』,执行器上下文O(1),RMBench成功率83.3%登顶,真机78.0%。

2026年9月14日 · 1 分钟

每日论文精读 #027:GPT-4.1在行为感知旅行规划上近乎全军覆没,8B小模型靠RL反超

美团+北航提出Behavior2Trip基准与B2T-Agent:从用户历史行为轨迹推断偏好生成旅行计划,GPT-4.1最难任务全约束通过率仅0.5%,而GRPO强化学习训练的Qwen3-8B反超至4.7,还泛化赢下TravelPlanner。

2026年9月7日 · 1 分钟

每日论文精读 #021:从行为轨迹推断偏好,8B模型RL训练反超GPT-4.1

Behavior2Trip提出从用户历史行为轨迹隐式推断偏好的旅行规划新任务,RL训练的Qwen3-8B在个性化约束上大幅反超GPT-4.1

2026年8月31日 · 1 分钟