📌 系列导航🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站

论文信息

项目内容
日期2026-08-17
论文ERSkill: Evolving for Skill-Guided Adaptive Memory Retrieval
作者Haolong Chen, Liang Zhang, Zhuo Li, Lei Xue, Guangxu Zhu
机构香港中文大学(深圳)、深圳大数据研究院、中山大学深圳校区
链接arxiv.org/abs/2608.12720
代码论文未提供公开仓库
领域Agent记忆系统 / 自进化检索

一句话总结

把Agent记忆的"检索策略"本身变成可组合、可进化、可路由的技能程序——不再问"记忆存什么",而是问"记忆怎么取"。

解决什么问题

LLM Agent的长期记忆研究很热,但几乎所有人都聚焦在记忆的构建端:怎么抽取、压缩、更新、遗忘。而查询时的检索行为基本是写死的——典型就是一次稠密检索(dense retrieval)完事。

问题在于查询是异构的。“Alice夏威夷之行给Bob买了什么礼物?“只需要定位一个具体事件;“Alice后来为什么不再和Bob计划夏威夷之旅?“则需要串联早期事件与后续发展、挖掘因果关系。这两种查询需要的证据构建策略在质上就不同,单一的静态检索必然顾此失彼。现有自进化方法(ReasoningBank、MemSkill等)进化的是推理经验或记忆构建技能,检索端依然是预定义的。

核心方法

ERSkill的框架分三层:

1. 可执行的记忆存储。 交互历史被切分成原子级记录(atom),配上索引(嵌入索引、实体-原子倒排)和图结构(相似度图、关系图)。关键是存储通过一个原语库暴露:entity_search、lexical_search(BM25)、dense_search三种检索原语,加temporal_focus_expand、similarity_expand、relation_expand三种扩展原语,再加一个llm_process处理改写/过滤。

2. 检索技能。 技能=原语的有序组合程序,以markdown文件存储,附描述与信息偏好。推理时由一个轻量路由器打分:查询和技能各自过共享编码器(Qwen3-Embedding-0.6B,冻结),拼接后过两层MLP输出匹配分,softmax选最优技能执行。路由器只训练打分头,编码器不动——新技能出现时靠文本描述就能被评分,无需改输出空间。

3. 技能-路由器共同进化。 这是论文最精彩的部分,两个机制:

  • 经验前缀树(experience trie):所有技能都是固定原语库上的序列,把探索过的原语路径存成trie,共享前缀只存一次。生成新候选时先查trie排除重复路径,失败和成功的探索都保留作参考——避免进化过程反复提出等价程序。
  • 双前沿(double frontier)能力前沿保留"理想情况下每个查询选最优技能"的oracle价值技能,负责探索;部署前沿只包含经路由器验证、能被可靠选中的技能,负责稳定上线。两者解耦,意味着探索激进的同时部署不翻车。路由器用软标签交叉熵训练,目标分布由rollout得分诱导。

实验结果

三个基准:LoCoMo、LongMemEval(直接迁移LoCoMo训练的技能,零额外训练)、PerLTQA。

  • Qwen3-Next-80B骨干:三项指标(F1/BLEU-1/LLM-judge)总平均超最强基线31.3%;GPT-5.4-nano骨干超28.1%
  • LoCoMo上LLM-judge达72.93(GPT-5.4-nano),比最强自进化基线GEPA的59.55高出13个点
  • 细分品类上Single Hop和Multi Hop提升最大——正是证据定位密集型任务
  • 消融实验:去掉技能进化或路由器损失最大,双前沿和经验trie各有稳定贡献
  • 稳定性:5次独立运行CV<5.4%
  • 成本:LLM构建类方法中最轻(LLM只用于关系抽取),推理端也在低成本档位

深层洞察

这篇论文的价值在于完成了一次视角转换:记忆检索从"基础设施"变成了"一等公民”。过去我们把retriever当水管——通着就行;ERSkill把它当技能——可以练、可以教、可以选。

双前沿设计尤其值得咀嚼。它承认了一个现实:一个技能"理论上最好"和"路由器能 reliably 选中它"是两回事。多数进化式agent框架忽略这一点,导致探索越激进、部署越抖动。把capability和deployment分离,本质上是在进化系统里复刻了软件工程的staging/production双环境思想。

经验trie则是对"进化=无限试错"这一误区的回应:把搜索历史结构化沉淀,失败路径也是资产。

局限性

作者自己也承认:一是训练期依赖rollout评估和LLM-as-a-Judge监督,成本不低(虽然部署前沿推理很轻);二是原语库固定,检索行为空间有上界,不支持进化出新的原语算子;三是实验只覆盖记忆问答,对规划、工具调用、交互决策的扩展还是未知数。

另外一点论文没明说:三个基准都是对话式记忆QA,查询类型分布相对可控。真实产品里的查询长尾更长,路由器的泛化能力面临更大考验。

工程实践启示

  1. 别再默认"一次向量检索"了:按查询类型区分检索策略(实体锚定/时序聚焦/多跳扩展),即使不上进化机制,手动做路由也能吃到大半收益
  2. 软标签训练轻量路由器比每次查询都让LLM选策略便宜得多——冻结编码器+小MLP就能做
  3. 缓存设计教科书级:内容哈希缓存技能rollout、oracle表复用、路由器replay不重跑——这套增量评估思路任何做agent进化的团队都该抄
  4. 探索与部署分离的双前沿模式,可以直接借鉴到任何自进化系统的工程架构里

本笔记由星月自动生成,每日精读一篇高价值论文。