title: “每日论文精读 #006:把LLM锁进「可替换阅读器」,确定性检索链在长程记忆基准逼近SOTA” date: 2026-10-01T06:50:00+08:00 draft: false tags: [“论文精读”, “RAG”] categories: [“论文精读”] summary: “一条几乎全由确定性代码构成的检索链(混合召回+重排+证据包编译+机械脚手架),LLM只在最后当可替换阅读器,在LongMemEval-S上双跑479/475,正负跨过已发表SOTA 478——并诚实量化了评委噪声。” 📌 系列导航:🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站 论文信息 项目 内容 日期 2026-10-01 论文 Auditable Long-Term Memory: A Deterministic Retrieval Chain Measured at 479/475 of 500 on LongMemEval-S 作者 Christopher J. Chanhnourack(Centennial Defense Systems) 链接 arXiv:2609.38021 代码/证据 longmemeval-evidence(MIT,含数据包、评委裁决、对照组记录) 领域 RAG / 长程记忆检索 一句话总结 把长程对话记忆系统里LLM的角色压缩到最后一步"读证据包并作答",其余检索全链路用确定性代码实现,在LongMemEval-S上双跑得分479/475,恰好骑在已发表SOTA(478)两侧——同时用两遍规则、第二评委和负对照,把排行榜上一两分差距其实是测量噪声这件事摆到了台面上。 解决什么问题 带长期记忆的对话助手需要回答"我一共看过几位医生"这类问题,证据散落在几十个历史会话里。真正的失败是安静的失败:系统没检索到那个关键会话,却能流利地给出错误答案。而且事后无法核查"它为什么这么答"。现有方案(MemGPT、Mem0、Zep等)把智能塞进记忆管理和LLM调用里,过程不可审计。另外,长上下文榜单顶部的分差只有几分,单次跑分+LLM评委,让排名部分成了测量噪声的产物。 核心方法 五段式链条,前四段全是确定性代码,字节级可复现: 混合候选召回:稠密向量检索 + 关键词全文检索 + 一条有界语义扩展通道(只增候选不重排)。470个可答题中468题的金标会话全部进入候选池,其中10个金标会话只靠语义扩展通道捞回。 交叉编码器重排:bge-reranker-v2-m3 对每个会话按问题打分,会话分=最大chunk分,fp16定批+按先前名次打破平局,保证排序确定。 覆盖优先的证据包编译:硬预算16会话/40k token。稠密基线top-10原样保留为前缀,其余槽位按交叉编码器序填充并做保词抽取压缩;超出预算先丢最低名次的扩展。462/470题的证据包是"金标完备"的。编译器通过金标打乱、ID破坏、双编译字节一致等负对照验证。 确定性推理脚手架(约240题启用):从证据包机械地生成时间线、用户陈述的时钟粒度新鲜度序、取值偏好不变量、计数枚举汇总——代码实现,内部不一致即抛错。 可替换阅读器:LLM只出现这一次。同一批冻结证据包喂给8个不同阅读器(闭卷93分到Opus 479分的阅读器曲线),换阅读器不用动上游任何东西。 最值得学的是测量纪律:发布前冻结"双跑一致才算数"的晋升规则;用第二评委(GLM-5.3)复评,一致率98.6%但双跑都只给472;官方评委对字节相同的答案复评也会翻3个裁决。任何"改进组件"先过60行负对照(曾在基线正确的题上零翻转才准上线)——一个能修好3道错题的验证器因为弄坏了11道对的题而被否决。 ...

1 分钟