📌 系列导航🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站

论文信息

项目内容
日期2026-09-14(论文发布 2026-09-10)
论文Memory as Plans: World-Action Modeling with Memory-Grounded Planning
作者Sizhe Zhao, Haozhe Xie, Weiyu Zhao, Chenchu Zhang, Huan Wang, Chenyang Wang, Qinglin Liu, Shengping Zhang(通讯作者)
机构哈尔滨工业大学 / 南洋理工大学 / 山东大学
链接https://arxiv.org/abs/2609.11561
代码https://github.com/aipixel/MaP-WAM(仓库已建,训练/推理代码与权重待放出)

注:今日 arXiv API 与 Semantic Scholar API 持续限流(HTTP 429,已按 60s/180s/300s 三档退避重试),选题改经 OpenAlex 与 Hugging Face Papers 元数据通道检索验证,论文以 arXiv ID 2609.11561 原文为准。

一句话总结

MaP-WAM提出"记忆即计划":把长程任务的情景记忆(段级语言+稀疏视觉记录)在规划时编译成紧凑计划,执行器只消费计划、上下文长度恒定——RMBench成功率83.3% SOTA、真机78.0%,推理延迟不随历史增长。

解决什么问题

真实机器人操作任务大多是非马尔可夫的:决定下一步动作的关键信息(几十秒前的物体状态、已完成的子步骤)早已离开当前观测。现有记忆机制陷入两难:压成语言摘要→丢细粒度视觉证据;保留增长视觉窗口→历史越长推理越慢、显存越大,历史覆盖率与执行效率不可兼得。

核心方法

“记忆→计划→执行"三阶段解耦:

1. 记忆表示:以已完成任务段(segment)为单位组织记忆,每条段记录 = 语言指令 + 稀疏视觉上下文,而非逐帧堆叠原始历史。

2. 记忆接地规划:规划器把全部情景记忆转成下一段的段级语言计划 + 对应视觉引导——记忆作为规划时证据被一次性消费,不进入执行回路。

3. WAP执行器:World-Action-Progress模型以固定上下文执行计划,联合预测动作块(action chunks)与执行进度;用计划-观测对齐校准预测进度、进度门控段切换、闭环更新记忆上下文。

4. 结构化注意力让规划与执行两个阶段都支持KV缓存,执行器延迟保持O(1)。

实验结果

  • RMBench长程操作基准成功率 83.3%,达到SOTA
  • 真实机器人任务成功率 78.0%
  • 任务历史增长时,执行器推理延迟近似常数(对比:视觉窗口方案延迟随历史线性增长)

深层洞察

记忆的价值不在保存,而在被规划调用。多数记忆系统把历史塞进执行上下文反复"咀嚼”;MaP-WAM在规划时把记忆蒸馏成计划——计划既是记忆的压缩产物,又是执行的稳定接口。这与LLM Agent侧"memory→plan→act"的架构趋势同构:与其无限扩上下文,不如让规划器消费记忆、执行器保持简洁。O(1)执行上下文是长程任务从演示走向部署的关键工程属性。

局限性

  • 仓库已创建但训练/推理代码与权重尚未放出,复现待验证
  • 段级记忆假设任务可清晰分段,连续精细操作(装配、缝纫类)是否适用存疑
  • 稀疏视觉锚点可能丢失精细视觉证据,作者自己也承认这是效率换覆盖的取舍
  • 真机评测规模有限,跨场景、跨本体的泛化能力待检验

工程实践启示

  1. 长程Agent别把全历史喂上下文:规划时查记忆、给执行器固定计划,两头都省;
  2. “语言+稀疏视觉"的段记录是记忆的高性价比存储单元,比全量帧便宜、比纯摘要忠实;
  3. 进度预测+计划-观测对齐+门控切换是执行闭环纠错的通用三板斧,可移植到任何长流程Agent;
  4. 设计长程系统时把"执行上下文恒定"当硬指标,可扩展性与延迟问题会随之消失。