论文信息
| 项目 | 内容 |
|---|---|
| 日期 | 2026-09-14(论文发布 2026-09-10) |
| 论文 | Memory as Plans: World-Action Modeling with Memory-Grounded Planning |
| 作者 | Sizhe Zhao, Haozhe Xie, Weiyu Zhao, Chenchu Zhang, Huan Wang, Chenyang Wang, Qinglin Liu, Shengping Zhang(通讯作者) |
| 机构 | 哈尔滨工业大学 / 南洋理工大学 / 山东大学 |
| 链接 | https://arxiv.org/abs/2609.11561 |
| 代码 | https://github.com/aipixel/MaP-WAM(仓库已建,训练/推理代码与权重待放出) |
注:今日 arXiv API 与 Semantic Scholar API 持续限流(HTTP 429,已按 60s/180s/300s 三档退避重试),选题改经 OpenAlex 与 Hugging Face Papers 元数据通道检索验证,论文以 arXiv ID 2609.11561 原文为准。
一句话总结
MaP-WAM提出"记忆即计划":把长程任务的情景记忆(段级语言+稀疏视觉记录)在规划时编译成紧凑计划,执行器只消费计划、上下文长度恒定——RMBench成功率83.3% SOTA、真机78.0%,推理延迟不随历史增长。
解决什么问题
真实机器人操作任务大多是非马尔可夫的:决定下一步动作的关键信息(几十秒前的物体状态、已完成的子步骤)早已离开当前观测。现有记忆机制陷入两难:压成语言摘要→丢细粒度视觉证据;保留增长视觉窗口→历史越长推理越慢、显存越大,历史覆盖率与执行效率不可兼得。
核心方法
“记忆→计划→执行"三阶段解耦:
1. 记忆表示:以已完成任务段(segment)为单位组织记忆,每条段记录 = 语言指令 + 稀疏视觉上下文,而非逐帧堆叠原始历史。
2. 记忆接地规划:规划器把全部情景记忆转成下一段的段级语言计划 + 对应视觉引导——记忆作为规划时证据被一次性消费,不进入执行回路。
3. WAP执行器:World-Action-Progress模型以固定上下文执行计划,联合预测动作块(action chunks)与执行进度;用计划-观测对齐校准预测进度、进度门控段切换、闭环更新记忆上下文。
4. 结构化注意力让规划与执行两个阶段都支持KV缓存,执行器延迟保持O(1)。
实验结果
- RMBench长程操作基准成功率 83.3%,达到SOTA
- 真实机器人任务成功率 78.0%
- 任务历史增长时,执行器推理延迟近似常数(对比:视觉窗口方案延迟随历史线性增长)
深层洞察
记忆的价值不在保存,而在被规划调用。多数记忆系统把历史塞进执行上下文反复"咀嚼”;MaP-WAM在规划时把记忆蒸馏成计划——计划既是记忆的压缩产物,又是执行的稳定接口。这与LLM Agent侧"memory→plan→act"的架构趋势同构:与其无限扩上下文,不如让规划器消费记忆、执行器保持简洁。O(1)执行上下文是长程任务从演示走向部署的关键工程属性。
局限性
- 仓库已创建但训练/推理代码与权重尚未放出,复现待验证
- 段级记忆假设任务可清晰分段,连续精细操作(装配、缝纫类)是否适用存疑
- 稀疏视觉锚点可能丢失精细视觉证据,作者自己也承认这是效率换覆盖的取舍
- 真机评测规模有限,跨场景、跨本体的泛化能力待检验
工程实践启示
- 长程Agent别把全历史喂上下文:规划时查记忆、给执行器固定计划,两头都省;
- “语言+稀疏视觉"的段记录是记忆的高性价比存储单元,比全量帧便宜、比纯摘要忠实;
- 进度预测+计划-观测对齐+门控切换是执行闭环纠错的通用三板斧,可移植到任何长流程Agent;
- 设计长程系统时把"执行上下文恒定"当硬指标,可扩展性与延迟问题会随之消失。