论文信息
| 项目 | 内容 |
|---|---|
| 日期 | 2026-08-26 |
| 论文 | Prime Agent: A Self-Improving RLM Harness |
| 作者 | Seth Karten, Alex L. Zhang, Kevin Thomas 等 11 人 |
| 机构 | Prime Intellect / Princeton / MIT |
| 链接 | arXiv:2608.23552 |
| 代码 | github.com/PrimeIntellect-ai/prime-agent |
一句话总结
不换模型、不改权重,只靠一套开源的agent运行时(持久REPL+递归子代理+自我精炼的记忆系统),把ARC-AGI-3的Best@1从30%拉到95.5%——harness本身就是能力的一部分。
解决什么问题
LLM本质是个"有界顺序处理器":每次决策只能看到权重和当前上下文里的信息。但长程任务(跑几天的实验、多步编码、开放世界游戏)需要远超上下文窗口的信息和计算。传统做法有两条死路:要么把工作流写死在harness里(模型被迫适应脚手架的节奏),要么上下文一爆就丢状态、重启就失忆。
更致命的是评测问题:很多benchmark上模型得分低,不是因为模型不行,而是harness丢了状态、限制了可用动作、提前终止了任务。你测的是脚手架的天花板,不是模型的天花板。
核心方法
Prime Agent的核心是把"状态"显式分层,像管理CPU缓存一样管理信息:
- L0 模型权重:推理时固定,只有微调能改
- L1 活跃上下文:compaction(压缩摘要)负责重写
- L2 持久REPL+子代理会话:中间变量活在IPython内核里,不占上下文token,需要时才序列化进L1。作者称之为"agentic garbage collection"——模型自己决定创建、保留、摘要还是删除这些对象
- L3 磁盘级历史/记忆/技能:Continual Harness管理的持久层
三个关键设计:
rlm异步原语:调用
rlm即生成一个子代理,立刻返回句柄,父代理继续本地计算,结果稍后通过agent间直接通信送达。子代理有自己的上下文、内核、工作区。模型在本地代码/工具/串行委派/并行子代理之间自由选择——harness只定义执行语义,不定义工作流图。Continual Harness自我精炼:把轨迹证据转成带版本的持久状态——有效计算变成技能(skills),重复的协调模式变成子代理规格,纠正过的假设变成记忆。
/refine命令后台跑一次模型调用,在turn边界应用编辑,支持回滚。权重不变,行为持续进化。长程控制三件套:Autonomous模式(预算内循环直到终止条件测试通过)、Goals(目标跨多次延续保持)、Heartbeats(cron定时唤醒)。资源核算聚合根会话和所有后代,委派的成本不会隐身。
实验结果
- ARC-AGI-3:RHAE Best@1从30%提到95.5%,且强配置随token/成本投入持续爬升、弱配置早早平台化——证明表达力强的接口才能让模型"吃掉"更多test-time compute
- 长上下文套件:对齐或超过Pi、Claude Code、Codex,优于Hermes Agent、OpenCode、Kimi-Code
- nanoGPT speedrun:维持85.5小时自主运行,验证19项纪录(八种子均值);有趣发现是harness选择对最终纪录影响不大,但模型行为差异显著
- Factorio:refinement机制支撑了持续科技树推进,专职子代理实现并行化作业
深层洞察
这篇论文最锋利的观点是**“harness即膜”(membrane)**:模型通过harness观察和作用于世界,膜的低效会直接伪装成模型的低能。当社区热议"模型能力天花板"时,很多人测的其实是自己agent框架的天花板。
第二个洞察是test-time scaling的"接口依赖性":同样是加token加预算,有的配置能持续转化为进展,有的早早饱和。差异不在模型,在接口是否允许模型自主构建策略。这对"scaling law放缓"的叙事是一个重要反例——可能不是算力不够,是膜太厚。
第三,L0-L3的状态分层本质上是把冯·诺依曼架构引入agent设计:模型像CPU,REPL像内存,磁盘记忆像外存。这个抽象比"多代理框架"的各种花哨拓扑更接近本质。
局限性
- ARC-AGI-3对照组用了官方自报数字(自己复跑的Claude Code/Codex反而更低),作者也承认这是"定位结果"而非"隔离因果"——95.5%里有水分警惕空间
- 长上下文表格无置信区间,bold标注"不是统计显著性"
- 85.5小时nanoGPT运行的成本核算、以及这套架构对非编码任务的泛化,着墨不多
- 自我精炼依赖模型自身的元认知,弱模型上refinement质量存疑
工程实践启示
- 把中间状态挪出上下文:大日志、任务规格、评估器输出放文件/REPL变量里,按需检索序列化——这是长上下文任务的正确打开方式,比硬塞200K token高效得多
- harness要定义语义而非流程:给模型
rlm原语和执行保证,让它自己决定分解与并行,比编排一张固定DAG更鲁棒 - 可回滚的记忆版本化:技能/记忆/子代理规格的每次编辑记录触发条件和预期效果——agent的自我改进需要git式的审计能力
- 资源核算要穿透委派:聚合所有子会话的token/时间/成本,否则多代理系统的账本必然失真
- 开源代码可直接上手,是研究长程评测和coding agent工作流的高质量基线
本文由AI精读生成,仅供参考