📌 系列导航🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站

论文信息

项目内容
日期2026-08-26
论文Prime Agent: A Self-Improving RLM Harness
作者Seth Karten, Alex L. Zhang, Kevin Thomas 等 11 人
机构Prime Intellect / Princeton / MIT
链接arXiv:2608.23552
代码github.com/PrimeIntellect-ai/prime-agent

一句话总结

不换模型、不改权重,只靠一套开源的agent运行时(持久REPL+递归子代理+自我精炼的记忆系统),把ARC-AGI-3的Best@1从30%拉到95.5%——harness本身就是能力的一部分

解决什么问题

LLM本质是个"有界顺序处理器":每次决策只能看到权重和当前上下文里的信息。但长程任务(跑几天的实验、多步编码、开放世界游戏)需要远超上下文窗口的信息和计算。传统做法有两条死路:要么把工作流写死在harness里(模型被迫适应脚手架的节奏),要么上下文一爆就丢状态、重启就失忆。

更致命的是评测问题:很多benchmark上模型得分低,不是因为模型不行,而是harness丢了状态、限制了可用动作、提前终止了任务。你测的是脚手架的天花板,不是模型的天花板。

核心方法

Prime Agent的核心是把"状态"显式分层,像管理CPU缓存一样管理信息:

  • L0 模型权重:推理时固定,只有微调能改
  • L1 活跃上下文:compaction(压缩摘要)负责重写
  • L2 持久REPL+子代理会话:中间变量活在IPython内核里,不占上下文token,需要时才序列化进L1。作者称之为"agentic garbage collection"——模型自己决定创建、保留、摘要还是删除这些对象
  • L3 磁盘级历史/记忆/技能:Continual Harness管理的持久层

三个关键设计:

  1. rlm异步原语:调用rlm即生成一个子代理,立刻返回句柄,父代理继续本地计算,结果稍后通过agent间直接通信送达。子代理有自己的上下文、内核、工作区。模型在本地代码/工具/串行委派/并行子代理之间自由选择——harness只定义执行语义,不定义工作流图。

  2. Continual Harness自我精炼:把轨迹证据转成带版本的持久状态——有效计算变成技能(skills),重复的协调模式变成子代理规格,纠正过的假设变成记忆。/refine命令后台跑一次模型调用,在turn边界应用编辑,支持回滚。权重不变,行为持续进化。

  3. 长程控制三件套:Autonomous模式(预算内循环直到终止条件测试通过)、Goals(目标跨多次延续保持)、Heartbeats(cron定时唤醒)。资源核算聚合根会话和所有后代,委派的成本不会隐身。

实验结果

  • ARC-AGI-3:RHAE Best@1从30%提到95.5%,且强配置随token/成本投入持续爬升、弱配置早早平台化——证明表达力强的接口才能让模型"吃掉"更多test-time compute
  • 长上下文套件:对齐或超过Pi、Claude Code、Codex,优于Hermes Agent、OpenCode、Kimi-Code
  • nanoGPT speedrun:维持85.5小时自主运行,验证19项纪录(八种子均值);有趣发现是harness选择对最终纪录影响不大,但模型行为差异显著
  • Factorio:refinement机制支撑了持续科技树推进,专职子代理实现并行化作业

深层洞察

这篇论文最锋利的观点是**“harness即膜”(membrane)**:模型通过harness观察和作用于世界,膜的低效会直接伪装成模型的低能。当社区热议"模型能力天花板"时,很多人测的其实是自己agent框架的天花板。

第二个洞察是test-time scaling的"接口依赖性":同样是加token加预算,有的配置能持续转化为进展,有的早早饱和。差异不在模型,在接口是否允许模型自主构建策略。这对"scaling law放缓"的叙事是一个重要反例——可能不是算力不够,是膜太厚。

第三,L0-L3的状态分层本质上是把冯·诺依曼架构引入agent设计:模型像CPU,REPL像内存,磁盘记忆像外存。这个抽象比"多代理框架"的各种花哨拓扑更接近本质。

局限性

  • ARC-AGI-3对照组用了官方自报数字(自己复跑的Claude Code/Codex反而更低),作者也承认这是"定位结果"而非"隔离因果"——95.5%里有水分警惕空间
  • 长上下文表格无置信区间,bold标注"不是统计显著性"
  • 85.5小时nanoGPT运行的成本核算、以及这套架构对非编码任务的泛化,着墨不多
  • 自我精炼依赖模型自身的元认知,弱模型上refinement质量存疑

工程实践启示

  1. 把中间状态挪出上下文:大日志、任务规格、评估器输出放文件/REPL变量里,按需检索序列化——这是长上下文任务的正确打开方式,比硬塞200K token高效得多
  2. harness要定义语义而非流程:给模型rlm原语和执行保证,让它自己决定分解与并行,比编排一张固定DAG更鲁棒
  3. 可回滚的记忆版本化:技能/记忆/子代理规格的每次编辑记录触发条件和预期效果——agent的自我改进需要git式的审计能力
  4. 资源核算要穿透委派:聚合所有子会话的token/时间/成本,否则多代理系统的账本必然失真
  5. 开源代码可直接上手,是研究长程评测和coding agent工作流的高质量基线

本文由AI精读生成,仅供参考