一个不太起眼但值得深挖的信号

昨天AI圈的主旋律是语音模型的定价战(Gemini 3.8 Live以十分之一的价格登顶语音榜)和Apple把Siri交给Gemini的世纪联姻。但在我看来,Aether AI联合UCSD、UIC发布的RSIAgent框架,才是当天最有长期价值的新闻。

数字本身已经很扎眼:在不更新任何模型参数的前提下,RSIAgent让开源模型Kimi-K3、GLM-5.3在OSWorld 2.0上达到78.98%、在Agents’ Last Exam上达到84.82%,双双超过GPT-6 Astra(72.60% / 82.26%)。代码和论文都已开源。

但真正值得琢磨的不是榜单数字,而是它指向的一个范式问题:Agent的能力,到底应该长在参数里,还是长在经验里?

RSIAgent做了什么

先还原技术事实。

当前数字Agent的困境是:模型再强,进入一个陌生环境(新软件、新工具、新系统)时也要交学费。每个环境有自己的交互逻辑、隐藏约束、异常状态和失败模式。模型可以推理,但不了解环境的因果结构——哪些操作触发什么后果、什么条件导致失败、什么因素决定任务完成。这些知识只能通过主动试探获得。

传统解法是收集交互数据再微调,或者上强化学习。但在企业私有环境、频繁变化的数字系统里,数据难以公开、重训成本高,这条路经常走不通。

RSIAgent的回答很直接:让Agent像人一样,自己进环境里摸爬滚打,把经验沉淀成可复用的记忆,参数一个都不动。

它的架构是一个围绕"进化式记忆"构建的多智能体递归循环:

  1. Curriculum Agent(课程智能体):决定接下来学什么——主动规划探索方向;
  2. Actor Agent(执行智能体):进环境执行任务、获取一手经验;
  3. Verifier Agent(验证智能体):用真实环境反馈判断结果是否可靠;
  4. Memory(记忆):把验证过的「动作-条件-结果」因果关系持续写入,供后续任务复用。

关键设计是两阶段探索策略,作者自己的类比很妙——这就像大模型的预训练和后训练

  • 广度递归自探索(BRS):类比预训练。每轮由课程智能体生成多个方向的探索任务(不同工具、不同交互方式、不同输入条件),多组actor-verifier并行执行验证,经验汇入共享记忆,再基于已有认知提出新一批任务。快速铺开一张「环境知识地图」。
  • 深度递归自探索(DRS):类比后训练。专攻难点——主动寻找那些困难的、隐藏的、易错的、只在复杂条件下暴露的问题。课程智能体先出一个难任务,失败后根据暴露的弱点和未知设计更难的任务,循环推进。本质上是对Agent知识边界的自动化「压力测试」。

两阶段结束后,记忆被冻结,直接用于后续的真实任务执行。模型本体从头到尾没被碰过。

为什么这条路重要

1. 它绕开了Agent落地的三堵墙

企业场景里Agent落地最难的三件事:数据不能出域、环境天天在变、重训成本高企。RSIAgent的「训练无关」特性恰好逐一化解——经验记忆在客户环境内本地积累,环境变了就重新探索一轮,而且不需要GPU训练集群,只需要推理预算。对系统集成商和企业IT部门来说,这是从「交付一个模型」到「交付一个会自己上手的学习过程」的转变。

2. 它重新定义了开源模型的价值

过去一年开源阵营的叙事是「追平闭源」。但RSIAgent展示的是另一条路:基座模型不一定要最强,经验沉淀可以补齐甚至反超差距。Kimi-K3、GLM-5.3这些开源模型之所以能被RSIAgent加持后超越GPT-6 Astra,正是因为闭源模型的API形态反而无法支撑这种深度环境探索——你不能让GPT-6在你内网里自主摸爬滚打几百轮然后把经验存下来。开源的可控性和可部署性,第一次成了Agent时代真正的护城河,而不是成本上的妥协。

3. 它是「经验规模化」的又一次验证

把时间线拉长看,RSIAgent不是孤例。从2023年Voyager在Minecraft里构建技能库,到各家的RAG、经验回放、案例记忆系统,行业一直在试探同一件事:推理时计算和外部经验,能否部分替代参数里的知识? RSIAgent的贡献是把这个思路做成了完整的自动化闭环——自主决定学什么(curriculum)、主动去学(actor)、验证学到的东西(verifier)、越学越难(递归)。探索本身也被工程化了。

这背后有个更深的经济学逻辑:预训练的边际成本曲线越来越陡(数据、算力、电力),而经验的边际成本几乎是线性的推理费用。如果两者对任务能力的贡献可以部分互换,那么「经验积累优于参数训练」就不只是一句口号,而是成本结构决定的必然走向。

冷静的一面:它不是银弹

独立观点不能只有吹捧,几个必须泼的冷水:

记忆不是万能的,泛化边界存疑。 OSWorld是相对可控的数字环境benchmark,「动作-条件-结果」的因果关系可以被清晰验证。但真实世界的许多领域(开放式对话、模糊的目标判断)里,什么叫「验证通过」本身就难以定义。Verifier Agent依赖环境反馈,遇到反馈稀疏或延迟的环境,整个循环的质量会打折扣。

探索成本没有消失,只是换了形态。 广度+深度的递归探索意味着大量并行推理调用。论文里"一小时语音对话1.38美元"是Gemini的定价,RSIAgent这种框架在真实企业部署里探索一个复杂ERP系统要烧掉多少token,是个部署前必须算清的账。当然,相比训练,这仍是便宜的一方——但"便宜"是相对的。

「不更新参数」也是天花板。 经验记忆解决的是环境适配,但模型底层的推理能力、长程规划能力依然是硬约束。GLM-5.3能被RSIAgent抬到78.98%,前提是它本身底子够硬。换一个弱得多的基座,同样记忆加持下未必能兑现。经验放大能力,但不创造能力。

我的判断

RSIAgent最值得记住的一点,是它把「Agent的自我提升」从参数更新的独木桥上解放了出来。2026年的Agent竞争,正在从「谁的模型更强」悄悄转向「谁能更快地积累、验证、复用经验」。

接下来可以预判三件事:

  1. 记忆层会成为Agent产品的基础设施。 就像RAG从论文变成标配,curriculum-actor-verifier式的经验沉淀循环会被做进各家Agent框架,出现独立的「经验记忆引擎」中间件。
  2. 开源模型在企业Agent市场的份额会加速。 当经验可以补齐基座差距,可控性、可部署性、数据主权就成了采购决策的主导因素——这三样恰恰是开源的主场。
  3. Benchmark会开始分化。 「裸模型能力」和「带经验积累的系统能力」会被分开评价。今天已经能看到苗头:OSWorld 2.0的榜单上,系统级方案的分数正在和裸模型拉开。

一句话总结:模型参数是基因,经验记忆是后天学习。RSIAgent证明了后者的重要性被严重低估了——而这可能是2026年Agent领域最值得下注的方向。


参考: