一个反直觉的开源发布

9月初,中国实验室 AllSpark 在 arXiv 上传论文《Iris: Climbing to the Search Frontier》(2609.04304),发布两款开源搜索智能体:基于 Qwen3.6-35B-A3B 的 Iris-mini 和基于 Qwen3.5-397B-A17B 的 Iris-pro,均支持 256K 上下文。Iris-pro 在 BrowseComp 上拿到 88.6%,是同规模开源权重搜索 Agent 中的最强;Iris-mini 也在四个基准中的三个上领先同级别模型,在 BrowseComp 上超出下一个对手 XYZ-Aquila-mini 3.4 个百分点。

如果把这条新闻读成"国产开源模型又刷了一个榜",就错过了它真正有信息量的部分。这篇论文值得细读,不是因为它证明了"中国实验室能训出好模型"——这一点早已不新鲜——而是因为它在三个层面上都给出了超出预期的答案:训练数据怎么造、训练流程怎么设计、评测方法论该怎么反思。这三件事恰好是当下 Agent 领域最缺公共知识的部分,而 AllSpark 承诺放出完整的数据构造、训练和评测配方。

本文拆解这三个层面,并讨论一个更根本的问题:为什么一个"搜索 Agent"的训练,会顺带提升模型在办公任务和通用工具调用上的表现?

一、反向造题:从网页链接结构里"长"出问题

训练搜索 Agent 最大的瓶颈不是模型,是数据。你需要的题目必须满足一个看似矛盾的条件:闭卷做不出来,但给了正确的资料就能做出来。太简单,模型靠参数里记忆的知识就能蒙对,学不到检索;太偏门,连"标准证据"都找不到,训练信号就是噪声。

业界的常见做法是人工出题(BrowseComp 本身就是这么造的),或者用 LLM 从文档里改写生成问答对。前者贵且规模有限,后者有个致命缺陷:LLM 生成的题目往往可以靠字符串匹配直接命中——题目里的关键词和答案页面的关键词高度重合,Agent 根本不需要推理,一次搜索就能捞到答案。这种数据训出来的模型,学到的是"关键词匹配",不是"搜索"。

Iris 的做法在思路上是一次漂亮的反转:不是从问题出发找资料,而是从资料的链接结构反向构造问题

具体流程分四步:

  1. 建图。从一个种子页面出发,抓取它的出链,把页面中的实体和关系蒸馏成一张实体图。网页的链接结构本身就是人类知识关联的显式表达——A 页面链接到 B,往往意味着 A 和 B 之间存在某种语义关系,这比让 LLM 凭空想象实体关联要可靠得多。

  2. 造多跳链。在实体图上手工构造多跳推理链:要得到最终答案,必须依次穿过若干个相互关联的中间节点。每一步的解都藏在下一步的线索里,天然强制了"搜索→阅读→再搜索"的循环。

  3. 改写防作弊。这是最关键的一步:把问题中所有非答案实体全部改写成描述性指代,确保没有任何线索能靠字符串匹配直接检索命中。比如不问"某公司的创始人",而问"那家在 2015 年由一位前搜索引擎工程师创立的公司"。Agent 必须 understanding→search→resolve→search,而不是 pattern match。

  4. 双向校验。最后用参考模型做守门员:一道题只有当参考模型闭卷答错、但给它支持证据后能答对时,才准入数据集。前者保证题目的难度下限,后者保证题目是可解的、证据链是完整的。这个"fail closed-book, solve open-book"的双向门槛,是整个数据质量的核心保险。

这套流程的价值在于可扩展且可验证。链接结构是现成的、近乎无限的;改写和校验都可以自动化;每道题天然自带"标准证据链",为后续的轨迹筛选提供了 ground truth。相比人工出题,它的边际成本趋近于零;相比 LLM 直接生成,它从源头堵住了字符串匹配的漏洞。

这对整个行业的启发是:高质量 Agent 数据的瓶颈不在生成,在约束。LLM 生成能力早已过剩,稀缺的是像"非答案词全部改写"、“双向校验"这类保证数据真的在训练目标能力的约束条件。

二、SFT-RL climbing:不是流水线,是螺旋

有了数据,怎么训?主流做法是两段式:先 SFT(监督微调)学会基本行为,再 RL(强化学习)对齐真实环境。Iris 的训练也遵循这个骨架,但有两个值得注意的工程细节和一个方法论创新。

细节一:RL 对着实时网页搜索做,judge 自己部署。 奖励判分模型和观测摘要器都跑在训练集群内部,由团队自己的 Qwen 大模型驱动。这解决了 RL 训练 Agent 最疼的问题之一:对外部 API 的依赖会让训练吞吐不可控,而搜索环境的非平稳性(网页内容会变)本身又是真实训练信号的一部分。把 judge 收进集群,等于把"环境"和"裁判"都纳入了可管理的范围。

细节二:超长 rollout 的断点续训。 搜索 Agent 的推理轨迹经常超出单次请求的长度上限。Iris 的处理方式是在请求层面中断超长轨迹,下一步从已提交的前缀恢复继续跑。这个看似不起眼的机制,实际上是长程 Agent RL 训练的刚需——没有它,要么丢掉长轨迹的训练信号,要么训练系统被失控的 rollout 拖垮。

真正的创新是 SFT-RL climbing(交替攀登):SFT 和 RL 不是一次性的流水线,而是交替迭代。每一轮 RL 结束后,把最难解出的题目最有效率的解题轨迹挑出来,回填到下一轮 SFT 的数据里,再进入下一轮 RL。如此螺旋上升。

这个设计的洞察在于:RL 不仅是优化阶段,也是数据挖掘阶段。RL 探索出来的高质量轨迹(尤其是那些高效解法)是比任何人工构造都更真实的示范数据;而 RL 中的失败案例反过来界定下一轮 SFT 需要补的能力。SFT 提供稳定的行为先验,RL 提供真实的探索信号,两者的产物互相喂养。相比"一遍 SFT、一遍 RL"的传统配方,这种交替结构更接近"刻意练习”——在自己的能力边缘反复打磨,而不是把课程表一次性过完。

三、评测的诚实:脚手架可能比模型差距更大

如果说前两点是工程贡献,第三点可能是这篇论文对社区最有价值的部分:对推理时上下文管理(context management)的系统性质疑

搜索 Agent 跑长任务时,上下文窗口会在问题解完之前被填满。业界的普遍解法是在推理时做上下文管理:丢弃历史、压缩摘要、失败后带笔记重试。问题在于——当你看到一个 Agent 在 BrowseComp 上报了高分,你无法分辨这个分数多少来自模型本身,多少来自外挂的脚手架。

Iris 团队的做法是:每个基准都报告开和关上下文管理两个版本,同时固定工具集、上下文上限和 judge 模型,把变量隔离开。

结果很有信息量。上下文管理对 Iris-mini 的提升高达 21.2 个 BrowseComp 百分点——原因不是小模型上下文窗口小,而是它完成同样任务需要更多步数,更快撞上窗口上限。而最佳策略是"丢弃历史 + 二次尝试"的组合:第一次失败后,把已检查和已排除的内容压缩成简短笔记,附加到任务里重跑。这本质上是在推理时做显式的"工作记忆外化"。

对从业者的含义很直接:你在榜单上看到的模型间几个点的差距,可能小于你自己系统里上下文管理策略带来的波动。选型时盯着模型分数卷,不如先把脚手架的变量控制好。另外,Iris 的所有成绩都来自单一 ReAct Agent,没有子 Agent、没有测试时验证——在人人堆架构的今天,这个"裸奔"设定反而是最有可比性的。

顺带一提论文附录里的一个案例:BrowseComp-ZH 中一道关于《权力的游戏》的题,Agent 答"Bolton"被判错,标准答案"Lannister"——而 Sansa Stark 的第二任丈夫确实是 Ramsay Bolton,Agent 是对的,ground truth 是错的。基准本身的质量问题,正在成为 Agent 评测的天花板。

四、意外的收获:搜索是元技能

论文里最值得玩味的发现是副产品:用搜索数据训出来的模型,在从未训练过的任务上也变强了,包括通用工具调用和办公任务。

团队的解释是:搜索不是一门专科,而是一种元能力——在信息不完全的条件下工作时所需的基本功。拆开看确实如此:一个搜索 Agent 需要的能力包括——把模糊目标分解为可检索的子问题、评估信息源的可靠性、在部分证据下更新信念、知道什么时候该放弃一条线索换方向、把零散发现综合成连贯结论。这些能力里没有一项是"搜索"专属的,它们是所有 Agent 任务的地基。

这给 Agent 训练提供了一个反直觉的优先级建议:如果你的算力只够训一种能力,训搜索的性价比可能高于训代码、训工具调用。因为后者是具体技能,前者是处理不确定性的通用素养。现实中的 Agent 失败案例,多数不是因为不会调 API,而是在信息模糊时乱猜、在证据不足时过度自信、在死路上反复撞墙。

结语:开源价值的转移

把这三个层面合起来看:反向造题解决了数据从哪来,SFT-RL climbing 解决了训练怎么爬坡,双版本评测解决了分数怎么读。AllSpark 已放出 Iris-mini/pro 的权重(Hugging Face 上的 AllSpark-Research/Iris 集合)、含 Agent 循环和上下文管理策略的 Iris Harness,以及全部四个基准的评测代码,数据构造和训练管线承诺后续放出。

开源竞赛的焦点正在从"权重"转移到"配方"。权重是结果,配方是过程;结果可以 forks,过程的复现难度才是真正的壁垒。如果 Iris 最终兑现完整配方,它的价值将不只是一个高分模型,而是一份可审计、可改进的搜索 Agent 工程范本。对社区而言,后者比 88.6% 这个数字重要得多。

而对每个正在搭 Agent 系统的人,这篇论文留下的最实际的一句话是:先控制你脚手架里的变量,再谈模型选型;先想清楚你的数据约束,再谈训练算法。搜索是元技能,诚实的评测也是。