一道算术题:70分去哪了
先看一组数字。
ARC Prize 官方对 Claude Opus 5 在 ARC-AGI-3 上的记录是:高推理档位下约 30%。这已经是所有裸模型里的最高分——OpenAI 的旗舰模型得分不到 10%,据说这个结果让 ARC-AGI 系列成了 OpenAI 的心病。
昨天,NVIDIA 研究院发布了同一模型在同一个基准上的新成绩:100.00 RHAE,25 个环境、183 个关卡全部完成。
模型没有换。30 分的 Claude Opus 5 和满分的 Claude Opus 5 是同一个模型、同一个家族、同一套权重。中间的 70 分,来自模型外面的东西——一个叫 AVO(Agentic Variation Operators) 的 Agent 系统:持久记忆、监督者、独立的执行循环。这类包裹模型的外围系统,业内叫 harness。
TechCrunch 的标题说得直白:真正的英雄现在是 harness,不是模型。
这道算术题值得每个做 AI 应用的人停下来想一想:如果你在为"选哪个模型"纠结,而你的竞争对手在打磨 harness,谁会赢?
AVO 是什么:把"进化搜索"换成自主Agent
AVO 出身并不在游戏或推理基准,而在一个极其硬核的场景:GPU 内核优化。
传统上,内核调优靠进化搜索:预定义的变异算子随机改代码,跑基准,留优汰劣。AVO 的思路是把"变异"这一步换成一个自主 Agent——它自己决定看什么、改什么、测什么、提交什么。编译器、profiler、测试套件的输出是它的反馈信号。
效果:在 DGX B200 上,AVO 围绕注意力内核连续自主运行七天,探索了 500 多个优化方向,提交了 40 个内核版本,最终比 cuDNN 快至高 3.5%、比 FlashAttention-4 快至高 10.5%。之后让它把演化出的内核适配到 grouped-query attention,只用了约 30 分钟的额外自主工作。
这次 ARC-AGI-3 的尝试,NVIDIA 做的事更激进:换掉任务接口,Agent 本体不动。GPU 内核和 2D 交互游戏,反馈信号从编译器和 profiler 变成环境状态转移,但"假设-行动-观察-更新状态-继续"的循环完全一样。为了让对比纯粹,他们甚至没有用图像:观察输入是精确的 64×64 文本网格,零图像 token。
结果是同一个架构从编译器世界无缝迁移到了游戏世界。NVIDIA 的原话:可迁移的不是领域知识,而是维持长期自主进步的机器本身。
支撑这台机器的两个关键机制值得单独说:
持久记忆。内核代码、评估结果、profiler 输出、积累的推理全部落盘,Agent 每次从当前状态恢复,而不是每次从零重建搜索。ARC-AGI-3 上 183 个关卡共用了 6,624 次环境动作,比参照系统 VISTA 用 Claude Opus 5 完成同样关卡少约 12%——记忆减少了重复探索。
监督者(Supervisor)。一个独立组件盯着搜索轨迹的大方向,发现停滞或无效循环就干预、换策略。NVIDIA 副总裁 Adel El Hallack 的比喻是:它"几乎像一个 CEO,在 Agent 偏离方向、走进死胡同、或重复走老路时推它一把"。
30%不是孤例:harness效应的三份旁证
如果 AVO 只是个例,可以当趣闻看。但它恰好是最近一串证据里最响的一个:
OpenAI 自己的实验。上个月 OpenAI 发文承认,仅调整 harness 的两个设置,模型在 ARC-AGI-3 上的得分就翻了两倍。不到 10% 的起点,说明裸模型离这类任务的可用线有多远。
Databricks 的成本账。七月 Databricks 在数百万行代码库上做编码 Agent 基准,CEO Ali Ghodsi 的结论是:同一个模型配不同的 harness,成本可以差一倍。“你以为这是贵模型、那是便宜模型——等等,你用的哪个 harness?”
微软的长时程测试。四月的一份研究让 19 个 LLM 做跨多步的文档编辑,包括前沿模型在内全部错误百出。人类交出这种质量的工作会被开除,但模型没有 harness 帮它维持状态、校验、恢复,就只能交出这种质量的活。
三条证据指向同一件事:在长时程任务上,模型能力的转化率是由系统决定的。模型是马力的上限,harness 决定你能用上几成。这跟单轮问答的世界完全不同——单轮里模型分数基本就是全部,长时程里模型分数只是入场券。
基准榜变成了架构博览会
ARC-AGI-3 的榜单现在有一个耐人寻味的现象:排名靠前的条目,比的已经不是模型,而是 harness 哲学。
Tycho 走程序化世界模型路线,让 Agent 显式构建可执行的环境模型再规划;VISTA 走直接交互路线,用渲染画面或文本网格让模型像人一样试错;AVO 则是通用长时程架构,把在 GPU 内核上验证过的记忆-监督体系直接搬过来。三种哲学,同一个榜单。NVIDIA 在博文中也明确提醒:这些成绩不可直接比较,因为 Agent 后端、观察表示、记忆管理全都不同。
这意味着基准测试的性质变了。过去跑分比的是"哪个大脑更聪明",现在比的是"哪套神经系统更有效"。榜单名次里模型的贡献占比越来越模糊——这次 AVO 用的还是 Anthropic 的模型,跑分却记在 NVIDIA 头上。模型厂商的榜首话语权,正在被系统设计者分走。
更值得玩味的是 NVIDIA 的立场。卖模型的公司有动力让你相信模型决定一切;NVIDIA 不卖这个模型,它卖的是整栈——从 GPU 到运行时到安全框架(NeMo 体系)。它有全部动机告诉你"harness 才是胜负手"。立场不等于错误,但读这份研究时应当带着这层滤镜。
保持怀疑的两个理由
热情之外,有两点值得按住。
第一,满分只在公开集。 AVO 的 100.00 是 25 个环境公开集的成绩,NVIDIA 自己加了编辑注:不含半私有集和私有竞赛集。公开集可以被反复研究、针对性调整,而 harness 是最容易过拟合基准的层——它就在你手里,所有细节都能为榜单定制。Hume AI 前两天刚揭露了 ASR 领域的"benchmaxxing":多个榜单头部模型在音频已被破坏的情况下,仍能背出基准数据集的原文。语音识别尚且如此,参数空间大得多的 harness 更是如此。harness 分数的含金量,要看它在没见过的环境里的表现。
第二,跨模型结论仍然单薄。 满分成绩只用了 Claude Opus 5;GPT-5.6 Sol 只在子集上做了有限实验(墙钟时间更快 vs 动作数更少,呈现互补 profile)。“AVO 让任意模型都满分"和"AVO 让 Opus 5 满分"是两个强度完全不同的命题,目前证据只支持后者。
harness的"K8s时刻”
那么 harness 会成为新的护城河吗?我的判断是:会,但护城河期比大多数人预期的短。
回看基础设施史:早期每个团队手写部署脚本,脚本质量就是竞争力;然后 Kubernetes 出现,编排变成标准件,竞争力上移到了使用层。harness 正走在同样的路上——AVO 的记忆管理、supervisor、状态机,Cloudflare 分诊流水线里的四段式子代理,本质都是同一批模式的不同实现。今天需要顶级工程团队才能调出的东西,两三年后大概率是开源框架里的一个配置项。
真正沉淀下来的不是某个 harness,而是已经被验证的设计模式:单一职责的子 Agent、文件化的上下文交接、监督者与执行者的分离、以标签驱动状态机。这些模式的价值不随框架商品化而贬值——它们会变成 Agent 时代的"十二要素应用"。
所以对从业者,可操作的建议是三条:
- 别再把预算全押在模型选型上。给 harness 工程留出与模型采购同级的投入,长时程场景下这是回报率更高的杠杆;
- 评估体系要换对象:测你的 Agent,而不是测模型。同一个模型在你自己的任务管线里能跑到几分,才是有效数字;
- 盯住私有集成绩。公开榜上的 harness 分数参考价值有限,能在未见环境保持表现的架构才是真通用。
结语
从 30% 到 100%,模型一分未涨。这个结果用一个最直观的方式宣告:Agent 竞赛的主战场,正在从模型层移到系统层。
有意思的是,翻翻同一天的新闻,这个趋势早就弥漫开了:NVIDIA 的另一篇文章在给 Agent 安全栈分层,指出只有基础设施层才是权限的权威控制点;Cloudflare 用四段式子代理加状态机把开源项目 issue 砍掉 85%;Mistral 给 RAG 补上"检索后推理"的工具链。没有一家在谈模型参数,全部在谈系统设计。
模型决定 Agent 想做什么,系统决定 Agent 能做成什么。2026 年的 AI 竞争,正在从大脑的竞争变成神经系统的竞争。
参考