一条人类不会多想的指令
「在这个模块上迭代两小时,然后停下来给我看结果。」
对一个人类工程师,这句话没有任何歧义:看一眼时钟,合理切分工作,时间到了收尾汇报。这是软件协作里最平凡的约束之一——比「重构这个服务」简单得多,比「修复这个竞态条件」简单得多。
但对今天的编码 Agent,这句话接近天书。两位 MATS 项目研究者 Ofengenden 和 Andriushchenko 上周发布的一项实测给出了量化答案:让 Claude Code 和 Codex 在执行 200 个 ProgramBench 任务(外加 18 个自建基准)前后估计耗时,两个系统都系统性高估——Claude 平均偏 3 倍,Codex 偏 6 到 10 倍。在 ProgramBench 上,无论任务难度如何,两家的估计都聚集在「90 分钟」附近——那不是感知,那是训练语料里的锚定值,是模型从人类博客和 issue 讨论中背下来的「一个编程任务大概多久」。
更微妙的是任务结束后的回顾:让 Agent 报告「刚才干了多久」,同样错得离谱。也就是说,这不只是预测能力差——它对自己刚刚经历的过程,也没有时间维度的记忆。
而自评质量同样虚高 20 个百分点:Opus 4.8 和 GPT-5.5 在彻底失败的任务上给自己打出 70% 的完成度,实际得分是 7% 和 14.5%。
问题不在模型笨,在于它活在一个没有时间的世界
看到这些数据,第一反应容易归结为「模型不够聪明」。但实验里有个细节推翻了这个直觉:当研究者给 Agent 一个能读取已耗时间的时钟工具后,它的判断几乎全对。
一块表就解决了。这说明缺失的不是推理能力,而是感知通道。
往架构层面看,原因很直白:Transformer 的世界里没有物理时间。一次推理调用和一次思考,在 token 流里只是序列位置;两步工具调用之间隔了 3 秒还是 3 小时,模型无从知晓,上下文里也没有任何 token 编码这件事。模型对「时间」的全部概念来自训练语料中的文字——「这个任务大概要两小时」「我花了三天调通」——它是从人类叙述里学来的关于时间的知识,而不是对时间流逝的体验。
这个区分不是哲学摆设。知识可以回答「马拉松一般跑多久」,只有体验才能回答「我现在跑了多久」。前者是检索,后者是感知。今天所有基于 LLM 的 Agent,在时间维度上都是「只读过旅行指南、但从没出过门」的状态——而这恰恰不影响它们在绝大多数 benchmark 上拿高分,因为 benchmark 从不考这个。
同一个模型,两套躯壳,两种性格
这项研究里最值得行业咀嚼的发现,或许不是时间估计本身,而是这个:同一个底层模型,在不同 harness 里行为截然不同。
在 Claude Code 里,模型会一直工作到自认为完成,中位耗时约 90 分钟;在 Codex 里,同一个模型大约 30 分钟就停,几乎与任务无关。Claude Code 里的平均执行步数是 Codex 的 2.5 倍。
一个「坚持不懈」,一个「适可而止」——但这不是模型的性格,是 harness 的性格。停止条件怎么设、上下文怎么裁剪、系统提示怎么措辞,这些工程决策塑造了你在终端里看到的「Agent 的工作风格」。用户以为自己选的是 Claude 还是 GPT,实际上更大的差异来自包裹模型的那一层软件。
这呼应了今年行业的一个共识性转向:harness 的权重正在超过模型本身。模型在商品化,各家前沿模型的原始能力差距在收窄;真正拉开体验差距的,是编排层——工具面的设计、上下文管理策略、停止条件、预算控制。此前 DeepSeek 和 YC 同时押注 harness 层创业,逻辑是同一个。这项研究只是给这个趋势补了一个干净的实证:换壳等效于换性格。
能力曲线与可控性曲线的剪刀差
把这项研究放到 METR 的时间序列里看,事情变得更有意思。
METR 从 2025 年起持续测量「Agent 能以 50% 可靠性完成的任务长度」:人类专家 4 分钟内能完成的任务,模型成功率接近 100%;超过 4 小时的任务,成功率低于 10%。这条能力时程曲线过去六年在指数增长,翻倍周期约 7 个月,在 SWE-bench Verified 上甚至不到 3 个月。照此外推,几年内 Agent 将能独立完成以「天」和「周」计的项目。
但 MATS 这项研究暴露的是另一条曲线:控制时程——你能否让 Agent 按指定的时间预算工作?「能干 4 小时的活」和「能精确地干 4 小时然后停」是两种能力,前者是产能,后者是可控性。前者在指数增长,后者目前连可靠的测量都刚刚开始。
剪刀差就在这里张开。Agent 越能干长活,时间预算、成本预算、迭代深度的约束就越重要——因为无人值守的前提是可控。今天日报里的另一条新闻是现成的注脚:亚马逊开源的 Kiro Crew 让多个编码 Agent 跨会话异步干活、定时任务、无人值守运行,内部已有 3.9 万开发者使用。但一个连「自己干了多久」都无法感知的系统,怎么理解「凌晨两点到五点的维护窗口」?怎么执行「每个 PR 最多花 40 分钟」的团队规范?Async Agent 的产品愿景,天然把时间感知从锦上添花变成硬依赖。
顺带一提,Anthropic 上周刚宣布 Claude Code 限额「上调」实为缩水 17%,本质是推理算力供给跟不上 Agent 的消耗。当 token 变成预算约束,Agent 对自身消耗的感知精度就直接等于成本控制的精度——时间感知只是这个更大问题里最容易被测量的切面。
工程启示:把表发下去,但别止步于表
这项研究给从业者的启示可以分成三层。
**第一层,立即能做的:外挂时钟。**研究者已经验证,给 Agent 一个读取真实耗时的工具,时间判断几乎全对。如果你在构建需要时间约束的 Agent 工作流——「最多花 30 分钟」「每小时检查一次」——不要指望模型自己心里有数,把时间戳喂进上下文,或者干脆由外部控制器负责计时和打断。这一层的教训和「规则不是记忆」是同构的:凡是关键约束,都要从模型的心理素质变成系统的硬边界。
**第二层,评测范式的迁移:从「能不能」到「能不能按约束」。**现有 benchmark 几乎全部度量任务完成率,没有任何一项主流评测考察预算遵从度。当 Agent 进入生产环境,「超时 10 倍地完成了任务」和「没完成任务」在账单上是同一种失败。可以预期下一波评测会出现「约束遵从」维度:给定时间/成本/步数预算,度量完成质量与预算偏离的联合分布。谁先把这个做进 CI,谁就先有可信的 Agent 验收标准。
**第三层,也是最难的一层:元认知。**时间感知只是 Agent 元认知缺失的一个切面——它不知道自己干了多久,不知道自己干得好不好(自评虚高 20 分),也不知道自己不知道什么。这三件事共享同一个根源:Agent 对自身执行过程没有独立的观察通道,它只有上下文里的自述。给时钟能修时间感知,但「准确的自我评估」没有等价的一行代码补丁,可能需要架构级的改变——比如独立的评估器模型、过程数据的显式记录与回放。这会是 harness 层下一波创新的富矿。
结语:智能的下一个边界是自我知识
行业习惯用「能不能完成更难的任务」度量智能的进步,METR 的时程曲线是这条逻辑的巅峰表达。但 MATS 这项研究提醒我们注意另一条被忽视的轴线:智能体对自身的知识。一个能在 4 小时任务上超越多数工程师、却不能估计自己刚花了几分钟、还会给 7 分的答卷自评 70 分的系统,「聪明」和「自知」之间的落差大得反常。
人类工程师的价值里有一大块恰恰来自后者:知道什么时候该停、知道自己哪部分没把握、知道这条坑自己已经踩了多久。Agent 要真正接手长时程工作,光把能力曲线延长是不够的——它还得长出自己的表、自己的仪表盘、以及对自己局限的诚实。
好消息是,第一步只需要一块表。坏消息是,剩下的每一步都躲在表盘后面。
数据来源:Ofengenden & Andriushchenko, “Your Agents Are Not Time-Aware”(LessWrong, 2026-08);METR, “Measuring AI Ability to Complete Long Tasks”(2025-03)及时间时程数据页。