3.1比1:当递归自我改进第一次有了运营账本
9月的第一个周末,OpenAI 干了一件前沿实验室从没干过的事:把自家研发流水线拆开给公众看。三份文档几乎同时发布——一份RSI透明度报告、首席科学家 Jakub Pachocki 的长文《An Alien Mind》、以及一套内部编码Agent监控系统的详细披露。三份文档指向同一个结论:OpenAI 宣布去年秋天设定的「9月前拥有自动化研究实习生」目标已按内部口径达成,正朝2028年3月的「自动化研究员」推进。 比起结论,更有信息量的是那份账本本身。这是前沿实验室第一次用运营指标——而非基准测试跑分——来丈量递归自我改进(RSI)的进度。而账本里至少藏着三条暗线,比头条结论值得深读得多。 一份数字异常诚实的账本 先看核心数字: 到8月中旬,OpenAI 研究部门的 Agent 总运行时长达到每1个人类工作日对应3.1个Agent工作日。今年6月之前,这个比值还小于1。 按 API 价格折算,中位研究员每天消耗超过600美元的推理费用,90分位用户超过7000美元/天。研究员群体全天并发使用编码 Agent,用量增速超过公司其他所有团队。 人均实验数在2026年8月创下2025年1月有追踪以来的新高。报告坦承这与 Codex 采纳率相关,但可用算力同期也大幅增长——两个变量没有剥离。 从1月到7月,各难度档位的任务成功率普遍上升;但过去6个月里,成功完成的4-8小时任务中,超过一半需要人类至少介入一次。 研究者求助人工技术支持的内部频道流量持续下滑,一个团队的答疑 office hours 干脆停办——Agent 吃掉了整个排障队列。 这份报告的诚实程度超出行业惯例。它主动标注「指标改善不等于研究进度同步加速」,承认「最不易自动化的环节会占据越来越大的精力份额、成为新瓶颈」,甚至给出了「Agent工作日」这种外人可以复算的口径。在惯于营销式披露的前沿实验室里,这近乎异类。 「实习生」的成色:干预率才是真正的进度条 「自动化研究实习生」的定义值得逐字看:在人类指导下,完成熟练研究者需要数天才能完成的、定义明确的研究任务。 拆开看,三个限定词一个都不能少:「人类指导」「定义明确」「数天级」。对照 Epoch AI 那套被 OpenAI 直接引用的研发生命周期分类法(Decide / Design / Build / Run / Analyze / Communicate),Agent 的 token 消耗集中在 Build 和 Analyze——写代码、跑实验、排障。而 Decide(决定做什么、往哪投算力)在 Agent 产出中始终占比极小。真正的「研究员」要占住的是 Decide 和 Design,那才是2028年3月目标的硬骨头。 所以这份账本里最诚实的指标不是任何吞吐量,而是干预率:4-8小时任务一半以上需要人类出手纠偏。这个数字定义了当前自动化在自主性曲线上的真实位置——一个干活很快、但离不开师傅带的实习生。反过来说,当干预率开始显著下降、且下降发生在更长时程的任务档位上,那才是 RSI 进度条真正开始走的时刻。营销里程碑会撒谎,干预率不会。 这也是普通团队可以直接借用的观测框架:与其争论「我们离全自动还有多远」,不如建立自己的干预率台账——按任务时程分桶,记录成功率和人类介入次数。这个口径今天还只是内部管理工具,但 OpenAI 已经把它升格为对外承诺;可以预期,未来两年「Agent 产出度量」会从实验室的自愿披露,变成融资尽调和政府采购的必填项。 暗线二:算力是流体,安全限制产生的是「改道」而非「减速」 账本里最容易被忽略、但政策含义最重的段落,是 Astra 事件后的算力流向数据。 ...