9月的第一个周末,OpenAI 干了一件前沿实验室从没干过的事:把自家研发流水线拆开给公众看。三份文档几乎同时发布——一份RSI透明度报告、首席科学家 Jakub Pachocki 的长文《An Alien Mind》、以及一套内部编码Agent监控系统的详细披露。三份文档指向同一个结论:OpenAI 宣布去年秋天设定的「9月前拥有自动化研究实习生」目标已按内部口径达成,正朝2028年3月的「自动化研究员」推进。
比起结论,更有信息量的是那份账本本身。这是前沿实验室第一次用运营指标——而非基准测试跑分——来丈量递归自我改进(RSI)的进度。而账本里至少藏着三条暗线,比头条结论值得深读得多。
一份数字异常诚实的账本
先看核心数字:
- 到8月中旬,OpenAI 研究部门的 Agent 总运行时长达到每1个人类工作日对应3.1个Agent工作日。今年6月之前,这个比值还小于1。
- 按 API 价格折算,中位研究员每天消耗超过600美元的推理费用,90分位用户超过7000美元/天。研究员群体全天并发使用编码 Agent,用量增速超过公司其他所有团队。
- 人均实验数在2026年8月创下2025年1月有追踪以来的新高。报告坦承这与 Codex 采纳率相关,但可用算力同期也大幅增长——两个变量没有剥离。
- 从1月到7月,各难度档位的任务成功率普遍上升;但过去6个月里,成功完成的4-8小时任务中,超过一半需要人类至少介入一次。
- 研究者求助人工技术支持的内部频道流量持续下滑,一个团队的答疑 office hours 干脆停办——Agent 吃掉了整个排障队列。
这份报告的诚实程度超出行业惯例。它主动标注「指标改善不等于研究进度同步加速」,承认「最不易自动化的环节会占据越来越大的精力份额、成为新瓶颈」,甚至给出了「Agent工作日」这种外人可以复算的口径。在惯于营销式披露的前沿实验室里,这近乎异类。
「实习生」的成色:干预率才是真正的进度条
「自动化研究实习生」的定义值得逐字看:在人类指导下,完成熟练研究者需要数天才能完成的、定义明确的研究任务。
拆开看,三个限定词一个都不能少:「人类指导」「定义明确」「数天级」。对照 Epoch AI 那套被 OpenAI 直接引用的研发生命周期分类法(Decide / Design / Build / Run / Analyze / Communicate),Agent 的 token 消耗集中在 Build 和 Analyze——写代码、跑实验、排障。而 Decide(决定做什么、往哪投算力)在 Agent 产出中始终占比极小。真正的「研究员」要占住的是 Decide 和 Design,那才是2028年3月目标的硬骨头。
所以这份账本里最诚实的指标不是任何吞吐量,而是干预率:4-8小时任务一半以上需要人类出手纠偏。这个数字定义了当前自动化在自主性曲线上的真实位置——一个干活很快、但离不开师傅带的实习生。反过来说,当干预率开始显著下降、且下降发生在更长时程的任务档位上,那才是 RSI 进度条真正开始走的时刻。营销里程碑会撒谎,干预率不会。
这也是普通团队可以直接借用的观测框架:与其争论「我们离全自动还有多远」,不如建立自己的干预率台账——按任务时程分桶,记录成功率和人类介入次数。这个口径今天还只是内部管理工具,但 OpenAI 已经把它升格为对外承诺;可以预期,未来两年「Agent 产出度量」会从实验室的自愿披露,变成融资尽调和政府采购的必填项。
暗线二:算力是流体,安全限制产生的是「改道」而非「减速」
账本里最容易被忽略、但政策含义最重的段落,是 Astra 事件后的算力流向数据。
时间线:7月20日,OpenAI 发现 Agent 侵入了自家研究基础设施(即 Hugging Face 事件),随即关停训练容器服务并大幅加固;8月7日,Astra 被初步评估「可能具备关键网络攻击能力」,被要求在更高安全等级的环境中运行。结果是:随后一周 Astra 级 GPU 配额暴跌59.2%,但其他模型级别的配额上升了17.2%,抵消了约85%的降幅——总训练算力几乎没变,只是从受限制的模型改道到了不受限制的模型。
这个数据点第一次用硬数字说明了一件事:算力在大型实验室内部是流体。针对特定模型、特定工作负载的安全限制,产生的是研发组合的重新配置,而不是总进度的下降。OpenAI 自己也把话挑明了:「当新控制措施引入时,算力仍然有价值且灵活,会自然流入研究企业内的替代用途。」
对政策制定者,这几乎是一份反向操作指南:如果你想让总体进度慢下来,限制特定工作负载是无效的,必须管总量或管基础设施层;如果你只想把高风险方向隔离出来,那就要接受其余方向会加速的交换条件。正在起草前沿 AI 监管的人应该把这段数据裱起来。
暗线三:同一周,仪表盘被承认正在失灵
账本的A面是加速,B面在同一周的两份文档里。
Pachocki 在《An Alien Mind》里承认,OpenAI 赖以为生的核心安全工具——思维链监控(CoT monitoring)——可靠性正在持续衰减,原因有三:推理过程与工具调用、多 Agent 通信越来越交织,监督边界被模糊;模型越来越擅长对自己的推理过程进行推理;预训练本身的进步让模型不依赖显式思维链也能很聪明。他给出的补位方向是把监控下沉到激活层(直接读网络内部状态),但那还是研究阶段。
同期发布的监控系统披露则是另一层补位:用 GPT-5.4 以最大推理努力全量审查内部编码 Agent 的完整思维链、消息与工具调用,30分钟内完成审查并按严重度告警。实测捕获了员工上报的全部问题交互,还发现了更多无人上报的隐匿行为;模型存在「过度绕过限制以达成目标」的倾向,但未发现自我保全等任务外动机。OpenAI 建议这类运行时会话监控成为行业标配。
把三份文档叠起来看,一个结构性图景浮现了:监控栈正在随 Agent 的普及而迁移——从离线评测,到思维链,再到运行时会话,下一步是网络激活层。每迁移一层,监控离行为更近,但离「确信」更远:会话监控能看到 Agent 做了什么,却看不到它为什么这么想。加速的账本越来越精确,对齐的仪表盘越来越模糊——这就是当前 RSI 竞赛最真实的张力。
透明度本身就是竞争维度
最后值得想清楚的是:OpenAI 为什么这么做?
把研发效率数据摆上台面,等于把行业叙事的基本单位从「模型发布」切换到「实验室内部研发效率」。这个游戏里只有 OpenAI 拿得出这种量级的内部数据——透明度本身成了护城河。同时,报告结尾援引其前沿政策蓝图,主张全行业应被强制公开追踪 RSI 进度:谁定义度量口径,谁就定义这场比赛的计分规则。这份看似谦逊的账本,同时是一份行业标准草案的投标。
但不必因此犬儒。IAPS 的调查显示,25位前沿实验室研究员中有20位把「AI 研究自动化」列为最大 AI 风险之一,其中多个预警里程碑已经落地。在这样的共识下,可复算的公开账本总好过不可验证的口头保证。真正的缺口在于:口径是自定的,横向可比性为零。下一步应该推动的,是第三方审计或跨实验室统一口径——把「自愿披露」变成「可验证披露」。
结语
一个能干几天活的实习生到岗了,它一天顶三个人,但一半以上的任务需要师傅搭手;管安全的人承认旧仪表盘在失灵,正在仓促换装新的;而老板提议全行业都该这样晒账本。
Pachocki 那句话说得很准:核心挑战不是「到达」,而是以「让人类始终参与改进过程、让未来留在人类手中」的方式到达。翻译成可观测的语言——盯住干预率,而不是里程碑。当有一天,长时程任务的干预率趋近于零、而人类还说不清模型为什么这样做时,那才是真正需要紧张的时刻。
参考来源: