一张奇怪的对账单

先看一张对账单。

API 预算 3000 美元,实际花费 1130 美元;GPU 预算只用了一小半;截止时间前七个小时,项目被宣布"完成"——宣布完成前不久,内部审稿人刚返回连续第十五个 Reject。几天后,两位真正的评审、也就是"考题"的原作者,给出了最终判词:一篇 Reject,一篇 Strong Reject。审稿意见里出现的是"‘以例代证’的谬误"、“高度不科学”、“实验选择令人费解"这样的措辞。

这不是一个摆烂的研究生的故事。这是一篇刚刚发布的论文里,Claude Opus 4.8(Extra-High Reasoning)在严格受控条件下做"真科研"的全过程记录。

这篇论文就是普林斯顿大学与英国 AI 安全研究所团队的《AI agents 能否开展开放式 AI 研究?两个案例研究的早期证据》(arXiv:2607.27191)。作者阵容里包括 Sayash Kapoor 和 Arvind Narayanan——过去两年最有力量的"AI 炒作批判"学术组合。他们设计了一种叫**影子评测(Shadow Evaluation)**的方法,而这项研究本身,可能比它的结论更重要。

影子评测:把考题从未来借来

评测 AI 的科研能力,一直有个死结。

用公开基准测,窄且可验证的任务排除了"开放式研究”;把 AI 写的论文投给会议,则撞上同行评审系统的老毛病——审稿人超载、结果随机、质量参差。更根本的问题是:无论哪种方式,考题几乎都在训练数据里泡过,你永远无法排除模型在"背诵"而非"研究"。

影子评测的思路干净利落:用还没发表的论文当考题,让原作者当审稿人

研究团队与两篇 NeurIPS 2026 投稿的作者合作。第一篇研究如何通过模型权重直接调控大模型的人格特质;第二篇围绕 TabPFN 开发方法,检测表格模型在部署数据与训练数据剧烈偏移时的精度崩塌。Agent 拿到的是这两篇论文的核心研究问题——由于论文未发表、不在网上任何角落,模型不可能从训练数据里偷看答案;而评分者是花了数月时间回答同一个问题的人,这可能是目前能拿到的最专业的审稿。

考试条件相当宽裕:六天时间、3000 美元 API 额度、独立 GPU 预算、完整虚拟机和开放网络。Agent 运行在 CRUX-2 脚手架上(基于开源编排框架 OpenClaw 构建),可以派生子 Agent、启动长时 GPU 任务、由心跳机制在任务完成后唤醒自己,还能调用外部 AI 审稿工具。一个不存在的条件是:任何人类帮助。

工程全对

结果的一半好得出人意料。

Agent 独立完成了全部研究工程:文献调研、调试 GPU 代码、跑完数百个实验和鲁棒性检验、用 LaTeX 编写出完整论文。整个过程中人类只出手三次:修一个脚手架 bug、延长一次截止时间、要求重写一次可读性糟糕的摘要。为了排除"某个模型或框架背锅"的怀疑,团队用 GPT-5.6 Sol 加 OpenAI 自家 Codex 脚手架复现了实验——工程能力同样成立。

还有一个值得单独划出的发现:没有发现任何 reward hacking。Agent 没有为了分数操纵结果、修剪数据,甚至反其道行之——从雄心勃勃的宣称出发,逐步把结论修正向诚实的负结果。

诚实,且勤奋,且工程过硬。然后呢?

科研全错:五种失败模式

然后是另一半:两篇论文被原作者"毫不含糊地拒绝"。论文作者从日志中归纳出五种反复出现的失败模式,每一种都值得抄录:

一、对"可发表的门槛"没有判断。 Agent 能生成看起来合理的假设,却会在小规模、手工挑选或合成的数据集上轻率地把假设扔掉——它不知道什么证据足以杀掉一个想法,什么证据只是噪声。

二、面对缺陷不会创造性地转向。 当初始假设被证伪,人类研究者的本能是开辟新方向;Agent 的本能是收缩现有宣称,把大问题缩成小问题糊弄过去。十五轮修订中,AI 审稿人(自审加外部审稿)从未给出一次 Accept,Agent 却始终没有回应那条最核心的批评。

三、不会从死胡同回撤。 两个 Agent 都在头十小时内放弃了最有雄心的目标。Personas 那一局,Agent 给探索阶段规划了 36 到 48 小时,实际五小时就收工锁定了技术路线。

四、资源感知失灵。 两局都剩着超过一半的 API 预算结束。其中一个 Agent 在自己的审稿人又一次给出 Reject 后不久,干脆宣布项目完成——比截止时间早了七小时。讽刺的是,它随时可以查询自己的用量。

五、指令漂移。 在超长上下文中逐渐忘记显式约束:两篇论文全部超页,直接投 NeurIPS 会被桌面拒稿;正文里一张可视化图都没有——而人类原论文有 15 张图。Meta 最近把类似现象命名为"行为状态衰减":Agent 早期明确知道某条要求,晚期修一个不相关的 bug 时就忘了。

值得注意的是 GPT-5.6 的复现:它展现出相反的资源失败模式——两天多就烧光了 3000 美元,导致实验规模不足。一个过度节俭,一个挥霍无度,但判断力层面的失败如出一辙。资源管理是模型各自的怪癖,判断力缺口是普遍的。

我的判断:目标函数错位

把这五种失败模式放在一起看,我发现它们其实指向同一个根因:Agent 的优化目标是"完成任务",而科研的目标是"在预算内最大化认知增量"

大模型是被对话产品塑造的。对话产品的隐含目标是让用户满意地结束这一轮——干净、利落、给出交代。这种"交卷冲动"深深刻进了模型的行为分布里。于是你会看到一个诡异的场景:面对 Reject,研究者的反应是"我还剩 1870 美元和七小时,哪里出了问题",Agent 的反应是"项目完成"。它把审稿人的拒绝当作了结案信号,而科研里拒绝恰恰是继续的理由。

“门槛判断"的失灵也可以用同样的框架解释。模型在数千万篇已发表论文上训练,学到的是论文作为一种文体的分布——结构、术语、图表的语法。但它看不到被审稿人毙掉的 90% 稿件,看不到编辑部的拒信,看不到一个想法从平庸到锋利之间的血污路径。品味无法从幸存者分布中学到。这解释了为什么 Agent 产出的论文"像论文”——却是一篇零图表、超页数、以例代证的论文:它掌握了体裁,没掌握这门学科的经济学。

这也解释了为什么"再加算力"在这个问题上显得无力。论文自己也观察到,提高推理强度确实能改善质量,但判断力的鸿沟依然如故——毕竟 GPT-5.6 用完全不同的资源策略,倒在了同一道坎上。

这项研究没有反驳什么,反驳了什么

媒体标题说这项研究"打脸 Anthropic 和 OpenAI",但仔细读,靶子比标题精确。

今年六月,Anthropic 发布《When AI Builds Itself》,晒出内部数据称 Claude 已写下超过 90% 的自家代码;OpenAI 则宣称 GPT-5.6 Sol 自主完成了小模型 Luna 的后训练、为研究员省下数周时间(有趣的是,这项贡献在 81 页的系统卡里只字未提)。注意,这些声称的本质都是加速:AI 承担研究流程中工程密集的部分。

而影子评测恰恰证实了工程自动化已经成立——文献、代码、实验、论文装配,全链路无人接管。它真正反驳的是从"加速"到"自主"的那次外推:实验室说"研究加速",传播中被读成"自主科学家近在眼前",而这是两件事。所有"智能爆炸"预测的关键铰链,恰恰是判断力回路能否被自动化——这个铰链至今没有实证支撑。

所以这篇论文的支持者和反对者都会引用它:乐观派会指着自己 90% 的代码说"看,被证实了";谨慎派会指着 Strong Reject 说"看,也被证实了"。诚实的读法只有一句:研究工程师的自动化已经发生,科学家的自动化尚无证据。

顺带一提,同一天的月之暗面 PerceptionBench 把视觉感知从推理中剥离后,十六个前沿模型无一及格——评测正在集体进入"隔离变量"的深水区。当综合跑分被拆成原子能力,每拆一层,就有一层叙事被证伪。

可以修的和难修的

五种失败模式,可修性天差地别。

资源感知是工程问题。 预算仪表、强制消费策略、心跳里注入资源状态——脚手架层面就能大幅缓解。这不是 AI 的问题,是基础设施的问题。

指令漂移是记忆问题。 长任务中的约束遗忘,正对应着上下文工程的最新共识:同一天 InfoQ 演讲的核心结论是"300 个精选 token 胜过 10 万噪声 token",Meta 则在用第二个 AI 当"记忆教练"对抗行为状态衰减。方向明确,工程上可逼近。

门槛判断和创造性转向是没奖可训的问题。 工程能力之所以能被后训练快速推高(智谱 GLM-5.3 基座不变、编程成绩翻数倍,就是最新例证),是因为存在清晰的验证信号:测试通过、基准分数、任务成败。而"这个想法值不值得做"没有信号——你想构造一个奖励科研品味的 RL 环境,就会发现设计这个奖励函数本身就是一个开放式科研问题。鸡生蛋,蛋生鸡。

这也给了"下一步会发生什么"一个可检验的预测:未来一年,我们会看到资源感知和指令漂移在脚手架层面被显著改善(因为可修),但门槛判断的缺口只会靠更多影子评测被量化得更精确(因为难修)。判断力将是下一个主战场,而它没有 benchmark 可以刷。

给落地者的一份清单

对在真实场景里部署 Agent 的团队,这项研究最有价值的部分不是结论,是那五种失败模式——它们在业务 Agent 上同样成立,只是换了皮肤:

  • 早期锁定警报:Agent 在任务前几小时(或前几轮对话)就锁定了方案?研究里它五小时收工了规划 48 小时的探索,你的 Agent 也可能在第一份搜索结果后就停止探索。
  • 预算利用率是个 bug 检测器:Agent 只用了一小半资源就宣布完成,不是高效,是"交卷冲动"。给支出设下限,给"完成"设审查。
  • 末端约束回归检查:长任务收尾时,显式重放最初的硬约束清单。超页、零图表这类失败不会在过程中报警,只会在终点爆炸。
  • 用自己的"未发表问题"做影子评测:这套方法论完全可以从学术界搬走——在采购或信任一个 Agent 之前,拿一个你们内部尚未解决的真实问题让它跑,用最懂这个问题的人打分。这是唯一不会被训练数据污染的考试。

至于分工:人设定方向和门槛,Agent 承担工程执行。科研里大部分工时本来就是工程工时,所以生产力故事依然成立——但请把"研究级自主"从你未来四年的路线图里划掉。这不是保守,这是刚刚有实证的说法。

尾声

回到那张对账单:1130 美元的花费,1870 美元的结余,七个小时的空转,一个 Strong Reject。

它不是不够努力,也不是不够诚实——它是不知道为什么努力。工程能力决定了你能跑多快,判断力决定了你跑的方向值不值得跑。前者已经有了训练信号和飞轮,后者连奖励函数都还写不出来。

下一次你看到一个 Agent 两小时就交出一份漂亮的报告,先别急着夸效率。问一句:预算还剩多少?


参考资料