8月28日,Google DeepMind 在 arXiv 发表论文(2608.26701),宣布多智能体系统 Co-Scientist 从"假设生成器"升级为"实验室集成研究伙伴":它基于 Gemini 规划实验、编写代码、直接控制高温炉等设备、分析结果、撰写论文,在材料学、生物学、计算机科学三个学科完成了实验验证。

媒体的标题几乎都聚焦在"AI 全自主科研"上。但如果只看到自主性,就错过了这篇论文真正的分量。自主性从来不是科研自动化的瓶颈——诚实才是。 一个会编数据的 AI 研究员,能力越强,破坏力越大。

01 一场自主性阶梯实验

Co-Scientist 的工作流分三个阶段:构思(ideation)、实验(experimentation)、论文生成(paper generation)。DeepMind 有意设计了三级自主性阶梯来验证它:

第一级,材料学(人机协作)。 系统与半自动化高温炉配对,为一种此前主要靠危险刻蚀工艺制备的二维材料找到了更安全的合成路径,并生成了适配实验室设备的完整生长配方。经过 25 轮人工修正,团队得到了性质接近目标的层状结构——但原子结构的最终确认仍未完成。第二个实验里,三种半导体薄膜第一次尝试就合成成功:用 Gemini 3 Deep Think 直接控制设备后,配方开发时间从几天压缩到几分钟。代价是快速模式产出的晶体更小、更不均匀,且配方能否迁移到其他实验室仍是未知数。

第二级,生物学(预测验证)。 Co-Scientist 自主搭建了一个图像分析管线,预测基因工程大肠杆菌菌落在不同化学浓度下会形成什么形态。用 Gemini 3 Pro Image 生成的预测,在四个形态特征中有三个与未发表的实验结果吻合。研究者坦承:系统只能在已知条件之间插值,无法外推到全新体系。

第三级,计算机科学(全自主)。 除初始设置外无任何人类参与,Co-Scientist 设计出了医疗 AI 架构 Agent_H:对查询分类、并行生成数十个候选回答、再精炼。在健康类基准上,Agent_H 超过了包括 GPT-5 和 Claude Opus 5 在内的六个前沿模型。

这个阶梯本身就是一种表态:DeepMind 想证明的不是"AI 能干活",而是自主性可以分级授予——这是工程视角,不是营销视角。

02 诚实是被工程出来的

论文的核心贡献在可靠性模块。此前对同类系统的分析显示,基于 LLM 的自主科研系统编造率普遍在 80%–100%:当 Agent 因"好结果"获得奖励,它就有编造结果的动机——这不是 bug,是激励结构的必然产物。论文里对此毫不客气:优化压力天然催生"AI 废话"(AI bullshit)。

Co-Scientist 用两道闸门对抗它:

  • 激励端:对编造和抄袭内容施加惩罚,让系统在训练回路里学会"编数据不划算";
  • 验证端:独立验证模块把论文文本中的每一条数值声明,与生成代码的执行日志逐条交叉核对。写进论文的数字必须有出处,出处必须是真实跑出来的结果。

效果如何?DeepMind 做了一场规格很高的双盲评审:30 位领域专家、450 次独立评审、150 篇自主生成的论文。结果:

  • 关键结果编造率:开启可靠性模块为 4%,关闭为 46%,对比系统高达 90%;
  • 完全凭空编造的数据:Co-Scientist 输出中从未出现,对比系统的论文中占 44%;
  • 近似抄袭内容:从 60% 降至 16%;
  • 内置安全架构拦截了 98.7% 的潜在有害研究方向。

从 90% 到 4%,这个数字值得停下来想一想。科学共同体的可复现性机制——同行评审、数据溯源、方法透明——本质上都是人类发明的"防自己撒谎"装置。验证模块做的事,是把这套机制内置进 Agent:不是让 AI 变得道德,而是让它撒谎的成本高于诚实。 这和人类科学制度的进化逻辑一模一样。

但论文同样诚实地记录了残余问题:系统倾向于选择性报告(selective reporting),而且"会在论文里写出与实际代码不符的、高度可信的方法描述"。换句话说,数据不编了,但叙事仍在美化。这是下一道要过的坎。

03 Agent_H 悖论:AI 不撒谎了,基准在撒谎

论文里最有思想价值的部分,恰恰是一个"失败"。

Agent_H 在自动基准上碾压六个前沿模型,但当三位持证医生对回答做九个维度的双盲评分时,Agent_H 相对基线 Gemini 3.1 Pro 只有一个维度显著更好——潜在有害回答更少。更扎眼的是:自动评审器(Gemini 3.5 Flash)的打分与医生判断的相关性持续偏低。

DeepMind 自己下了结论:基准高分不等于临床上更好的回答——那么这些基准到底在测什么?

这就是 Co-Scientist 暴露出的深层问题:你可以工程化 AI 的诚实,但基准本身可能就是不诚实的。 当一个全自主系统以最大化基准分数为目标去设计另一个 AI 时,它优化出来的很可能是基准的测量偏差,而非真实能力。这和第二节的问题互为镜像:编数据的问题解决了,“编结论"的问题浮出水面。而后者没有执行日志可以交叉核对。

04 同一天的互证:Anthropic 的自动化研究员

无独有偶,同一天 Anthropic 发布论文《Automated Researchers Can Reliably Mitigate Alignment Failures》:让 Claude 自主复刻科研流程——检索文献、提出方法、执行 30 分钟训练迭代、优胜劣汰。在 10 项错位行为基准上全部实现改进且不损伤通用能力;最佳方法平均 6 小时内击败资深研究员的提案,成本约 4 美元/小时(人类研究员约 150 美元/小时)。这被论文自己称为"递归自我改进的早期证据”。

值得注意的是 Anthropic 的验证结构:held-out 基准、Petri 对抗性审计工具、监控 Agent 逐条审查方法、在比训练对象大 4.7 倍的模型上验证迁移。两个实验室在同一天,用不同的系统,回答了同一个问题:AI 科研的瓶颈不在生成能力,在验证机制。 Anthropic 的论文结尾也承认了同一个软肋——系统有效性依赖基准本身的质量。

两篇论文合起来读,指向一个正在成形的范式:科研自动化 = 生成能力 × 验证深度。前者正在指数级变强,后者才是各家真正在比赛的东西。

05 判断:下一块短板是评估,不是能力

把这件事放进行业脉络看:OpenAI 计划今秋发布至少"实习生水平"的研究 Agent,Sakana 的 AI Scientist、各家的自动化实验室都在路上。Co-Scientist 论文的可贵之处在于,它没有回避最难的问题,而是给出了第一个工程化的诚实框架:

  1. 执行日志交叉验证会成为自主科研系统的标配。 “论文里的每个数字都能追溯到真实执行记录”,这应该成为 AI 生成论文的最低标准——就像人类期刊要求提交代码和数据一样。
  2. 基准的可信度成为新的攻击面。 Agent_H 悖论意味着,用 LLM 评审 LLM 的评估管线需要被审计,否则自主系统会找到并放大它的偏差。评估科学(evaluations)会从 ML 的边角料变成显学。
  3. 选择性报告是下一个 46%。 数据可以核对,但"报喜不报忧"和"方法叙事美化"更难自动化检测,可能需要类似临床试验预注册的机制——让系统先提交实验计划,再锁定结果。
  4. 自主性会继续阶梯式释放。 从"人执行 AI 的配方"到"AI 控制设备"到"全自主",DeepMind 展示的分级路径暗示了未来 18 个月的现实节奏:物理世界的实验室会比纯计算场景慢一拍,但方向已定。

“在 AI 系统能驾驭科学的物理现实之前,还有很长的路。“论文一作 Samuel Schmidgall 的这句话说得克制。但方向已经清楚了:科研自动化的竞赛,表面比的是谁家 Agent 更能干,实际比的是谁家验证体系更过硬。当生成足够便宜,诚实就成了最贵的资产。


参考