📌 系列导航🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站

论文信息

项目内容
日期2026-08-15
论文OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
作者Bobo Li, Hao Fei*, Tianjie Ju, Mong-Li Lee, Wynne Hsu
机构新加坡国立大学、牛津大学
链接arXiv:2608.13558
代码github.com/Omni-Scientist/OmniScientist

一句话总结

AI 科学家的瓶颈不是工作流覆盖,而是证据访问:让 agent 在研究全生命周期直接"看"原始数据(波形、影像、3D 结构),而非依赖人工预处理的特征,论文质量在全部 7 个维度提升、正面对比 85% 获胜。

解决什么问题

从 AI Scientist、Agent Laboratory 到最近的端到端系统,AI 科学家已经能自主完成"想法→代码→实验→写稿→自审"的完整流程。但作者指出一个被忽视的断层:这些系统全部只消费文本、代码、标签或预计算摘要——工作流完整,证据不完整

科学证据的核心关系藏在原始数据里:显微图像的局部形态、波形的时序包络、多通道信号的一致性、实验视频的过程性信息。接口决定了哪些关系能存活:一段 caption 会丢掉局部形态,一组标量特征会抹掉时间顺序。现有系统让 agent 在研究开始前就继承了人类选定的表示,这直接约束了它能注意到什么异常、提出什么假设、支撑什么结论。多模态模型本身并不解决这个问题——科学基准把观察和问题都预先固定了,而已有 agent 对感知的使用只停留在局部环节(检查生成的图表、看界面)。

核心方法

OmniScientist 的架构是"开放内核 + 确定性外壳":

  • 感知层:把证据分为 4 个与学科无关的族——感知型、符号型、量化统计型、过程型。同一引擎可以处理地震图、CAD 点云或知识图谱。感知有预算控制:优先做原生数值分析(如 FFT 峰值),只在空间/结构模式必要时才渲染视觉,且视觉调用次数封顶。
  • 3 个自主 agent(ideation / experiment / writeup)在阶段内跑 ReAct 循环,自由推理。
  • 代码把关的阶段出口:idea check、rigour check、claim check 不是模型自评,而是 Python 谓词——检查 finalize 载荷和循环的真实状态,不通过就把拒绝原因作为新观察喂回去,阶段无法结束。检查项包括:≥5 个候选想法+≥3 次文献检索(新颖性)、泄漏与有效样本量、执行溯源、反 HARKing(禁止结果出来后编假设)、数值可追溯(每个报告的数字必须来自真实程序输出)。

扩展新学科只需一个 spec 文件,核心管线和检查代码零改动。

实验结果

  • 36 个真实数据案例,覆盖 5 大学科族(物理、地空、生医、农业生态、工程信息)、4 类证据、11 种模态(图像、信号、音频、视频、3D、轨迹、表格、公式、图谱等),全部跑通"原始数据→编译论文"。
  • Sonnet 5 骨干平均总分 6.3/10(2 名跨族评委);GLM-5.2、Kimi K2.7 表现相当(部分子集 6.4–7.5)。按学科/模态分组的中位数紧贴 6.1–7.1,跨域稳定;事实准确性在 36 例中 30 例 ≥7.0。
  • 盲测对照(只给预计算标量特征):感知版 7 个维度全面占优,正面对比 85% 获胜;最大增益在多模态 grounding(+2.8)和科学显著性(+1.8)。事实准确性两组打平——因为都受同一溯源检查约束。
  • 消融:去掉先验文献检索跌幅最大(6.9→5.7)。
  • 案例1:审计 STEAD 地震数据,agent 从波形形态发现"噪声"标注轨迹里有明确的起震-衰减包络,据此提出问题并构造 STA/LTA+极化+跨通道符合检测器:21.7% 的噪声标注轨迹携带相干瞬态能量(95% CI [18.8, 24.9]),在 3 种零模型、50 倍虚警率范围、417 台站 bootstrap 下稳健。
  • 案例2:读儿科胸片发现肺炎肺野"斑驳"而非均匀变亮,将其转化为局部熵空间离散度指标:Cohen’s d>1.2,held-out AUC 0.851,且独立于整体熵水平。

深层洞察

这篇论文最锋利的观点是**“接口即天花板”**:数据以什么形式进入 agent,决定了科学发现的上限。机制分析显示感知改变的不是文风而是研究轨迹本身——同一个星系数据,感知版问"视觉模型的形态判读在更浅巡天中是否退化",盲版只能问"3 类能否沿 8 个给定特征轴分开",这是两项完全不同的研究。

第二个洞察关于可靠性来源:防造假不靠模型自觉,靠管线约束。事实准确性在盲测和感知版之间打平(约四分之一判决是平局),因为两组都过了同一套代码级溯源检查——确定性约束是比更强的模型更可靠的护栏

局限性

  • 36 案例是精选演示套件,非开放竞争性发现;6.3/10 的均分离顶会论文尚有距离。
  • 评审依赖 2 名 LLM 评委的主观 rubric,存在评价偏差风险。
  • 只支持纯计算实验,需要物理实验的想法直接被拒。
  • 新颖性判断依赖 OpenAlex 文献检索覆盖。
  • 全模态感知+多轮循环的成本不低,论文未给出经济性分析。

工程实践启示

  1. Agent 管线模式:阶段内自由推理、阶段边界代码控制转移和验证——这种"开放内核+确定性外壳"值得所有多阶段 agent 系统借鉴,比纯 prompt 编排可靠得多。
  2. 出口谓词模式:finalize 载荷+循环状态→(accept, reason),拒绝原因回灌对话。实现简单,但把"检查"从模型自评变成了硬约束。
  3. 感知预算控制:数值优先、视觉按需、次数封顶,是控制多模态 agent 成本的实际手段。
  4. 给 agent 的数据接口本身就是最重要的设计决策——做数据 agent 时,先问"哪些关系在预处理中被丢掉了"。