一个不寻常的公告

昨天,Anthropic 宣布成立生命科学研究组,并公布了一项早期成果:Claude 在只有高层级指令的情况下,从巨型噬菌体 DNA 数据库中自主发现了一类全新的酶系统——阵列关联逆转录酶(Array-associated Reverse Transcriptases,ART)。这套系统由一个逆转录酶、一个相邻的伴侣基因和一长段均匀间隔的 DNA 重复序列阵列组成,其布局与 CRISPR 阵列高度相似。要知道,历史上同时具备这类特征组合的系统——限制性内切酶、CRISPR、retron——最终都成了可编程的基因操作工具。CRISPR 先驱张锋在审阅预印本后的评价是「确实引人入胜,值得进一步研究」。

但如果你只把这看作「AI 又立功了」的新闻,就错过了重点。真正值得深挖的,是这次发现的流程结构:约 950 个 Agent 协作 21 小时,消耗 2.1 亿 token,从超过 20 万个逆转录酶中筛出 3500 个候选系统,再收窄到 20 份人类可读的分析报告。人类科学家的参与被压缩到两件事——写下最初的提示词,以及在末端做实验验证。

假设生成,这个科研中最核心、最被视为「不可替代」的脑力环节,第一次被证明可以批量外包。

被压缩的发现链条

先看清楚这次到底发生了什么。

传统上,发现一套新酶系统靠的是「基因组挖掘」(genome mining):研究者在海量序列数据库里搜索没人表征过的基因,凭经验和直觉注意到异常的那些,再花数月弄清它们的功能。过去几年新发现的逆转录酶家族几乎全部出自这条路。这条路的天花板很明显——它受限于人类专家能读多少序列、能记住多少系统、能在多长的原始 DNA 里保持注意力。

Anthropic 的工作流把它改造成了漏斗。第一层,Agent 集群扫描数据库,收集 20 万+ 个 RT;第二层,用「不符合任何已知系统」为标准筛出 3500 个新候选;第三层,收窄到 20 个最有说服力的对象,每个都写出一份人类可读的报告——提出功能假设、列出支持证据;第四层,Claude 对自己的报告做批判性复核,大多数候选在这一步被自己淘汰。最后活下来的候选进入湿实验室,由人类科学家表达蛋白、做生化和结构表征,Claude 再帮助解读数据。

有意思的是发现发生的那一刻。某个 Agent 在阅读 RT 附近的原始 DNA 序列时「惊呼」:这段 DNA 旁边的串联重复阵列——这是 CRISPR 样的重复阵列?接下来它做的事情和一个人类科学家面对潜在发现时完全一样:数重复次数、量间隔距离、和已知 RT 系统对比布局、检索文献确认没人报道过——然后确信自己找到了新的生物系统,提交报告等待人类审阅。

这个「惊呼—验证—提交」的链条,就是过去只能由博士后完成的工作。专家做这类分析需要数周到数月;这次是 21 小时。

为什么是假设生成先被接管

AI for Science 已经热闹了几年,但此前的主流形态是 AlphaFold 式的:给一个明确、可形式化的计算问题(氨基酸序列→结构),用专用模型暴力求解。这类工作取代的是「计算」,而 ART 的发现取代的是「品味」——在无结构的原始数据里判断「哪里有值得追的东西」。

为什么偏偏是这一环先被攻破?我认为有三个结构性原因:

第一,假设生成的瓶颈是广度而非深度。 生物数据库里躺着海量未表征的蛋白质家族,没人看它们不是因为问题难,而是因为「没人有空看」。这正是 Agent 集群的主场:并行、不知疲倦、单位注意力成本低。当一个领域的主要瓶颈是覆盖面积时,950 个中等水平的 Agent 胜过一个顶级专家。

第二,验证环节天然可分离。 假设生成和实验验证之间有一个干净的接口——报告。Agent 产出结构化的候选假设,人类在湿实验室闭环。这个接口的存在意味着风险可控:错的假设会被实验淘汰,而筛选成本已经被 Agent 压到很低。Anthropic 团队自己说,他们已经在把「假设本身」当研究对象——一次 campaign 产生成百上千份候选报告,团队研究的是「值得测的假设和被搁置的假设差在哪」,再把结论写回给 Claude 的指令里,让模型模仿人类的科学品味。这是一条品味的外化与复制管道。

第三,失败模式温和。 科研里 Agent 犯错的代价是浪费一次实验,而不是像自动驾驶或交易那样直接造成事故。这是 Agent 大规模上场的理想环境:错误可回收、反馈信号清晰(实验结果)、迭代周期可承受。

别急着欢呼:三个冷静的注脚

这件事的真实边界也需要说清楚。

功能未知。 ART 是什么、能不能编程、有没有应用价值,全部悬而未决。Anthropic 只验证了它存在于噬菌体中、重复阵列会表达为一组短 RNA。回看历史,CRISPR 从「奇怪的重复序列」到基因编辑工具用了二十多年。发现只是万里长征第一步——但历史上多次证明,发现这一步最依赖运气,而 Agent 恰好把运气变成了可复制的工业流程。

门槛比看起来高。 这不是随便一个团队拿 API 就能复现的。Anthropic 自建了 BSL-1/2 实验室,团队是做过 CRISPR 进化与调控研究、发现过下一代细胞治疗酶的资深科学家。AI 放大的是已有的科学品味,而不是替代它。没有那个能判断「20 份报告里哪份值得测」的团队,2.1 亿 token 只是电费。

数据才是真正的稀缺品。 950 个 Agent 消费的是公共序列数据库,而下一个阶段的竞争焦点会转向未表征数据的所有权。同一天的新闻里,生物数据公司 Basecamp Research 拿到 1.4 亿美元融资,投资方包括 NVIDIA 和 Anthropic 自己的 Anthology Fund,做的事正是「把进化变成训练数据」。模型和 Agent 框架会商品化,独家数据集 + 自动化实验室的组合不会。这是下一轮 AI for Science 竞争的真实壁垒。

对行业的三条推论

一、未表征数据的价值将系统性重估。 基因组、蛋白质组、代谢组里那些「没人看」的角落,过去估值近似为零(只有机会成本)。当扫描它们的边际成本降到 2.1 亿 token 一次 campaign,这些数据变成了可开采的矿。拥有生物数据积累的机构——测序公司、生物样本库、甚至制药公司的历史实验记录——会发现自己坐着一座此前无法定价的资产。

二、「科研品味」的定价权上移。 当假设生成变得廉价,可验证的想法供给爆炸,稀缺的是两端的判断力:给 Agent 的初始方向(问对问题),和末端从报告里挑出真金的能力(识货)。中间环节——勤奋的文献调研、大海捞针式的序列扫描——价值趋零。这对科研人员的职业结构是实质性的挤压:博后和研究生承担的「体力科研」首当其冲。

三、Agent 编排能力成为科学基础设施。 950 个 Agent 协作 21 小时不是一个人点 950 次运行,背后是并行会话的协调框架——Anthropic 自己承认部分用的是对外销售的 Claude Science 和 Claude Code,外加自研的 harness。这与同日 Google 开源 Agent 编排器 AX、Modal 重构百万级沙箱调度的信号完全一致:当 Agent 数量从个位数走向集群,「怎么编排它们」正在成为一门独立的工程学科。看懂 ART 的发现,需要同时看懂这两条线——它恰好是 Agent 基础设施成熟度的生物学科应用题。

结语

限制性内切酶来自细菌免疫系统,Taq 聚合酶来自黄石公园的温泉细菌,CRISPR 最初只是细菌 DNA 里一段「奇怪的重复」。科学史上最重要的工具,反复来自「有人注意到了数据里的异常」。注意,是注意到——不是理解,不是应用,仅仅是那个最初的「咦」。

Anthropic 这次证明的是:那个「咦」,可以被工业化了。21 小时、2.1 亿 token、一份提示词。至于 ART 会不会成为下一个基因编辑工具,坦率说概率不高——大多数发现都死在验证路上。但这已经不重要了。重要的是流程本身已经跑通:第一块多米诺倒下了,剩下的问题只是哪个领域的数据还没被这样扫过一遍。

对科研界来说,该问的问题不再是「AI 能不能做科学发现」,而是「当假设生成变成批量商品,我的价值在哪一环」。


参考: