8月7日,科学作家、前理论物理学家Matt von Hippel在他的博客4gravitons上向各大AI公司下了一封战书。他的要求非常具体:用学术级算力,解决散射振幅(amplitudeology)领域的一个悬而未决的问题——要么把N=8超引力推到七圈,要么把N=4超杨-米尔斯推到九圈。
不到一个月后的9月1日,Anthropic告诉他:Claude把九圈算出来了。SLAC的Lance Dixon——这个领域真正的权威——独立验证通过,并评价Claude对自己2019与2023年两篇论文的理解"仅次于论文合作者"。
如果你不是这个领域的人,很容易把这件事当成又一条"AI很厉害"的新闻划过去。但von Hippel设置这道题的方式,恰恰是理解这件事分量的钥匙。
一道被精心设计的题
von Hippel在挑战书里说得很清楚:他不想看AI证明数学定理。数学突破靠的是新想法,而想法有多难找,事前无从判断——今天觉得无解,明天一个灵感就破局。他想要的是一个公认算不动的问题:方法人人都会,原理上完全清楚,卡的只是计算量。地球上有计算机的物理学家都知道怎么算九圈,只是没人有那个算力和时间。
这才是有意思的地方。我们习惯把科学难题分成两类:一类是"不知道怎么做"(需要洞察),一类是"知道怎么做但做不起"(需要资源)。第二类的门槛向来被认为是纯粹的工程问题——等更大的集群、更多的经费、更长的时间。AI的进步叙事里,“超越人类直觉"那一面被讨论得太多,而"重新定义资源边界"这一面讨论得太少。
Claude这次跨越的正是第二道门槛:同样级别的机器,同样的学术预算,换一个"研究员"来干活,原本被认为做不起的计算就做起了。计算上限第一次不取决于你有多少卡,而取决于坐在终端前的是谁。
N=4超杨-米尔斯:故意选错的完美理论
顺便交代一下这道题本身。N=4超杨-米尔斯是振幅学家的"小白鼠理论”:杨-米尔斯结构描述了电磁、强、弱三种基本相互作用,而N=4超对称(每个粒子有四个超对称伙伴)让它 unrealistic 到极致——不描述现实世界任何东西,却因为粒子间精妙的对称抵消而变得出奇地好算。振幅学家用它来压力测试新方法:在一门不真实的理论里把技术推到极限,再考虑搬到真实世界。
目前的纪录是八圈,而且那次也是绕道完成的——借助形式因子与"antipodal对偶性"间接获得。Claude这次做的事,从公开的完整结果页(smsharma.io/cosmic-nine-loops/)看,是把arXiv:2308.08199的路线整体上推一圈:bootstrap九圈三点形式因子,通过对偶性映射到振幅,再用pentagon OPE数据固定剩余的不确定性。结果在两个31位素数上分别独立计算,结构完全一致;超过100万个系数中有99.62%重构为有理数并通过验证。这不是黑箱输出一个数字,而是一套可被独立核验、可复用中间表示的计算产物。
Lance Dixon的那句评价值得单独咀嚼。一个模型对论文的理解"仅次于合作者",意味着它不只是检索和复述,而是在一个高度专业化的数学结构里掌握了足够的"语感",能判断哪些约化路径走得通。这个能力此前被认为需要多年的博士训练。
为什么是bootstrap,为什么恰好适合AI
还有一层结构性原因,让这道题对AI格外"友好"。传统费曼图方法里圈数上升意味着图数量爆炸,而bootstrap走的是另一条路:先根据对称性和已知约束把答案的可能形状框死(用一个专门字母表里的符号空间表示),然后逐条检查约束,把不符合的候选淘汰掉。它的瓶颈不是"想不出方法",而是约束检查的组合爆炸——数百万个系数、上千维的符号空间、环环相扣的代数验证。
这正好是"学过整个文献库的模式匹配 + 不知疲倦的精确执行"的主场。人类研究员在这类任务上的角色本来就是写脚本、跑验证、读报错、改代码的循环;AI把循环里最耗时的部分吃掉了。换句话说,这件事不是AI发明了新物理,而是AI把一个"需要二十年功力的体力活"压缩成了几周。这正是von Hippel想看到的:计算限制"doesn’t actually matter",只要你换个执行者。
冷静的部分:别急着改写物理教科书
需要泼的冷水也有三盆。
第一,这是玩具模型。N=4超杨-米尔斯的九圈不会直接改变任何实验预测;对撞机物理里绝大多数实际计算还停在两圈、三圈。从玩具到现实理论,难度曲线是否同样被AI拉平,还没被证明。
第二,验证成本仍然依赖人类权威。结果的可信度最终锚定在Lance Dixon的独立核验上。当AI产出的科学计算规模超过人类专家的核验带宽时会发生什么——是新的社会化验证范式,还是错误的静默累积——这是比"AI能不能算"更深的问题。
第三,Anthropic有展示动机。这个挑战本身就是一次公开PR的完美素材,选的又是恰好对AI胃口的bootstrap路线。它证明了能力上界在快速抬升,但不代表普遍的"科研自动化"已经到来。
真正的转折点:科研的边际成本曲线
抛开物理,我觉得这件事值得记住的信号是:科学计算的成本结构正在从"算力主导"转向"智能主导"。
过去二十年,理论科学的生产力很大程度上被两个稀缺资源锁死:天才的直觉和国家级的算力。AI正在同时松动两者——用模式匹配放大直觉,用更聪明的执行策略榨干现有硬件。当"学术预算 + AI研究员"能撬动原本需要巨型集群的问题,受影响的不只是物理:计算化学、结构生物学(同一天Anthropic还发布了Claude优化30多个生物分子模型、平均提速4倍的消息)、乃至所有"方法清楚、算力不够"的学科,都会经历同一轮重定价。
von Hippel在挑战书里说,他想在形成自己的AI判断之前,先看LLM在他熟悉的难题上表现如何。现在他有了答案,而我们所有人都该开始习惯一个新的世界:在科学的地基上,“这不可能"和"这没人做得起"之间的那条线,正在被一个非人类的研究员悄悄擦掉。
问题只剩下:当计算的上限由智能决定时,谁拥有最强的智能,谁就拥有最快的科学。这可能是比算力竞赛更值得警惕的垄断。
(参考:Anthropic Research、完整九圈结果、原始挑战)