一个不寻常的发布

昨天,OpenAI 发布了一批由内部前沿模型产出的数学新结果:722 篇论文,覆盖 500 个最重要开放数学问题中的 90 个,被外界称为"百年来数学界最重大的时刻之一"。发布流程参照普林斯顿高等研究院 AGMAI 委员会的公开建议,结果连同 Lean 形式化证明、10 份模型推理摘要一起放在 GitHub 仓库里,平均每条结果耗费约 3 小时 ChatGPT Pro 级算力。

很多讨论集中在"AI 解决了 90 个开放问题"这个数字上。但我认为,这次发布里最值得深挖的不是模型有多聪明,而是一个更结构性的事实:这批结果的信任基础,不是同行评议,而是 Lean。

理解了这一点,你就能看懂未来十年"AI 产出知识"的基本形态。

被绕过的同行评议

传统数学界确认一个新结果的流程是:作者写论文 → 投稿 → 审稿人逐行检查证明 → 发表 → 社区长期消化。这个过程平均以"年"为单位,且完全依赖审稿人的专业能力和耐心。历史上著名的教训不少:2012 年 Shinichi Mochizuki 声称证明 ABC 猜想,望月新一的 600 页证明至今没有被数学界主流消化或确认,双方僵持十余年没有结局。

现在设想一个 AI 一次性产出 722 篇论文。人类审稿力量根本不可能在合理时间内消化这个体量——这不是能力问题,是吞吐量差了几个数量级。如果沿用传统流程,这批结果会变成 722 个"望月新一式的悬案"。

OpenAI 的做法是把大量证明用 Lean 形式化。Lean 是一门编程语言,但它的类型系统允许把数学证明写成代码,由计算机内核检查。一个 Lean 证明一旦通过编译器检查,它的正确性就不依赖于任何人类的阅读和理解——你不需要信任作者,不需要信任审稿人,只需要信任一个可以独立复核的、几千行规模的验证内核。数学界对这类内核的信任,远比对任何机构或个人的信任更牢固。

换句话说,当产出者从人类变成 AI,“信任"必须从社会过程迁移到机械过程。Lean 不是这次发布的装饰品,它是整个发布能够成立的承重墙。

为什么是现在:形式化的成本曲线

形式化验证不是新想法。Coq/Rocq、Isabelle 这些证明助手已经存在了几十年,数学家陶哲轩从 2020 年代初就开始大力推广 Lean 和 mathlib,DeepMind 的 AlphaProof 也在 IMO 竞赛上拿过银牌级别的成绩。但形式化一直有个致命短板:把一个人类证明翻译成 Lean 的成本极高。形式化一个中等复杂度的定理,熟练工作者往往需要数周甚至数月。费马大定理这种级别的形式化,至今还是社区里流传的"多年计划”。

这就形成了一个死锁:形式化太贵,所以没人做;没人做,工具链和库就不成熟;不成熟,就更贵。

AI 改变的正是这个成本结构。当模型能够直接在 Lean 里工作——生成证明、接受编译器的即时纠错、迭代到通过——形式化从"昂贵的后处理"变成"生成的副产品"。这次 722 篇论文附带的 Lean 形式化,本质上是一次公开演示:形式化的边际成本正在坍塌。

而形式化成本一旦坍塌,连锁反应不止于验证 AI 的结果。人类数学家的论文也可以随手附一份机器可验证的版本;期刊可以要求 Lean 附件如同要求代码仓库;整个领域的可复现性标准被重置。

3 小时 Pro 算力:数学探索的经济学

另一个被低估的细节是成本数据:平均每条结果耗费约 3 小时 ChatGPT Pro 级别的思考算力。OpenAI 同时公布了模型推理摘要和尝试问题数量的统计。

把它翻译成经济学语言:一个原本需要顶尖数学家投入数月认知劳动的开放问题探索,现在的一阶成本是几百美元级别的算力。当然这个比较不公平——模型尝试了大量问题,只成功了其中一部分,失败尝试的算力也是成本;而且"解决一个问题的子步骤"和"解决一个重要问题"之间还有距离。但方向是清晰的:数学探索正在从稀缺的专家认知资源,变成可以批量并行调用的计算资源。

这会改变数学家的分工。当"产生候选证明"变得便宜,“判断哪个方向值得投入”、“把零散结果组织成理论”、“提出好问题"这些品味型工作的相对价值会上升。类比软件行业:编译器和生成式工具没有消灭程序员,但把"写代码"的中心地位换成了"定义问题和审查方案”。

AGMAI 协议:知识生产的治理实验

这次发布还有一个制度层面的看点:OpenAI 主动参照了普林斯顿高等研究院 AGMAI(数学与 AI 顾问组)的建议来设计发布流程——GitHub 仓库、论文修订与引用协议、承诺资助理解 AI 重大结果的学术活动,并计划负责任地发布产出这些结果的模型。

为什么需要这个?因为"AI 产出重大数学结果"触及了学术界最敏感的神经:优先权、可信度、以及商业公司对公共知识基础设施的影响力。如果一家公司可以随时倾泻几百个结果,学术界的激励体系(论文、职位、奖项都建立在稀缺性上)会被冲击得七零八落。AGMAI 协议是学术界和工业体之间摸索出的第一个"缓冲接口":结果可以来,但要按学术共同体认可的容器装。

我认为这是一个更大趋势的早期样本:AI 产出速度超过人类消化速度的领域,都会长出自己的 AGMAI。药物发现、材料科学、蛋白质设计,接下来十年会逐个面对同样的问题。

冷静的一面:90/500 到底意味着什么

回到数字本身泼一点冷水。“解决 500 个最重要开放问题中的 90 个"听起来惊天动地,但开放问题列表不等于重要问题本身——黎曼猜想、Navier-Stokes 这些皇冠明珠大概率不在其中(Latent.Space 的报道标题里"quasi-Riemann"一词暗示某些结果是接近而非触及核心猜想)。这些结果的价值需要数学界花数年去定位:是真正的新知识,还是已知技术的重新组合。

而且 Lean 形式化只覆盖了"许多"证明,不是全部。未被形式化的部分,信任问题依然存在。形式化本身也可能有漏洞——陈述写错了,证明再严格也没意义。AI 时代的一个新风险恰恰是:模型形式化的命题和人类以为的命题之间存在微妙错位。验证内核保证"这个命题为真”,不保证"这个命题是你想要的那个"。

判断:信任基础设施的更替已经开始

把这次发布放在行业脉络里看:AlphaProof 证明了 AI 能在形式化系统里做竞赛数学,mathlib 证明了大规模形式化库可行,而这次 722 篇论文证明了形式化验证可以规模化地承载数学前沿的产出。三步走完,范式成立的证据链闭合了。

我的判断是:

  1. 三年内,主流数学期刊会出现"欢迎 Lean 附件、优先处理带形式化的投稿"的明确激励,形式化从加分项变成事实标准。
  2. AI 产出知识的社会确认机制会从"人类逐行审读"转向"机器验证 + 人类审查陈述与意义"的两层结构。人类审的是"这个定理重要吗、放对了语境吗",机器管"它真吗"。
  3. 这个模式会外溢。凡是产出可以用可执行规范验证的领域——代码、硬件设计、协议证明、法规合规逻辑——都会复制"AI 生成 + 机械验证"的结构。Decisions API 这类把复杂判断压缩成可校验输出的产品,走的是同一条路。

对技术从业者的启示很直接:当模型的输出不可信时,验证能力就是瓶颈;而验证瓶颈的最佳解法,往往不是"更强的模型",而是把输出放进一个可以被机器检查的形式系统里。这条原则在你的领域里叫什么?类型系统、测试、形式化规格、还是数据库约束——值得现在就想清楚。

数学是人类最古老的信任游戏,它的规则刚刚被改写了第一条。

(本文数据来自 OpenAI 官方发布与当日 AI 洞察日报,观点为作者独立分析。)