2026年9月30日,《自然》杂志刊载了一项看似只是"又一场AI下棋胜利"的研究,但它的含金量远超棋盘本身。MIT、卡内基梅隆、纽约大学和斯坦福联合团队开发的AI系统Ataraxos,在被称为"不完全信息博弈最后堡垒"的Stratego(陆军棋)上,以15胜1负4平的战绩击败四届世界冠军、公认史上最强的荷兰棋手Niemeijer,世锦赛对阵人类顶尖选手时更是打出39胜2负的碾压比分。真正值得深挖的不是胜负,而是账单:DeepMind的DeepNash当年用1024个TPU节点训练2-3个月、烧掉约300-450万美元,最终没能越过顶级人类;Ataraxos只用16块H100训练一周,外加4天信念网络训练,总成本不足8000美元——不到前者的三百分之一,自博弈局数只有三十分之一。

为什么Stratego是最难的堡垒

要理解这个结果,先要理解Stratego的难度坐标。国际象棋和围棋是完全信息博弈:双方都能看到全部棋子,计算力的暴力美学足以制胜。Stratego则不同——双方各自暗置40枚棋子,可能布阵超过10^33种,比围棋合法局面还要多出二十多个数量级。你在开局面对的不是一块明牌的棋盘,而是一个巨大的概率迷雾:对面那个棋子是炸弹还是司令?工兵应该冒险去哪一侧试探?每一步行动既是在推进局面,也是在泄露或伪装信息。

这类问题在数学上等价于现实世界中最棘手的一类决策场景:谈判、竞标、军事指挥、网络安全攻防——双方都在隐藏信息、试探对方、管理己方信息暴露的节奏。Ataraxos这个名字取自希腊语"泰然自若",恰好点出了它对Niemeije比赛中的风格特征:研究团队观察到,人类棋手在王牌暴露时会慌乱、过度补救反而泄露更多信息,而Ataraxos异常镇定,绝不轻易交代底牌。这种"信息管理纪律"正是超人类水平的核心表现——它把每一步都当作一个贝叶斯更新问题来处理,而不是情绪化的危机响应。

两个算法杠杆:撬动三百倍成本差

Ataraxos的样本效率来自两个环环相扣的设计。

第一个杠杆是自博弈中的"蓝图策略"训练。团队没有沿用DeepNash那种接近穷举的搜索式训练,而是通过正则化手段强制自博弈策略多样化,避免模型陷入自我对弈常见的"策略坍缩"——即两个自我复制的对手反复打磨同一条狭窄路径,产出看似完美实则脆弱的策略。强制多样化让每一局自博弈都产生信息增量,训练样本的边际收益大幅提升。这解释了为什么它的自博弈局数只需前者的三十分之一。

第二个杠杆是决策时的"信念脑补"。蓝图策略只是起点。真正落子前,Ataraxos调用一个专门的信念网络,按概率分布推测对手所有隐藏棋子的身份,还原出"最可能的完整棋盘",再在这个脑补出的棋盘上做前向评估选出最优一手。这是生成模型在博弈搜索中的一次关键创新用法——它不再把不完全信息当作需要硬扛的噪声,而是主动建模成一个可以被推断的隐变量。团队自己评价:这个生成模型的创新用法补上了通往超人类水平的最后一块拼图。

值得注意的是,这套方法不是Stratego特化的。团队把Ataraxos迁移到Barrage Stratego、协作纸牌Hanabi、“二打一"斗地主等规则迥异的不完全信息博弈中,全部达到超人类水平。方法论的通用性,是它登上《自然》而非只上新闻头条的原因。

边际成本的坍塌:一条正在加速的曲线

把镜头拉远,Ataraxos不是孤立事件,而是2025-2026年一条清晰趋势线上的最新数据点。此前小米MiMo以约300万美元训练成本登顶开源模型榜;学术团队用消费级算力复现接近前沿的推理能力的案例也在累积。这些线索指向同一个判断:前沿AI能力的边际成本正在以数量级的速度下降,而驱动力主要来自算法侧而非硬件侧。

过去几年行业叙事的默认前提是"规模法则”——能力提升需要算力、数据、参数的同步扩张,前沿因此被少数能负担十亿美元级训练的机构垄断。但规模法则描述的是一条等产量线上的移动,而正则化、信念网络、更好的模拟器、更聪明的搜索这些算法改进,是在切换到更低的等产量线。Ataraxos的三百倍成本差就是一次这样的切换:同样的能力产出,投入坍缩了两个多数量级。

这对产业格局的含义是结构性的。当中小团队和高校能以万美元级算力触及此前数百万美元才能触及的能力区间,创新的分布会从少数巨头实验室向外扩散。历史上有过先例:2012年的AlexNet之后,视觉领域的每次算法效率跃迁(从ResNet到蒸馏到量化)都催生了一批新玩家。我们可能正处在强化学习与不完全信息决策这条赛道上类似的早段。

从棋盘到谈判桌:三个值得盯的方向

团队下一步的计划值得一提:给Ataraxos加上可解释性,让它能向人类解释自己的决策。研究负责人的表述很清醒——“人类必须对是否采纳建议有最终决定权,落地前得先能审计模型的决策。“这句话背后是一个正在成型的应用图景:Stratego常被用来建模交易、指挥、谈判、网络安全等非完全信息问题,一个能在信息迷雾中做出超人类决策、且能解释理由的系统,价值显然不止于棋类。

对从业者和观察者,我认为有三个方向值得持续跟踪:

其一,信念网络作为独立组件的价值。用生成模型推断隐藏状态、再做规划的架构,天然适配任何"部分可观测"的现实问题——风控中的未知欺诈模式、供应链中的对手行为、医疗中的未确诊病理。它可能成为继检索增强、工具调用之后又一个标准化的Agent架构组件。

其二,算法效率对算力叙事的对冲。如果样本效率的改善速度持续快于模型规模的扩张速度,那么"算力军备竞赛决定一切"的判断需要修正。对投资和战略决策而言,盯算法侧的论文产出可能比盯数据中心的资本开支更能提前感知拐点。

其三,超人类决策+可审计性的组合。在谈判、定价、安全对抗这些高风险场景,纯性能优势不足以落地,可解释性才是从"登上《自然》“到"进入生产系统"的桥。Ataraxos团队把这条桥放进路线图,说明学术界的判断也在从"能力优先"转向"能力与治理并重”。

结语

Ataraxos的意义不在于又一块被AI攻陷的棋盘,而在于账单上的那个数字。当攻克一类最难问题所需的资源从数百万美元压缩到八千美元,我们看到的不是一次孤立的技术胜利,而是算法复利的一次显性兑付。对资源有限的团队而言,这扇正在打开的窗口本身就是最重要的新闻——上一轮规模竞赛中被判定出局的玩家,正在被算法效率重新请回牌桌。

而牌桌上最不变的规则,恰恰是Stratego教给我们的:真正的优势,属于在信息迷雾中依然保持泰然自若的那一方。


参考来源