一个算法的60小时生死劫
2026年7月28日,NIST后量子密码标准化进程迎来一个戏剧性时刻。
Anthropic的Frontier Red Team公布了一项研究成果:Claude Mythos Preview模型在约60小时的半自主工作后,发现了后量子数字签名方案HAWK的一个此前未被察觉的数学缺陷。NIST密码学家Daniel Apon在一小时内确认了攻击的有效性。次日,HAWK的开发者主动将其从NIST标准化进程中撤回。
一个经历了两轮专家评审、进入第三轮候选名单的密码学方案,在AI面前仅存活了60小时。
这则新闻在当天的AI日报中并不算最吸睛的——DeepSeek-V4-Flash上线、OpenAI降价80%、字节发布3分钟AI视频生成——都更容易抓住大众眼球。但在我看来,这是2026年迄今为止最值得深挖的AI技术事件。因为它标志着AI在科学研究中的角色发生了一次质变:从「找代码实现的Bug」跨越到「发现算法本身的数学缺陷」。
技术解读:Claude到底做了什么?
HAWK是什么
HAWK是一种后量子数字签名方案,其安全性基于「格同构问题」(Lattice Isomorphism Problem)的数学难度。在经典密码学(RSA、ECDSA)面临量子计算机威胁的背景下,NIST从2016年起开始推进后量子密码标准化。HAWK在2022年提交,2026年5月进入第三轮候选名单——这意味着它已经通过了全球密码学界两年多的审视。
攻击的核心:非平凡自同构
Claude发现的关键攻击路径,是HAWK所依赖的格结构中一个此前未被利用的对称性——非平凡自同构(nontrivial automorphism)。
此前有研究证明,如果能高效找到这种自同构,就可以对HAWK发起攻击,但没有人回答的问题是:HAWK使用的格中,这种自同构是否真的存在、是否可访问?
Claude找到了。它利用这个对称性构建了更快的枚举攻击,将最小参数集HAWK-256的完整密钥恢复攻击成本从2^64降至2^38。虽然攻击仍是指数级复杂度,对大参数集暂无实际威胁,但有效密钥强度已被腰斩。而如果通过加倍密钥长度来恢复安全级别,又会抹杀HAWK作为紧凑型后量子签名方案的核心卖点。
对AES的「Möbius Bridge」
在第二项成果中,Claude几乎完全自主地开发了一种名为「Möbius Bridge」的指纹技术,针对7轮简化版AES-128的中间相遇攻击(meet-in-the-middle attack)实现了200-800倍的加速。这项技术消除了此前攻击中一个需要枚举256种可能值的步骤。
值得注意的是,Claude在AES攻击早期一直拒绝尝试,认为改进AES的密码分析是不可能的。在研究人员多次引导后才开始探索——这个细节本身就很有意思:AI在「自信心」和「坚持」之间需要人类补位。
成本账本
- HAWK攻击:约60小时,10万美元API成本,一位非格密码专家的人类研究员提供方向指引
- AES攻击:输出约10亿个token,人类验证耗时数百小时
- 额外成果:对13轮LEA轻量级加密的实际密钥恢复攻击(现代台式机1小时内完成),以及对Serpent-128、Salsa20、Poseidon哈希和SHA-1的改进攻击
10万美元,换来一个NIST候选算法的撤回。这个性价比足以让任何国家密码机构重新评估自己的安全审计流程。
范式转变:从代码审计到数学发现
理解这次突破的真正意义,需要区分两个层次的安全研究:
第一层:实现漏洞(Implementation Bugs) 代码写错了。缓冲区溢出、时序侧信道、随机数生成器缺陷。这是传统安全审计和模糊测试的领域。Claude Mythos Preview发布时就展示了在这方面的强大能力——几乎能自主发现主流密码库中的实现漏洞。
第二层:算法缺陷(Algorithmic Flaws) 数学本身有问题。算法的设计假设不成立,存在被忽视的数学结构可以被利用。这需要深度的数学推理和对特定密码学子领域的专家级理解。此前,这几乎完全是人类密码学家的领地。
Claude的这次成果跨越了这两层之间的鸿沟。
这不是微妙的进步。密码学界对这两层问题的研究方法、工具链和人才储备完全不同。实现漏洞可以用模糊测试和静态分析发现,算法缺陷需要数学证明和构造性攻击。一个AI系统同时能在两个层面工作——而且在第二层面的效率已经可以和人类专家团队竞争——这意味着安全研究的工具链正在被重塑。
CryptanalysisBench:把竞赛公开化
Anthropic并没有把这项能力藏着掖着。他们联合苏黎世联邦理工学院(ETH Zurich)、特拉维夫大学和柏林工业大学发布了CryptanalysisBench——一个专门测试LLM密码分析能力的基准。
这个基准包含191个任务,横跨六大密码原语家族(分组密码、哈希函数等),来自四场NIST标准化竞赛。分三个难度层级:
- Tier 1:已知存在实际攻击的方案 → 五个前沿模型(Claude Opus 4.8、Sonnet 5、Mythos 5、GPT 5.5、GLM 5.2)攻破了65%-86%
- Tier 2:无已知实际攻击的方案,测试完整版和缩小版 → 模型们在完整版上攻破了6-12个
- Tier 3:处于密码分析前沿的生产级方案
更值得关注的是,模型们不只是复现已知攻击,还产生了全新发现:对SpoC AEAD的设计缺陷攻击、对KINDI已发表CCA安全性证明中的错误——这些都是此前未被人类密码学家发现的。
换句话说,AI已经不是在做密码学练习题,而是在做密码学研究。
历史坐标系:当算法在评审中被攻破
HAWK不是第一个在NIST评审过程中被攻破的方案。这个先例本身就很有意思。
2022年,NIST后量子标准化的第一轮中,候选方案SIKE被证明可以在一台笔记本电脑上一小时内完全攻破。发现者不是AI,是人类密码学家。那次事件震惊了整个密码学界——一个通过了初步评审的方案竟然如此脆弱。
把Claude攻破HAWK放在这个坐标系里看:
| 维度 | SIKE (2022) | HAWK (2026) |
|---|---|---|
| 发现者 | 人类密码学家 | AI模型 + 人类方向指引 |
| 时间 | 数周研究 | 约60小时 |
| 攻击性质 | 完全攻破(多项式时间) | 有效密钥强度减半(仍为指数级) |
| 方案状态 | 第一轮 | 第三轮(已过两轮评审) |
| 结果 | 方案废弃 | 方案主动撤回 |
SIKE的攻破是「人类专家的灵光一现」,HAWK的攻破是「AI系统的系统性搜索」。前者依赖天才直觉,后者暗示了一种可重复、可扩展的研究范式。
更深层的问题:密码学的「AI不对称」
这项研究引出了一个被大多数讨论忽略的问题:AI密码分析能力的提升速度,可能远快于人类设计新密码算法的能力。
密码学的发展有一条不成文的规律:破坏总是比建设容易。一个密码算法的设计需要考虑所有可能的攻击路径,而攻击者只需要找到一条。这是为什么NIST的标准化过程需要数年、需要全球密码学家参与——本质上是在做穷举式的「防御性思维」。
AI的引入可能加剧这种不对称:
- 攻击侧:AI可以系统性地搜索数学结构,进行大规模组合推理,而且可以24/7不间断运行。CryptanalysisBench已经证明前沿模型能发现人类未注意到的设计缺陷。
- 防御侧:AI是否同样能帮助设计更强的算法?Anthropic在博客中提到「希望AI在设计和验证新型密码方案中发挥关键作用」——但目前还只是希望。设计需要的是构造性创造力,而攻击需要的更多是搜索能力。AI在两者上的进展并不平衡。
如果这种不对称持续扩大,未来的密码学标准化可能变成一场「AI攻 vs AI守」的军备竞赛。人类密码学家的角色将从「设计者和攻击者」转变为「AI协作的管理者和结果验证者」。
安全范式的涟漪效应
这次事件的影响会辐射到多个层面:
对NIST和标准化机构
后量子密码标准化已经在加速(NIST从2016年启动,2024年发布首批标准),但AI驱动的密码分析可能进一步压缩评审周期。未来标准化流程可能需要引入AI审计作为强制环节——不跑一遍CryptanalysisBench,就别提交方案。
对企业安全团队
如果AI能在60小时内发现人类专家两年未发现的数学缺陷,企业的威胁模型需要更新。当前使用中的密码方案(尤其那些处于标准化边缘的新方案)可能面临「突然失效」的风险。这类似于零日漏洞,但发生在数学层面而非代码层面。
对AI治理
MIT Tech Review在同一天报道了LLM存在「不可修复的角色混淆漏洞」。这是一个有趣的对照:AI在发现别人的安全漏洞方面越来越强,但自身的安全漏洞却可能无法修复。AI既是安全工具,也是安全风险——这种双重身份正在成为AI治理的核心矛盾。
对开源模型
CryptanalysisBench的结果显示,开源权重的GLM 5.2也参与了测试。这意味着AI密码分析能力不只掌握在闭源模型厂商手中。当任何开发者都能下载一个具有密码分析能力的模型时,这项技术的可及性远超大多数人的想象。
我的判断
Claude攻破HAWK这件事本身不会影响任何现有系统——HAWK尚未部署,AES攻击针对的是简化版本。如果你今天问「这影响我的生产环境吗」,答案是否定的。
但如果你问「这在未来三年会改变什么」,我的判断是:
密码审计流程会被AI重塑。 大型科技公司和国家机构将把AI驱动的密码分析纳入常规安全审计。10万美元发现一个NIST候选方案的致命缺陷,这个ROI足以让每个密码标准化流程都标配AI审计。
后量子迁移的紧迫性增加。 不是因为量子计算机要来了,而是因为AI可能比量子计算机更早削弱现有方案的替代品。如果新的后量子方案在AI面前也可能存在未发现的缺陷,那迁移过程中就需要同时维持经典方案和后量子方案的防御纵深。
会出现「AI发现」级别的零日。 我们会越来越多地看到:「一个AI模型发现了X协议中存在了Y年的数学缺陷。」这将成为新的安全常态。关键基础设施需要为此做好准备。
密码学人才结构会分化。 纯密码分析的需求可能部分被AI替代,但能够理解、验证和引导AI发现的人才将变得更加稀缺和有价值。密码学家的角色会从「计算者」演变为「审判者」——判断AI的发现是否真的有效,以及如何将有效发现转化为更强的方案设计。
60小时攻破一个NIST候选算法,这个数字会被反复引用。但真正的故事不是60小时,而是一个AI系统第一次证明:在人类智慧的巅峰领域之一,它已经不再是辅助工具,而是研究伙伴。
密码学诞生于保密与破解的永恒博弈。这场博弈的下一位参与者,已经到场。
📖 参考来源