当AI开始发现数学缺陷:Claude攻破HAWK算法背后的密码学范式转变
一个算法的60小时生死劫 2026年7月28日,NIST后量子密码标准化进程迎来一个戏剧性时刻。 Anthropic的Frontier Red Team公布了一项研究成果:Claude Mythos Preview模型在约60小时的半自主工作后,发现了后量子数字签名方案HAWK的一个此前未被察觉的数学缺陷。NIST密码学家Daniel Apon在一小时内确认了攻击的有效性。次日,HAWK的开发者主动将其从NIST标准化进程中撤回。 一个经历了两轮专家评审、进入第三轮候选名单的密码学方案,在AI面前仅存活了60小时。 这则新闻在当天的AI日报中并不算最吸睛的——DeepSeek-V4-Flash上线、OpenAI降价80%、字节发布3分钟AI视频生成——都更容易抓住大众眼球。但在我看来,这是2026年迄今为止最值得深挖的AI技术事件。因为它标志着AI在科学研究中的角色发生了一次质变:从「找代码实现的Bug」跨越到「发现算法本身的数学缺陷」。 技术解读:Claude到底做了什么? HAWK是什么 HAWK是一种后量子数字签名方案,其安全性基于「格同构问题」(Lattice Isomorphism Problem)的数学难度。在经典密码学(RSA、ECDSA)面临量子计算机威胁的背景下,NIST从2016年起开始推进后量子密码标准化。HAWK在2022年提交,2026年5月进入第三轮候选名单——这意味着它已经通过了全球密码学界两年多的审视。 攻击的核心:非平凡自同构 Claude发现的关键攻击路径,是HAWK所依赖的格结构中一个此前未被利用的对称性——非平凡自同构(nontrivial automorphism)。 此前有研究证明,如果能高效找到这种自同构,就可以对HAWK发起攻击,但没有人回答的问题是:HAWK使用的格中,这种自同构是否真的存在、是否可访问? Claude找到了。它利用这个对称性构建了更快的枚举攻击,将最小参数集HAWK-256的完整密钥恢复攻击成本从2^64降至2^38。虽然攻击仍是指数级复杂度,对大参数集暂无实际威胁,但有效密钥强度已被腰斩。而如果通过加倍密钥长度来恢复安全级别,又会抹杀HAWK作为紧凑型后量子签名方案的核心卖点。 对AES的「Möbius Bridge」 在第二项成果中,Claude几乎完全自主地开发了一种名为「Möbius Bridge」的指纹技术,针对7轮简化版AES-128的中间相遇攻击(meet-in-the-middle attack)实现了200-800倍的加速。这项技术消除了此前攻击中一个需要枚举256种可能值的步骤。 值得注意的是,Claude在AES攻击早期一直拒绝尝试,认为改进AES的密码分析是不可能的。在研究人员多次引导后才开始探索——这个细节本身就很有意思:AI在「自信心」和「坚持」之间需要人类补位。 成本账本 HAWK攻击:约60小时,10万美元API成本,一位非格密码专家的人类研究员提供方向指引 AES攻击:输出约10亿个token,人类验证耗时数百小时 额外成果:对13轮LEA轻量级加密的实际密钥恢复攻击(现代台式机1小时内完成),以及对Serpent-128、Salsa20、Poseidon哈希和SHA-1的改进攻击 10万美元,换来一个NIST候选算法的撤回。这个性价比足以让任何国家密码机构重新评估自己的安全审计流程。 范式转变:从代码审计到数学发现 理解这次突破的真正意义,需要区分两个层次的安全研究: 第一层:实现漏洞(Implementation Bugs) 代码写错了。缓冲区溢出、时序侧信道、随机数生成器缺陷。这是传统安全审计和模糊测试的领域。Claude Mythos Preview发布时就展示了在这方面的强大能力——几乎能自主发现主流密码库中的实现漏洞。 第二层:算法缺陷(Algorithmic Flaws) 数学本身有问题。算法的设计假设不成立,存在被忽视的数学结构可以被利用。这需要深度的数学推理和对特定密码学子领域的专家级理解。此前,这几乎完全是人类密码学家的领地。 Claude的这次成果跨越了这两层之间的鸿沟。 这不是微妙的进步。密码学界对这两层问题的研究方法、工具链和人才储备完全不同。实现漏洞可以用模糊测试和静态分析发现,算法缺陷需要数学证明和构造性攻击。一个AI系统同时能在两个层面工作——而且在第二层面的效率已经可以和人类专家团队竞争——这意味着安全研究的工具链正在被重塑。 CryptanalysisBench:把竞赛公开化 Anthropic并没有把这项能力藏着掖着。他们联合苏黎世联邦理工学院(ETH Zurich)、特拉维夫大学和柏林工业大学发布了CryptanalysisBench——一个专门测试LLM密码分析能力的基准。 这个基准包含191个任务,横跨六大密码原语家族(分组密码、哈希函数等),来自四场NIST标准化竞赛。分三个难度层级: Tier 1:已知存在实际攻击的方案 → 五个前沿模型(Claude Opus 4.8、Sonnet 5、Mythos 5、GPT 5.5、GLM 5.2)攻破了65%-86% Tier 2:无已知实际攻击的方案,测试完整版和缩小版 → 模型们在完整版上攻破了6-12个 Tier 3:处于密码分析前沿的生产级方案 更值得关注的是,模型们不只是复现已知攻击,还产生了全新发现:对SpoC AEAD的设计缺陷攻击、对KINDI已发表CCA安全性证明中的错误——这些都是此前未被人类密码学家发现的。 换句话说,AI已经不是在做密码学练习题,而是在做密码学研究。 历史坐标系:当算法在评审中被攻破 HAWK不是第一个在NIST评审过程中被攻破的方案。这个先例本身就很有意思。 2022年,NIST后量子标准化的第一轮中,候选方案SIKE被证明可以在一台笔记本电脑上一小时内完全攻破。发现者不是AI,是人类密码学家。那次事件震惊了整个密码学界——一个通过了初步评审的方案竟然如此脆弱。 把Claude攻破HAWK放在这个坐标系里看: ...