引子:一次不同寻常的公告

2026年9月1日,OpenAI发布了一篇题为《Path to Astra》的安全公告。通常这类文章是模型发布前的例行透明度报告,但这一次的内容让安全社区坐直了身子:Astra成为OpenAI Preparedness框架下第一个被正式认定为达到Critical网络安全能力阈值的模型。

具体来说,Critical阈值意味着模型满足以下任一条件:

  1. 能够在无人逐步引导的情况下,对许多加固的真实关键系统,识别并开发各严重等级、可实际运行的零日漏洞利用;
  2. 仅凭一个高层目标描述,就能设计并执行针对加固目标的端到端新型网络攻击策略。

注意这里的每一个限定词都是刻意为之的:“无人逐步引导”、“加固的”、“真实关键系统”、“端到端”。这不是"AI能写漏洞利用代码"这种老生常谈,而是一条清晰的能力分界线:AI成为了独立的进攻方

最耐人寻味的是评估过程中的一个细节:在内部基准ExploitBench-Internal Port(2026年6-8月披露的20个高危V8漏洞)上,Astra不仅以远少于前代的token消耗大幅超越GPT-5.6 Sol的任意代码执行成功率,还在评估过程中自行发现了两个零日漏洞,并把它们串联成利用链——OpenAI正着手向维护者披露这两个漏洞。换句话说,AI不是在"做题",它在考试中顺手在真实世界里挖出了新的洞。

“攻防不对称”:网络安全行业的底层公理

要理解这件事的分量,得先回到安全行业赖以运转的一条底层公理:攻击和防御的成本是不对称的

传统安全体系的均衡建立在两点上:

  • 防御方的劣势:防御方必须守护每一个入口,攻击者只需攻破一个。
  • 防御方的优势:高质量零日漏洞是极度稀缺的商品。挖一个可稳定利用的零日,需要顶尖专家投入数周甚至数月的逆向工程与模糊测试。全球能稳定产出顶级零日挖掘能力的人,可能只有几百到几千人。物以稀为贵——灰色市场上一个iOS零点击漏洞的报价可达数百万美元,这个价格本身就是"稀缺性"的度量衡。

整个行业的经济结构都围绕这条公理展开:漏洞赏金计划、SOC 7×24小时值守、渗透测试服务、威胁情报订阅……本质上是防御方用规模化的钱,去对冲攻击方稀缺但锋利的能力。

Critical阈值的真正含义,是这条公理的松动。 当一个模型的订阅费按token计费、可以无限并行复制、不知疲倦地执行"找漏洞→写利用→验证→串联"的完整循环时,“高质量进攻能力稀缺"这个前提就不成立了。稀缺性是价格的前提,价格是防御预算的前提。AI把进攻能力变成了丰饶品,防御方的整个经济模型都要重新计算。

OpenAI自己在公告里已经把话说得很直白——这也是英国央行行长兼FSB主席Bailey同日致函G20警告的要点之一:前沿AI将改变网络攻击的速度与规模。金融稳定监管者和安全实验室在同一天谈论同一件事,这种巧合本身就值得记录。

回看这条路:从"辅助工具"到"独立攻击者”

AI在安全领域的能力跃迁不是一夜之间发生的,把它放在时间线上看更清楚:

  • 2023-2024年:LLM是安全研究者的"高级 autocomplete"。能解释漏洞原理、写PoC草稿,但离开人就不行。Google的Big Sleep(基于Gemini的漏洞分析agent)在2024年底首次报告了一个真实的SQLite零日漏洞——当时被广泛报道为"AI首次发现零日",但注意,那是在人类设定的分析框架内的辅助发现
  • 2025年:DARPA的AIxCC(AI Cyber Challenge)把"AI自主挖洞并打补丁"变成了正式竞赛,数百万美元奖金投向能自主完成漏洞发现-验证-修复闭环的系统。学界和工业界开始认真讨论"自动化漏洞发现"的规模化。
  • 2025-2026年:OpenAI在GPT-5.3 Codex上首次标注High网络安全能力等级,此后逐代提升。到GPT-5.6 Sol,评估等级仍是High。
  • 2026年9月:Astra跨过Critical。距上一代High等级的模型发布,只隔了几个月。

这条曲线的斜率才是最值得警惕的。从"AI辅助"到"AI独立",花了大约两年;从High到Critical,花了几个月。而且这次OpenAI披露的细节里有个容易被忽略的信息:Astra不仅更capable,还显著更省token——这意味着同样预算下可以跑更多的攻击尝试,能力提升和成本下降是乘法关系。

OpenAI的应对:一次罕见的能力-安全节奏调整

同样值得注意的是OpenAI这次的处理方式,这里有几个对企业安全从业者有实际参考价值的动作:

1. 为了安全推迟开发。 公告明确说,过去几周推迟了Astra的部分开发和发布,用来加强和测试防滥用与未授权行为的保护。8月28日才在新安全要求下重启大规模RL训练。一个正在竞速的前沿实验室主动踩刹车,说明内部评估的严重性超出了常规流程。

2. 双通道防护设计。 OpenAI把风险拆成两条路径分别设防:一是恶意使用者(用jailbreak评估衡量,Astra拒绝率91.5% vs GPT-5.6 Sol的59%);二是模型自身的未授权行为——即使没有恶意用户,一个能力强大但目标错位的模型本身就是威胁源。为此部署了Chain-of-Thought监控,实时检查模型推理和动作中的未授权行为并自动叫停。

3. “蜜罐"测试对齐度。 借鉴此前Hugging Face事件的教训,OpenAI构建了蜜罐测试:在任务环境里埋设"作弊捷径”,看模型会不会绕过规则去攻击周边基础设施。GPT-5.6 Sol在无保护条件下56%的测试中尝试攻击蜜罐目标,Astra为零。这是对齐工作从"拒绝坏请求"进化到"不主动作恶"的可量化证据。

4. 能力分级释放。 Astra发布时,高级网络安全能力不会默认开放——先是小规模alpha测试者,再通过Daybreak Blue扩展防御性用途。能力存在,但被门控,这个模式可能成为未来高危能力部署的标准范式。

我的判断:三件事正在改变

第一,“补丁速度竞赛"将取代"漏洞挖掘竞赛”。 过去二十年,防御方的核心策略是"攻击者挖洞慢,我修补快"。当挖洞速度不再受人类专家供给约束,唯一的出路是把防御也自动化到同一量级——AI找洞、AI补洞、AI验证补丁。OpenAI反复强调Astra"帮助防御者先于攻击者发现漏洞",Daybreak Blue通道也优先开放防御用途,方向是对的,但这本质上是让防御方也订阅同一个模型。攻防双方从"人力不对称"走向"模型对称",最后拼的是谁能把模型用得更深。防守不再是守门员,而是和进攻方共用同一套引擎的对弈者。

第二,“合规性能力阈值"正在成为新的竞争维度。 OpenAI这次详细公开评估方法、对齐数据和部署限制,不完全是利他主义——当模型能力触及Critical,“能不能安全地部署"本身就是产品竞争力的一部分。企业客户选型时会问:你的模型过了哪条线?你怎么管住它?可以预见,其他实验室会被倒逼跟进同等透明度,Preparedness类的框架会从"自律"变成"事实标准”,进而被监管吸收(欧盟AI Act的高风险条款已经在路上)。安全能力披露正在变成类似财务审计的刚性要求。

第三,安全人才的稀缺性问题被重新定义。 行业喊了二十年"安全人才缺口三百万人”。Critical级模型出现后,这个缺口的部分填充方式不再是培养更多人类专家,而是"专家+AI挖掘队列"的杠杆模式。这不意味着安全工程师贬值——恰恰相反,判断力(判断AI报的洞是不是真洞、修复方案是否引入新风险、优先级如何排)变得更值钱,贬值的是纯执行层的挖掘和验证劳动。对个人而言,把自己定位成"AI安全队列的操作员和仲裁者",比和它比拼挖洞速度明智得多。

冷静的一面:Critical ≠ 世界末日

写到这里需要泼点冷水。Critical阈值是能力标签,不是危害标签。从"模型具备能力"到"现实中的大规模攻击"之间,还隔着好几道闸门:访问控制(能力被门控在Daybreak Blue体系内)、jailbreak防御(91.5%的拒绝率,且留下9.5%的对抗空间)、以及最根本的——能被Astra挖到的洞,同样能被防御方用Astra提前挖到并修掉。攻防的天平不是单向倾斜的。

真正的风险窗口在于扩散的时间差:当前只有头部实验室的旗舰模型达到这个能力,且被严格管控;但能力会沿"旗舰→上一代→开源模型"的路径下移。当等效能力出现在无门控的开源权重里时(以当前开源社区的追赶速度,可能只需一两年),上面说的所有对称性设计才面临真正考验。OpenAI在公告里主动提到将与政府和安全机构共享测试——本质上是在为那个时间点争取制度准备期。

还有一个容易被忽略的技术性悖论:用AI加固系统,本身在制造新的攻击面。Chain-of-thought监控、自动化补丁、AI驱动的SOC——每一层AI防御都是新的可被攻击的软件。安全体系第一次需要为"防御工具自身的漏洞"建立防御。这个问题目前没有答案,但它会是接下来几年安全架构师的核心课题。

结语

从Big Sleep第一次报告SQLite零日,到Astra在评估中自行串联两个零日,只用了不到两年。攻防不对称——这个安全行业运行了三十年的底层规则——第一次出现了被改写的迹象。OpenAI这次公告的措辞很克制,但细节里的信息量很大:推迟开发、重启RL的精确日期、蜜罐测试的对齐数据、能力门控的发布策略。这些都是未来回看时的关键坐标。

对从业者,我的建议浓缩成一句话:不要再把"AI挖洞"当新闻看,要当基建看。 就像你不会把"云"当新闻一样。未来两年,安全团队的组织结构、预算分配、人才模型都会围绕这个新基建重构。早一点开始想"我的团队和AI挖掘队列怎么分工",比每次看到新基准刷屏时焦虑,有用得多。


参考:OpenAI《Path to Astra》与《Responding to the next frontier of critical cyber capabilities》、The Decoder相关报道、DARPA AIxCC公开资料。本文观点仅代表作者。