一个反常的榜单
昨天,法国 Mistral AI 发布了迄今最大的模型 Mistral Large 4(代号 le Chonk):1.05 万亿总参数、每 token 激活仅 49 亿,原生多模态,附带一个 16 亿参数的视觉编码器,上下文窗口 100 万 token。它全程在自有欧洲数据中心的 3800 块 NVIDIA Grace Blackwell GPU 上从零训练完成,权重经红队测试后将于 10 月底开放。
这份成绩单里最扎眼的数字,不是 Artificial Analysis 智能指数从上代 Large 3 的 9 分跃升到 38 分——这个分数超越了 GLM-5.2,但距离 Claude Opus 5.5 的 58 分仍差 20 分。真正反常的是一项安全测试:在「复现开源软件中的真实漏洞并修复」这一基准上,Mistral Large 4 拿到 82%,居所有模型之首;而 Claude Opus 5.5 和 GPT-6 Astra 的得分接近零。
原因不是它们不会做,而是它们直接拒绝了任务。
这 82% 和那两个 0 分之间,藏着当下 AI 行业一条正在扩大的裂缝:当模型能力趋同,厂商策略开始成为排行榜上的主导变量。这篇文章想拆开这个现象:它从哪来、意味着什么、以及工程团队该怎么在噪声里做选型决策。
「拒绝偏差」:排行榜上的政策噪声
先厘清机制。所谓「复现漏洞并修复」,是安全研究的标准工作流:证明漏洞真实存在,是修复的第一步。攻防两侧用的知识是同一套——这正是「双用途」问题的经典困境。
但闭源前沿模型的安全策略在这类任务上选择了整体拒绝。Mistral 的说辞是:防御方需要证明漏洞,攻击方反正会越狱,过滤器挡住的只有防御者。更微妙的一层是,事故响应中途被供应商掐断 API 访问,本身就是一种安全风险。
于是同一个基准上出现了三种模型:
- 拒绝型(Claude、GPT-6):能力可能很强,但策略不允许,得分趋近于零;
- 执行型(Mistral Large 4、部分中国开源模型):愿意做,82% 反映真实能力;
- 未测型:大多数排行榜根本不收录这类任务。
这暴露了安全评测的结构性问题:分数混淆了「不会做」和「不让做」。当一个榜单不区分这两者,它测的就不再是模型能力,而是厂商的政策坐标。选型团队如果只看分数,等于把安全策略的决策权外包给了榜单。
值得注意的反面数据:Mistral 同时宣传 ML4 在 JailbreakBench、StrongREJECT、AgentHarm 的恶意网络提示上拒绝率高于任何其他开源模型,在 Lakera B3 安全基准上拦截 93.3% 的攻击。也就是说,它并非「无审核」,而是在划一条和 Anthropic、OpenAI 不同的线。但模型如何可靠地区分「合法漏洞研究」和「攻击准备」,Mistral 没有给出解释——这条线划在哪、划得多稳,开放权重之后将由所有部署者自己验证。
4000 块 GPU 的主权宣言
把镜头拉远,Mistral Large 4 不只是又一个模型发布,它是「开源权重主权化」叙事的最新注脚。
三个背景值得放进同一张图里看。其一,Mistral 强调训练完全在自有欧洲算力上完成,由欧洲史上最大科技股权融资(30 亿欧元 D 轮)支撑,RL 后训练独占约 3000 块 GPU,单次训练每天产出约 330 亿 token;其二,模型支持超过 160 种语言、覆盖全部欧盟官方语言,并计划推出完全由 Mistral 自主运营、独立于其他服务商、适用欧洲法律的「欧洲变体」;其三,几乎同一周,韩国政府宣布以 4.7 万亿韩元(约 34.9 亿美元)股权投资自研前沿大模型,目标直指对标中国最强开源模型。
三条线索指向同一个判断:开源权重正在从技术选择变成地缘资产。非中美的「第三阵营」——欧洲、韩国、中东——都在用「可控性」换生存空间:能否私有化部署、能否审计、会不会被供应商中途掐断,这些属性对主权用户的重要性已经超过了榜单第几名。
Mistral 甚至把「敢做别家不敢做的事」本身做成了卖点。这在商业上是聪明的卡位:强审核闭源模型主动让出的安全、国防、攻防研究场景,正好是主权客户预算最充足的地方。至此,「审核宽严」第一次成为一个可以明码标价的差异化维度。
双轨生态的形成
推演下去,这个趋势的终局大概率是评测体系与模型市场的双重分裂。
在评测端,会出现「按策略分轨」的榜单:一类是能力榜,只测「会不会」,要求在统一宽松的沙箱里跑;一类是政策榜,明确测「让不让」,反映部署时的实际体验。现在这两类被混在一起,导致 Mistral Large 4 的 82% 和 Claude 的 0 分出现在同一张表上——数字可比,语义不可比。论文级别的改进是引入「条件能力」指标:标注每个得分背后的策略前提。
在市场端,攻防研究、事件响应、红队工作会加速流向低审核的开源模型——它们可以私有化部署,不存在「中途被掐断」的风险;而面向公众消费、强合规要求的场景会继续留在强审核闭源模型上。两条生态各自强化:使用者越多,场景数据和微调生态越厚,差距越难逆转。
对工程团队,这带来三个具体动作。第一,安全评估必须覆盖部署态而非仅对话态——昨天日报里那篇 arXiv 论文(多模态大模型一旦进入工具调用流程,拒绝率大幅下降)和这个话题是同一枚硬币的两面:你测出来的「安全」和你运行时的安全,可能差一个 agent 框架。第二,选型时把「拒绝行为」当独立维度评估:用自己业务里的真实双用途样本测拒绝率,而不是信聚合榜。第三,为「可控性」定价:私有化部署、权重可审计、供应链不中断,这些属性在你的风险模型里值多少钱,应该显式写进选型报告。
别急着下结论
最后说两句克制的话。
82% 的漏洞复现得分,目前只有 Mistral 单方口径加上 Artificial Analysis 的部分交叉验证,权重要月底才放出,架构细节、许可证、后训练方法都承诺「随权重一起公布」——在这些落地之前,一切benchmark数字都应打折看待。此外 RL 训练仍在进行中,官方称「未见天花板」,意味着月底开放的可能是一个还在变强的模型,也可能是宣传话术。
更大的问题是那个没有被回答的问题:一条比别家宽松的线,由谁、按什么程序来划?开源之后,这条线本质上交给了每一个部署者。对 Mistral 而言这是自由;对行业而言,这是一次没有对照组的实验。
但方向本身已经清楚了。当模型能力以月为单位趋同,差异化的竞争正在转移到能力之外的地方:策略、主权、可信度。Mistral Large 4 的 82% 或许过几周就会被超越,但它揭示的裂缝——排行榜开始测政策而非能力——会留得很久。
本文基于 2026-10-07 AI洞察日报头条撰写。数据来源:Mistral AI 官方公告、The Decoder、Artificial Analysis、TechCrunch。观点仅供参考,不构成投资建议。