当「敢做」成为卖点:Mistral Large 4 与被政策污染的安全评测
一个反常的榜单 昨天,法国 Mistral AI 发布了迄今最大的模型 Mistral Large 4(代号 le Chonk):1.05 万亿总参数、每 token 激活仅 49 亿,原生多模态,附带一个 16 亿参数的视觉编码器,上下文窗口 100 万 token。它全程在自有欧洲数据中心的 3800 块 NVIDIA Grace Blackwell GPU 上从零训练完成,权重经红队测试后将于 10 月底开放。 这份成绩单里最扎眼的数字,不是 Artificial Analysis 智能指数从上代 Large 3 的 9 分跃升到 38 分——这个分数超越了 GLM-5.2,但距离 Claude Opus 5.5 的 58 分仍差 20 分。真正反常的是一项安全测试:在「复现开源软件中的真实漏洞并修复」这一基准上,Mistral Large 4 拿到 82%,居所有模型之首;而 Claude Opus 5.5 和 GPT-6 Astra 的得分接近零。 原因不是它们不会做,而是它们直接拒绝了任务。 这 82% 和那两个 0 分之间,藏着当下 AI 行业一条正在扩大的裂缝:当模型能力趋同,厂商策略开始成为排行榜上的主导变量。这篇文章想拆开这个现象:它从哪来、意味着什么、以及工程团队该怎么在噪声里做选型决策。 「拒绝偏差」:排行榜上的政策噪声 先厘清机制。所谓「复现漏洞并修复」,是安全研究的标准工作流:证明漏洞真实存在,是修复的第一步。攻防两侧用的知识是同一套——这正是「双用途」问题的经典困境。 ...