把成本写进架构:Qwen3.8-Flash-Next 预演的大模型效率范式
8月26日晚,阿里千问团队发布并开源了 Qwen3.8-Flash-Next。这个名字里的"Next"是关键信号:它不是旗舰,而是 Qwen4 下一代架构的公开预演——就像电影上映前的预告片,正片是 Qwen4 全家桶。 但如果只把它当成又一次"国产模型刷新榜单",会错过真正值得看的东西。这个模型的总参数量 176B,每个 token 只激活 6B(3.4%);官方版训练成本约为 Qwen3.7-Plus 的 1/9;原生 262K 上下文,YaRN 扩展到 1M 后注意力核 prefill 提速最高 7.6 倍。这些数字指向同一个事实:架构设计的重心,正在从"能力上限"转向"成本结构"。过去两年实验室在拼谁的模型更强,现在开始拼谁的每个 token 更便宜。这个范式转移值得拆开看。 三个反常规的设计选择 1. 超稀疏 MoE:激活率降到 3.4% Qwen3.7-Plus 是 397B 总参、17B 激活(4.3%);Qwen3.8-Flash-Next 总参降到 125B 主模型(加上嵌入层约 176B),激活只有 6B。总参数砍到三分之一,激活参数砍到三分之一强,但 SWE-bench Pro 从 55.8 涨到 62.5,官方口径领先 Claude Opus 4.6 达 9.1 分。 稀疏 MoE 本身不新鲜,但"稀疏度"的量级在变。GPT-4 时代的 MoE 激活率大约在 10%-20%,现在头部模型一路压到 3% 左右。这背后的逻辑很直白:MoE 的本质是把"知识容量"和"计算量"解耦——总参数决定模型知道多少,激活参数决定回答一次要花多少算力。当激活率足够低,一个 176B 的模型可以跑出接近 7B 稠密模型的推理成本,却保留大模型的的知识密度。 2. GDN + QSA 混合注意力:压缩与检索的分工 这是整个发布里技术含量最高的部分。此前 Qwen 的混合模型是 Gated DeltaNet(GDN)配 Gated Attention,这次换成了 GDN + Qwen Sparse Attention(QSA)的组合,48 层按固定节奏排布:3 组"GDN 层 → MoE 层"接 1 组"QSA 层 → MoE 层",循环 12 次。也就是四分之三的层做压缩,四分之一做检索。 ...