Scaling 的下一个旋钮,与它尚未回答的燃料问题
8月19日和20日,两条消息相隔不到一天抵达。 智谱创始人唐杰在 X 上发布长文,系统阐述他对 Scaling Law 的最新理解:参数从来不是模型能力的唯一刻度,GLM-5.3 是一次严格的控制变量实验——与 GLM-5.2 相同的基座、相同的架构、相同的总参数与激活参数,仅靠一个月的长时间范围环境训练与强化学习,就在 Artificial Analysis 指数上拿到 60 分、跻身国产 SOTA。他的结论是:「Scaling 不止一个旋钮,这一次我们转动了后训练旋钮,因为它剩下的 slack 最大。」 几乎同一时间,图灵奖得主、强化学习奠基人 Richard Sutton 在介绍新公司 Oak Lab 时,把当今各大实验室的核心策略——用合成数据扩展大模型——直接判为「一个大错误」(a big mistake)。世界无限复杂,任何模拟都只是微观近似;判断合成数据的好坏仍需人类专家把关,这条路最终受限于人类。 一边说:扩展还有巨大空间,换个旋钮就行。另一边说:你们的燃料本身就是错的。 这不是巧合。当参数规模这条曲线变得昂贵而平缓,整个行业都在问同一个问题:下一步靠什么扩展?唐杰和 Sutton 给出了两种方向一致、内核冲突的回答。把这场隔空交锋拆开看,能看清大模型竞争下半场的真实地形。 一、唐杰到底说了什么:Scaling 从单变量变成多旋钮系统 先别急着把唐杰的长文当成新模型的公关稿。它真正有价值的地方,是把 Scaling Law 从一条曲线还原成了一个多变量系统。 参数数量只有与另外三个因素放在一起才有意义:你拥有多少数据、计算资源如何分配、模型在什么条件下被推理调用。这个认知是行业用惨痛代价换来的。Kaplan 等人 2020 年的 Scaling Law 主张参数增长快于数据增长(约 2.7:1),GPT-3、Gopher、MT-NLG 照方抓药;2022 年 Hoffmann 等人在四百个模型上重做实验(即 Chinchilla),发现最优分配约为每参数 20 个 token——回头看,那批万亿参数级模型是整个领域共同走过的弯路。 但 Chinchilla 也不是终点。它优化的是「训练一次就评估」的计算分配,而今天的模型每天被调用数十亿次,推理成本在模型全生命周期中占主导。把推理纳入目标函数,最优解就转向更小的模型、训练更久——Llama-2-7B 和 Gemma-2-9B 的 tokens-per-parameter 分别达到约 290 和 889,远超 Chinchilla 时代的 20。这是「有意识的过度训练」,旋钮转动的方向完全变了。 MoE 又改写了一次规则:总参数大致决定模型能「持有」多少——知识、事实、长尾;激活参数与有效深度决定它能「思考」多远——因果链上能走多少步而不散架。唐杰举的例子很具体:找漏洞不是检索问题,不取决于记住多少 CVE 列表,而取决于能否把二十步推理链坚持到底。这种能力不吃参数总数。2025 年的研究也显示,最优 tokens-per-parameter 是任务相关的:记忆任务偏好更多参数,推理任务偏好更多数据。 ...