📌 系列导航:🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站

论文信息

项目内容
日期2026-10-09
论文Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability
作者Bingxi Hou, Guochao Jiang, Guofeng Quan, Weiqing Li, Wenfeng Feng, Guohua Liu, Yuewei Zhang
机构阿里云
链接arXiv:2610.08448
代码未提供

一句话总结

跨分词器在线蒸馏不必执着于补齐所有对齐缺口:严格1:1位置的紧凑监督(top-16共享词表reverse KL)比全覆盖监督更有效,因为监督的可靠性比覆盖面更重要。

解决什么问题

在线策略蒸馏(OPD)让学生在自己生成的轨迹上接受教师反馈,是跨模型家族压缩能力的主流路径。但当师生分词器不同(如Qwen→Llama),同一句话切出的token边界和词表都不同,预测分布无法直接比较。此前工作(SimCT、字节前缀边缘化等)用多token组、学到的映射等手段尽量"恢复"被对齐过程丢掉的监督信号。本文追问:这些费劲恢复的额外监督,到底有多少学习价值?

核心方法

论文先定义严格1:1组:一个学生token和一个教师token覆盖完全相同的文本区间。在这些位置,把师生分布限制在共享词表 V∩ 上并归一化,再做reverse KL:

ℒ₁:₁ = E[Σ_r KL(π̄_θ(·|x,y_<ir) ‖ π̄_T(·|x,v_<jr))]

关键发现在三组异构师生对(Qwen2.5-7B-Instruct→Llama-3.2-3B、Granite-4.1-8B→Phi-4-mini、Granite-4.1-8B→Qwen2.5-7B-Base)上展开:

  1. 覆盖被低估了:静态词表Jaccard重叠只有39-65%,但学生轨迹上严格1:1组覆盖了85.6-97.0%的学生token,且整个训练过程稳定。
  2. 概率质量高度集中:在严格位置,共享词表几乎承载了师生全部概率质量;学生自选的top-16子集就能保留大部分。
  3. span MSE适得其反:对mismatch组用MSE匹配span对数概率,18组正权重设置全部降低平均准确率。
  4. 梯度诊断给出解释:只训严格损失时检查checkpoint,span梯度与严格梯度的方向一致性很弱甚至为负,且相对范数随训练增大——这些方向不一致、越来越大的梯度污染了训练信号。

实验结果

  • 训练数据:2万prompt(DAPO-Math-17K数学1万 + CodeForces代码1万);评测覆盖MATH500、GSM8K、AIME 2024-2026、AMC23、Minerva-Math、HumanEval、MBPP、LiveCodeBench。
  • k=16的紧凑严格目标保留了完整共享词表OPD至少96%的平均提升。
  • 完整与紧凑严格目标在三组师生对上的全面平均都超过了所评测的跨分词器基线。
  • 加span MSE监督:全覆盖换来的是一致性掉点。

深层洞察

这篇论文的核心贡献是一次范式纠偏:对齐覆盖面(alignment coverage)≠ 监督价值(supervision reliability)。静态词表重叠是误导性指标——token频率分布高度不均,常用token恰恰最容易被严格对齐。更深刻的是梯度诊断:多token组上构造的span监督,看似"恢复"了教师信号,实际产生了与主损失方向冲突的梯度,而且冲突随训练放大。这呼应了蒸馏文献中"集中支撑集足够"的结论,并把它推广到了异构分词器场景。方法论上,“先测概率质量保留、再测梯度方向一致性"这套诊断流程,对任何构造辅助损失的工作都有借鉴意义。

局限性

  • 只测了3组师生对和数学/代码两个领域,开放式生成、多模态场景未验证。
  • span监督用的是MSE on span log-probs,其它mismatch目标函数(如对齐组内的序列级KL)未必同样有害。
  • top-16的选取依赖学生分布,教师侧概率质量是否总被学生top-k覆盖,理论上无保证,只有经验测量。
  • 无开源代码,复现需自行实现token-group对齐管线(好在附录给了细节)。

工程实践启示

  • 做跨模型蒸馏时,先测量严格对齐的真实覆盖率再决定是否上复杂的对齐恢复机制——大概率已经够用。
  • 把KL限制在学生top-16候选上,既省算力(词表越大收益越明显)又不掉点,是直接的工程优化。
  • 构造任何辅助损失前,先做梯度方向一致性检查:方向为负的辅助信号加得越多,伤害越大。