📋 论文信息
| 项目 | 内容 |
|---|---|
| 日期 | 2026-08-18(论文发布 2026-08-14) |
| 论文 | CForce: Boosting Parallel Decoding for dLLMs via Consistency Forcing |
| 作者 | Yuji Ren, Chenkai Xu, Zhuocheng Gong, Jianguo Li, Zhijie Deng |
| 机构 | 上海交通大学、蚂蚁集团(蚂蚁研究基金资助) |
| 链接 | arxiv.org/abs/2608.13925 |
| 代码 | github.com/inclusionAI/dFactory |
🎯 一句话总结
把模型自己"慢思考"(多步解码)时的后期高置信预测,蒸馏给"快思考"(高并行解码)时的早期低上下文预测,让 dLLM 敢于一次多填 token 而不翻车。
❓ 解决什么问题
扩散语言模型(dLLM)靠一次前向预测多个 mask 位来加速生成。但激进并行解码时,早期阶段上下文极少(大部分位置还是 [MASK]),模型预测不可靠;一旦早期填错,错误会传播到后续阶段。现有加速方法要么只做推理时优化(不训模型),要么依赖冻结教师或特权轨迹,没有直接在"模型自己阈值解码路径产生的低上下文状态"上训练。核心矛盾:速度要求早期就敢填,质量却依赖后期修正。
🔧 核心方法
1. 分段轨迹构造
用预训练模型冷启动,按置信度阈值 τ 做自rollout解码,得到轨迹 (s₀, s₁, …, s_T)。不是逐帧配对(相邻状态差异太小、监督信号弱),而是按累计揭示 token 数达到固定步长 S 切段,形成粗粒度相邻阶段对——每对之间上下文变化足够大,训练信号更实。
2. 相邻阶段一致性强迫
- 早期状态当学生输入,后期状态(信息更多)经 stop-gradient 当教师目标——同一个模型,无需冻结外部教师
- 在两阶段都仍 mask 的位置 U 上,用 Confidence Adaptive KL(CAD):
$$\mathcal{L}{CAD} = \frac{1}{|\mathcal{U}|}\sum{j} \left[ D_{KL}(p_{tar} | p_{stu}) + c_j , D_{KL}(p_{stu} | p_{tar}) \right]$$
前向 KL(无权重)负责稳住分布漂移,反向 KL 按后期置信度 c_j 加权——教师确定时才施加 mode-seeking 压力,避免过早坍缩。这个设计很聪明:消融显示纯前向 KL 分数高但保守(TPF 5.07),纯反向 KL 并行猛但崩分(65.57),CAD 两全(80.88 分 + 6.42 TPF)
- 在揭示边界位置 Δ 上加 CE anchor 锚定即将提交的 token,防止边界处翻车
3. 课程学习
初期完整阶段间隙太难,按线性调度只揭示部分新token构造"打折版后期状态"(ρ: 0.1→1),让模型先学局部一致性再学大跨步。
4. 可编辑 dLLM 的免费增益
可编辑模型(如 LLaDA2.1)后期能改已生成的 token(T2T refinement)。这些后期修正直接变成早期 mask 预测的额外监督——早期填错没关系,后期改对了就拿来教早期的自己。
5. 理论保证
论文证明了一个上界:早期预测误差(TV距离)≤ 相邻阶段 KL 漂移之和 + 揭示边界 token 误差——CAD 优化的正是这个上界的 tractable surrogate。
📊 实验结果
| 模型 | 平均 TPF | 平均分数 | 平均 AUP |
|---|---|---|---|
| LLaDA2.1-mini(基线) | 6.94 | 85.57 | 687 |
| LLaDA2.1-mini-CForce | 9.08(+31%) | 86.41(↑) | 925(+35%) |
| LLaDA2.0-mini(基线) | 3.60 | — | 257 |
| LLaDA2.0-mini-CForce | 6.42 | 略降 | 498 |
- 可编辑模型收益最大:MBPP AUP 从 636 → 1016(+60%),代码类基准提升最猛——印证"后期修正反哺早期起草"的设计
- 同模型 stop-gradient 目标 优于冻结教师(分数 +1.39,TPF +0.51)——教师跟着学生一起进化,监督更对齐
- 步长 S=8 最优(S=16 太粗反而掉分)
- 评测用 SGLang,block size 32,四个基准:GSM8K / MATH500 / MBPP / HumanEval
💡 深层洞察
为什么这篇重要: 这是"训练-推理对齐"思想在 dLLM 加速上的干净落地。此前一致性蒸馏多依赖冻结教师或固定表示,本文的关键洞察是:模型自己推理时走过的路,就是最好的训练数据——不需要更强的教师,只需要"未来的自己"教"现在的自己"。这与 LLM 领域的 self-play / STaR 一脉相承,但用在了去噪轨迹上。
CAD 的置信度自适应加权也值得细品:它本质是在"质量保险"(前向KL)和"速度激进"(反向KL)之间做了逐位置、逐时刻的动态插值——不是全局超参,而是样本内自适应,这解释了它在 Pareto 前沿上的位置。
⚠️ 局限性
- 离线轨迹:轨迹在训练前一次性收集,训练中模型变化后缓存轨迹逐渐失配(作者自己也承认,未来做在线收集)
- 非编辑模型上分数略有下降,是显式的速度-质量交换,不是免费午餐
- 只在 LLaDA 系 mini 模型 + 数学/代码基准上验证,泛化性待考
🛠️ 工程实践启示
- 部署 dLLM 服务追求吞吐:CForce 式后训练是现成方案,SGLang 兼容,直接换 checkpoint
- 自蒸馏无需额外教师模型:训练成本主要在 rollout 收集,一次前向 rollout 即可复用整个训练
- 置信度门控损失值得迁移:任何"教师信号可靠性不均"的蒸馏场景(小模型蒸馏、RLHF 策略约束)都可借鉴 c_j 加权反向 KL 的思路
- 代码已开源(inclusionAI/dFactory),蚂蚁系出品,工业界可信度较高
本文由每日论文精读流水线自动生成,人工审核后发布。