📌 系列导航🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站

📋 论文信息

项目内容
日期2026-08-18(论文发布 2026-08-14)
论文CForce: Boosting Parallel Decoding for dLLMs via Consistency Forcing
作者Yuji Ren, Chenkai Xu, Zhuocheng Gong, Jianguo Li, Zhijie Deng
机构上海交通大学、蚂蚁集团(蚂蚁研究基金资助)
链接arxiv.org/abs/2608.13925
代码github.com/inclusionAI/dFactory

🎯 一句话总结

把模型自己"慢思考"(多步解码)时的后期高置信预测,蒸馏给"快思考"(高并行解码)时的早期低上下文预测,让 dLLM 敢于一次多填 token 而不翻车。

❓ 解决什么问题

扩散语言模型(dLLM)靠一次前向预测多个 mask 位来加速生成。但激进并行解码时,早期阶段上下文极少(大部分位置还是 [MASK]),模型预测不可靠;一旦早期填错,错误会传播到后续阶段。现有加速方法要么只做推理时优化(不训模型),要么依赖冻结教师或特权轨迹,没有直接在"模型自己阈值解码路径产生的低上下文状态"上训练。核心矛盾:速度要求早期就敢填,质量却依赖后期修正。

🔧 核心方法

1. 分段轨迹构造

用预训练模型冷启动,按置信度阈值 τ 做自rollout解码,得到轨迹 (s₀, s₁, …, s_T)。不是逐帧配对(相邻状态差异太小、监督信号弱),而是按累计揭示 token 数达到固定步长 S 切段,形成粗粒度相邻阶段对——每对之间上下文变化足够大,训练信号更实。

2. 相邻阶段一致性强迫

  • 早期状态当学生输入,后期状态(信息更多)经 stop-gradient 当教师目标——同一个模型,无需冻结外部教师
  • 在两阶段都仍 mask 的位置 U 上,用 Confidence Adaptive KL(CAD)

$$\mathcal{L}{CAD} = \frac{1}{|\mathcal{U}|}\sum{j} \left[ D_{KL}(p_{tar} | p_{stu}) + c_j , D_{KL}(p_{stu} | p_{tar}) \right]$$

前向 KL(无权重)负责稳住分布漂移,反向 KL 按后期置信度 c_j 加权——教师确定时才施加 mode-seeking 压力,避免过早坍缩。这个设计很聪明:消融显示纯前向 KL 分数高但保守(TPF 5.07),纯反向 KL 并行猛但崩分(65.57),CAD 两全(80.88 分 + 6.42 TPF)

  • 在揭示边界位置 Δ 上加 CE anchor 锚定即将提交的 token,防止边界处翻车

3. 课程学习

初期完整阶段间隙太难,按线性调度只揭示部分新token构造"打折版后期状态"(ρ: 0.1→1),让模型先学局部一致性再学大跨步。

4. 可编辑 dLLM 的免费增益

可编辑模型(如 LLaDA2.1)后期能改已生成的 token(T2T refinement)。这些后期修正直接变成早期 mask 预测的额外监督——早期填错没关系,后期改对了就拿来教早期的自己。

5. 理论保证

论文证明了一个上界:早期预测误差(TV距离)≤ 相邻阶段 KL 漂移之和 + 揭示边界 token 误差——CAD 优化的正是这个上界的 tractable surrogate。

📊 实验结果

模型平均 TPF平均分数平均 AUP
LLaDA2.1-mini(基线)6.9485.57687
LLaDA2.1-mini-CForce9.08(+31%)86.41(↑)925(+35%)
LLaDA2.0-mini(基线)3.60257
LLaDA2.0-mini-CForce6.42略降498
  • 可编辑模型收益最大:MBPP AUP 从 636 → 1016(+60%),代码类基准提升最猛——印证"后期修正反哺早期起草"的设计
  • 同模型 stop-gradient 目标 优于冻结教师(分数 +1.39,TPF +0.51)——教师跟着学生一起进化,监督更对齐
  • 步长 S=8 最优(S=16 太粗反而掉分)
  • 评测用 SGLang,block size 32,四个基准:GSM8K / MATH500 / MBPP / HumanEval

💡 深层洞察

为什么这篇重要: 这是"训练-推理对齐"思想在 dLLM 加速上的干净落地。此前一致性蒸馏多依赖冻结教师或固定表示,本文的关键洞察是:模型自己推理时走过的路,就是最好的训练数据——不需要更强的教师,只需要"未来的自己"教"现在的自己"。这与 LLM 领域的 self-play / STaR 一脉相承,但用在了去噪轨迹上。

CAD 的置信度自适应加权也值得细品:它本质是在"质量保险"(前向KL)和"速度激进"(反向KL)之间做了逐位置、逐时刻的动态插值——不是全局超参,而是样本内自适应,这解释了它在 Pareto 前沿上的位置。

⚠️ 局限性

  • 离线轨迹:轨迹在训练前一次性收集,训练中模型变化后缓存轨迹逐渐失配(作者自己也承认,未来做在线收集)
  • 非编辑模型上分数略有下降,是显式的速度-质量交换,不是免费午餐
  • 只在 LLaDA 系 mini 模型 + 数学/代码基准上验证,泛化性待考

🛠️ 工程实践启示

  1. 部署 dLLM 服务追求吞吐:CForce 式后训练是现成方案,SGLang 兼容,直接换 checkpoint
  2. 自蒸馏无需额外教师模型:训练成本主要在 rollout 收集,一次前向 rollout 即可复用整个训练
  3. 置信度门控损失值得迁移:任何"教师信号可靠性不均"的蒸馏场景(小模型蒸馏、RLHF 策略约束)都可借鉴 c_j 加权反向 KL 的思路
  4. 代码已开源(inclusionAI/dFactory),蚂蚁系出品,工业界可信度较高

本文由每日论文精读流水线自动生成,人工审核后发布。