📌 系列导航🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站

论文信息

项目内容
日期2026-09-15(论文发布 2026-09-08,EMNLP 2026 接收)
论文Osprey: Target-agnostic Pre-training Makes Stronger Drafters in Speculative Decoding
作者Fengxiang Bie, Yuqing Jian, Yifan Yu, Zhongzhu Zhou, Zelei Shao, Ben Athiwaratkun, Shuaiwen Leon Song, Chenfeng Xu, Xiaoxia Wu, Tianyi Zhang
机构伊利诺伊大学香槟分校 / 悉尼大学 / 得克萨斯大学奥斯汀分校(LeanModels 团队)
链接https://arxiv.org/abs/2609.09338
代码https://github.com/LeanModels/Osprey(7个适配后草稿器与骨干在 HuggingFace 开放)

注:今日 arXiv API 与 Semantic Scholar API 持续限流(HTTP 429,已按 60s/180s/300s 三档退避重试),选题改经 OpenAlex 与 Hugging Face Papers 元数据通道检索,arXiv ID 2609.09338 已经 https://arxiv.org/abs/2609.09338 页面(HTTP 200)与 OpenAlex 记录、arXiv 官方摘要/作者元数据三方交叉验证。

一句话总结

Osprey 把投机解码的草稿模型从"为一个目标从零训练"翻转为"剪枝现成小模型 → 目标无关预训练(一次)→ 轻量适配(每目标)":同一个预训练骨干跨 Qwen3-8B / Llama-3.3-70B / MiniMax-M2.5-229B 复用,平均接受长度 +16.1%~22.7%,域外与多语场景增益最大。

解决什么问题

投机解码是 LLM 推理加速的标配,但它的收益很脆弱:草稿器通常在单一目标模型、单一数据分布上训练,工作负载一变(域外文本、多语言、换目标模型)接受率就塌方。这形成了刺眼的反差——目标模型靠大规模预训练获得广谱泛化,为其服务的草稿器却享受不到预训练的红利。原因在于现有配方是目标特定的:草稿器消费目标的隐状态、在目标的 logits 上蒸馏,预训练成果无法跨目标摊销,换个目标就得推倒重来。

核心方法

四阶段流水线,把"预训练"变成可复用资产:

1. 剪枝(Prune):取现成预训练小 LM,保留 embedding、LM head 与前 N 层,得到延迟预算内的浅层骨干;

2. 目标无关预训练(Pre-train,仅一次):在 FineWeb 上做下一词预测,恢复剪枝受损的语言建模能力,产出一个可复用的"骨干资产";

3. 逐目标适配(Adapt):词表对齐让草稿器能输出目标词表的 token;零初始化 QKV 扩展把目标模型隐状态以旁路注入——零初始化保证训练起点恒等,既学会"看"目标状态,又不破坏预训练计算;

4. EAGLE-3 蒸馏(Distill):对冻结目标模型的输出分布做 on-policy 蒸馏,完成与目标的最终对齐。

实验结果

  • 同一 Osprey 骨干适配三个目标:Qwen3-8B 平均接受长度 +16.1%,Llama-3.3-70B-Instruct +21.2%,MiniMax-M2.5(229B FP8 MoE)+22.7% 且吞吐 +17.5% tokens/s
  • 最大增益出现在域外与多语数据——恰是传统草稿器崩溃的场景;五域跨域矩阵与消融实验验证各组件贡献
  • 仓库开源 Stage 3/4(适配+蒸馏)代码,HuggingFace 提供 7 个适配后草稿器、Stage-2 骨干与 5 个评测切分,全部可复现

深层洞察

这篇论文最有力的观念转换:把 LLM 世界的"预训练—微调"范式搬进投机解码——预训练预算花一次,适配成本摊销到每个新目标。零初始化 QKV 扩展是"注入新输入而不遗忘旧知识"的通用技巧,与 LoRA 的零初始化 B 矩阵异曲同工。更重要的信号是它在 229B MoE 模型上依然成立:目标模型越换越大,草稿器不必跟着重训,这对多模型服务平台是真金白银的算力节省。

局限性

  • 仓库只开源 Stage 3/4,剪枝与目标无关预训练(Stage 1/2)“另行发布”,骨干复现暂时依赖作者 checkpoint
  • 适配阶段仍需跑目标模型做蒸馏,换目标成本没有降为零
  • 接受长度提升不等于端到端等比加速,大 batch、延迟敏感场景需自行实测
  • 评测以生成类任务为主,代码等重结构化域覆盖有限

工程实践启示

  1. 多模型服务平台(网关、多租户推理)可直接复用其 HF 草稿器:Qwen3-8B、Llama-3.3-70B、MiniMax-M2.5 三个目标开箱即用;
  2. 草稿器选型思路从"与目标绑定"转向"骨干+适配头",新目标只训练轻量适配层;
  3. 零初始化旁路注入可迁移到一切"新增条件输入又怕灾难遗忘"的场景(分类器引导、检索注入等);
  4. 域外/多语流量占比高的业务,草稿器泛化能力直接决定线上 P99 加速比,应纳入投机解码服务的 SLO 评测项。