论文信息
| 项目 | 内容 |
|---|---|
| 日期 | 2026-09-15(论文发布 2026-09-08,EMNLP 2026 接收) |
| 论文 | Osprey: Target-agnostic Pre-training Makes Stronger Drafters in Speculative Decoding |
| 作者 | Fengxiang Bie, Yuqing Jian, Yifan Yu, Zhongzhu Zhou, Zelei Shao, Ben Athiwaratkun, Shuaiwen Leon Song, Chenfeng Xu, Xiaoxia Wu, Tianyi Zhang |
| 机构 | 伊利诺伊大学香槟分校 / 悉尼大学 / 得克萨斯大学奥斯汀分校(LeanModels 团队) |
| 链接 | https://arxiv.org/abs/2609.09338 |
| 代码 | https://github.com/LeanModels/Osprey(7个适配后草稿器与骨干在 HuggingFace 开放) |
注:今日 arXiv API 与 Semantic Scholar API 持续限流(HTTP 429,已按 60s/180s/300s 三档退避重试),选题改经 OpenAlex 与 Hugging Face Papers 元数据通道检索,arXiv ID 2609.09338 已经 https://arxiv.org/abs/2609.09338 页面(HTTP 200)与 OpenAlex 记录、arXiv 官方摘要/作者元数据三方交叉验证。
一句话总结
Osprey 把投机解码的草稿模型从"为一个目标从零训练"翻转为"剪枝现成小模型 → 目标无关预训练(一次)→ 轻量适配(每目标)":同一个预训练骨干跨 Qwen3-8B / Llama-3.3-70B / MiniMax-M2.5-229B 复用,平均接受长度 +16.1%~22.7%,域外与多语场景增益最大。
解决什么问题
投机解码是 LLM 推理加速的标配,但它的收益很脆弱:草稿器通常在单一目标模型、单一数据分布上训练,工作负载一变(域外文本、多语言、换目标模型)接受率就塌方。这形成了刺眼的反差——目标模型靠大规模预训练获得广谱泛化,为其服务的草稿器却享受不到预训练的红利。原因在于现有配方是目标特定的:草稿器消费目标的隐状态、在目标的 logits 上蒸馏,预训练成果无法跨目标摊销,换个目标就得推倒重来。
核心方法
四阶段流水线,把"预训练"变成可复用资产:
1. 剪枝(Prune):取现成预训练小 LM,保留 embedding、LM head 与前 N 层,得到延迟预算内的浅层骨干;
2. 目标无关预训练(Pre-train,仅一次):在 FineWeb 上做下一词预测,恢复剪枝受损的语言建模能力,产出一个可复用的"骨干资产";
3. 逐目标适配(Adapt):词表对齐让草稿器能输出目标词表的 token;零初始化 QKV 扩展把目标模型隐状态以旁路注入——零初始化保证训练起点恒等,既学会"看"目标状态,又不破坏预训练计算;
4. EAGLE-3 蒸馏(Distill):对冻结目标模型的输出分布做 on-policy 蒸馏,完成与目标的最终对齐。
实验结果
- 同一 Osprey 骨干适配三个目标:Qwen3-8B 平均接受长度 +16.1%,Llama-3.3-70B-Instruct +21.2%,MiniMax-M2.5(229B FP8 MoE)+22.7% 且吞吐 +17.5% tokens/s
- 最大增益出现在域外与多语数据——恰是传统草稿器崩溃的场景;五域跨域矩阵与消融实验验证各组件贡献
- 仓库开源 Stage 3/4(适配+蒸馏)代码,HuggingFace 提供 7 个适配后草稿器、Stage-2 骨干与 5 个评测切分,全部可复现
深层洞察
这篇论文最有力的观念转换:把 LLM 世界的"预训练—微调"范式搬进投机解码——预训练预算花一次,适配成本摊销到每个新目标。零初始化 QKV 扩展是"注入新输入而不遗忘旧知识"的通用技巧,与 LoRA 的零初始化 B 矩阵异曲同工。更重要的信号是它在 229B MoE 模型上依然成立:目标模型越换越大,草稿器不必跟着重训,这对多模型服务平台是真金白银的算力节省。
局限性
- 仓库只开源 Stage 3/4,剪枝与目标无关预训练(Stage 1/2)“另行发布”,骨干复现暂时依赖作者 checkpoint
- 适配阶段仍需跑目标模型做蒸馏,换目标成本没有降为零
- 接受长度提升不等于端到端等比加速,大 batch、延迟敏感场景需自行实测
- 评测以生成类任务为主,代码等重结构化域覆盖有限
工程实践启示
- 多模型服务平台(网关、多租户推理)可直接复用其 HF 草稿器:Qwen3-8B、Llama-3.3-70B、MiniMax-M2.5 三个目标开箱即用;
- 草稿器选型思路从"与目标绑定"转向"骨干+适配头",新目标只训练轻量适配层;
- 零初始化旁路注入可迁移到一切"新增条件输入又怕灾难遗忘"的场景(分类器引导、检索注入等);
- 域外/多语流量占比高的业务,草稿器泛化能力直接决定线上 P99 加速比,应纳入投机解码服务的 SLO 评测项。