论文信息
| 项目 | 内容 |
|---|---|
| 日期 | 2026-09-08 |
| 论文 | Instruction Duplication as an Inference-Time Control Primitive |
| 作者 | Victor Lavrenko(单作者) |
| 链接 | arXiv:2609.04024 |
| 代码 | github.com/victorlavrenko/answer-engineering |
一句话总结
只把过程指令(不放问题本身)在提示里重复一遍,就能显著提高模型对结构化协议的执行完整度,但最终答案准确率完全不变——这是一篇把"输出轨迹"当控制对象的推理时控制研究。
解决什么问题
LLM 系统的下游机制(验证器、审计器、运行时控制器、轨迹编辑器)往往不只需要最终答案,还需要模型显式地暴露中间状态:列出事实、给出备选、说明鉴别依据、延迟表态。问题是:不改参数、不改解码、不改模型,仅靠提示词层面的最小干预,能不能稳定地控制这些显式状态的产出?
已有工作显示整体重复提示(Q→QQ)或重读问题能提升推理,但那些干预重复的是"任务内容"。本文问得更窄:如果实质问题一字不动,只重复过程指令本身,会怎样?
核心方法
定义指令 I 与问题 Q。常规提示是 ⟨I⟩⟨Q⟩;指令复制则是 ⟨I⟩⟨Q⟩⟨I⟩ 之类的变体。关键设计:
- 完整 2×2×2 位置因子设计:指令可出现在 system 消息(S)、问题前(B)、问题后(A),共 8 个条件(0/1/2/3 份拷贝 × 位置组合),把"拷贝数"与"位置"解耦
- 过程指令:要求模型按 8 个标题依次输出——事实、含义、临时答案、最佳备选、决定性鉴别、什么会改变答案、重新考虑、最终答案——模拟假设演绎式临床鉴别诊断流程
- 测量层:All-8 诊断(8 个可观测测试全过)、确定性角色完成度、对比式讨论完成度、预表态 TF-IDF 召回率(用 1510 万 PubMed 摘要冻结的 IDF 权重,衡量模型在表态前把题干词汇复现了多少)、过早表态率、最终准确率
- 统计纪律:问题簇自助法置信区间、符号翻转检验、Holm 多重校正、长度稳健性回归
实验规模:7 个指令模型(Gemma 3 12B、Llama 3.3 70B、Llama 4 Scout、Ministral 3 14B、Mistral Large 3、Qwen3 30B-A3B、Qwen3 235B-A22B)× 300 道医学选择题(MedQA/MedXpertQA/AfriMed-QA 各 100)× 8 条件 = 16,800 次生成,temperature=0。
实验结果
- All-8 协议完整率:90.22% → 93.17%(+2.95 个百分点),消灭了单份指令剩余失败的 30.2%
- TF-IDF 召回:73.44% → 74.81%(+1.38 点,Holm 校正后 p<.001);尾部复制(S→SA、B→BA)效果最强:+2.19 点
- 准确率:两臂一模一样,都是 60.21%——但不是输出相同:341 个"模型×问题"块的正确次数发生了变化(170 vs 171,完全对称);480 个块的 All-8 完整度变化中 79% 不伴随准确率变化
- 副作用:过早表态率 1.52% → 2.30%(p=.005),三份拷贝时达 3.12%
- 盲审挑战:30 个机器判定的改善转换中,人眼 20 个平局、10 个确认、0 个反转——预设的 28/30 确认标准未达标
- 下游 AE 实验(最亮眼):在轨迹编辑器 Answer Engineering 中,SSNHL 端点从无编辑基线 25.1% → AE 复现 84.2% → AE+尾部复制 97.1%
深层洞察
这篇文章最有价值的是那个"分离":协议状态变了,答案没变。直觉上我们会用准确率评判一切干预,但这篇说明存在一个独立的"控制面"——当你有下游系统要消费模型的显式轨迹时,让中间状态可机读、可定位,本身就是价值。AE 实验是完整闭环:25.1% 到 97.1% 的跃升,靠的正是"指令复制让轨迹更完整 → 编辑器有了更多可修复的抓手"。
盲审结果同样深刻:机器判定的 30 个改善里人眼只确认 10 个,20 个是"感知平局"。人觉得差不多的输出,对确定性下游系统可能天差地别——因为机器需要显式的备选、限定词、保留/修订标记,而人能从上下文推断。这为"LLM 输出评估该用机器可验证指标还是人评"提供了新证据。
另外,尾部复制最强但"只放尾部"(A 条件)并不强,说明这不是简单的"指令放最后"效应,而是重复暴露的交互作用;第一份指令已捕获大部分收益,加性检验显示强饱和、无超可加性。
局限性
- 单一领域(医学选择题)、单一协议指令,外推性存疑
- 准确率零提升——它不是"让模型更聪明"的方法,只改善可控制性
- 盲审未达预设标准(28/30 只拿到 10/30),人机判定分歧本身削弱了"All-8 指标可信"的论述
- 过早表态上升是真实的副作用,三份拷贝时更糟——不能无脑堆指令
- 单作者、7 页短文,属于探索性研究
工程实践启示
- 做 Agent/流水线时:如果下游要解析模型的中间步骤(结构化轨迹、清单、显式备选),把过程指令在问题后再放一份(S→SA),是零成本、零依赖的黑盒杠杆,协议完整度提升立竿见影
- 别指望它提分:这是"格式合规/可控制性"工具,不是准确率工具;评估时要用结构化指标而非只看最终答案
- 一份就够,最多两份:收益强饱和,三份反而推高过早表态和截断率
- 位置敏感:尾部追加优于系统消息重复;简单"指令后置"单独用效果有限
- 评估协议合规时,机器判定与人眼判定会系统性分歧——为下游机器服务的指标就该用机器判
一句话:当你关心的是"模型暴露了什么"而非"模型答对了什么",指令复制是性价比最高的第一个旋钮。