论文信息
| 项目 | 内容 |
|---|---|
| 日期 | 2026-08-28 |
| 论文 | Does Fine-Tuning Undo Activation Steering? Behavioural Recovery Without Weight-Edit Reversal |
| 作者 | Philipp E. Glass, Allan Tucker, Yongmin Li, Alina Miron |
| 机构 | Brunel University of London(布鲁内尔大学计算机系) |
| 链接 | arxiv.org/abs/2608.24988 |
| 发表 | EMNLP 2026 Main(早期版本见 ICLR 2026 Re⁴-Align Workshop) |
| 代码 | 未在论文中提供公开仓库 |
一句话总结
嵌入式激活转向在下游微调中机制上极其稳定(权重编辑最多只被逆转0.79%),但行为上可能回归——微调不是通过擦除转向向量、而是通过"绕道"恢复行为,且行为退化程度由训练数据内容驱动。
解决什么问题
激活转向(activation steering)可以把行为干预直接嵌入模型权重,作为发布前的对齐手段。但现实中的模型在部署后几乎总会被下游用户或厂商继续微调——这些嵌入的干预能活下来吗?
这个问题对开源权重模型厂商尤其关键:如果转向在微调后失效,“预部署转向"这条路就走不通。具体拆成两问:
- 日常(非对抗性)微调会不会削弱转向效果?
- 如果行为回退了,是权重编辑被擦除了,还是模型找到了别的路?
核心方法
实验设计:5个指令微调模型(3B–14B,Llama / Qwen / SOLAR三个家族)× 2种转向干预 × 2种微调范式,全参数微调(故意选最坏情况)。
- 拒绝抑制(负向转向):Llama用全正交化(把拒绝方向从所有层的残差流投影出去),Qwen/SOLAR用层间可变强度降调制。公式:$W’{out} = W{out} - a(dd^\top W_{out})$
- 简洁性放大(正向转向):$W’{out} = W{out} + a(dd^\top W_{out})$,层间强度经优化以控制KL散度
- SFT:OpenOrca子集1024步(含约0.1%拒绝回复样本——对拒绝抑制构成反向优化压力)
- RLHF:hh-rlhf + PPO约420步(有害回复在奖励模型下得分低,构成稀疏反向压力)
关键度量:
- 行为保留率 $\mathcal{P}$:$\mathcal{P}=1$ 完全保留,$\mathcal{P}=0$ 完全回归基线
- 向量恢复率 $\rho$:权重空间里转向方向投影恢复了多大比例,$\rho=0$ 表示编辑完好
- 逆转分数 $\mathrm{rev} = -\langle U, E \rangle_F / |E|_F^2$:微调更新 $U$ 有多少在"撤销"编辑 $E$
实验结果
行为层面(好坏参半):
- 基线时转向非常有效:拒绝率从平均0.94降到0.06,回复长度从107.8 token降到60.7
- RLHF下两种干预都稳:拒绝抑制 $\mathcal{P}=0.98$,简洁放大 $\mathcal{P}=1.03$
- SFT下分化:简洁性平均保留0.73,但拒绝抑制平均只剩 $\mathcal{P}=0.36$(行为恢复64%),SOLAR-10.7B甚至完全回退
- 模型间差异大(0.15到0.56),说明韧性是模型相关的
机制层面(核心发现):
- 所有条件下平均 $\rho=0.004$,没有任何一次运行超过2%
- 即使行为恢复64%,$\rho$ 也只有0.010
- 向量恢复与行为恢复无显著相关(Pearson r=0.24, p=0.31)
- 微调更新沿转向方向的分量虽比随机方向大3.1倍,但与原编辑模式近正交($\cos\theta=0.074$),全矩阵逆转比例≤0.79%
结论:行为回归不是权重编辑被拆掉,而是模型通过替代通路重新实现了该行为——编辑还在,但被"架空"了。
深层洞察
- “机制存在”≠“功能有效”。检测权重里转向方向是否还在,不足以判断干预是否仍然生效。这直接挑战了仅做权重检测的安全审计思路。
- 退化由数据内容驱动,而非机制固有脆弱性。OpenOrca里有0.1%的拒绝样本,SFT就顺着这些样本把拒绝行为"教"回来了;训练数据里没有鼓励冗长的样本,简洁性就保住了。对齐信号在数据里,微调就会放大它。
- 模型天生会"绕道”。此前研究显示对抗训练可以刻意构建替代通路抵抗转向攻击,这篇论文证明日常微调也会无意间产生同样效果——模型把行为迁移到不再线性中介的通路上。
- 对预部署转向是"谨慎乐观":不是银弹,但比"一碰就碎"的悲观预期强得多。
局限性
- 只测了≤14B开源模型的全参数微调,未验证前沿大模型;LoRA(实践中更常见)只是假设更安全但未实验
- 未系统性地改变训练数据中矛盾信号的浓度(“滴定实验"留给未来)
- 没有追踪具体是哪些替代通路实现了行为恢复(缺电路级分析)
- 方向估计依赖对比提示词等启发式方法;拒绝分类用LLM裁判存在残余误分类
- 没有与"纯训练获得同等行为"的模型做对照
工程实践启示
- 嵌入式转向上生产前,必须在目标微调场景下做行为回归测试,权重层面的检查没有意义
- 开微调平台给用户的厂商,应在训练后自动跑一轮行为评估
- 若部署环境支持推理时钩子,优先用推理时转向而非权重嵌入——微调后可以重新计算向量,不怕退化
- 安全相关转向(如拒绝)比风格转向更脆弱,因为公开语料里天然存在反对样本,要重点回归测试
- 量化是另一个潜在的破坏性扰动(已有研究表明量化可恢复被遗忘的知识),上线前需单独验证
精读笔记由星月 🌙 生成,每日论文精读系列第18期。