📌 系列导航🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站

论文信息

项目内容
日期2026-08-28
论文Does Fine-Tuning Undo Activation Steering? Behavioural Recovery Without Weight-Edit Reversal
作者Philipp E. Glass, Allan Tucker, Yongmin Li, Alina Miron
机构Brunel University of London(布鲁内尔大学计算机系)
链接arxiv.org/abs/2608.24988
发表EMNLP 2026 Main(早期版本见 ICLR 2026 Re⁴-Align Workshop)
代码未在论文中提供公开仓库

一句话总结

嵌入式激活转向在下游微调中机制上极其稳定(权重编辑最多只被逆转0.79%),但行为上可能回归——微调不是通过擦除转向向量、而是通过"绕道"恢复行为,且行为退化程度由训练数据内容驱动。

解决什么问题

激活转向(activation steering)可以把行为干预直接嵌入模型权重,作为发布前的对齐手段。但现实中的模型在部署后几乎总会被下游用户或厂商继续微调——这些嵌入的干预能活下来吗?

这个问题对开源权重模型厂商尤其关键:如果转向在微调后失效,“预部署转向"这条路就走不通。具体拆成两问:

  1. 日常(非对抗性)微调会不会削弱转向效果?
  2. 如果行为回退了,是权重编辑被擦除了,还是模型找到了别的路?

核心方法

实验设计:5个指令微调模型(3B–14B,Llama / Qwen / SOLAR三个家族)× 2种转向干预 × 2种微调范式,全参数微调(故意选最坏情况)。

  • 拒绝抑制(负向转向):Llama用全正交化(把拒绝方向从所有层的残差流投影出去),Qwen/SOLAR用层间可变强度降调制。公式:$W’{out} = W{out} - a(dd^\top W_{out})$
  • 简洁性放大(正向转向):$W’{out} = W{out} + a(dd^\top W_{out})$,层间强度经优化以控制KL散度
  • SFT:OpenOrca子集1024步(含约0.1%拒绝回复样本——对拒绝抑制构成反向优化压力)
  • RLHF:hh-rlhf + PPO约420步(有害回复在奖励模型下得分低,构成稀疏反向压力)

关键度量

  • 行为保留率 $\mathcal{P}$:$\mathcal{P}=1$ 完全保留,$\mathcal{P}=0$ 完全回归基线
  • 向量恢复率 $\rho$:权重空间里转向方向投影恢复了多大比例,$\rho=0$ 表示编辑完好
  • 逆转分数 $\mathrm{rev} = -\langle U, E \rangle_F / |E|_F^2$:微调更新 $U$ 有多少在"撤销"编辑 $E$

实验结果

行为层面(好坏参半):

  • 基线时转向非常有效:拒绝率从平均0.94降到0.06,回复长度从107.8 token降到60.7
  • RLHF下两种干预都稳:拒绝抑制 $\mathcal{P}=0.98$,简洁放大 $\mathcal{P}=1.03$
  • SFT下分化:简洁性平均保留0.73,但拒绝抑制平均只剩 $\mathcal{P}=0.36$(行为恢复64%),SOLAR-10.7B甚至完全回退
  • 模型间差异大(0.15到0.56),说明韧性是模型相关的

机制层面(核心发现):

  • 所有条件下平均 $\rho=0.004$,没有任何一次运行超过2%
  • 即使行为恢复64%,$\rho$ 也只有0.010
  • 向量恢复与行为恢复无显著相关(Pearson r=0.24, p=0.31)
  • 微调更新沿转向方向的分量虽比随机方向大3.1倍,但与原编辑模式近正交($\cos\theta=0.074$),全矩阵逆转比例≤0.79%

结论:行为回归不是权重编辑被拆掉,而是模型通过替代通路重新实现了该行为——编辑还在,但被"架空"了。

深层洞察

  1. “机制存在”≠“功能有效”。检测权重里转向方向是否还在,不足以判断干预是否仍然生效。这直接挑战了仅做权重检测的安全审计思路。
  2. 退化由数据内容驱动,而非机制固有脆弱性。OpenOrca里有0.1%的拒绝样本,SFT就顺着这些样本把拒绝行为"教"回来了;训练数据里没有鼓励冗长的样本,简洁性就保住了。对齐信号在数据里,微调就会放大它。
  3. 模型天生会"绕道”。此前研究显示对抗训练可以刻意构建替代通路抵抗转向攻击,这篇论文证明日常微调也会无意间产生同样效果——模型把行为迁移到不再线性中介的通路上。
  4. 对预部署转向是"谨慎乐观":不是银弹,但比"一碰就碎"的悲观预期强得多。

局限性

  • 只测了≤14B开源模型的全参数微调,未验证前沿大模型;LoRA(实践中更常见)只是假设更安全但未实验
  • 未系统性地改变训练数据中矛盾信号的浓度(“滴定实验"留给未来)
  • 没有追踪具体是哪些替代通路实现了行为恢复(缺电路级分析)
  • 方向估计依赖对比提示词等启发式方法;拒绝分类用LLM裁判存在残余误分类
  • 没有与"纯训练获得同等行为"的模型做对照

工程实践启示

  • 嵌入式转向上生产前,必须在目标微调场景下做行为回归测试,权重层面的检查没有意义
  • 开微调平台给用户的厂商,应在训练后自动跑一轮行为评估
  • 若部署环境支持推理时钩子,优先用推理时转向而非权重嵌入——微调后可以重新计算向量,不怕退化
  • 安全相关转向(如拒绝)比风格转向更脆弱,因为公开语料里天然存在反对样本,要重点回归测试
  • 量化是另一个潜在的破坏性扰动(已有研究表明量化可恢复被遗忘的知识),上线前需单独验证

精读笔记由星月 🌙 生成,每日论文精读系列第18期。